01 — LE DÉFI
Un modèle utile commence par la bonne question.
La recherche par métadonnées échoue lorsque les tags sont absents, incohérents ou trop littéraux. Le but était de rendre un catalogue visuel interrogeable par le sens et l’apparence.
02 — Recherche multimodale · Retrieval
Trouver une image avec une idée, pas avec un nom de fichier.
Tester la démo↗Un moteur de recherche multimodal qui relie une intention formulée en langage naturel à du contenu visuel grâce à des représentations texte-image partagées.
Anatomie du projet
Le moteur projette textes et images dans un espace CLIP partagé, puis interroge un index vectoriel enrichi de filtres et de métadonnées du catalogue.
Pipeline principal
Sélectionnez une étape pour comprendre la transformation des données.Les œuvres, descriptions, auteurs, catégories, dates et URLs d’image sont préparés comme documents interrogeables.
La démonstration permet de rechercher une œuvre avec des mots ordinaires, puis de visualiser comment la proximité entre la requête et les images organise les résultats.
Démonstration pédagogique : les données sont locales et certains calculs sont simulés ou accélérés.01 — LE DÉFI
La recherche par métadonnées échoue lorsque les tags sont absents, incohérents ou trop littéraux. Le but était de rendre un catalogue visuel interrogeable par le sens et l’apparence.
02 — L’APPROCHE
Création d’un pipeline complet d’ingestion et d’embedding
Encodage des textes et images dans un espace multimodal partagé
Indexation de vecteurs haute dimension à grande échelle
Combinaison de la similarité sémantique et des contraintes produit
Exposition de la recherche via une API rapide et interactive
03 — LE RÉSULTAT
“L’utilisateur peut décrire une intention visuelle ou partir d’une image pour retrouver du contenu sémantiquement proche dans un catalogue volumineux.”
04 — STACK PRINCIPALE