01 — Question produit
Un seul espace vectoriel peut-il servir toutes les intentions ?
La recherche sémantique part d’une requête textuelle et doit retrouver les produits pertinents. La recommandation visuelle part d’une image et doit retrouver des objets proches. Ces deux parcours utilisent des embeddings, mais ils ne sollicitent pas nécessairement les mêmes propriétés de représentation.
Le benchmark traite donc les usages séparément. Cette séparation évite qu’une moyenne globale masque un modèle très performant sur une modalité et faible sur l’autre.
02 — Protocole
Deux datasets publics et des métriques de ranking rendent la comparaison reproductible.
Les essais utilisent Amazon Berkeley Objects et H&M. En semantic search, les termes de catégorie sont retirés du texte indexé pour réduire les raccourcis lexicaux. En visual retrieval, chaque image interroge les autres produits et la catégorie fournit un indicateur reproductible de pertinence.
Precision@K, Recall@K et NDCG@K mesurent respectivement la précision du top K, sa couverture et la qualité de l’ordre. Un contrôle qualitatif complète ces scores, car deux produits partageant une catégorie ne sont pas forcément de bons voisins visuels.
03 — Résultats
Le modèle gagnant change avec la modalité.
Sur les requêtes textuelles, l’encodeur OpenAI atteint 62,2 % de NDCG@10 sur ABO et 72,7 % sur H&M dans ce protocole. Il devance les modèles vision-langage testés pour relier l’intention écrite aux descriptions produit.
Sur la similarité entre images, FashionCLIP améliore le NDCG@10 de 4,8 points sur ABO et de 4,0 points sur H&M face à CLIP. Le gain se répète sur les deux catalogues, ce qui renforce la décision d’utiliser un modèle spécialisé mode pour cette tâche.
04 — Décision
Composer l’architecture par usage plutôt que chercher un vainqueur universel.
Le pipeline peut conserver un encodeur textuel pour la recherche sémantique et un encodeur vision-langage spécialisé pour les voisins visuels. Le résultat devient ainsi un choix d’architecture, pas seulement un tableau de scores.
La limite principale reste le proxy de catégorie, complété ici par l’inspection qualitative. Une évaluation produit ultérieure doit intégrer les jugements de pertinence, la diversité, la latence et les comportements observés en ligne.