01 — Question de recherche
Un modèle multimodal peut-il retrouver une première impression UX ?
Le Web Design Prototypicality Dataset associe des captures de pages d’accueil à des évaluations humaines : esthétique, utilisabilité perçue, confiance, typicalité, ressemblance avec la catégorie et qualité comme exemple représentatif.
La comparaison porte sur une impression visuelle à partir d’une capture. Elle ne mesure ni la réussite d’une tâche ni le comportement après interaction.
02 — Protocole
Aligner les items ne suffit pas : il faut aussi vérifier les scores.
Le fichier de résultats relie chaque score à une capture, une dimension et au modèle GPT-4.1-mini. La jointure sur l’identifiant de capture et la dimension retrouve les 600 paires, sans doublon ni score manquant. La configuration actuelle reprend les six items ; le fichier final ne conserve pas l’empreinte historique du prompt ni la version immuable du modèle.
Des réponses brutes entre −3 et +3 ne sont pas directement comparables à des scores humains standardisés. Il faut documenter les transformations et construire une échelle commune avant de calculer un écart moyen ou un biais de niveau.
03 — Analyse
Trois mesures répondent à trois questions différentes.
La corrélation de Pearson décrit une association linéaire. Celle de Spearman décrit l’accord des rangs. Aucune des deux, à elle seule, n’établit que le modèle attribue les mêmes notes que les participants.
Les corrélations de Pearson par dimension sont : esthétique 0,343 ; ressemblance 0,513 ; exemple représentatif 0,535 ; confiance 0,427 ; typicalité 0,438 ; utilisabilité perçue 0,486. Les corrélations de Spearman vont de 0,180 à 0,436. Chaque dimension porte sur les mêmes 100 captures ; les 600 paires ne sont pas des observations indépendantes.
L’erreur absolue moyenne et le biais moyen évaluent l’accord de niveau seulement lorsque les scores sont commensurables. Une calibration éventuelle doit être ajustée sur un échantillon distinct, puis évaluée sur des données tenues à l’écart.
04 — Validation
Relier le résultat statistique à une décision de recherche.
Les associations sont descriptives sur ce sous-ensemble mode. Le r global de 0,416 résume les 600 paires et ne remplace pas l’analyse par dimension. L’écart absolu de 1,98 calculé dans le notebook soustrait des notes brutes du modèle à des agrégats humains standardisés : il n’est pas interprété comme une erreur de notation ou une preuve d’optimisme.
L’évaluation à poursuivre comprend des intervalles d’incertitude, une réplication dans d’autres secteurs et une comparaison avec les décisions observées lors de tests utilisateurs. Elle permettra de déterminer si le modèle apporte une aide à la présélection.