01 — Problème produit

Prédire un comportement futur à partir du début de la session.

Le modèle devait utiliser une courte séquence enregistrée au début de la session. À ce stade, la conversion ou l’action finale n’a pas encore eu lieu. Le défi consistait à transformer les premières interactions de navigation en variables suffisamment fiables pour prédire ce comportement futur.

Le protocole a porté sur plus d’un million d’observations comportementales filtrées. Certains comportements à prédire étaient beaucoup plus rares que d’autres. Le protocole prévoit des variables issues du début de session et une cible observée plus tard. Le volume désigne des observations filtrées, pas des personnes uniques ; les événements bruts, sessions et lignes de modèle ne sont pas des unités interchangeables.

02 — Construction des variables

Les trajectoires sont résumées par des mesures vérifiables.

J’ai regroupé les variables par type de donnée : vitesse et direction du curseur, pauses, retours en arrière, position dans l’écran, clics et défilement. Cette organisation permettait de mesurer la contribution de chaque groupe de variables.

Pour chaque ablation, une famille de variables était retirée avant de réentraîner et d’évaluer le modèle. La baisse de l’AUC indiquait alors ce que cette famille ajoutait à la prédiction. Les positions ont aussi été normalisées, et les usages sur mobile et ordinateur ont été traités séparément pour limiter l’effet de la taille de l’écran.

03 — Évaluation

Trois tests répondent à trois risques différents.

La validation croisée estime l’AUC moyenne sur des échantillons comparables. Le découpage temporel vérifie le modèle sur des interactions plus récentes que celles utilisées pour l’entraînement. Enfin, l’évaluation sur un autre site mesure sa capacité à changer d’environnement. Le bilan retenu montre un signal prédictif sur les environnements connus ; il ne permet pas d’attribuer une plage chiffrée commune à chaque cible et à chacun de ces découpages.

Le troisième test a été décisif : l’AUC chutait fortement sur un autre environnement. Le modèle avait appris une partie du comportement recherché, mais aussi des particularités du design, du trafic et du parcours. Une séparation aléatoire des données n’aurait pas révélé cette dépendance.

04 — Décision

Le modèle perdait trop de performance sur un autre site.

Nous avons donc écarté l’idée d’un modèle universel prêt à être déployé. Des modèles propres à chaque environnement auraient exigé une calibration, des seuils de décision et une maintenance spécifiques.

Cette contrainte a conduit à arrêter l’étude avant son industrialisation. Les résultats présentés ici restent des performances hors ligne ; ils ne démontrent ni déploiement en production ni impact commercial.