Data & Machine Learning

Des prompts qui s'optimisent (presque) tout seuls : construire un LLM-as-a-judge aligné sur l'annotation humaine

Conférence - 45min IntermédiaireFrançais

Vendredi 14:20, Grand Amphi

Dans tout système d’IA générative, l’évaluation est le maillon critique : sans métrique fiable, impossible de comparer deux versions, de mesurer un progrès ou de déployer en confiance. À grande échelle, le réflexe est devenu le LLM-as-a-judge, moins cher et plus rapide qu’une évaluation humaine.

Sauf qu’une question gênante reste sous le tapis : votre juge est-il vraiment d’accord avec vos humains ? Le plus souvent, non. On « corrige » alors le prompt à la main, souvent à l’aide du LLM lui-même. Ce qui pose plusieurs problèmes : rien ne garantit qu’on tient le meilleur prompt, on risque de dégrader le juge sur d’autres évaluations, et on reste dépendant d’un provider.

Cette session renverse le problème : traiter le prompt du juge comme une cible d’optimisation, avec pour objectif l’alignement sur un jeu d’annotations humaines. On verra comment mesurer cet alignement, puis comment le maximiser avec des optimiseurs de prompts réflexifs comme GEPA et SIMBA, capables de faire évoluer la grille du juge tout seuls.

Le tout ancré dans un retour d’expérience en contexte e-commerce, sur un catalogue de plusieurs millions de fiches produits enrichies par IA : aligner le juge sur l’évaluation de ces fiches, via une boucle de rétroaction entre annotations humaines et optimisation.

Vous repartez avec un schéma de boucle d’optimisation reproductible, transposable bien au-delà du e-commerce, et les pièges à éviter (surajustement au jeu d’annotations, coût de l’annotation).

Photo de Renaud Marmion

Renaud Marmion

  • Icône Linkedin

Machine Learning Engineer chez Cdiscount, je réalise l’industrialisation de produits d’IA générative à l’échelle d’un très grand catalogue e-commerce.

Voir le programme