LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle
benchmark
Nº 061 · v2026-08EN : benchmarkUn benchmark est une épreuve standardisée qui note les modèles sur un jeu de questions communes, afin de les comparer entre eux. Comme un examen national : il classe les candidats, il ne dit pas lequel fera l’affaire dans votre équipe.
Ce que ce n’est pas
Un benchmark n’est pas une évaluation de votre système. Il mesure un modèle nu sur des tâches génériques, alors que ce que vous mettez en service est un modèle plus un harnais plus vos documents plus vos consignes : les classements ne se transportent pas. Ce n’est pas non plus une garantie de qualité : un score élevé se cumule avec des échecs systématiques sur votre domaine, et l’écart entre deux modèles voisins au classement est souvent inférieur au bruit de mesure.
En profondeur
Le principal problème de ces épreuves est la contamination. Elles sont publiques, donc elles finissent dans les corpus d’entraînement, et un modèle peut alors restituer des réponses vues plutôt que résoudre le problème. Les auteurs de benchmarks répondent en publiant des versions renouvelées ou en gardant des jeux privés, mais le soupçon demeure structurel : plus une épreuve est ancienne et citée, moins son score est informatif. Un bon réflexe consiste à regarder la date d’une épreuve autant que le score obtenu.
S’ajoute un biais de sélection dans la communication. Un éditeur choisit les épreuves où son modèle se distingue, et les conditions de mesure varient : nombre d’essais, format des consignes, autorisation de raisonner longuement. Deux chiffres présentés côte à côte peuvent avoir été obtenus dans des conditions incomparables. Les classements par vote humain corrigent une partie du problème mais en introduisent un autre, puisqu’ils mesurent la préférence, qui récompense la présentation autant que l’exactitude.
La conclusion pratique est ferme, et c’est celle que ce lexique défend partout : les benchmarks servent à établir une liste courte, jamais à décider. Le choix se fait sur un jeu d’épreuves à vous, construit à partir de vos cas réels, y compris ceux qui ont échoué par le passé, et rejoué à chaque changement de version. Une trentaine de cas bien choisis en disent davantage sur votre usage que n’importe quel classement public, et ils gardent leur valeur quand les modèles changent.
Relations où vivent les voisins
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Un modèle est premier sur les principaux benchmarks. Est-ce le bon choix pour votre usage ?
Niveau 2 · Distinguer
Qu’appelle-t-on contamination d’un benchmark ?
Niveau 2 · Distinguer
Qu’est-ce qui distingue un benchmark d’une évaluation au sens du site ?
Lexigraph, « Benchmark », v2026-08, https://lexigraph.org/fr/benchmark, CC BY 4.0.