Ce que contient cette page
Cette page rassemble, catégorie par catégorie, les scores des principaux modèles LLM sur les benchmarks les plus suivis à ce jour. Chaque ligne de chaque tableau porte sa source, la date à laquelle la valeur a été relevée, et un badge qui indique si le chiffre vient de l'éditeur du modèle ou d'une mesure indépendante. Dernier relevé global : 28 juillet 2026.
Aucun chiffre n'est recopié dans le texte de cette page : ils vivent tous dans les tableaux, qui restent la seule source à jour. La prose explique ce que chaque famille de benchmarks mesure et où elle atteint ses limites.
Éditeur ou indépendant : la distinction qui compte
Avant de lire les tableaux
Un score publié par l'éditeur d'un modèle, dans une system card ou un article d'annonce, n'a été vérifié par personne d'autre que lui. Un score publié par un tiers qui ne vend aucun des modèles comparés (Artificial Analysis, Arena, le mainteneur officiel d'un benchmark) a été mesuré dans des conditions que l'éditeur ne contrôle pas. Les deux ont leur intérêt, mais ils ne pèsent pas le même poids.
Chaque ligne porte donc un badge Éditeur ou Indépendant, accompagné du nom du publisher. Un même modèle peut apparaître deux fois sur un même benchmark, une fois sous chaque statut : ce n'est pas une redondance, c'est l'information la plus utile de la page. Avant de comparer deux lignes entre elles, vérifiez d'abord qu'elles portent le même badge.
Codage et agentique
Ces benchmarks font résoudre au modèle des tâches de développement réelles : corriger un bug dans un dépôt, faire passer une suite de tests, exécuter des commandes dans un terminal. Le harness qui encadre le modèle, c'est-à-dire l'agent qui orchestre ses appels d'outils, influence le résultat autant que le modèle lui-même. Un même modèle testé avec deux harnesses différents ne produit pas le même score : la colonne de notes précise l'agent utilisé (agent=) quand la source le documente.
Le classement officiel de SWE-bench Verified n'a reçu aucune nouvelle soumission depuis février 2026. Les scores les plus récents de cette catégorie proviennent donc uniquement des cartes des éditeurs, pas d'une soumission vérifiée sur ce classement précis.
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| Claude Fable 5agent=Claude Code · ci=±1.2 · submitted=2026-06-07 | Anthropic | Propriétaire | 83,8 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet | |
| GPT-5.5agent=Codex · ci=±1.1 · submitted=2026-05-01 | OpenAI | Propriétaire | 83,1 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de GPT-5.5 dans un nouvel onglet | |
| Claude Opus 4.8agent=Claude Code · ci=±1.3 · submitted=2026-07-09 | Anthropic | Propriétaire | 78,9 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet | |
| GPT-5.6 Terraagent=Codex · ci=±1.3 · submitted=2026-07-11 | OpenAI | Propriétaire | 78,4 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet | |
| Muse Spark 1.1agent=mini-SWE-agent · ci=±1.2 · submitted=2026-07-09 | Meta | Non documentée | 76,2 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet | |
| GPT-5.6 Lunaagent=Codex · ci=±1.3 · submitted=2026-07-11 | OpenAI | Propriétaire | 75,7 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet | |
| Claude Sonnet 5agent=Claude Code · ci=±1.6 · submitted=2026-07-09 | Anthropic | Propriétaire | 74,6 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Claude Sonnet 5 dans un nouvel onglet | |
| Gemini 3 Proagent=Terminus 2 · ci=±1.3 · submitted=2026-05-01 | Propriétaire | 73,9 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Gemini 3 Pro dans un nouvel onglet | ||
| Claude Opus 4.7agent=Claude Code · ci=±1.4 · submitted=2026-05-01 | Anthropic | Propriétaire | 68,9 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet | |
| Gemini 3.1 Proagent=Gemini CLI · ci=±1.7 · submitted=2026-05-05 | Propriétaire | 65,8 % | IndépendantTerminal-Bench | tbench.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet |
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| GPT-5.6 Soleffort=xhigh · agent=Terminus 2 · runs=3 | OpenAI | Propriétaire | 89,5 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet | |
| Claude Opus 5effort=max · mode=adaptive · agent=Terminus 2 · runs=3 | Anthropic | Propriétaire | 89,1 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet |
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| Claude Opus 5effort=max · runs=5 · n=500 | Anthropic | Propriétaire | 96 % | ÉditeurAnthropic | www-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet | |
| Claude Opus 4.5effort=high · agent=mini-SWE-agent | Anthropic | Propriétaire | 76,8 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de Claude Opus 4.5 dans un nouvel onglet | |
| Gemini 3 Flasheffort=high · agent=mini-SWE-agent | Propriétaire | 75,8 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de Gemini 3 Flash dans un nouvel onglet | ||
| Claude Opus 4.6agent=mini-SWE-agent | Anthropic | Propriétaire | 75,6 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de Claude Opus 4.6 dans un nouvel onglet | |
| GPT-5.2 Codexagent=mini-SWE-agent | OpenAI | Propriétaire | 72,8 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de GPT-5.2 Codex dans un nouvel onglet | |
| Claude Sonnet 4.5effort=high · agent=mini-SWE-agent | Anthropic | Propriétaire | 71,4 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de Claude Sonnet 4.5 dans un nouvel onglet | |
| Gemini 3 Proagent=mini-SWE-agent | Propriétaire | 69,6 % | IndépendantSWE-bench | swebench.com Ouvrir la source du score de Gemini 3 Pro dans un nouvel onglet |
Raisonnement
GPQA Diamond et Humanity's Last Exam évaluent des connaissances de niveau expert sur des questions à réponse fermée, sans accès à des outils externes. GPQA Diamond approche la saturation : les modèles les plus récents se tiennent à moins d'un point d'écart, ce qui ne départage plus grand-chose entre eux. Humanity's Last Exam reste plus discriminant, mais son score dépend fortement du périmètre retenu (texte seul ou jeu complet) et du modèle utilisé pour juger les réponses ouvertes, deux paramètres que la colonne de notes précise quand ils sont connus.
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| Claude Fable 5tools=off | Anthropic | Propriétaire | 56,5 % | ÉditeurAnthropic | www-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet | |
| Claude Opus 5tools=off · effort=max · runs=5 | Anthropic | Propriétaire | 56,3 % | ÉditeurAnthropic | www-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet | |
| Claude Fable 5effort=max · fallback=Claude Opus 4.8 · subset=text-only · n=2158 | Anthropic | Propriétaire | 53,3 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet | |
| Claude Opus 5effort=max · mode=adaptive · subset=text-only · n=2158 | Anthropic | Propriétaire | 52,6 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet | |
| Claude Opus 4.8tools=off | Anthropic | Propriétaire | 49,8 % | ÉditeurAnthropic | www-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet | |
| GPT-5.6 Soltools=off · dataset=full | OpenAI | Propriétaire | 44,5 % | ÉditeurMoonshot AI | huggingface.co Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet | |
| Kimi K3tools=off · dataset=full · effort=max | Moonshot AI | Kimi K3 License | 43,5 % | ÉditeurMoonshot AI | huggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet | |
| GPT-5.5tools=off · dataset=full | OpenAI | Propriétaire | 41,4 % | ÉditeurMoonshot AI | huggingface.co Ouvrir la source du score de GPT-5.5 dans un nouvel onglet | |
| GLM-5.2tools=off · subset=text-only | Z.ai | MIT | 40,5 % | ÉditeurZ.ai | huggingface.co Ouvrir la source du score de GLM-5.2 dans un nouvel onglet |
Agents et outils
GDPval-AA, OSWorld et BrowseComp mesurent des capacités plus proches d'un usage réel : réaliser une tâche professionnelle notée par préférence humaine pour GDPval-AA, piloter une interface graphique d'ordinateur pour OSWorld, naviguer et rechercher sur le web pour retrouver une information précise pour BrowseComp. Ces benchmarks agentiques sont plus sensibles aux refus de sécurité et aux bascules automatiques vers un autre modèle qu'un test à réponse unique : un refus ou une bascule compte comme un échec dans la moyenne finale, au même titre qu'une erreur du modèle.
Long contexte
AA-LCR et OpenAI MRCR testent la capacité d'un modèle à retrouver et à raisonner sur une information noyée dans une fenêtre de contexte très longue, plutôt qu'à raisonner dans l'absolu. Un score élevé ici ne présage rien de la qualité de raisonnement du même modèle sur un contexte court, et inversement. Peu d'éditeurs publient ce type de chiffre pour l'ensemble de leur gamme, ce qui explique des tableaux plus courts que dans les autres catégories.
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| GPT-5.2 Codexeffort=xhigh | OpenAI | Propriétaire | 75,7 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de GPT-5.2 Codex dans un nouvel onglet | |
| GPT-5effort=high | OpenAI | Propriétaire | 75,6 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de GPT-5 dans un nouvel onglet | |
| GPT-5.1effort=high | OpenAI | Propriétaire | 75 % | IndépendantArtificial Analysis | artificialanalysis.ai Ouvrir la source du score de GPT-5.1 dans un nouvel onglet |
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | OpenAI | Propriétaire | 91,5 % | ÉditeurOpenAI | openai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet | |
| GPT-5.6 Terra | OpenAI | Propriétaire | 89,6 % | ÉditeurOpenAI | openai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet | |
| GPT-5.5 | OpenAI | Propriétaire | 81,5 % | ÉditeurOpenAI | openai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet | |
| GPT-5.6 Luna | OpenAI | Propriétaire | 41,3 % | ÉditeurOpenAI | openai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet |
Préférence humaine
Text Arena et WebDev Arena classent les modèles par un score Elo construit sur des votes de préférence humaine en aveugle, pas par une notation automatique. L'intervalle de confiance et le nombre de votes comptent alors plus que le rang affiché : sur ces classements, plusieurs modèles consécutifs se recouvrent souvent statistiquement, et un modèle récemment ajouté peut afficher un rang flatteur sur un volume de votes encore faible. La colonne de notes reporte l'intervalle de confiance (ci=) et le nombre de votes (votes=) quand la source les publie.
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| Claude Fable 5ci=±6 | Anthropic | Propriétaire | 1 508 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet | |
| Claude Opus 4.6mode=thinking · ci=±4 | Anthropic | Propriétaire | 1 505 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 4.6 dans un nouvel onglet | |
| Claude Opus 4.7mode=thinking · ci=±4 | Anthropic | Propriétaire | 1 502 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet | |
| Claude Opus 5effort=max · ci=±12 | Anthropic | Propriétaire | 1 495 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet | |
| Muse Spark 1.1ci=±7 | Meta | Non documentée | 1 491 | IndépendantArena | arena.ai Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet | |
| Muse Sparkci=±6 | Meta | Non documentée | 1 488 | IndépendantArena | arena.ai Ouvrir la source du score de Muse Spark dans un nouvel onglet | |
| Gemini 3.1 Proci=±3 | Propriétaire | 1 486 | IndépendantArena | arena.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet |
| Modèle | Éditeur | Licence | Score | Statut | Source | Relevé le |
|---|---|---|---|---|---|---|
| Claude Opus 5effort=max · votes=686 | Anthropic | Propriétaire | 1 725 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet | |
| Kimi K3effort=max · votes=3777 | Moonshot AI | Kimi K3 License | 1 682 | IndépendantArena | arena.ai Ouvrir la source du score de Kimi K3 dans un nouvel onglet | |
| Claude Fable 5votes=5801 | Anthropic | Propriétaire | 1 629 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet | |
| GPT-5.6 Soleffort=xhigh · votes=5340 | OpenAI | Propriétaire | 1 623 | IndépendantArena | arena.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet | |
| GLM-5.2effort=max · votes=5779 | Z.ai | MIT | 1 587 | IndépendantArena | arena.ai Ouvrir la source du score de GLM-5.2 dans un nouvel onglet | |
| Claude Opus 4.8mode=thinking · votes=8321 | Anthropic | Propriétaire | 1 568 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet | |
| Claude Opus 4.7votes=11138 | Anthropic | Propriétaire | 1 560 | IndépendantArena | arena.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet |
Indices composites
L'Artificial Analysis Intelligence Index agrège plusieurs benchmarks en un seul score, pondéré selon une méthodologie publique. Un indice composite simplifie la comparaison mais masque les écarts entre catégories : deux modèles à indice proche peuvent avoir des profils de forces très différents selon le sous-score retenu. Il donne un ordre de grandeur, pas un verdict.
Méthodologie et limites
Cette page ne couvre pas tous les pièges de lecture d'un score : effet du niveau d'effort de raisonnement, contamination des jeux de test, contradictions entre le texte d'une annonce et son propre tableau. L'article Lire un benchmark LLM sans se faire avoir détaille neuf de ces pièges à partir de cas vérifiés. Les scores de cette page sont mis à jour périodiquement selon la procédure de rafraîchissement suivie par l'équipe éditoriale ; la date du dernier relevé global figure en tête de page.
Prochaines étapes
- Lire un benchmark LLM sans se faire avoir : le guide de survie : les pièges méthodologiques derrière les chiffres de cette page
- Kimi K3 : le premier modèle ouvert de classe 3T, et ce qui change vraiment : un cas concret où plusieurs de ces benchmarks sont mobilisés
- Opus 5, GPT-5.6, Kimi K3 : trois lancements, trois classements qui se contredisent : une lecture comparative des scores les plus disputés de cette page
- Coûts réels de Claude Code : remettre ces scores en perspective face à ce qu'ils coûtent réellement à l'usage