Aller au contenu principal

Benchmarks LLM : tableaux de référence par catégorie

Terminal-Bench, SWE-bench, GPQA Diamond, Arena : les scores des principaux modèles LLM par catégorie, avec la source, le statut éditeur ou indépendant et la date de chaque relevé.

  • Référence
  • Outils
Publié le

Ce que contient cette page

Cette page rassemble, catégorie par catégorie, les scores des principaux modèles LLM sur les benchmarks les plus suivis à ce jour. Chaque ligne de chaque tableau porte sa source, la date à laquelle la valeur a été relevée, et un badge qui indique si le chiffre vient de l'éditeur du modèle ou d'une mesure indépendante. Dernier relevé global : 28 juillet 2026.

Aucun chiffre n'est recopié dans le texte de cette page : ils vivent tous dans les tableaux, qui restent la seule source à jour. La prose explique ce que chaque famille de benchmarks mesure et où elle atteint ses limites.

Éditeur ou indépendant : la distinction qui compte

Chaque ligne porte donc un badge Éditeur ou Indépendant, accompagné du nom du publisher. Un même modèle peut apparaître deux fois sur un même benchmark, une fois sous chaque statut : ce n'est pas une redondance, c'est l'information la plus utile de la page. Avant de comparer deux lignes entre elles, vérifiez d'abord qu'elles portent le même badge.

Codage et agentique

Ces benchmarks font résoudre au modèle des tâches de développement réelles : corriger un bug dans un dépôt, faire passer une suite de tests, exécuter des commandes dans un terminal. Le harness qui encadre le modèle, c'est-à-dire l'agent qui orchestre ses appels d'outils, influence le résultat autant que le modèle lui-même. Un même modèle testé avec deux harnesses différents ne produit pas le même score : la colonne de notes précise l'agent utilisé (agent=) quand la source le documente.

Le classement officiel de SWE-bench Verified n'a reçu aucune nouvelle soumission depuis février 2026. Les scores les plus récents de cette catégorie proviennent donc uniquement des cartes des éditeurs, pas d'une soumission vérifiée sur ce classement précis.

Terminal-Bench 2.1
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Fable 5agent=Claude Code · ci=±1.2 · submitted=2026-06-07AnthropicPropriétaire83,8 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
GPT-5.5agent=Codex · ci=±1.1 · submitted=2026-05-01OpenAIPropriétaire83,1 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
Claude Opus 4.8agent=Claude Code · ci=±1.3 · submitted=2026-07-09AnthropicPropriétaire78,9 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 Terraagent=Codex · ci=±1.3 · submitted=2026-07-11OpenAIPropriétaire78,4 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
Muse Spark 1.1agent=mini-SWE-agent · ci=±1.2 · submitted=2026-07-09MetaNon documentée76,2 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet
GPT-5.6 Lunaagent=Codex · ci=±1.3 · submitted=2026-07-11OpenAIPropriétaire75,7 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Claude Sonnet 5agent=Claude Code · ci=±1.6 · submitted=2026-07-09AnthropicPropriétaire74,6 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Claude Sonnet 5 dans un nouvel onglet
Gemini 3 Proagent=Terminus 2 · ci=±1.3 · submitted=2026-05-01GooglePropriétaire73,9 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Gemini 3 Pro dans un nouvel onglet
Claude Opus 4.7agent=Claude Code · ci=±1.4 · submitted=2026-05-01AnthropicPropriétaire68,9 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet
Gemini 3.1 Proagent=Gemini CLI · ci=±1.7 · submitted=2026-05-05GooglePropriétaire65,8 %IndépendantTerminal-Benchtbench.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Classement maintenu par Terminal-Bench (tbench.ai). Voir le classement officiel
Terminal-Bench 2.1, rejoué par Artificial Analysis
ModèleÉditeurLicenceScoreStatutSourceRelevé le
GPT-5.6 Soleffort=xhigh · agent=Terminus 2 · runs=3OpenAIPropriétaire89,5 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Claude Opus 5effort=max · mode=adaptive · agent=Terminus 2 · runs=3AnthropicPropriétaire89,1 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Classement maintenu par Artificial Analysis. Voir le classement officiel
SWE-bench Verified
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Opus 5effort=max · runs=5 · n=500AnthropicPropriétaire96 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Opus 4.5effort=high · agent=mini-SWE-agentAnthropicPropriétaire76,8 %IndépendantSWE-benchswebench.com Ouvrir la source du score de Claude Opus 4.5 dans un nouvel onglet
Gemini 3 Flasheffort=high · agent=mini-SWE-agentGooglePropriétaire75,8 %IndépendantSWE-benchswebench.com Ouvrir la source du score de Gemini 3 Flash dans un nouvel onglet
Claude Opus 4.6agent=mini-SWE-agentAnthropicPropriétaire75,6 %IndépendantSWE-benchswebench.com Ouvrir la source du score de Claude Opus 4.6 dans un nouvel onglet
GPT-5.2 Codexagent=mini-SWE-agentOpenAIPropriétaire72,8 %IndépendantSWE-benchswebench.com Ouvrir la source du score de GPT-5.2 Codex dans un nouvel onglet
Claude Sonnet 4.5effort=high · agent=mini-SWE-agentAnthropicPropriétaire71,4 %IndépendantSWE-benchswebench.com Ouvrir la source du score de Claude Sonnet 4.5 dans un nouvel onglet
Gemini 3 Proagent=mini-SWE-agentGooglePropriétaire69,6 %IndépendantSWE-benchswebench.com Ouvrir la source du score de Gemini 3 Pro dans un nouvel onglet
Classement maintenu par SWE-bench team. Voir le classement officiel
SWE-bench Pro
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Mythos 5AnthropicPropriétaire80,3 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Claude Mythos 5 dans un nouvel onglet
Claude Fable 5effort=maxAnthropicPropriétaire80 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Claude Opus 5effort=max · runs=5AnthropicPropriétaire79,2 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Mythos PreviewAnthropicPropriétaire77,8 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Claude Mythos Preview dans un nouvel onglet
Claude Opus 4.8AnthropicPropriétaire69,2 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 SolOpenAIPropriétaire64,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire63,4 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire62,7 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
GLM-5.2effort=maxZ.aiMIT62,1 %ÉditeurZ.aihuggingface.co Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
Muse Spark 1.1split=public · ci=±3.10MetaNon documentée61,5 %IndépendantScale AIlabs.scale.com Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet
GPT-5.5OpenAIPropriétaire59,4 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
GPT-5.4split=public · effort=xhigh · ci=±3.56OpenAIPropriétaire59,1 %IndépendantScale AIlabs.scale.com Ouvrir la source du score de GPT-5.4 dans un nouvel onglet
Muse Sparksplit=public · ci=±3.60MetaNon documentée55 %IndépendantScale AIlabs.scale.com Ouvrir la source du score de Muse Spark dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire54,2 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Claude Opus 4.6split=public · mode=thinking · ci=±3.61AnthropicPropriétaire51,9 %IndépendantScale AIlabs.scale.com Ouvrir la source du score de Claude Opus 4.6 dans un nouvel onglet
Gemini 3.1 Prosplit=public · mode=thinking · ci=±3.60GooglePropriétaire46,1 %IndépendantScale AIlabs.scale.com Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Classement maintenu par Scale AI. Voir le classement officiel

Raisonnement

GPQA Diamond et Humanity's Last Exam évaluent des connaissances de niveau expert sur des questions à réponse fermée, sans accès à des outils externes. GPQA Diamond approche la saturation : les modèles les plus récents se tiennent à moins d'un point d'écart, ce qui ne départage plus grand-chose entre eux. Humanity's Last Exam reste plus discriminant, mais son score dépend fortement du périmètre retenu (texte seul ou jeu complet) et du modèle utilisé pour juger les réponses ouvertes, deux paramètres que la colonne de notes précise quand ils sont connus.

GPQA Diamond
ModèleÉditeurLicenceScoreStatutSourceRelevé le
GPT-5.6 SolOpenAIPropriétaire94,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire94,3 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire94,1 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
GPT-5.6 Soleffort=maxOpenAIPropriétaire94,1 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Claude Opus 5effort=high · mode=adaptiveAnthropicPropriétaire93,7 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
GPT-5.5OpenAIPropriétaire93,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
Kimi K3effort=maxMoonshot AIKimi K3 License93,5 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire92,9 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
Claude Fable 5AnthropicPropriétaire92,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire92,3 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Claude Opus 4.8AnthropicPropriétaire92 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GLM-5.2effort=maxZ.aiMIT91,2 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
Classement maintenu par Artificial Analysis. Voir le classement officiel
Humanity's Last Exam
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Fable 5tools=offAnthropicPropriétaire56,5 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Claude Opus 5tools=off · effort=max · runs=5AnthropicPropriétaire56,3 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Fable 5effort=max · fallback=Claude Opus 4.8 · subset=text-only · n=2158AnthropicPropriétaire53,3 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Claude Opus 5effort=max · mode=adaptive · subset=text-only · n=2158AnthropicPropriétaire52,6 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Opus 4.8tools=offAnthropicPropriétaire49,8 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 Soltools=off · dataset=fullOpenAIPropriétaire44,5 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Kimi K3tools=off · dataset=full · effort=maxMoonshot AIKimi K3 License43,5 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet
GPT-5.5tools=off · dataset=fullOpenAIPropriétaire41,4 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
GLM-5.2tools=off · subset=text-onlyZ.aiMIT40,5 %ÉditeurZ.aihuggingface.co Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
Classement maintenu par Center for AI Safety, Scale AI. Voir le classement officiel

Agents et outils

GDPval-AA, OSWorld et BrowseComp mesurent des capacités plus proches d'un usage réel : réaliser une tâche professionnelle notée par préférence humaine pour GDPval-AA, piloter une interface graphique d'ordinateur pour OSWorld, naviguer et rechercher sur le web pour retrouver une information précise pour BrowseComp. Ces benchmarks agentiques sont plus sensibles aux refus de sécurité et aux bascules automatiques vers un autre modèle qu'un test à réponse unique : un refus ou une bascule compte comme un échec dans la moyenne finale, au même titre qu'une erreur du modèle.

GDPval-AA v2
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Opus 5effort=maxAnthropicPropriétaire1 861ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
GPT-5.6 SolOpenAIPropriétaire1 747,8ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Claude Fable 5AnthropicPropriétaire1 747ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Kimi K3effort=maxMoonshot AIKimi K3 License1 686ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet
Claude Opus 4.8AnthropicPropriétaire1 593ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire1 593ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire1 591,8ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
GLM-5.2effort=maxZ.aiMIT1 510ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
GPT-5.5OpenAIPropriétaire1 493,7ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
Gemini 3.5 FlashGooglePropriétaire1 348,8ÉditeurOpenAIopenai.com Ouvrir la source du score de Gemini 3.5 Flash dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire962,3ÉditeurOpenAIopenai.com Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Classement maintenu par Artificial Analysis. Voir le classement officiel
OSWorld 2.0
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Opus 5effort=maxAnthropicPropriétaire70,6 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Fable 5AnthropicPropriétaire66,1 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
GPT-5.6 SolOpenAIPropriétaire62,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Kimi K3effort=maxMoonshot AIKimi K3 License58,3 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet
Claude Opus 4.8AnthropicPropriétaire55,7 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire50,2 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
GPT-5.5OpenAIPropriétaire47,5 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire45,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Classement maintenu par OSWorld team, University of Hong Kong. Voir le classement officiel
BrowseComp
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Kimi K3effort=max · compaction=300KMoonshot AIKimi K3 License91,2 %ÉditeurMoonshot AIhuggingface.co Ouvrir la source du score de Kimi K3 dans un nouvel onglet
Claude Opus 5effort=maxAnthropicPropriétaire90,8 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
GPT-5.6 SolOpenAIPropriétaire90,4 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire87,5 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
Claude Fable 5AnthropicPropriétaire87,4 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire85,9 %ÉditeurOpenAIopenai.com Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
GPT-5.5OpenAIPropriétaire84,4 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
Claude Opus 4.8AnthropicPropriétaire84,3 %ÉditeurAnthropicwww-cdn.anthropic.com Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire83,3 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Classement maintenu par OpenAI. Voir le classement officiel

Long contexte

AA-LCR et OpenAI MRCR testent la capacité d'un modèle à retrouver et à raisonner sur une information noyée dans une fenêtre de contexte très longue, plutôt qu'à raisonner dans l'absolu. Un score élevé ici ne présage rien de la qualité de raisonnement du même modèle sur un contexte court, et inversement. Peu d'éditeurs publient ce type de chiffre pour l'ensemble de leur gamme, ce qui explique des tableaux plus courts que dans les autres catégories.

AA-LCR : raisonnement sur long contexte
ModèleÉditeurLicenceScoreStatutSourceRelevé le
GPT-5.2 Codexeffort=xhighOpenAIPropriétaire75,7 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.2 Codex dans un nouvel onglet
GPT-5effort=highOpenAIPropriétaire75,6 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5 dans un nouvel onglet
GPT-5.1effort=highOpenAIPropriétaire75 %IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.1 dans un nouvel onglet
Classement maintenu par Artificial Analysis. Voir le classement officiel
OpenAI MRCR v2 (8-needle, 256K-512K)
ModèleÉditeurLicenceScoreStatutSourceRelevé le
GPT-5.6 SolOpenAIPropriétaire91,5 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
GPT-5.6 TerraOpenAIPropriétaire89,6 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
GPT-5.5OpenAIPropriétaire81,5 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.5 dans un nouvel onglet
GPT-5.6 LunaOpenAIPropriétaire41,3 %ÉditeurOpenAIopenai.com Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Classement maintenu par OpenAI. Voir le classement officiel

Préférence humaine

Text Arena et WebDev Arena classent les modèles par un score Elo construit sur des votes de préférence humaine en aveugle, pas par une notation automatique. L'intervalle de confiance et le nombre de votes comptent alors plus que le rang affiché : sur ces classements, plusieurs modèles consécutifs se recouvrent souvent statistiquement, et un modèle récemment ajouté peut afficher un rang flatteur sur un volume de votes encore faible. La colonne de notes reporte l'intervalle de confiance (ci=) et le nombre de votes (votes=) quand la source les publie.

Text Arena
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Fable 5ci=±6AnthropicPropriétaire1 508IndépendantArenaarena.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
Claude Opus 4.6mode=thinking · ci=±4AnthropicPropriétaire1 505IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 4.6 dans un nouvel onglet
Claude Opus 4.7mode=thinking · ci=±4AnthropicPropriétaire1 502IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet
Claude Opus 5effort=max · ci=±12AnthropicPropriétaire1 495IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Muse Spark 1.1ci=±7MetaNon documentée1 491IndépendantArenaarena.ai Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet
Muse Sparkci=±6MetaNon documentée1 488IndépendantArenaarena.ai Ouvrir la source du score de Muse Spark dans un nouvel onglet
Gemini 3.1 Proci=±3GooglePropriétaire1 486IndépendantArenaarena.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Classement maintenu par Arena. Voir le classement officiel
WebDev Arena
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Opus 5effort=max · votes=686AnthropicPropriétaire1 725IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Kimi K3effort=max · votes=3777Moonshot AIKimi K3 License1 682IndépendantArenaarena.ai Ouvrir la source du score de Kimi K3 dans un nouvel onglet
Claude Fable 5votes=5801AnthropicPropriétaire1 629IndépendantArenaarena.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
GPT-5.6 Soleffort=xhigh · votes=5340OpenAIPropriétaire1 623IndépendantArenaarena.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
GLM-5.2effort=max · votes=5779Z.aiMIT1 587IndépendantArenaarena.ai Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
Claude Opus 4.8mode=thinking · votes=8321AnthropicPropriétaire1 568IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 4.8 dans un nouvel onglet
Claude Opus 4.7votes=11138AnthropicPropriétaire1 560IndépendantArenaarena.ai Ouvrir la source du score de Claude Opus 4.7 dans un nouvel onglet
Classement maintenu par Arena. Voir le classement officiel

Indices composites

L'Artificial Analysis Intelligence Index agrège plusieurs benchmarks en un seul score, pondéré selon une méthodologie publique. Un indice composite simplifie la comparaison mais masque les écarts entre catégories : deux modèles à indice proche peuvent avoir des profils de forces très différents selon le sous-score retenu. Il donne un ordre de grandeur, pas un verdict.

Artificial Analysis Intelligence Index v4.1
ModèleÉditeurLicenceScoreStatutSourceRelevé le
Claude Opus 5effort=maxAnthropicPropriétaire61IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Opus 5 dans un nouvel onglet
Claude Fable 5fallback=Claude Opus 4.8AnthropicPropriétaire60IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Fable 5 dans un nouvel onglet
GPT-5.6 Soleffort=maxOpenAIPropriétaire59IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.6 Sol dans un nouvel onglet
Kimi K3Moonshot AIKimi K3 License57IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Kimi K3 dans un nouvel onglet
GPT-5.6 Terraeffort=maxOpenAIPropriétaire55IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.6 Terra dans un nouvel onglet
Claude Sonnet 5effort=maxAnthropicPropriétaire53IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Claude Sonnet 5 dans un nouvel onglet
GLM-5.2effort=maxZ.aiMIT51IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GLM-5.2 dans un nouvel onglet
GPT-5.6 Lunaeffort=maxOpenAIPropriétaire51IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de GPT-5.6 Luna dans un nouvel onglet
Muse Spark 1.1effort=xhighMetaNon documentée51IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Muse Spark 1.1 dans un nouvel onglet
Gemini 3.5 FlashGooglePropriétaire50IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Gemini 3.5 Flash dans un nouvel onglet
Gemini 3.6 FlashGooglePropriétaire50IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Gemini 3.6 Flash dans un nouvel onglet
Gemini 3.1 ProGooglePropriétaire46IndépendantArtificial Analysisartificialanalysis.ai Ouvrir la source du score de Gemini 3.1 Pro dans un nouvel onglet
Classement maintenu par Artificial Analysis. Voir le classement officiel

Méthodologie et limites

Cette page ne couvre pas tous les pièges de lecture d'un score : effet du niveau d'effort de raisonnement, contamination des jeux de test, contradictions entre le texte d'une annonce et son propre tableau. L'article Lire un benchmark LLM sans se faire avoir détaille neuf de ces pièges à partir de cas vérifiés. Les scores de cette page sont mis à jour périodiquement selon la procédure de rafraîchissement suivie par l'équipe éditoriale ; la date du dernier relevé global figure en tête de page.

Prochaines étapes