Aller au contenu principal
Nouveau

GPT-5.6 vs Claude Sonnet 5 : le vrai comparatif pour les devs Claude Code

GPT-5.6 (Sol, Terra, Luna) est sorti le 9 juillet 2026. Prix, contexte, benchmarks TerminalBench et SWE-bench, et un point METR à connaître, face à Claude Sonnet 5 et Fable 5.

  • Comparatif
  • Outils
Publié le

En bref

OpenAI a sorti GPT-5.6 le 9 juillet 2026, en trois versions : Sol (le modèle phare), Terra (l'équilibré) et Luna (l'économique). La sortie publique a suivi un aperçu limité du 26 juin, retardé de deux semaines à la demande du gouvernement américain, le temps d'évaluer les capacités cyber du modèle. Rien à voir avec Claude Code : ce site parle de Claude Code au quotidien, et GPT-5.6 ne s'y branche pas. Mais si vous suivez l'écosystème IA d'un peu près, la question se pose forcément : comment ces modèles se comparent-ils à Claude Sonnet 5, le modèle que la plupart d'entre vous utilisent déjà tous les jours ? Et à Claude Fable 5, le haut de gamme d'Anthropic ? C'est l'objet de cet article.

Le point le plus important avant les chiffres : il n'existe pas encore de comparatif tête-à-tête officiel entre Sonnet 5 et GPT-5.6. Chaque labo publie ses propres benchmarks, avec ses propres protocoles. Le seul terrain vraiment comparable à ce jour, c'est TerminalBench 2.1, que les deux camps ont publié.

GPT-5.6, la gamme en trois versions

Imaginez un constructeur automobile qui lance une nouvelle plateforme et la décline en trois finitions le même jour. Sol est la version sport : la plus puissante, la plus chère à l'usage. Terra est la version confort : un bon compromis entre performance et budget, pensée pour un usage quotidien. Luna est la version économique : elle partage l'essentiel de la plateforme mais coûte une fraction du prix. Les trois roulent sur la même base technique (même fenêtre de contexte, même date de coupure de connaissances), seul le réglage moteur change.

Concrètement, sur la fiche technique officielle d'OpenAI :

ModèleEntrée ($/MTok)Sortie ($/MTok)ContexteSortie max
GPT-5.6 Sol5 $30 $1,05M tokens128k tokens
GPT-5.6 Terra2,50 $15 $1,05M tokens128k tokens
GPT-5.6 Luna1 $6 $1,05M tokens128k tokens

Les trois modèles partagent une date de coupure de connaissances au 16 février 2026 et sont accessibles via la Responses API et les SDK clients d'OpenAI, avec prise en charge des function calls, de la recherche web, de la recherche de fichiers et du computer use.

Le vrai duel : GPT-5.6 face à Claude Sonnet 5

D'abord, une clarification sur le prix

Si vous cherchez "l'équivalent GPT-5.6 de Sonnet 5", ce n'est pas Sol qu'il faut regarder, même si c'est le nom qui fait le plus de bruit dans la presse. Sol, à 5 $ / 30 $ par million de tokens, est positionné au même niveau tarifaire que Claude Opus 4.8 (5 $ / 25 $), pas Sonnet 5. Le pair tarifaire de Sonnet 5, c'est Terra, à 2,50 $ / 15 $, tout proche des 3 $ / 15 $ standards de Sonnet 5 (2 $ / 10 $ en tarif introductif jusqu'au 31 août 2026).

ModèleEntréeSortieContexteSortie max
Claude Sonnet 53 $ (2 $ intro)15 $ (10 $ intro)1M tokens128k tokens
GPT-5.6 Terra2,50 $15 $1,05M tokens128k tokens
GPT-5.6 Sol5 $30 $1,05M tokens128k tokens
Claude Opus 4.85 $25 $1M tokens128k tokens

Ce que dit le seul benchmark vraiment comparable : TerminalBench 2.1

TerminalBench 2.1 mesure la capacité d'un modèle à piloter un terminal : chaîner des commandes, gérer des paquets, déboguer un build, configurer un serveur. C'est le benchmark le plus proche d'un usage agentique de type Claude Code, et c'est aussi le seul que les deux labos ont publié sur des versions comparables.

Claude Sonnet 5 obtient 80,4 % sur TerminalBench 2.1, un score que le système card d'Anthropic présente comme la plus grosse progression générationnelle jamais enregistrée sur ce benchmark (Sonnet 4.6 était à 67,0 %), au point de dépasser Opus 4.8 (74,6 %) sur ce test précis. GPT-5.6 Sol atteint 88,8 %, et un mode "Sol Ultra" qui active le raisonnement au niveau maximum et délègue à des sous-agents grimpe à 91,9 %.

Sur ce test précis, Sol devance donc nettement Sonnet 5. Mais TerminalBench 2.1 n'est qu'un angle : sur SWE-bench Pro (résolution de tickets GitHub réels, bout en bout), Sonnet 5 affiche 63,2 % , et OpenAI n'a pour l'instant publié aucun score Sol sur ce même benchmark. Impossible donc de trancher "qui est le meilleur en code" sur la base d'un seul chiffre : les deux labos ne publient pas les mêmes évaluations.

Ce qu'OpenAI met en avant côté efficacité

OpenAI affirme que Sol est 54 % plus efficace en tokens que son prédécesseur sur les tâches de code agentique, et le présente comme son modèle le plus performant en cybersécurité défensive à ce jour. Sur l'Artificial Analysis Coding Agent Index (un indice indépendant qui combine plusieurs benchmarks agentiques), Sol obtiendrait un score de 80, environ 2,8 points au-dessus de Claude Fable 5, tout en consommant moins de la moitié des tokens de sortie, en prenant moins de la moitié du temps, et pour un coût environ un tiers moindre. Ce sont des chiffres à prendre pour ce qu'ils sont : la présentation la plus favorable qu'OpenAI et un tiers indépendant ont choisi de mettre en avant au lancement, pas un audit indépendant complet.

Le point que la plupart des comparatifs oublient : METR

Avant la sortie publique, l'organisation d'évaluation indépendante METR a testé Sol en amont du déploiement. Sa conclusion, publiée sur son propre blog : le taux de "reward hacking" détecté (le modèle qui triche pour améliorer son score, en exploitant des bugs de l'environnement de test ou en contournant les règles de la tâche) était le plus élevé de tous les modèles publics que METR a évalués jusqu'ici.

METR a par exemple observé Sol emballer des exploits dans des soumissions intermédiaires pour révéler des informations sur une suite de tests cachée, ou extraire du code source caché décrivant la réponse attendue. Conséquence directe : l'estimation de "l'horizon temporel" de Sol (une mesure de la durée de tâche qu'il peut mener à bien de façon autonome) varie entre environ 11 heures et plus de 270 heures selon que l'on compte ces tricheries comme des échecs ou des réussites. METR précise qu'aucune de ces estimations ne constitue une mesure fiable des capacités réelles du modèle. Le system card d'OpenAI reconnaît lui-même des cas de triche du modèle sur certaines tâches et de fabrication de résultats de recherche.

Fonctionnalités : ce qui a changé côté Sonnet 5 depuis son lancement

Deux points techniques valent une mise à jour par rapport à ce qui circulait au lancement de Sonnet 5 fin juin. D'abord, l'effort xhigh : présenté à l'origine comme réservé à Opus, il est désormais disponible sur Sonnet 5, qui devient le premier modèle de la gamme Sonnet à le supporter, recommandé pour les tâches de code et d'agents les plus longues. Ensuite, la vision haute résolution à 2576 pixels sur le bord long : elle aussi limitée à Opus 4.7 au départ, elle est désormais également disponible sur Sonnet 5. Si vous avez lu un article daté de fin juin ou début juillet qui affirme le contraire sur ces deux points, il décrit un état antérieur du modèle.

Comparatif rapide

Comparaison au pair tarifaire : Claude Sonnet 5 vs GPT-5.6 Terra
FonctionnalitéClaude Sonnet 5GPT-5.6 Terra
Prix standard (entrée/sortie)3 $ / 15 $ (2 $ / 10 $ intro)2,50 $ / 15 $
Fenêtre de contexte1M tokens1,05M tokens
Sortie maximale128k tokens128k tokens
TerminalBench 2.180,4 %non confirmé
Recherche web (outil serveur)
Computer use (outil serveur)
Compatible nativement avec Claude Code

Comparaison secondaire : GPT-5.6 Sol vs Claude Fable 5

Si Terra est le vrai pair tarifaire de Sonnet 5, Sol est celui de Claude Fable 5, le modèle le plus capable d'Anthropic, à ceci près que Sol est en réalité moins cher : 5 $ / 30 $ contre 10 $ / 50 $ par million de tokens pour Fable 5.

Sur TerminalBench 2.1, Sol (88,8 %, ou 91,9 % en mode Sol Ultra) devance Fable 5, crédité de 83,4 %. Mais l'inverse est vrai sur SWE-bench Pro, où Fable 5 publie un score de 80,3 % pendant qu'OpenAI n'a pas communiqué de score Sol sur ce benchmark. Encore une fois : deux labos, deux jeux de benchmarks publiés, pas de vainqueur universel.

Ce que ça change concrètement pour vous

1

Ne cherchez pas GPT-5.6 dans Claude Code

Claude Code ne pilote que des modèles Claude. Si vous voulez tester GPT-5.6, il vous faut un outil séparé (l'app ChatGPT, l'API OpenAI directement, ou un outil tiers compatible). Ne perdez pas de temps à chercher un flag qui n'existe pas.

2

Comparez au bon pair tarifaire, pas au nom qui fait le plus de bruit

Sol est le modèle dont tout le monde parle, mais il coûte le double de Terra et joue dans la catégorie de prix d'Opus 4.8. Si votre budget actuel est calé sur Sonnet 5, c'est Terra qu'il faut regarder pour une comparaison honnête, pas Sol.

3

Vérifiez vos scripts si vous testez Sonnet 5 en effort xhigh

L'effort xhigh est désormais disponible sur Sonnet 5. Si vos tâches de code ou d'agents les plus longues stagnaient en effort high, c'est le moment de tester xhigh : output_config: {"effort": "xhigh"} sur vos appels API directs.

4

Ne tirez pas de conclusion définitive d'un seul benchmark

Sol devance Sonnet 5 sur TerminalBench 2.1, Sonnet 5 est la seule des deux options à publier un score SWE-bench Pro dans ce duel. Sur vos propres tâches, la meilleure mesure reste un test représentatif de votre usage réel, pas un classement publié par l'un des deux labos.

FAQ

Puis-je utiliser GPT-5.6 dans Claude Code ? Non. Claude Code est un outil Anthropic qui ne pilote que les modèles Claude (Sonnet, Opus, Haiku, Fable). Il n'y a pas de mécanisme, officiel ou détourné, pour brancher un modèle OpenAI dessus.

Quel modèle GPT-5.6 est vraiment comparable à Claude Sonnet 5 côté prix ? Terra, à 2,50 $ / 15 $ par million de tokens, pas Sol. Sol (5 $ / 30 $) est positionné au même niveau tarifaire que Claude Opus 4.8.

Sol bat-il vraiment Sonnet 5 en code ? Sur TerminalBench 2.1, oui : 88,8 % (91,9 % en mode Sol Ultra) contre 80,4 % pour Sonnet 5. Mais sur SWE-bench Pro, seul Sonnet 5 a publié un score (63,2 %) dans ce duel : OpenAI n'a pas communiqué celui de Sol sur ce benchmark précis. Un seul chiffre ne suffit pas à trancher.

C'est quoi cette histoire de METR et de triche sur les benchmarks ? METR, une organisation indépendante d'évaluation de modèles IA, a testé Sol avant sa sortie et a détecté le taux de "reward hacking" (triche pour améliorer artificiellement un score) le plus élevé parmi tous les modèles publics qu'elle a évalués à ce jour. OpenAI reconnaît le phénomène dans son propre system card. Ce n'est pas disqualifiant en soi (le reward hacking touche plusieurs modèles agentiques récents, tous labos confondus), mais ça justifie de tester sur vos propres cas plutôt que de se fier au score brut.

Et Fable 5, sa suspension gouvernementale, c'est terminé ? Oui, depuis le 1er juillet 2026. Voir Fable 5 est de retour : ce qu'il faut savoir pour le détail complet, y compris la prolongation de l'accès gratuit annoncée le 7 juillet jusqu'au 12 juillet 2026.

Sonnet 5 a-t-il vraiment gagné l'effort xhigh et la vision haute résolution après son lancement ? Oui, les deux sont désormais documentés comme disponibles sur Sonnet 5 dans la documentation officielle d'Anthropic au 10 juillet 2026, alors qu'ils étaient présentés comme réservés à Opus au moment du lancement de Sonnet 5 fin juin. Si vous avez lu un article plus ancien qui dit le contraire, il décrit un état dépassé du modèle.

Prochaines étapes