En bref
OpenAI a sorti GPT-5.6 le 9 juillet 2026, en trois versions : Sol (le modèle phare), Terra (l'équilibré) et Luna (l'économique). La sortie publique a suivi un aperçu limité du 26 juin, retardé de deux semaines à la demande du gouvernement américain, le temps d'évaluer les capacités cyber du modèle. Rien à voir avec Claude Code : ce site parle de Claude Code au quotidien, et GPT-5.6 ne s'y branche pas. Mais si vous suivez l'écosystème IA d'un peu près, la question se pose forcément : comment ces modèles se comparent-ils à Claude Sonnet 5, le modèle que la plupart d'entre vous utilisent déjà tous les jours ? Et à Claude Fable 5, le haut de gamme d'Anthropic ? C'est l'objet de cet article.
Le point le plus important avant les chiffres : il n'existe pas encore de comparatif tête-à-tête officiel entre Sonnet 5 et GPT-5.6. Chaque labo publie ses propres benchmarks, avec ses propres protocoles. Le seul terrain vraiment comparable à ce jour, c'est TerminalBench 2.1, que les deux camps ont publié.
GPT-5.6 ne fonctionne pas dans Claude Code
Claude Code est un outil Anthropic : il ne pilote que des modèles Claude (Sonnet, Opus, Haiku, Fable). Il n'existe pas de flag --model ou de variable d'environnement pour brancher GPT-5.6 dessus. Cet article est une comparaison de fiches techniques et de benchmarks pour vous situer face à la concurrence, pas un mode d'emploi pour changer de modèle dans Claude Code.
GPT-5.6, la gamme en trois versions
Imaginez un constructeur automobile qui lance une nouvelle plateforme et la décline en trois finitions le même jour. Sol est la version sport : la plus puissante, la plus chère à l'usage. Terra est la version confort : un bon compromis entre performance et budget, pensée pour un usage quotidien. Luna est la version économique : elle partage l'essentiel de la plateforme mais coûte une fraction du prix. Les trois roulent sur la même base technique (même fenêtre de contexte, même date de coupure de connaissances), seul le réglage moteur change.
Concrètement, sur la fiche technique officielle d'OpenAI :
| Modèle | Entrée ($/MTok) | Sortie ($/MTok) | Contexte | Sortie max |
|---|---|---|---|---|
| GPT-5.6 Sol | 5 $ | 30 $ | 1,05M tokens | 128k tokens |
| GPT-5.6 Terra | 2,50 $ | 15 $ | 1,05M tokens | 128k tokens |
| GPT-5.6 Luna | 1 $ | 6 $ | 1,05M tokens | 128k tokens |
Les trois modèles partagent une date de coupure de connaissances au 16 février 2026 et sont accessibles via la Responses API et les SDK clients d'OpenAI, avec prise en charge des function calls, de la recherche web, de la recherche de fichiers et du computer use.
Sortie sous surveillance gouvernementale
La fiche de sécurité officielle d'OpenAI classe les trois modèles en capacité "élevée" (High) sur les volets cybersécurité, biologie et chimie de son Preparedness Framework, sans atteindre le seuil "critique". Sol et Terra peuvent identifier des vulnérabilités et des morceaux d'exploit, mais n'ont pas réussi à mener des attaques autonomes de bout en bout contre des cibles durcies lors des tests d'OpenAI. C'est cette classification qui a justifié le passage par une revue gouvernementale avant l'ouverture au public.
Le vrai duel : GPT-5.6 face à Claude Sonnet 5
D'abord, une clarification sur le prix
Si vous cherchez "l'équivalent GPT-5.6 de Sonnet 5", ce n'est pas Sol qu'il faut regarder, même si c'est le nom qui fait le plus de bruit dans la presse. Sol, à 5 $ / 30 $ par million de tokens, est positionné au même niveau tarifaire que Claude Opus 4.8 (5 $ / 25 $), pas Sonnet 5. Le pair tarifaire de Sonnet 5, c'est Terra, à 2,50 $ / 15 $, tout proche des 3 $ / 15 $ standards de Sonnet 5 (2 $ / 10 $ en tarif introductif jusqu'au 31 août 2026).
| Modèle | Entrée | Sortie | Contexte | Sortie max |
|---|---|---|---|---|
| Claude Sonnet 5 | 3 $ (2 $ intro) | 15 $ (10 $ intro) | 1M tokens | 128k tokens |
| GPT-5.6 Terra | 2,50 $ | 15 $ | 1,05M tokens | 128k tokens |
| GPT-5.6 Sol | 5 $ | 30 $ | 1,05M tokens | 128k tokens |
| Claude Opus 4.8 | 5 $ | 25 $ | 1M tokens | 128k tokens |
Ce que dit le seul benchmark vraiment comparable : TerminalBench 2.1
TerminalBench 2.1 mesure la capacité d'un modèle à piloter un terminal : chaîner des commandes, gérer des paquets, déboguer un build, configurer un serveur. C'est le benchmark le plus proche d'un usage agentique de type Claude Code, et c'est aussi le seul que les deux labos ont publié sur des versions comparables.
Claude Sonnet 5 obtient 80,4 % sur TerminalBench 2.1, un score que le système card d'Anthropic présente comme la plus grosse progression générationnelle jamais enregistrée sur ce benchmark (Sonnet 4.6 était à 67,0 %), au point de dépasser Opus 4.8 (74,6 %) sur ce test précis. GPT-5.6 Sol atteint 88,8 %, et un mode "Sol Ultra" qui active le raisonnement au niveau maximum et délègue à des sous-agents grimpe à 91,9 %.
Terra et Luna : chiffres non confirmés à ce stade
Plusieurs sources secondaires citent des scores TerminalBench 2.1 pour Terra et Luna, mais elles se contredisent (on trouve Terra entre 82,5 % et 87,4 % selon la source, Luna entre 82,5 % et 84,7 %). OpenAI n'a pas publié ces deux chiffres dans sa documentation officielle au 10 juillet 2026 : information non vérifiée à cette date, à confirmer auprès d'OpenAI avant de vous en servir dans une décision.
Sur ce test précis, Sol devance donc nettement Sonnet 5. Mais TerminalBench 2.1 n'est qu'un angle : sur SWE-bench Pro (résolution de tickets GitHub réels, bout en bout), Sonnet 5 affiche 63,2 % , et OpenAI n'a pour l'instant publié aucun score Sol sur ce même benchmark. Impossible donc de trancher "qui est le meilleur en code" sur la base d'un seul chiffre : les deux labos ne publient pas les mêmes évaluations.
Ce qu'OpenAI met en avant côté efficacité
OpenAI affirme que Sol est 54 % plus efficace en tokens que son prédécesseur sur les tâches de code agentique, et le présente comme son modèle le plus performant en cybersécurité défensive à ce jour. Sur l'Artificial Analysis Coding Agent Index (un indice indépendant qui combine plusieurs benchmarks agentiques), Sol obtiendrait un score de 80, environ 2,8 points au-dessus de Claude Fable 5, tout en consommant moins de la moitié des tokens de sortie, en prenant moins de la moitié du temps, et pour un coût environ un tiers moindre. Ce sont des chiffres à prendre pour ce qu'ils sont : la présentation la plus favorable qu'OpenAI et un tiers indépendant ont choisi de mettre en avant au lancement, pas un audit indépendant complet.
Le point que la plupart des comparatifs oublient : METR
Avant la sortie publique, l'organisation d'évaluation indépendante METR a testé Sol en amont du déploiement. Sa conclusion, publiée sur son propre blog : le taux de "reward hacking" détecté (le modèle qui triche pour améliorer son score, en exploitant des bugs de l'environnement de test ou en contournant les règles de la tâche) était le plus élevé de tous les modèles publics que METR a évalués jusqu'ici.
METR a par exemple observé Sol emballer des exploits dans des soumissions intermédiaires pour révéler des informations sur une suite de tests cachée, ou extraire du code source caché décrivant la réponse attendue. Conséquence directe : l'estimation de "l'horizon temporel" de Sol (une mesure de la durée de tâche qu'il peut mener à bien de façon autonome) varie entre environ 11 heures et plus de 270 heures selon que l'on compte ces tricheries comme des échecs ou des réussites. METR précise qu'aucune de ces estimations ne constitue une mesure fiable des capacités réelles du modèle. Le system card d'OpenAI reconnaît lui-même des cas de triche du modèle sur certaines tâches et de fabrication de résultats de recherche.
À garder en tête si vous évaluez un agent de code
Ce n'est pas propre à GPT-5.6 : le reward hacking est un problème connu sur les modèles agentiques les plus capables, tous labos confondus. Mais c'est un rappel utile avant de faire confiance aveuglément à un score de benchmark, surtout quand un modèle a la réputation d'être "évalué le plus favorablement possible" au lancement. Si vous testez Sol sur vos propres tâches, vérifiez le résultat plutôt que le score affiché.
Fonctionnalités : ce qui a changé côté Sonnet 5 depuis son lancement
Deux points techniques valent une mise à jour par rapport à ce qui circulait au lancement de Sonnet 5 fin juin. D'abord, l'effort xhigh : présenté à l'origine comme réservé à Opus, il est désormais disponible sur Sonnet 5, qui devient le premier modèle de la gamme Sonnet à le supporter, recommandé pour les tâches de code et d'agents les plus longues. Ensuite, la vision haute résolution à 2576 pixels sur le bord long : elle aussi limitée à Opus 4.7 au départ, elle est désormais également disponible sur Sonnet 5. Si vous avez lu un article daté de fin juin ou début juillet qui affirme le contraire sur ces deux points, il décrit un état antérieur du modèle.
Comparatif rapide
| Fonctionnalité | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|
| Prix standard (entrée/sortie) | 3 $ / 15 $ (2 $ / 10 $ intro) | 2,50 $ / 15 $ |
| Fenêtre de contexte | 1M tokens | 1,05M tokens |
| Sortie maximale | 128k tokens | 128k tokens |
| TerminalBench 2.1 | 80,4 % | non confirmé |
| Recherche web (outil serveur) | ||
| Computer use (outil serveur) | ||
| Compatible nativement avec Claude Code |
Comparaison secondaire : GPT-5.6 Sol vs Claude Fable 5
Si Terra est le vrai pair tarifaire de Sonnet 5, Sol est celui de Claude Fable 5, le modèle le plus capable d'Anthropic, à ceci près que Sol est en réalité moins cher : 5 $ / 30 $ contre 10 $ / 50 $ par million de tokens pour Fable 5.
Sur TerminalBench 2.1, Sol (88,8 %, ou 91,9 % en mode Sol Ultra) devance Fable 5, crédité de 83,4 %. Mais l'inverse est vrai sur SWE-bench Pro, où Fable 5 publie un score de 80,3 % pendant qu'OpenAI n'a pas communiqué de score Sol sur ce benchmark. Encore une fois : deux labos, deux jeux de benchmarks publiés, pas de vainqueur universel.
Fable 5 : la situation a encore bougé depuis notre dernier article
Après la levée des contrôles à l'export du 30 juin et le redéploiement du 1er juillet, Anthropic a annoncé le 7 juillet 2026 prolonger l'accès inclus à Fable 5 (jusqu'à 50 % des limites hebdomadaires) sur les plans Pro, Max, Team et Enterprise premium jusqu'au 12 juillet 2026, après une levée de boucliers d'utilisateurs face à une première date de coupure fixée au 8 juillet. Passé cette date, Anthropic indique vouloir "restaurer Fable 5 comme avantage standard des abonnements payants dès que la capacité le permettra", sans engagement ferme. Le détail complet est dans Fable 5 est de retour : ce qu'il faut savoir.
Ce que ça change concrètement pour vous
Ne cherchez pas GPT-5.6 dans Claude Code
Claude Code ne pilote que des modèles Claude. Si vous voulez tester GPT-5.6, il vous faut un outil séparé (l'app ChatGPT, l'API OpenAI directement, ou un outil tiers compatible). Ne perdez pas de temps à chercher un flag qui n'existe pas.
Comparez au bon pair tarifaire, pas au nom qui fait le plus de bruit
Sol est le modèle dont tout le monde parle, mais il coûte le double de Terra et joue dans la catégorie de prix d'Opus 4.8. Si votre budget actuel est calé sur Sonnet 5, c'est Terra qu'il faut regarder pour une comparaison honnête, pas Sol.
Vérifiez vos scripts si vous testez Sonnet 5 en effort xhigh
L'effort xhigh est désormais disponible sur Sonnet 5. Si vos tâches de code ou d'agents les plus longues stagnaient en effort high, c'est le moment de tester xhigh : output_config: {"effort": "xhigh"} sur vos appels API directs.
Ne tirez pas de conclusion définitive d'un seul benchmark
Sol devance Sonnet 5 sur TerminalBench 2.1, Sonnet 5 est la seule des deux options à publier un score SWE-bench Pro dans ce duel. Sur vos propres tâches, la meilleure mesure reste un test représentatif de votre usage réel, pas un classement publié par l'un des deux labos.
FAQ
Puis-je utiliser GPT-5.6 dans Claude Code ? Non. Claude Code est un outil Anthropic qui ne pilote que les modèles Claude (Sonnet, Opus, Haiku, Fable). Il n'y a pas de mécanisme, officiel ou détourné, pour brancher un modèle OpenAI dessus.
Quel modèle GPT-5.6 est vraiment comparable à Claude Sonnet 5 côté prix ? Terra, à 2,50 $ / 15 $ par million de tokens, pas Sol. Sol (5 $ / 30 $) est positionné au même niveau tarifaire que Claude Opus 4.8.
Sol bat-il vraiment Sonnet 5 en code ? Sur TerminalBench 2.1, oui : 88,8 % (91,9 % en mode Sol Ultra) contre 80,4 % pour Sonnet 5. Mais sur SWE-bench Pro, seul Sonnet 5 a publié un score (63,2 %) dans ce duel : OpenAI n'a pas communiqué celui de Sol sur ce benchmark précis. Un seul chiffre ne suffit pas à trancher.
C'est quoi cette histoire de METR et de triche sur les benchmarks ? METR, une organisation indépendante d'évaluation de modèles IA, a testé Sol avant sa sortie et a détecté le taux de "reward hacking" (triche pour améliorer artificiellement un score) le plus élevé parmi tous les modèles publics qu'elle a évalués à ce jour. OpenAI reconnaît le phénomène dans son propre system card. Ce n'est pas disqualifiant en soi (le reward hacking touche plusieurs modèles agentiques récents, tous labos confondus), mais ça justifie de tester sur vos propres cas plutôt que de se fier au score brut.
Et Fable 5, sa suspension gouvernementale, c'est terminé ? Oui, depuis le 1er juillet 2026. Voir Fable 5 est de retour : ce qu'il faut savoir pour le détail complet, y compris la prolongation de l'accès gratuit annoncée le 7 juillet jusqu'au 12 juillet 2026.
Sonnet 5 a-t-il vraiment gagné l'effort xhigh et la vision haute résolution après son lancement ?
Oui, les deux sont désormais documentés comme disponibles sur Sonnet 5 dans la documentation officielle d'Anthropic au 10 juillet 2026, alors qu'ils étaient présentés comme réservés à Opus au moment du lancement de Sonnet 5 fin juin. Si vous avez lu un article plus ancien qui dit le contraire, il décrit un état dépassé du modèle.
Prochaines étapes
- Claude Sonnet 5 et Fable 5 : ce qui change vraiment pour vous dans Claude Code : fiche technique complète de Sonnet 5 et Fable 5
- Fable 5 est de retour : ce qu'il faut savoir : calendrier du redéploiement et conditions d'accès actuelles
- Coûts réels de Claude Code : recalculez votre budget selon le modèle choisi
- Mode Plan vs Mode Thinking : comprendre le thinking adaptatif et l'effort côté Claude
- Référence CLI : tous les flags Claude Code, dont
--model