Aller au contenu principal
Nouveau

GPT-6 face à Opus 5.5 : ce que disent vraiment les prix et les chiffres

OpenAI lance GPT-6 Astra le 3 septembre 2026 puis Sol et Luna le 22, le jour même d'Opus 5.5. Tarifs officiels, benchmarks disponibles et pièges de comparaison, sans parti pris.

  • Comparatif
  • Performance
Publié le

En bref

Septembre 2026 a vu deux lancements majeurs le même jour. Le 22 septembre, Anthropic a publié Claude Opus 5.5 et OpenAI a publié GPT-6 Sol et GPT-6 Luna. Le modèle haut de gamme d'OpenAI, GPT-6 Astra, était sorti un peu avant, le 3 septembre.

Cet article compare ce qui peut l'être avec des sources officielles. Une précision d'emblée : la page d'annonce d'OpenAI n'a pas pu être consultée au moment de la rédaction (accès refusé côté serveur). Les informations OpenAI viennent donc de sa documentation développeur : le changelog et la page de tarifs.

Qui est qui dans la gamme GPT-6

OpenAI décline GPT-6 en trois modèles, sur le même schéma que GPT-5.6 :

  • GPT-6 Astra (gpt-6-astra) : présenté comme « notre modèle le plus capable, conçu pour le travail de bout en bout le plus difficile ». Raisonnement, code, computer use, recherche et création de documents.
  • GPT-6 Sol (gpt-6-sol) et GPT-6 Luna (gpt-6-luna) : des modèles de raisonnement qui acceptent texte et images, disponibles via les API Responses et Chat Completions.

Pour faire simple, Astra joue dans la catégorie d'Opus 5.5 et de Fable 5.1. Sol et Luna visent plutôt le volume, là où Anthropic place Sonnet et Haiku (Sonnet 5.5 et Haiku 5.5 sont annoncés « dans les semaines à venir »).

Les tarifs, côte à côte

Prix officiels par million de tokens, en traitement standard. Pour OpenAI, ce sont les tarifs « contexte court », qui s'appliquent jusqu'à 272 000 tokens en entrée.

ModèleEntréeLecture de cacheÉcriture de cacheSortie
Claude Opus 5.54 $0,20 $5 $20 $
GPT-6 Astra10 $1 $12,50 $50 $
GPT-6 Sol2 $0,20 $2,50 $10 $
GPT-6 Luna0,10 $0,01 $0,125 $0,50 $

Au-delà de 272 000 tokens en entrée, OpenAI applique un tarif « contexte long » plus élevé : par exemple 20 $ en entrée et 75 $ en sortie pour Astra. Si vous travaillez sur de gros dépôts avec beaucoup de contexte, c'est un seuil à surveiller.

Sur le papier, Opus 5.5 coûte deux fois et demie moins cher qu'Astra, token pour token. GPT-6 Sol est deux fois moins cher qu'Opus 5.5 en entrée et en sortie, avec le même prix de lecture de cache.

Les benchmarks disponibles

Le seul tableau officiel qui met Opus 5.5 et GPT-6 Astra côte à côte vient d'Anthropic. Il faut donc le lire comme ce qu'il est : le point de vue d'un des deux concurrents.

BenchmarkOpus 5.5GPT-6 Astra
Terminal-Bench 4.066,4 %57,9 %
FrontierCode v1.1 (Main)54,4 %53,3 %
GDPval-AA v2.1 (Elo)18461542
AutomationBench40,0 %41,4 %
Humanity's Last Exam (avec outils)67,7 %57,2 %
Terminal-Bench-Science 0.158,7 %64,6 %

Ce que les notes de bas de tableau précisent :

  • Les scores de GPT-6 Astra sur Terminal-Bench 4.0 et Terminal-Bench-Science sont « tels que rapportés par OpenAI ». Anthropic ne les a pas re-mesurés.
  • Sur Terminal-Bench 4.0, Opus 5.5 est noté en effort xhigh et Astra en effort high. Chaque modèle est pris à son meilleur score.
  • Les résultats AutomationBench viennent de Zapier. Les runs d'Opus 5.5 ont été faits sans modèle de repli, donc chaque intervention des garde-fous comptait comme un échec.

Astra gagne sur AutomationBench et Terminal-Bench-Science. Opus 5.5 gagne sur les autres lignes. Aucun des deux ne domine partout.

Il manque surtout une chose : aucun chiffre ne compare Opus 5.5 à GPT-6 Sol, sorti le même jour. Les deux annonces ont été publiées en parallèle, et aucune des deux sources officielles consultées ne propose ce face-à-face. Méfiez-vous des tableaux qui circulent déjà avec ces deux colonnes : vérifiez d'où viennent les chiffres.

Les différences techniques qui comptent pour un dev

Au-delà des scores, quelques contraintes documentées peuvent peser dans le choix :

Côté GPT-6 Astra, le changelog OpenAI liste des changements à prévoir pour une migration : pas de niveau de raisonnement none, pas de temperature ni de top_p personnalisés, pas de logprobs, et l'appel d'outils exige l'API Responses. OpenAI ajoute aussi une surveillance d'alignement asynchrone qui peut déclencher une alerte ou arrêter une conversation pour revue.

Côté Opus 5.5, le mode « thinking » ne peut plus être désactivé, et la plupart des tâches de cybersécurité sont redirigées vers Opus 4.8.

Les deux éditeurs convergent donc sur un point : le raisonnement devient obligatoire sur leurs modèles haut de gamme.

Alors, lequel choisir ?

Si vous êtes sur Claude Code, la question se pose peu : l'outil tourne sur les modèles Anthropic, et Opus 5.5 y est le modèle par défaut sur la plupart des offres.

Si vous construisez votre propre produit sur une API, voici une grille de lecture honnête :

  • Tâches d'agent longues sur du code : les chiffres publiés favorisent Opus 5.5, mais ils viennent d'Anthropic. Testez sur vos propres tâches.
  • Gros volume, tâches simples : GPT-6 Luna à 0,10 $ en entrée n'a pas d'équivalent Anthropic publié à ce jour, Haiku 5.5 n'étant pas encore sorti.
  • Recherche scientifique agentique : Astra a le meilleur score publié sur Terminal-Bench-Science (64,6 %), d'après le même tableau d'Anthropic.

La seule méthode fiable reste la même qu'en juillet : prendre dix tâches représentatives de votre travail, les faire tourner sur chaque modèle et mesurer le coût réel et la qualité.

Prochaines étapes