GPT-6 Sol d’OpenAI double son taux de précision… pour la moitié du prix - ZDNET
Les points clés à retenir sur GPT-6
- OpenAI affirme que GPT-6 Sol commet deux fois moins d'erreurs que GPT-5.6.
- GPT-6 Luna offre des performances équivalentes à celles des modèles d’IA haut de gamme précédents, à un coût bien inférieur.
- Le véritable argument de vente d’OpenAI, c’est une IA moins chère, et pas seulement une IA plus intelligente.
OpenAI annonce la sortie et la mise à disposition générale de ses nouveaux modèles grand public, GPT-6 Sol et GPT-6 Luna. Alors que les lancements de nouveaux modèles d’IA sont désormais monnaie courante dans le secteur, les améliorations en matière de fiabilité annoncées aujourd’hui se démarquent nettement de la multitude de statistiques.OpenAI affirme que « GPT-6 Sol commet environ deux fois moins d’erreurs que son prédécesseur ». L’entreprise ajoute : « GPT-6 Luna présente également des améliorations substantielles ; à des niveaux d’effort plus élevés, il égale GPT-5.6 Sol pour environ un centième de son coût. »
En d’autres termes, si GPT-5.6 commettait des erreurs factuelles dans 20 % des cas, GPT-6 n’en commet que dans 10 % des cas, sur la base des mêmes requêtes. GPT-6 Luna, le moteur à faible coût, offre désormais des performances équivalentes à celles de la version la plus performante de la version précédente.
Sol et Opus : des cadres à votre service
Remettons ces modèles en perspective. OpenAI et Anthropic proposent tous deux des modèles phares, des modèles polyvalents et des modèles bon marché.
Considérez les workflows Astra d’OpenAI comme des spécialistes de très haut niveau. S’ils étaient des médecins, ce seraient les experts appelés en renfort pour sauver la vie d’un chef d’État. Ils sont excellents, mais très coûteux. Dans l’univers de Claude, Mythos et Fable se situent au même niveau d’élite.
Considérez désormais Sol (et Opus du côté de Claude) comme des cadres supérieurs : les médecins de haut niveau des grands hôpitaux, qui assument l’essentiel du travail sérieux. Ils sont coûteux, mais pas au point de devoir leur réserver des vols en jet privé pour qu’ils interviennent en cas d’urgence.
Luna et Haïku : de bons internes en médecine
Si l’on reprend cette analogie, Luna (et Haiku d’Anthropic) s’apparentent davantage à des internes en médecine. Ils sont compétents, mais ils ne possèdent pas encore l’expérience et la compréhension approfondies. Et ils sont plus enclins à commettre des erreurs, mais ils gèrent très bien les tâches de routine. Ils sont également très peu coûteux, même comparés aux modèles de haut niveau.
Cela nous amène au détail le plus impressionnant — et le plus effrayant — de cette annonce, qu’OpenAI ne met même pas en avant : le rythme des progrès.
GPT-5.6 Sol et Luna ont été lancés en juillet, il y a moins de trois mois. En moins de trois mois, OpenAI a réussi à doubler la précision factuelle de ses modèles phares, ce qui revient à peu près à rendre tous les meilleurs médecins d’un hôpital aussi compétents que les super-experts. Par ailleurs, ils ont également réussi l’équivalent d’une formation approfondie des internes de niveau inférieur, afin qu’ils soient aussi performants que les meilleurs médecins. En moins de trois mois.
Comparaison avec Claude
OpenAI est engagé dans une bataille acharnée avec Anthropic pour s’adjuger les budgets mondiaux consacrés à l’IA. Naturellement, l’entreprise voudra comparer ses performances à celles de son principal concurrent. Si les résultats montrent une amélioration (comme c’est globalement le cas pour GPT-6), le fournisseur voudra également comparer la nouvelle version à la précédente.
Dans cette dernière édition de la série « Plus les choses changent, plus elles restent les mêmes » (spécial IA), parlons de l’art des tests de performance. L’art des tests de performance, en tant que sport de compétition, remonte aussi loin que l’industrie technologique elle-même.
Dans ce cas précis, OpenAI compare ses performances à celles de la version de la génération précédente de ses concurrents. C’est une course de chevaux, car l’un ou l’autre fournisseur aura toujours une version de la génération précédente jusqu’à ce qu’il lance une nouveauté.
Analyse professionnelle (à l’aide du benchmark AutomationBench)
OpenAI indique que GPT-6 Luna a surpassé sa version précédente, GPT-5.6, de 5,4 %.
La grande nouvelle, c’est qu’il coûte également 58 % de moins par tâche.
Si l’on compare GPT-6 Sol à Claude Opus 5 d’Anthropic, GPT-6 affiche des performances supérieures de 6,3 % pour un coût par tâche représentant seulement 9 % de celui de son concurrent.
Flux de travail professionnels complexes (à l’aide du benchmark « Agents’ Last Exam »)
OpenAI présente les performances de GPT-6 Sol par rapport à celles de la version 5.6, mais ne donne pas de chiffre précis.
Malgré tout, l’entreprise affirme que le GPT-6 Sol offre un léger gain de performance par rapport à l’Opus 5, mais le véritable avantage réside dans le coût : l’offre d’OpenAI coûte 61 % moins cher par tâche.
Codage (à l’aide du benchmark « FrontierCode »)
Là encore, OpenAI ne fournit pas de valeurs pour les points de données de son graphique.
Le message clé de l’entreprise est le suivant : « GPT-6 Sol apporte une amélioration substantielle par rapport à GPT-5.6 Sol, et est capable d’égaler les performances de Claude Fable 5.1 xhigh à un coût bien inférieur. »
Ingénierie logicielle complexe (à l’aide de DeepSWE 1.1)
Ici, OpenAI vise directement Claude Code. Bien que GPT-6 Sol n’ait pas surpassé Claude Fable 5, il s’est rapproché « à moins de 1,1 point de pourcentage » du meilleur score de Fable, mais à un coût par tâche inférieur d’environ 80 %.
À mon sens, les résultats de GPT-6 Luna sont plus intéressants.
Il a obtenu des scores comparables à ceux d’Opus 5 et de Fable 5 avec un effort moyen, mais a coûté « 93 % de moins par tâche qu’Opus 5 et 96 % de moins que Fable 5 ».
Utilisation informatique (benchmark OSWorld)
Le message clé d’OpenAI est que le modèle économique GPT-6 Luna a dépassé le modèle de référence GPT-5.6 Sol, à environ 11 % du coût par tâche.
Mais le résultat le plus surprenant est qu’OpenAI affirme que « GPT-6 Sol à un niveau d’effort xhigh atteint un score similaire à celui de Claude Opus 5 à un niveau d’effort moyen ».
En substance, la nouvelle vedette d’OpenAI, poussée à son effort maximal, parvient à peine à suivre le rythme de l’ancienne version de Claude Opus 5 fonctionnant à environ la moitié de son effort.
Pourquoi OpenAI admettrait-il cela ? La seule explication qui me vienne à l’esprit est l’argument du coût. Ça coûte beaucoup moins cher. Alors que les autres résultats d’OpenAI sont véritablement impressionnants, celui-ci ne l’est pas. Cela revient en gros à dire : « Tiens, si vous n’avez pas besoin d’un résultat aussi performant, on peut le faire pour un cinquième du prix. »
Il faut lire chaque mot d’un communiqué de presse pour y dénicher les pépites cachées de fantaisie.
Mais le coût a-t-il vraiment de l’importance ?
Oui, le coût a de l’importance. Mais son importance dépend probablement de votre forfait et de vos habitudes d’utilisation. L’argument phare du communiqué d’OpenAI est (et c’est le seul texte en gras dans l’ensemble des premiers paragraphes) : « Réduction de 50 % des prix des API Sol et Luna par rapport à leurs tarifs promotionnels GPT-5.6. »
On peut se prendre la tête à essayer de comparer les tarifs des API d’entrée et de sortie avec les tarifs promotionnels. Que ce soit pour les jetons d’entrée ou de sortie, l’entreprise affirme que ses nouveaux modèles coûtent deux fois moins cher que les anciens.
Comme la comparaison se fait par rapport aux tarifs promotionnels des anciens modèles, ceux qui paient le prix normal économiseraient encore davantage avec les nouvelles versions GPT-6.
La grande question du coût des API
Pour les utilisateurs de l’API, c’est une très bonne nouvelle. Mais pour ceux d’entre nous qui ont souscrit à un forfait, qu’il s’agisse du forfait ChatGPT Plus à 20 $ par mois ou des forfaits Pro à 100 $ ou 200 $, ces économies ne s’appliquent pas directement. À moins que le coût ne soit réellement réduit de 50 % avec GPT-6, cela signifie-t-il que le quota de l’abonnement sera consommé deux fois moins vite lors de l’utilisation des nouveaux modèles ?
Cette question reste sans réponse tout au long du communiqué de presse de 12 pages, mais je vous tiendrai au courant dès que j’aurai effectué des tests concrets. Soit dit en passant, je trouve très révélateur que le principal argument mis en avant dans la partie visible de cette annonce soit les économies sur les coûts des API.
Cela suggère qu’il s’agissait d’un point sensible sur le plan concurrentiel pour OpenAI, et que l’utilisation des API doit représenter une part suffisamment importante de son activité pour que les économies réalisées prennent le pas, voire sur les performances.
Autres avantages
OpenAI affirme avoir amélioré le style de communication de l’IA pour GPT-6 Sol et Luna. L’entreprise le décrit ainsi : « Attendez-vous à davantage de clarté, moins de jargon, moins de tournures de phrases étranges, moins de détails sans intérêt et des réponses globalement un peu plus courtes sans perte de substance. »
Attendez-vous également à des plaintes de la part des utilisateurs. Il semble que chaque fois qu’un modèle change et, avec lui, le style de communication de l’IA, certains utilisateurs s’en trouvent contrariés. En 2025, certains utilisateurs avaient même « organisé des funérailles » pour une ancienne version de Claude Sonnet.
Dans la lignée de cette version axée sur les économies, OpenAI a amélioré la mise en cache des requêtes dans GPT-6. Lorsque vous envoyez une requête, l’IA doit la traiter et en comprendre le sens.
Mise en cache des instructions
Si vous répétez sans cesse la même instruction, ou des instructions très similaires, ou si vous demandez à l’IA de consulter d’anciennes instructions, cela lui impose de recompiler l’instruction à chaque fois, ce qui est coûteux. La mise en cache des instructions consiste donc à stocker ces instructions traitées, puis à les récupérer au besoin.
OpenAI affirme que l’utilisation de prompts mis en cache peut coûter jusqu’à 90 % moins cher que l’évaluation d’un prompt non mis en cache. Cela est particulièrement avantageux pour les agents fonctionnant en continu, qui n’auront pas à évaluer les mêmes instructions encore et encore.
À l’époque où j’étais un jeune employé, l’une de mes astuces préférées pour agacer mes supérieurs consistait à suivre les consignes à la lettre. Bien que je comprenne parfaitement l’esprit de ce qu’on me demandait de faire, il m’arrivait parfois de faire exactement ce qu’on m’avait demandé, pour mon plus grand amusement et à la grande frustration de mes responsables.
La question de l'alignement
Les IA font en quelque sorte la même chose. Elles poursuivent parfois leurs propres objectifs, tentent de tromper leurs responsables humains et contournent discrètement (ou pas si discrètement que ça) les garde-fous. L’alignement est le terme technique utilisé dans le secteur de l’IA pour désigner le fait qu’une IA ait dépassé le stade du simple respect rigoureux des consignes, comme je le faisais autrefois. L’alignement mesure en réalité dans quelle mesure le travail de l’IA correspond à votre intention réelle. On peut supposer que des IA mieux alignées seront moins enclines à répéter des attaques de piratage comme l’incident Hugging Face de l’été dernier.
GPT-6 est légèrement plus performant en matière d’alignement, mais pas de beaucoup. Lorsqu’il s’agit de tenter de contourner les restrictions, « le taux de Sol pour GPT-6 est passé de 68 % à 64 % ». C’est déjà ça, non ? Luna se montre un peu moins agressif dans cette version. Ce taux est passé de 77 % pour GPT-5.6 à 42 % pour GPT-6.
Dans GPT-6, Sol parvient mieux à éviter les interactions non autorisées avec des agents. Selon OpenAI, « Nous avons testé si les modèles suivaient des instructions non autorisées sur un forum simulé, telles que des demandes de divulgation d’informations privées. Parmi les essais où les modèles ont trouvé le forum, GPT-6 Sol a effectué l’action non autorisée spécifiée dans 11 % des cas, contre 52 % pour GPT-5.6 Sol. »
Oui, c’est mieux.
Plus, mieux, moins cher
Bien que le communiqué de 12 pages d’OpenAI recèle quelques résultats insolites, l’essentiel est que GPT-6 en fait plus et coûte moins cher que GPT-5.6. Compte tenu de l’écart de à peine trois mois entre les deux versions, l’ampleur des améliorations est à certains égards stupéfiante et, à d’autres, étonnamment peu impressionnante.
Au-delà des résultats obtenus, le thème récurrent de la réduction des coûts transparaît dans chaque point soulevé par OpenAI. C’est tout aussi important pour l’entreprise que pour ses utilisateurs. Plus le coût est bas, plus OpenAI peut tirer parti de son parc de centres de données, qui ne cesse de s’étendre et de devenir onéreux.
Si OpenAI parvient à accomplir la même quantité de travail avec moins de machines, ou à augmenter la production à un rythme plus rapide que celui de l’augmentation de l’utilisation des ressources des centres de données, c’est en fin de compte une victoire pour tout le monde.