GPT-5.6 arrive avec une promesse folle : des modèles plus puissants, mais jusqu'à 80 % moins chers. Comment ? En optimisant chaque couche du système, du code aux requêtes. Le résultat ? Une intelligence artificielle enfin accessible à tous.
GPT-5.6 : TROIS MODÈLES POUR TOUS LES BESOINS
La famille GPT-5.6 est conçue pour s’adapter à tous les usages, sans gaspillage. Le modèle phare, GPT-5.6 Sol, surpasse Claude Fable 5 sur l’index d’agents codeurs Artificial Analysis Coding Agent, et ce pour moins de la moitié du prix. Terra offre les mêmes performances que GPT-5.5 sur les benchmarks d’intelligence, mais à moitié prix. Quant à Luna, c’est le modèle le plus rapide et le plus abordable : 80 % moins cher que Sol. Ces gains de prix s’expliquent par des optimisations radicales à tous les niveaux du système.
L'EFFICACITÉ, CLÉ DE LA RÉVOLUTION
Avec plus d’1 milliard d’utilisateurs actifs et 2 millions d’entreprises utilisant leurs modèles, l’efficacité n’est pas un luxe, mais une nécessité. L’objectif ? Rendre l’intelligence artificielle accessible au plus grand nombre. Depuis quatre ans, les équipes techniques ont travaillé sans relâche pour pousser toujours plus loin les optimisations à chaque couche de la pile technologique. Résultat : GPT-5.6 atteint un niveau d’efficacité inédit en termes d’intelligence par token. Pendant l’entraînement, le modèle est poussé à accomplir plus de travail avec moins de calculs, en prenant des chemins plus directs pour résoudre les tâches.
L'INFÉRENCE : RÉINVENTER LE MOTEUR POUR ÉCONOMISER LES RESSOURCES
Dans un monde où la demande en calcul explose plus vite que les capacités des serveurs, l’efficacité est au cœur de chaque décision. L’inférence — ce processus qui fait tourner les modèles entraînés pour générer des réponses — doit être repensée. L’enjeu ? Produire plus de tokens avec les mêmes machines, sans sacrifier la qualité, la vitesse ou la fiabilité des réponses. Pour y parvenir, chaque couche du système doit être optimisée : de la répartition des requêtes au code qui s’exécute sur les GPU, en passant par la mise en cache et l’implémentation des modèles.
LA RÉPARTITION DES REQUÊTES : UN JEU D'ÉQUILIBRE PRECIS
GPT-5.6 Sol joue un rôle central dans ces optimisations. Par exemple, la répartition des requêtes (load balancing) est cruciale. À l’échelle mondiale, les requêtes sont orientées en fonction de la géographie, de la capacité disponible et du type d’accélérateur (GPU ou puce spécialisée). Au sein d’un même cluster, le travail est distribué entre les instances de modèles en fonction de la charge, de la longueur du contexte, de la disponibilité du cache et d’autres propriétés. Chaque instance doit ensuite répartir efficacement le travail entre les accélérateurs, les sous-réseaux du modèle et les cœurs de calcul. Grâce à GPT-5.6 Sol, les équipes ont pu analyser le trafic de production, identifier des déséquilibres ignorés jusqu’ici, tester de nouvelles stratégies de routage et ajuster en permanence ces heuristiques. Ces améliorations seules ont drastiquement réduit le coût de service des modèles.
OPTIMISER LE PASSAGE EN AVANT : QUAND LE CODE S'AUTO-AMÉLIORE
Un autre levier majeur est l’optimisation du passage en avant (forward pass), c’est-à-dire la transformation des entrées en prédictions de tokens. Même si chaque opération est rapide, des mouvements de mémoire excessifs, des synchronisations inefficaces ou des dispositions de données mal adaptées peuvent laisser les GPU inactifs. Pour éviter cela, GPT-5.6 Sol a identifié des calculs qui pouvaient être précomputés, évités ou parallélisés. Avec Codex, le modèle a réécrit et optimisé de manière autonome les kernels de production — ces morceaux de code qui exécutent les opérations mathématiques des modèles. Cette prouesse est possible grâce à l’entraînement de GPT-5.6 à écrire et améliorer des kernels dans Triton et Gluon, deux langages de programmation GPU open source maintenus par OpenAI. Ces optimisations, combinées à d’autres avancées, ont réduit les coûts de service de 20 %. Des Outils comme FpSan (Floating-Point Sanitizer), également open source, ont permis de valider la correction des kernels générés.
LE DÉCODAGE SPÉCULATIF : PRODUIRE PLUS, AVEC MOINS
Le décodage spéculatif est une technique qui consiste à faire tourner un petit modèle « draft » (ou « spéculateur ») en parallèle du modèle principal. Ce modèle propose plusieurs tokens que le modèle principal vérifie en parallèle. Quand ces propositions sont acceptées, le système peut générer plusieurs tokens de sortie en un seul passage du modèle principal, réduisant ainsi les calculs séquentiels coûteux. GPT-5.6 Sol a amélioré son propre modèle draft en menant des centaines d’expériences sur son architecture : taille, structure, fonctionnalités. Le modèle a également lancé et supervisé le processus d’entraînement du spéculateur, intervenant de manière autonome en cas de problèmes (pannes matérielles, instabilité de l’entraînement). Résultat : l’efficacité de génération des tokens a augmenté de plus de 15 %.
LE CACHE KV : ÉCONOMISER LES RESSOURCES EN RÉUTILISANT
Quand le modèle traite des tokens non mis en cache, il construit le cache clé-valeur (KV) en un passage coûteux en calculs. Ensuite, lors de la génération de la réponse, il lit et étend ce cache à répétition. La configuration optimale pour le service — batching, sharding, gestion du cache KV — dépend entièrement de la charge de travail : longueur des prompts et réponses, taille des lots, taux de succès du cache, caractéristiques des requêtes, etc. Cependant, l’espace des configurations était si vaste qu’il était impossible de tout tester systématiquement, forçant les ingénieurs à se fier à des heuristiques approximatives. Avec GPT-5.6 Sol dans Codex, les équipes ont pu analyser les charges de travail en production, générer et évaluer des configurations candidates, et hyper-optimiser la configuration du moteur et du modèle pour chaque scénario. Cette approche permet d’extraire bien plus d’inférences utiles des mêmes machines.
L'INFÉRENCE : UN CERCLE VERTUEUX D'AMÉLIORATIONS PERMANENTES
L’optimisation de l’inférence est un processus continu en boucle fermée. Les équipes mesurent le comportement en production, identifient les plus gros écarts, implémentent des changements et vérifient que ces modifications améliorent l’ensemble du système, et pas seulement un benchmark isolé. GPT-5.6 Sol et Codex accélèrent chaque étape de cette boucle. Les équipes peuvent ainsi explorer plus d’idées, réagir plus vite aux changements de charge et créer une pile d’inférence avec une latence réduite, plus de capacité et des coûts moindres pour les utilisateurs.
AGENTS INTELLIGENTS : ÉLIMINER LES GASPILLAGES DANS LES TÂCHES COMPLEXES
ChatGPT Work et Codex accomplissent des tâches complexes en enchaînant des requêtes de modèles et des appels d’outils. En un seul tour — de la demande de l’utilisateur à la réponse finale — Codex peut inspecter du code source, rechercher l’historique de déploiement, lire des rapports d’incidents, modifier un fichier et lancer des tests. Chaque étape peut nécessiter une requête au modèle. Préparer le contexte, transmettre des données, exécuter l’inférence, appeler des outils et démarrer des processus prennent du temps et des ressources. Si une tâche nécessite 30 requêtes, une seconde supplémentaire par requête s’accumule rapidement. Améliorer les performances globales signifie donc réduire le travail répété dans tout le système, et pas seulement accélérer le modèle.
L'ORCHESTRATION DES AGENTS : UNE ARCHITECTURE RUST POUR ÉCONOMISER
Ces multiplicateurs ont guidé la conception du harness agentique (orchestrateur), une couche d’orchestration en Rust qui connecte les modèles, les outils et l’environnement de l’utilisateur. Pour rendre chaque requête plus efficace, trois leviers sont exploités : éviter la dilatation du contexte, charger les outils à la demande et réutiliser le travail déjà effectué.
LA DILATATION DU CONTEXTE : UN PIÈGE À ÉVITER
Plus les agents ont accès à des outils, des compétences, des plugins et à l’historique des conversations, plus les fenêtres de contexte peuvent gonfler. Résultat : coût accru, distraction du modèle et raisonnements inutiles. L’orchestrateur réduit cette surcharge grâce à la découverte différée : les intégrations, outils personnalisés, compétences et plugins ne sont rendus accessibles que lorsque c’est nécessaire. L’orchestrateur empêche également les outils et intégrations MCP de consommer inutilement la fenêtre de contexte. Par défaut, la sortie des outils est limitée à 10 000 tokens, sauf si le modèle demande une limite différente.
LE CACHING DES PROMPTS : NE PAS REFAIRE CE QUI EST DÉJÀ FAIT
Dans une boucle agentique, les mêmes instructions, l’historique des conversations, les définitions des outils et les résultats précédents peuvent être envoyés plusieurs fois aux GPU en un seul tour. Traiter ces entrées répétées est coûteux, c’est pourquoi le caching des prompts réutilise les calculs associés à un préfixe de prompt déjà traité. Pour préserver ce préfixe, l’orchestrateur traite tout l’historique visible par le modèle comme append-only : les nouveaux messages, résultats d’outils et mises à jour d’environnement sont ajoutés à la fin plutôt qu’insérés au milieu du contexte. Les outils sont également présentés dans un ordre déterministe, tandis que les paramètres d’exécution, comme les politiques d’approbation, sont appliqués pendant l’exécution plutôt que dans les définitions des outils. Ce choix de conception contribue aux taux de succès élevés du cache de prompts pour Codex et ChatGPT Work.
L'EFFICACITÉ À TOUS LES NIVEAUX : UNE COURSE SANS FIN
Les gains d’efficacité apportés par GPT-5.6 sont le fruit de plusieurs années d’améliorations cumulatives à travers toute la pile technologique : recherche, inférence et harness agentique. Le rôle central joué par GPT-5.6 dans ces optimisations laisse penser que le rythme des améliorations va encore s’accélérer. Les équipes continueront à pousser les optimisations, notamment dans l’optimisation des kernels et les améliorations fondamentales de la pile. L’objectif ? Transférer ces progrès, souvent invisibles pour les utilisateurs, sous forme d’intelligence plus accessible et moins chère pour tous.
- OpenAI News
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO


