Un processeur conçu spécialement pour l'IA qui double l'efficacité énergétique et divise par 3 la latence. OpenAI frappe fort avec Jalapeño.

UN PROCESSEUR CRÉÉ POUR L'INFÉRENCE DE L'IA

Depuis l'annonce de Jalapeño, le premier processeur dédié à l'inférence conçu par OpenAI, les tests menés révèlent des performances exceptionnelles. Ce composant Matériel permet d'exécuter davantage de tâches d'intelligence artificielle avec la même quantité d'énergie, tout en réduisant drastiquement le temps de réponse. Là où les systèmes classiques doivent souvent choisir entre rapidité et efficacité énergétique, Jalapeño parvient à concilier les deux grâce à une architecture unique.

Jalapeño peut traiter jusqu'à 1,9 fois plus de tâches par watt que les systèmes comparables, avec une latence jusqu'à 3,6 fois inférieure.

DES RÉSULTATS QUI CHANGENT LA DONNE POUR LES UTILISATEURS

Pour les utilisateurs finaux, ces améliorations se traduisent par des réponses plus rapides, des agents conversationnels plus réactifs et un accès plus fiable à l'IA, même lorsque la demande explose. OpenAI a pour mission de rendre l'intelligence artificielle générale bénéfique pour toute l'humanité. Ces gains de performance permettent de rendre des modèles d'IA toujours plus performants plus accessibles financièrement et plus répandus.

Les modèles d'OpenAI ont également joué un rôle clé dans le développement de Jalapeño. Les générations précédentes ont aidé les ingénieurs à concevoir et finaliser le processeur, tandis que les versions les plus récentes accélèrent l'optimisation et la programmation de ce matériel. Les performances de Jalapeño ont été évaluées sur trois modèles majeurs : GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T. Ces tests démontrent que l'architecture de Jalapeño fonctionne aussi bien avec des modèles développés en interne qu'en externe.

DES PERFORMANCES RECORD SUR TOUS LES MODÈLES TESTÉS

Sur les trois modèles évalués, Jalapeño a atteint des performances comprises entre 1,5 et 1,9 fois supérieures en termes de tâches par watt en pic de débit, avec une latence de bout en bout réduite de 1,7 à 3,6 fois par rapport aux systèmes de comparaison. Pour les charges de travail hautement interactives, la performance était de 2,1 à 4,1 fois supérieure.

OpenAI souligne que Jalapeño représente aussi un avantage complet à l'échelle de la pile technologique. L'entreprise conçoit désormais de manière intégrée les modèles, les produits, les logiciels de service, les puces, la mémoire, le réseau et les systèmes. Chaque couche de cette pile bénéficie des enseignements tirés des charges de travail réelles. Jalapeño est le premier processeur de première génération mesuré en conditions réelles, marquant le début d'une plateforme multigénérationnelle. Dans les mois à venir, OpenAI prévoit de déployer Jalapeño pour proposer des produits plus rapides, plus performants et plus efficaces à ses clients.

COMMENT OPENAI ÉVALUE-T-ELLE LES PERFORMANCES ?

OpenAI mesure les performances en maintenant une expérience utilisateur équivalente. L'objectif est de déterminer combien de tâches d'IA utiles chaque système peut accomplir par unité d'énergie, tout en respectant les contraintes de latence imposées par les utilisateurs et les agents interactifs. Cette approche est particulièrement importante pour les agents, qui doivent enchaîner de nombreuses étapes. Un retard sur l'une d'elles peut se répercuter sur l'ensemble de la tâche.

Pour les agents, chaque milliseconde compte : Jalapeño réduit les délais jusqu'à 4,1 fois sur les charges de travail les plus interactives.

DES TESTS BASÉS SUR DES BENCHMARKS PUBLICS

Pour comprendre comment Jalapeño se comporte en situation réelle, OpenAI a mené des tests sur InferenceX, un benchmark public développé par SemiAnalysis qui évalue l'ensemble du processus de traitement d'une requête d'IA. Les performances de Jalapeño ont été comparées à celles des principaux systèmes d'IA commercialement disponibles, couvrant une large gamme d'utilisations, du traitement à haut débit aux interactions à très faible latence. Résultat : Jalapeño offre une combinaison optimale de débit, d'efficacité énergétique et de latence.

Bien que les performances soient parfois exprimées par puce, OpenAI estime que l'unité de mesure la plus pertinente reste la performance par unité d'énergie. Sur les trois modèles publics testés, Jalapeño a démontré une meilleure combinaison de performance par watt et de latence, le plaçant ainsi sur la frontière de Pareto. Pour comparer équitablement les systèmes, OpenAI a normalisé les résultats en utilisant la puissance électrique publiée de chaque accélérateur. Jalapeño est officiellement classé à 700 watts, bien que sa puissance mesurée en continu soit restée à 550 watts ou moins sur les charges de travail testées.

DES PERFORMANCES EXCEPTIONNELLES SUR LES PLUS GROS MODÈLES

Jalapeño a démontré des performances remarquables sur GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. Sur Kimi, le plus grand modèle public testé, Jalapeño a atteint une performance de pointe par watt environ 1,5 fois supérieure et une latence de bout en bout 3,4 fois inférieure à celle du système de comparaison. Lors des tests internes, cet avantage s'est encore accentué sur les modèles les plus avancés d'OpenAI, suggérant que l'architecture de Jalapeño devient encore plus précieuse à mesure que les charges de travail deviennent plus lourdes et plus exigeantes.

UNE CONCEPTION PENSÉE POUR LES MODÈLES DE LANGAGE MODERNES

Jalapeño a été conçu dès le départ en se posant une question simple : quel matériel faudrait-il développer si sa principale fonction était de servir les modèles de langage modernes et futurs, en particulier les agents interactifs ? Les gains de Jalapeño proviennent d'une conception intégrée du processeur, de la mémoire, du réseau, des logiciels et du système à l'échelle du rack, centrée sur les charges de travail réelles des modèles de langage.

L'inférence des modèles de langage se déroule en plusieurs phases distinctes, chacune présentant des goulots d'étranglement différents. La phase de prefill, qui consiste à traiter une requête, est très gourmande en calcul. La phase de decode, où le système génère la réponse token par token, est davantage limitée par la bande passante mémoire. La communication peut également ajouter de la latence lorsque les données doivent transiter entre les cœurs et les puces, laissant certains unités de traitement inactives en attendant les données. Un système excellent dans une phase peut perdre cet avantage en attendant des données ou en déplaçant l'état du modèle entre différentes ressources.

MINIMISER LES DÉPLACEMENTS DE DONNÉES POUR UNE INFÉRENCE PLUS RAPIDE

Jalapeño a été conçu pour minimiser les déplacements de données et les délais de communication. Cela signifie que l'état du modèle, y compris le cache KV utilisé lors de la génération d'une réponse, peut être explicitement placé et conservé localement. Le système active la bonne combinaison de calcul, de mémoire et de réseau pour chaque phase d'inférence. Le réseau est un élément central de l'architecture. Sa grande capacité permet de garder l'ensemble de la charge de travail au sein d'un même système connecté, réduisant ainsi les déplacements de données et garantissant que la requête reste rapide et efficace du début à la fin.

Le résultat est un accélérateur équilibré et flexible, capable de supporter des architectures de modèles changeantes, d'exceller à la fois en phase de prefill et de decode, et de s'adapter lorsque l'équilibre entre ces deux phases évolue. Cette caractéristique est essentielle pour les charges de travail agentiques, où l'équilibre entre calcul et mémoire varie constamment.

L'INTELLIGENCE ARTIFICIELLE AU CŒUR DU DÉVELOPPEMENT DE JALAPEÑO

L'IA a joué un rôle direct dans le développement de Jalapeño. Elle a permis à l'équipe de passer de la conception initiale au tapeout (la gravure du circuit sur silicium) en seulement neuf mois. L'IA a exploré différentes implémentations, raccourci les cycles de conception, de mesure et de vérification, et a permis d'itérer en continu sur les charges de travail des modèles. L'IA a également aidé à optimiser les circuits arithmétiques du processeur, permettant à l'équipe de loger davantage de puissance de calcul dans la puce tout en respectant le calendrier prévu.

Jalapeño a été conçu comme une cible de programmation claire et prévisible, tant pour les humains que pour l'IA. Les ingénieurs peuvent décrire leur travail à travers des tenseurs locaux, des communications explicites et une synchronisation prévisible. L'IA peut ensuite optimiser la façon dont ce travail est cartographié, placé, planifié et coordonné dans le système. Cette structure claire et prévisible offre à l'IA un moyen traitable pour aborder le problème traditionnellement complexe de la programmation parallèle.

UNE ARCHITECTURE QUI S'ADAPTE RAPIDEMENT AUX NOUVEAUX MODÈLES

Pour chaque nouvelle famille de modèles, il est nécessaire de développer de nouveaux noyaux et des optimisations spécifiques. En utilisant Codex avec GPT-Astra, l'équipe a réussi à porter trois modèles à poids ouverts non prévus initialement dans le plan de production de Jalapeño à un niveau de performance élevé en seulement deux mois. Cela démontre à la fois la flexibilité de l'architecture et la rapidité avec laquelle l'IA peut aider à la programmer.

Pour certains blocs d'attention et d'experts-mixtes de GPT-OSS, les implémentations générées par l'IA ont été de 1,5 à 1,8 fois plus rapides que celles écrites par des experts humains. Ces chiffres s'appliquent uniquement aux blocs sélectionnés, et non au modèle complet, mais ils indiquent une nouvelle boucle de développement puissante.

L'IA a permis de porter trois modèles non prévus à haute performance en seulement deux mois, prouvant la flexibilité exceptionnelle de Jalapeño.

POURQUOI L'INFRASTRUCTURE IA EST-ELLE SI IMPORTANTE ?

L'infrastructure IA a de la valeur parce qu'elle permet d'accomplir des tâches utiles dans le monde réel. En produisant davantage de travail utile à partir de la même quantité d'énergie et de matériel, Jalapeño permet de répondre à une demande croissante tout en réduisant le coût de livraison d'un résultat réussi. Pour OpenAI, cela peut améliorer l'effet de levier opérationnel en permettant au travail utile et aux revenus de croître plus rapidement que le coût de service. Cela peut également soutenir une adoption plus large et des investissements continus dans de meilleurs modèles, produits et infrastructures. Une inférence plus rapide permet une itération plus rapide et de nouveaux cas d'usage.

Jalapeño élargit ce qui est possible pour une inférence efficace et à faible latence :

UN DÉPLOIEMENT PROGRESSIF POUR UNE IA PLUS ACCESSIBLE

OpenAI prévoit de commencer à déployer Jalapeño au sein de son infrastructure de calcul d'ici la fin de l'année. Il s'agit de la première génération d'une feuille de route multigénérationnelle : la deuxième génération est déjà en développement avancé, et la troisième est en cours de conception. Chaque génération s'appuiera sur les enseignements tirés et fera progresser encore davantage l'efficacité et la vitesse.

Pour répondre à la demande croissante en IA, il faudra davantage de puissance de calcul provenant de toutes les sources disponibles. OpenAI continuera à déployer largement les accélérateurs de NVIDIA et d'autres partenaires pour les charges de travail de formation et d'inférence. Leur mission reste inchangée : garantir que l'intelligence artificielle générale bénéficie à toute l'humanité.

À l'approche du déploiement, OpenAI poursuit la qualification de production, la maturation des logiciels, la préparation à l'exploitation de Jalapeño à grande échelle et la validation des performances sur davantage de modèles. Les résultats obtenus jusqu'à présent montrent ce qui est possible lorsque l'ensemble du système est conçu ensemble : une IA plus réactive, plus performante et plus agentique, livrée de manière plus efficace à un plus grand nombre de personnes.

Sources :
  • OpenAI News

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO