Actualité · Infrastructure IA
Jalapeño : le premier chip custom d'OpenAI bat Nvidia sur l'inférence
26 août 2026 · 6 min de lecture

Au Hot Chips 2026, OpenAI a présenté les premiers benchmarks de Jalapeño, son premier chip custom. Les chiffres sont nets : 1,5 à 1,9 fois plus de travail IA par watt que les meilleurs systèmes disponibles, 1,7 à 3,6 fois moins de latence, pour 700 W contre 1 400 W pour un GB300 de Nvidia. Et c'est seulement la génération 1.
Ce qu'est Jalapeño
Jalapeño est un ASIC (Application-Specific Integrated Circuit) conçu par OpenAI en partenariat avec Broadcom, dédié à l'inférence. L'inférence, c'est le moment où un modèle entraîné reçoit une requête et génère une réponse. Ce n'est pas l'entraînement. OpenAI continue d'utiliser des GPU Nvidia et AMD pour entraîner ses modèles.
Le chip a été annoncé en juin 2026. Au Hot Chips, le 25 août, OpenAI a publié ses premiers résultats détaillés dans un papier de recherche et un blog post. Richard Ho, head of hardware chez OpenAI, a présenté les chiffres lors d'une conférence de presse.
Le point clé : Jalapeño n'est pas lié aux modèles OpenAI. Les benchmarks ont tourné sur trois modèles ouverts extérieurs : GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. C'est un accélérateur d'inférence généraliste.
Les benchmarks
OpenAI a utilisé InferenceX, un benchmark public de SemiAnalysis, pour mesurer les performances. Le protocole couvre l'ensemble du processus de serving d'une requête IA, du prefill (traitement du prompt) au decode (génération des tokens de réponse).
Comparé aux meilleurs systèmes commerciaux disponibles au moment des tests (GB200 et GB300 de Nvidia) :
| Métrique | Jalapeño vs comparaison | Détail |
|---|---|---|
| Throughput par watt | 1,5 à 1,9× supérieur | À puissance de crête |
| Latence end-to-end | 1,7 à 3,6× plus basse | Selon le modèle |
| Performance interactive | 2,1 à 4,1× supérieure | Pour les workloads agentic |
| Puissance consommée | 700 W (550 W mesuré) | vs 1 200-1 400 W pour les GPU Nvidia |
Sur GPT-OSS 120B, Jalapeño atteint environ 1 400 tokens par seconde par utilisateur. Sur DeepSeek R1 670B, plus de 700 tokens par seconde. À vitesse de décodage équivalente, le throughput par kilowatt est 54 à 104 fois supérieur à la meilleure accélération disponible, selon le modèle.
Il y a un caveat important. La comparaison équitable n'est pas contre Blackwell (GB200/GB300), mais contre Vera Rubin, la prochaine plateforme Nvidia qui utilise aussi de la mémoire HBM4. SemiAnalysis a regardé ce comparatif : Jalapeño sort légèrement devant Vera Rubin en tokens par mégawatt, même si Rubin utilise le multi-token prediction que Jalapeño n'a pas encore adopté. Sur le coût total de possession par token, les deux sont grosso modo à égalité. Et Vera Rubin livre déjà, quand Jalapeño n'est qu'à l'étape d'échantillons engineering.
Ce qui rend Jalapeño différent
L'inférence d'un LLM passe par plusieurs phases, chacune avec ses propres goulots. Le prefill (traiter le prompt) est compute-intensive. Le decode (générer la réponse token par token) est limité par la bande passante mémoire. La communication entre chips ajoute de la latence quand des données doivent se déplacer. Un système bon sur une phase peut perdre son avantage en attendant que les données arrivent.
OpenAI a conçu Jalapeño pour minimiser ces déplacements. Le KV cache, qui stocke l'état du modèle pendant la génération, reste local. Le réseau est intégré à l'architecture, pas ajouté autour. L'ensemble du workload tient dans un seul système connecté, ce qui réduit les aller-retours entre chips.
Le chip a été conçu en pile complète : modèle, logiciel de serving, chip, mémoire, réseau et rack sont pensés ensemble. C'est l'avantage qu'OpenAI met en avant : ils contrôlent toute la chaîne, des modèles au silicium, et peuvent optimiser chaque couche en fonction des workloads réels.
Neuf mois du design au tapeout
OpenAI a démarré le design à mi-2024 et a envoyé le blueprint final à la fonderie en novembre 2025. Neuf mois se sont écoulés entre le premier design et le tapeout. Un cycle court pour un premier chip, et OpenAI attribue une partie de cette vitesse à ses propres modèles.
Les générations antérieures de modèles OpenAI ont aidé à explorer des implémentations et à raccourcir les boucles de design, mesure et vérification. Les modèles plus récents ont accéléré la programmation et l'optimisation. Sur des blocs GPT-OSS spécifiques (attention et mixture-of-experts), les implémentations générées par IA tournaient 1,5 à 1,8 fois plus vite que le code écrit par des ingénieurs humains. Ces chiffres concernent des blocs sélectionnés, pas le modèle complet, mais ils montrent une boucle de développement nouvelle.
SemiAnalysis en tire une conclusion forte : le « CUDA moat », l'avantage logiciel qui protégeait Nvidia, est potentiellement mort. Si OpenAI peut porter de nouveaux modèles sur son silicium en quelques mois avec l'aide de ses modèles, l'argument du verrou logiciel s'affaiblit.
Le contexte stratégique
Jalapeño ne remplace pas les partenariats Nvidia. OpenAI continue d'acheter des GPU pour l'entraînement et déploie des accélérateurs de plusieurs partenaires (Nvidia, AMD, AWS, Cerebras, CoreWeave). Sarah Friar, CFO d'OpenAI, décrit Jalapeño comme un complément, pas une rupture.
Mais les chiffres parlent. Si Jalapeño délivre 1,9 fois plus de travail par watt à la génération 1, et que les générations 2 et 3 sont déjà en cours, la dynamique change. Nvidia, AMD et les autres construisent aussi leurs propres chips. Tout le monde a intérêt à dire qu'il faut plus de compute, parce que ça justifie les investissements de chaque côté. Mais le premier chip custom d'OpenAI, conçu en neuf mois, qui bat le flagship Nvidia sur l'inférence, c'est un signal.
La prochaine étape : le déploiement. OpenAI prévoit de petits volumes fin 2026, une montée en charge en 2027. Il faudra voir si les performances en production confirment les benchmarks, et comment Vera Rubin répond.
Un exemple chez Maisons&Mobilia
Sophie, PM chez Maisons&Mobilia, utilise un agent IA pour analyser les retours clients. L'agent tourne sur l'API OpenAI, qui elle-même tourne sur une infrastructure de GPU Nvidia. Chaque requête consomme des tokens, chaque token coûte de l'argent.
Jalapeño ne change rien pour Sophie dans l'immédiat. Elle ne va pas acheter des chips. Mais si OpenAI déploie Jalapeño à grande échelle et que le coût d'inférence baisse, le prix par token que Sophie paie peut baisser aussi. L'agent qui analyse 500 retours par semaine coûte moins cher à servir. C'est le mécanisme : plus de throughput par watt signifie plus de tokens par dollar, et ce gain peut remonter jusqu'à l'utilisateur final.
La limite : ça dépend de la vitesse de déploiement, et de ce que OpenAI décide de faire des gains. Rien ne garantit que l'économie arrive jusqu'à Sophie. Mais la pression concurrentielle (Nvidia qui répond, AMD qui pousse) augmente les chances que oui.
Ce que ça change si tu apprends l'IA
Trois notions ressortent de cette annonce :
- Inférence vs entraînement : Jalapeño fait l'inférence, pas l'entraînement. Comprendre la différence, c'est comprendre pourquoi un chip peut être excellent pour faire tourner un modèle sans servir à le créer. Ce sont deux problèmes différents, avec des goulots différents.
- Throughput par watt : c'est la métrique qui compte pour l'inférence à échelle. Pas les TFLOPS bruts, pas le nombre de chips. Combien de tokens utiles tu sors par watt consommé. C'est ce qui détermine le coût réel.
- Pile complète vs composants : OpenAI contrôle modèle, logiciel, chip et système. Nvidia contrôle chip et logiciel (CUDA). L'avantage de la pile complète, c'est l'optimisation coordonnée. L'avantage des composants, c'est la flexibilité et l'écosystème. Les deux modèles coexistent.
La compétence pratique : savoir lire un benchmark d'inférence et comprendre ce qu'il mesure vraiment. Pas regarder un chiffre de TFLOPS, mais comprendre le protocole (InferenceX ici), les modèles testés, les conditions de comparaison, et les caveats.
Aller plus loin
Pour comprendre les phases de l'inférence (prefill, decode, KV cache) et pourquoi elles posent des problèmes différents, notre article sur comment fonctionne un agent IA pose les bases du reasoning et du tool use. Pour voir comment les agents multiplient les appels de modèle et pourquoi la latence compte, le guide sur les garde-fous des agents IA montre comment un agent enchaîne les étapes. Et pour t'entraîner à ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur l'inférence, les modèles et les agents, en français, sans coder.
Sources
- OpenAI, "Jalapeño's first results show industry-leading speed and efficiency in AI inference", 25 août 2026
- TechCrunch, "OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show", 25 août 2026
- The Verge, "OpenAI says its Jalapeño chip can power faster AI responses than the competition", 25 août 2026
- The Decoder, "OpenAI's first custom chip Jalapeño reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks", 25 août 2026
- SemiAnalysis, "OpenAI Jalapeño: Better Than Nvidia", 25 août 2026
Questions fréquentes
- C'est quoi Jalapeño ?
- Jalapeño est le premier chip custom d'OpenAI, conçu spécifiquement pour l'inférence (faire tourner des modèles entraînés, pas les entraîner). C'est un ASIC co-développé avec Broadcom, annoncé en juin 2026 et présenté en détail au Hot Chips en août 2026.
- Jalapeño est-il plus performant que les GPU Nvidia ?
- Sur le benchmark InferenceX de SemiAnalysis, Jalapeño délivre 1,5 à 1,9 fois plus de travail IA par watt que les systèmes GB200 et GB300 de Nvidia, avec 1,7 à 3,6 fois moins de latence. Il consomme 700 W contre 1 400 W pour un GB300. La comparaison la plus équitable serait contre Vera Rubin (HBM4), qui commence à livrer.
- Jalapeño peut-il entraîner des modèles ?
- Non. Jalapeño est dédié à l'inférence uniquement. OpenAI continue d'utiliser des GPU Nvidia et AMD pour l'entraînement. Le chip est un complément, pas un remplacement de toute la chaîne de compute.
- Quand Jalapeño sera-t-il déployé ?
- OpenAI prévoit un déploiement en très petits volumes fin 2026, avec une montée en charge en 2027. La génération 2 est déjà en développement et la génération 3 commence à prendre forme.
- Jalapeño fonctionne-t-il seulement avec les modèles OpenAI ?
- Non. Les benchmarks ont été réalisés sur trois modèles ouverts extérieurs : GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. L'architecture est conçue comme un accélérateur d'inférence généraliste, pas comme un chip lié à un seul modèle.