OpenAI a publié le 25 août 2026 les premiers résultats de sa puce Jalapeño, un système de traitement conçu avec Broadcom pour l’inférence rapide d’IA à grande échelle. Testée sur le benchmark InferenceX de SemiAnalysis, elle surpasse les processeurs d’inférence Nvidia Blackwell sur plusieurs critères clés.
Plus de tokens, moins de watts
Selon les chiffres communiqués par OpenAI, Jalapeño délivre davantage de tokens par utilisateur et un meilleur débit par kilowatt consommé que les systèmes d’inférence Nvidia de dernière génération. Richard Ho, directeur du matériel chez OpenAI, affirme que « les résultats montrent une avancée très significative », en soulignant une efficacité énergétique et une latence réduites.
Le gain technique tient en grande partie à la gestion des phases de « prefill » et de communication, deux étapes du calcul d’inférence souvent sources d’engorgement. Jalapeño gère explicitement la localité des données et du cache KV, ce qui réduit les délais lors du traitement de requêtes complexes.
Une plateforme pensée sur plusieurs générations
Développée en étroite collaboration avec Broadcom, la puce s’inscrit dans une approche que l’entreprise qualifie de plateforme multigénérationnelle, où modèles, puces et mémoire sont conçus conjointement plutôt que de façon séparée. OpenAI présente cette stratégie comme le socle matériel de ce qu’elle appelle une « intelligence abondante » : rendre l’inférence à grande échelle plus accessible et moins coûteuse à mesure que l’usage de ses modèles augmente.
Déploiement progressif jusqu’en 2027
Le calendrier reste prudent : Jalapeño sera déployée en très petits volumes d’ici la fin de l’année 2026, avant un déploiement plus significatif prévu pour 2027. OpenAI ne communique pas encore de date pour une disponibilité à grande échelle sur ses propres produits comme ChatGPT ou l’API.
Cette annonce confirme la stratégie amorcée par OpenAI en juin 2026 avec Broadcom pour concevoir des puces optimisées pour ses propres modèles de langage, dans un secteur où la maîtrise du matériel devient un enjeu de compétitivité aussi important que celle des modèles eux-mêmes.
Détails complets des benchmarks sur le blog officiel d’OpenAI.
