OpenAI Ultrafast est le nom du nouveau mode dévoilé le 13 août 2026 par OpenAI pour faire tourner GPT-5.6 Sol jusqu’à 14 fois plus vite que le traitement standard, avec un débit annoncé de 750 tokens de sortie par seconde.
Cerebras derrière l’accélération
Cette vitesse repose sur un partenariat avec le fabricant de puces Cerebras, spécialisé dans le calcul à très haut débit pour l’inférence de grands modèles de langage. Dans son billet de blog, OpenAI explique : « Jusqu’ici, obtenir une vitesse en temps réel impliquait généralement de choisir un modèle plus petit ou plus spécialisé. Ultrafast ouvre une nouvelle direction : plus de travail utile par seconde. » L’entreprise ne modifie donc pas la taille du modèle, mais le matériel et l’infrastructure d’inférence utilisés pour le faire tourner. Concrètement, un débit de 750 tokens par seconde permet de générer plusieurs paragraphes de texte en une fraction de seconde, un gain surtout perceptible dans les applications qui enchaînent de nombreux appels à l’API, comme les agents autonomes ou les assistants vocaux en temps réel.
Un accès en prévisualisation limitée
Ultrafast est actuellement disponible en préversion, réservée à un nombre restreint de clients. OpenAI indique qu’elle élargira l’accès « à mesure que la capacité augmente », sans donner de calendrier précis ni de tarification dédiée à ce stade. La fonctionnalité cible en priorité des usages professionnels sensibles à la latence : réponse à incident, support client, analyse de marchés financiers en temps réel et commerce en ligne.
OpenAI face à la concurrence sur la vitesse
Anthropic propose déjà un mode accéléré pour Claude, le Fast Mode, mais sans atteindre le débit annoncé par Ultrafast. Cette course à la vitesse d’inférence s’ajoute à celle sur les capacités et les prix : la même semaine, Google a lancé Gemini 3.7 Flash à moitié prix et xAI a sorti Grok 4.6, deux annonces qui confirment un rythme de compétition très soutenu entre les grands laboratoires en cet été 2026.
Qu’est-ce que le mode Ultrafast d’OpenAI ?
Ultrafast est un mode d’inférence pour GPT-5.6 Sol qui tourne jusqu’à 14 fois plus vite que le traitement standard, grâce à un partenariat avec le fabricant de puces Cerebras.
Quelle est la vitesse annoncée par Ultrafast ?
OpenAI annonce jusqu’à 750 tokens de sortie par seconde, contre un débit nettement inférieur en mode standard pour GPT-5.6 Sol.
Ultrafast est-il disponible pour tous les utilisateurs ?
Non. Ultrafast est en préversion limitée à un petit groupe de clients au 13 août 2026. OpenAI prévoit d’élargir l’accès progressivement selon la capacité disponible.

