Cerebras a dévoilé le 24 août 2026 son nouveau système Cerebras CS-4, un accélérateur IA à l’échelle du rack qui double les performances de son prédécesseur, la CS-3. L’annonce, faite en amont de la conférence Hot Chips, promet jusqu’à 4 400 tokens par seconde et par utilisateur.
Même puce, deux fois plus de débit
Contrairement à ce que son nom pourrait laisser penser, la CS-4 conserve la même puce WSE-3 gravée en 5 nm que la génération précédente. Le gain de performance vient d’ailleurs : une fréquence d’horloge revue à la hausse, une alimentation électrique renforcée et un refroidissement amélioré. Cerebras a aussi revu la densité de son rack, qui accueille désormais trois wafers au lieu de deux, sans changer la capacité mémoire de 44 Go par wafer.
Le fabricant affirme que la CS-4 va jusqu’à 30 fois plus vite que des configurations équivalentes tournant sur GPU Nvidia. Une comparaison à prendre avec précaution puisqu’elle vient de Cerebras lui-même, mais qui illustre la stratégie de l’entreprise : miser sur l’inférence à très faible latence plutôt que sur l’entraînement de modèles géants, terrain où Nvidia domine largement.
Un nouveau design pour aller plus vite à l’assemblage
Cerebras introduit également un design modulaire baptisé « Backpack », pensé pour accélérer l’assemblage des racks en data center. L’entreprise mise par ailleurs sur l’inférence désagrégée, en s’appuyant sur des partenaires comme AMD et les puces Trainium d’AWS pour répartir certaines étapes du calcul.
« C’est le système le plus rapide de l’industrie », a déclaré Andrew Feldman, PDG de Cerebras, lors de la présentation. Parmi les clients déjà identifiés figure OpenAI, qui utilise le matériel Cerebras pour faire tourner Codex Spark, sa version accélérée de l’assistant de code.
Pourquoi ça compte
La vitesse d’inférence est devenue un argument commercial à part entière depuis que les agents IA enchaînent des dizaines d’appels de modèle pour accomplir une seule tâche. Plus un système répond vite, moins l’attente pénalise l’utilisateur final — un enjeu que Cerebras partage avec Groq et d’autres fabricants de puces spécialisées dans l’inférence, dans un marché où Nvidia reste toutefois largement dominant sur l’entraînement.
D’autres détails techniques doivent être dévoilés lors de la conférence Hot Chips, où Cerebras présentera ses résultats face à la concurrence. Plus de détails dans l’article de The Decoder.
Quelle est la vitesse de la Cerebras CS-4 ?
Le système atteint jusqu’à 4 400 tokens par seconde et par utilisateur, soit le double de la CS-3 selon Cerebras.
La CS-4 utilise-t-elle une nouvelle puce ?
Non, elle repose sur la même puce WSE-3 gravée en 5 nm que la CS-3. Le gain vient de la fréquence, de l’alimentation et du refroidissement.
Qui utilise déjà le matériel Cerebras ?
OpenAI fait tourner Codex Spark, sa version accélérée de l’assistant de code, sur l’infrastructure Cerebras.
