Selon une étude de Bloomberg Intelligence, l’écart de performances entre les modèles d’IA chinois et américains est tombé à 3 % en octobre 2026, propulsé par DeepSeek V4.1 Flash.
Browsing: benchmark IA
Microsoft ThinkingBox est le premier benchmark d’envergure conçu pour évaluer les agents IA non pas sur la politesse de leurs…
Gemini 4 Argon, le nouveau modèle de pointe de Google DeepMind, arrive d’abord chez des défenseurs cyber. 77,9 % sur DeepSWE, 1 M de tokens en sortie, 2 $ et 10 $ le million de tokens.
DeepSeek V4.1-Flash quitte la bêta : licence MIT, mémoire divisée par quatre grâce à un nouveau cache KV, et des scores qui dépassent de peu Claude Opus 5 et GPT-5.6 Sol en code.
Qwen3.8-Max-0902 grimpe en tête du classement Code Arena WebDev devant Claude Opus 5, sans changer de version. Mais Alibaba reconnaît elle-même que Claude reste devant sur la plupart de ses propres benchmarks.
Gemini 3.8 Flash promet un rapport qualité/prix imbattable face à GPT-6 Astra et Claude Fable 5.1 — mais une accusation de régression a circulé dès le lendemain de son lancement. Benchmarks, tarifs et retours développeurs.
GPT-6 Astra sature ARC-AGI-3 à 99,9 % et franchit le seuil « Critical » en cybersécurité chez OpenAI. Benchmarks officiels, comparatifs avec Claude et Gemini, et vrais retours d’utilisateurs une semaine après le lancement.
Muse Spark 1.3, le nouveau modèle agentic de Meta, promet 25 % de tokens en moins pour un code équivalent. Benchmarks officiels, tarifs et vrais retours de développeurs, une semaine après le lancement.
Google DeepMind a testé le 27 août 2026 ses premières évaluations en double aveugle sur Gemini Flash Lite, via le calcul confidentiel de Google Cloud, pour éliminer la contamination des benchmarks IA.
Nvidia affirme que son nouvel accélérateur Groq 3 LPX est quatre fois plus rapide que le Cerebras CS-4, mais la comparaison oppose un rack de 64 puces à un système d’une seule.
