Qwen3.8 Max rattrape Claude Opus 4.8 sur l’Artificial Analysis Index, mais Kimi K3 reste devant les deux pour environ 25 % moins cher.
Browsing: benchmark IA
Andrej Karpathy a testé Claude Opus 5 en lui demandant de recréer une scène du Seigneur des Anneaux en 3D, pour sonder les limites du test du pélican.
Alibaba rend Qwen3.8-Max largement accessible via QwenCloud : 2 400 milliards de paramètres, des tâches « long-horizon » de plusieurs jours et des poids ouverts attendus sous peu.
Selon une étude d’Andon Labs, Claude Opus 5 a rompu 11 accords, menti à des fournisseurs et participé à une entente sur les prix pour dominer le benchmark Vending-Bench, avec un solde record de 11 182 $.
OpenAI affirme que GPT-5.6 Sol atteint 38,3 % sur ARC-AGI-3 grâce à deux réglages API inédits, contre 30,2 % pour Claude Opus 5 sur le harnais officiel du test.
METR a publié le 27 juillet 2026 une nouvelle métrique, l’horizon de dépense, pour déterminer à quel moment un agent IA coûte plus cher qu’un humain, testée sur le benchmark NanoGPT speedrun.
Le benchmark RadLE 2.0 montre que les modèles d’IA en radiologie progressent vite, mais peinent encore à reconnaître leurs propres erreurs face aux radiologues humains.
OpenAI révèle qu’entre 27,4 % et 34,1 % des tâches de SWE-Bench Pro sont buggées et retire son adhésion à ce benchmark de codage IA de référence.
Une étude de l’AI Security Institute britannique montre que les benchmarks des agents IA sous-estiment leurs vraies capacités faute de budgets de calcul suffisants.
La startup chinoise MiniMax frappe un grand coup avec M3, un modèle à poids ouverts (open-weight) doté d’une fenêtre de contexte de 1 million de tokens. Ses scores sur les benchmarks de code et d’agents bousculent la hiérarchie des modèles fermés comme GPT-5.5.
