METR a publié le 27 juillet 2026 une nouvelle métrique, l’horizon de dépense, pour déterminer à quel moment un agent IA coûte plus cher qu’un humain, testée sur le benchmark NanoGPT speedrun.
Browsing: benchmark IA
Le benchmark RadLE 2.0 montre que les modèles d’IA en radiologie progressent vite, mais peinent encore à reconnaître leurs propres erreurs face aux radiologues humains.
OpenAI révèle qu’entre 27,4 % et 34,1 % des tâches de SWE-Bench Pro sont buggées et retire son adhésion à ce benchmark de codage IA de référence.
Une étude de l’AI Security Institute britannique montre que les benchmarks des agents IA sous-estiment leurs vraies capacités faute de budgets de calcul suffisants.
La startup chinoise MiniMax frappe un grand coup avec M3, un modèle à poids ouverts (open-weight) doté d’une fenêtre de contexte de 1 million de tokens. Ses scores sur les benchmarks de code et d’agents bousculent la hiérarchie des modèles fermés comme GPT-5.5.
