Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Breaking News»SWE-Bench Pro : OpenAI dévoile qu’un quart du benchmark est buggé
Benchmark SWE-Bench Pro avec tests de code buggés
SWE-Bench Pro : OpenAI révèle que plus d'un quart du benchmark est buggé
Breaking News

SWE-Bench Pro : OpenAI dévoile qu’un quart du benchmark est buggé

3 Mins Readjuillet 9, 2026
Share
Twitter Email Copy Link

OpenAI a publié le 9 juillet 2026 une analyse qui fait tache dans le petit monde des SWE-Bench Pro : entre 27,4 % et 34,1 % des tâches de ce benchmark, largement utilisé pour évaluer les capacités de codage des modèles d’IA, seraient buggées. L’entreprise annonce retirer son adhésion au test.

Comment OpenAI a détecté les failles

La méthode tient en trois étapes. D’abord, un outil de détection automatisé a passé au crible l’ensemble des tâches du benchmark et en a signalé 286 comme suspectes. Ensuite, des agents IA basés sur Codex ont examiné chacune d’elles en détail. Enfin, des chercheurs humains ont validé les résultats, avec une revue parallèle menée par cinq développeurs logiciels expérimentés.

Résultat : sur les 731 tâches passées à la moulinette automatisée, 200 ont été jugées buggées, soit 27,4 %. Quand ce sont des humains qui reprennent la main sur un sous-ensemble de 249 tâches, le taux grimpe à 34,1 %. Deux méthodes, deux chiffres, mais une même conclusion : plus d’un quart du test ne mesure pas ce qu’il prétend mesurer.

Des erreurs qui faussent le classement des modèles

Selon OpenAI, les tâches incriminées souffrent de critères trop stricts, d’énoncés trop vagues, ou sont carrément superficielles ou mal orientées. L’entreprise illustre le problème par une formule qui résume bien l’absurdité de certains cas : un simple caractère d’espace peut suffire à faire basculer une tâche entre succès et échec.

Le problème dépasse la simple coquetterie académique. Les scores obtenus sur ce type de benchmark influencent directement les décisions de publication des modèles et les évaluations de sécurité menées par les laboratoires. Un test buggé, c’est potentiellement un mauvais modèle qui passe pour meilleur qu’il ne l’est, ou l’inverse.

Un signal d’alarme pour l’industrie des benchmarks

SWE-Bench Pro sert de référence à une bonne partie de l’industrie pour comparer les capacités de codage des grands modèles de langage, qu’ils soient propriétaires ou open source. En retirant son approbation du test, OpenAI met une pression directe sur la fiabilité des classements affichés par ses concurrents comme par elle-même.

L’épisode rappelle que la course aux benchmarks, aussi spectaculaire soit-elle en pourcentages, repose sur des fondations parfois plus fragiles qu’il n’y paraît. Reste à voir si d’autres laboratoires vont suivre OpenAI dans cet audit de leurs propres outils d’évaluation.

Source : OpenAI, « Separating signal from noise in coding evaluations »

Qu’est-ce que SWE-Bench Pro ?

SWE-Bench Pro est un benchmark utilisé par l’industrie de l’IA pour évaluer les capacités de codage des grands modèles de langage sur des tâches d’ingénierie logicielle réelles.

Quel pourcentage du benchmark est buggé selon OpenAI ?

Entre 27,4 % (détection automatisée sur 731 tâches) et 34,1 % (revue humaine sur 249 tâches), selon la méthode employée par OpenAI.

Quelles conséquences pour les modèles déjà évalués sur ce test ?

Les scores obtenus influencent les décisions de publication et les évaluations de sécurité des laboratoires, donc des classements pourraient devoir être révisés à la lumière de ces failles.

benchmark IA OpenAI SWE-Bench SWE-Bench Pro
Share. Twitter Email Copy Link
Previous ArticleMuse Spark 1.1 : Meta déploie son modèle agentic multimodal avec la nouvelle Meta Model API
Next Article Ollama série B : 65 millions de dollars pour l’IA locale open source

Related Posts

Actualité IA Agents IA Breaking News Mistral Open Weight Sécurité

Mistral Large 4 : le modèle souverain 1T qui bouscule l’IA

Actualité IA Agents IA Breaking News Business & Stratégie ByteDance

TikTok Shopping Assistant : l’IA d’achat débarque dans le flux Pour Toi

Actualité IA Agents IA Breaking News

Sécurité des agents IA : OpenAI s’excuse en Australie et veut une loi

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}