Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»Breaking News»SWE-Bench Pro : OpenAI dévoile qu’un quart du benchmark est buggé
    Benchmark SWE-Bench Pro avec tests de code buggés
    SWE-Bench Pro : OpenAI révèle que plus d'un quart du benchmark est buggé
    Breaking News juillet 9, 20263 Mins Read

    SWE-Bench Pro : OpenAI dévoile qu’un quart du benchmark est buggé

    3 Mins Read
    Share
    Twitter Email Copy Link

    OpenAI a publié le 9 juillet 2026 une analyse qui fait tache dans le petit monde des SWE-Bench Pro : entre 27,4 % et 34,1 % des tâches de ce benchmark, largement utilisé pour évaluer les capacités de codage des modèles d’IA, seraient buggées. L’entreprise annonce retirer son adhésion au test.

    Comment OpenAI a détecté les failles

    La méthode tient en trois étapes. D’abord, un outil de détection automatisé a passé au crible l’ensemble des tâches du benchmark et en a signalé 286 comme suspectes. Ensuite, des agents IA basés sur Codex ont examiné chacune d’elles en détail. Enfin, des chercheurs humains ont validé les résultats, avec une revue parallèle menée par cinq développeurs logiciels expérimentés.

    Résultat : sur les 731 tâches passées à la moulinette automatisée, 200 ont été jugées buggées, soit 27,4 %. Quand ce sont des humains qui reprennent la main sur un sous-ensemble de 249 tâches, le taux grimpe à 34,1 %. Deux méthodes, deux chiffres, mais une même conclusion : plus d’un quart du test ne mesure pas ce qu’il prétend mesurer.

    Des erreurs qui faussent le classement des modèles

    Selon OpenAI, les tâches incriminées souffrent de critères trop stricts, d’énoncés trop vagues, ou sont carrément superficielles ou mal orientées. L’entreprise illustre le problème par une formule qui résume bien l’absurdité de certains cas : un simple caractère d’espace peut suffire à faire basculer une tâche entre succès et échec.

    Le problème dépasse la simple coquetterie académique. Les scores obtenus sur ce type de benchmark influencent directement les décisions de publication des modèles et les évaluations de sécurité menées par les laboratoires. Un test buggé, c’est potentiellement un mauvais modèle qui passe pour meilleur qu’il ne l’est, ou l’inverse.

    Un signal d’alarme pour l’industrie des benchmarks

    SWE-Bench Pro sert de référence à une bonne partie de l’industrie pour comparer les capacités de codage des grands modèles de langage, qu’ils soient propriétaires ou open source. En retirant son approbation du test, OpenAI met une pression directe sur la fiabilité des classements affichés par ses concurrents comme par elle-même.

    L’épisode rappelle que la course aux benchmarks, aussi spectaculaire soit-elle en pourcentages, repose sur des fondations parfois plus fragiles qu’il n’y paraît. Reste à voir si d’autres laboratoires vont suivre OpenAI dans cet audit de leurs propres outils d’évaluation.

    Source : OpenAI, « Separating signal from noise in coding evaluations »

    Qu’est-ce que SWE-Bench Pro ?

    SWE-Bench Pro est un benchmark utilisé par l’industrie de l’IA pour évaluer les capacités de codage des grands modèles de langage sur des tâches d’ingénierie logicielle réelles.

    Quel pourcentage du benchmark est buggé selon OpenAI ?

    Entre 27,4 % (détection automatisée sur 731 tâches) et 34,1 % (revue humaine sur 249 tâches), selon la méthode employée par OpenAI.

    Quelles conséquences pour les modèles déjà évalués sur ce test ?

    Les scores obtenus influencent les décisions de publication et les évaluations de sécurité des laboratoires, donc des classements pourraient devoir être révisés à la lumière de ces failles.

    benchmark IA OpenAI SWE-Bench SWE-Bench Pro
    Share. Twitter Email Copy Link
    Previous ArticleMuse Spark 1.1 : Meta déploie son modèle agentic multimodal avec la nouvelle Meta Model API
    Next Article Ollama série B : 65 millions de dollars pour l’IA locale open source
    Steve
    • Website

    Related Posts

    Actualité IA Analyse

    JudgeGPT Pakistan : une étude chiffre l’impact de l’IA sur la justice

    Breaking News

    AI Overviews France : Google lance enfin les résumés IA

    Actualité IA Business & Stratégie ChatGPT News

    ChatGPT petites entreprises : OpenAI lance son programme dédié aux PME

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}