Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»News»Les benchmarks des agents IA sous-estiment leurs vraies capacités, selon le Royaume-Uni
    Graphique de données affiché sur un écran d'ordinateur, illustrant les benchmarks de performance des agents IA
    News juillet 4, 20263 Mins Read

    Les benchmarks des agents IA sous-estiment leurs vraies capacités, selon le Royaume-Uni

    Updated:juillet 4, 20263 Mins Read
    Share
    Twitter Email Copy Link

    Une étude de l’AI Security Institute (AISI) britannique montre que les benchmarks des agents IA sous-estiment systématiquement ce dont ces systèmes sont réellement capables. En cause : des budgets de calcul plafonnés qui interrompent les évaluations avant que les modèles n’aient pu déployer tout leur potentiel.

    Le calcul au moment de l’inférence, angle mort des évaluations

    Dans un billet intitulé « More Compute, More Capability », les chercheurs de l’AISI ont testé des modèles frontières sur sept benchmarks en faisant varier le budget de tokens alloué à chaque tâche, c’est-à-dire la quantité de calcul disponible au moment de l’inférence. Résultat : plus le budget augmente, plus les modèles résolvent de tâches jugées jusque-là hors de portée.

    Des écarts de performance considérables

    Sur des tâches de cybersécurité, 8 % des problèmes n’ont été résolus que lorsque le budget dépassait 10 millions de tokens. Sur des benchmarks d’ingénierie logicielle comme TerminalBench 2.0 et SWE-Bench Pro, le taux de réussite progresse d’environ 25 % quand le budget passe de 1 à 10 millions de tokens. Sur des tâches académiques tirées de Humanity’s Last Exam, l’amélioration atteint environ 22 % jusqu’à un budget de 5 millions de tokens.

    L’étude constate aussi que l’horizon temporel des tâches qu’un modèle frontière peut mener à bien s’étend d’environ 40 minutes avec 2,5 millions de tokens à près de 4 heures avec 50 millions de tokens.

    Une loi de puissance qui favorise les modèles récents

    En croisant les temps de résolution des experts humains sur 211 tâches d’ingénierie logicielle et 78 tâches de cybersécurité, les chercheurs montrent que les besoins en tokens des agents suivent une loi de puissance corrélée à la durée que prendrait un expert humain pour la même tâche. Autre constat notable : les modèles les plus récents profitent de façon disproportionnée des budgets de calcul élevés, avec des progrès qui apparaissent jusqu’à 60 % plus rapides lorsque le budget augmente.

    Ce que cela change pour l’évaluation des agents

    La conclusion pratique de l’AISI est simple : les benchmarks à budget fixe, utilisés par défaut dans la plupart des évaluations publiques, coupent l’évaluation avant que le modèle ait pu montrer ce dont il est capable. Pour évaluer correctement la sécurité et les risques réels des agents IA, notamment en cybersécurité, les futurs protocoles de test devront donc faire varier le budget de calcul plutôt que de le fixer arbitrairement.

    Que révèle l’étude de l’AI Security Institute sur les benchmarks des agents ?

    L’étude montre que les benchmarks à budget de calcul fixe sous-estiment les capacités réelles des agents IA, car ils interrompent l’évaluation avant que les modèles puissent exploiter tout leur potentiel de raisonnement.

    De combien les performances s’améliorent-elles avec plus de calcul ?

    Sur des tâches d’ingénierie logicielle, le taux de réussite progresse d’environ 25% quand le budget de tokens passe de 1 à 10 millions, et l’horizon des tâches résolubles passe de 40 minutes à environ 4 heures.

    Pourquoi ce constat compte pour la cybersécurité ?

    8% des tâches de cybersécurité testées n’ont été résolues qu’avec un budget dépassant 10 millions de tokens, ce qui signifie que les évaluations de sécurité actuelles pourraient sous-estimer les risques réels posés par des agents disposant de plus de ressources.

    agent IA benchmark IA Royaume-Uni
    Share. Twitter Email Copy Link
    Previous ArticleMicrosoft fusionnerait Copilot et AutoPilot en une seule appli, selon une fuite
    Next Article GPT-5.6 d’OpenAI arrive jeudi après un blocage du gouvernement américain
    Steve
    • Website

    Related Posts

    News

    Samsung Mistral : discussions pour un investissement jusqu’à 1 milliard d’euros

    News

    Substack détection IA : la plateforme identifie le contenu généré par Pangram

    News Emploi

    France Travail IA : un algorithme pour cibler les chômeurs à contrôler

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}