Nvidia a publié le 21 août 2026 une étude qui déplace le regard porté sur la performance des agents IA : sur des tâches complexes de raisonnement, le harnais IA — l’ensemble des outils, de la gestion de mémoire et des règles qui encadrent un modèle — pèserait davantage que le modèle lui-même. Avec un harnais personnalisé, Claude Opus 5 passe d’un score de 30 % à 100 % sur le benchmark ARC-AGI-3.
Un bond de 30 % à 100 % sur ARC-AGI-3
ARC-AGI-3 est un benchmark de raisonnement interactif composé de jeux en deux dimensions sans aucune instruction fournie au modèle, qui doit comprendre seul les règles du jeu. Utilisé seul, Claude Opus 5 obtenait 30 %, déjà le meilleur résultat parmi tous les modèles testés par Nvidia. Équipé du harnais développé par Nvidia, baptisé AVO (Agentic Variation Operators), le même modèle atteint un score parfait de 100 %.
Un harnais désigne la couche logicielle qui entoure un modèle brut pour le transformer en système capable d’agir de façon autonome : outils disponibles, gestion de la mémoire sur la durée, et règles qui cadrent son comportement. Selon Nvidia, cette couche compte davantage que le choix du modèle sous-jacent pour les tâches qui s’étendent sur de nombreuses étapes.
Un « superviseur » qui joue les garde-fous
L’élément central du harnais AVO est un composant superviseur, décrit par Nvidia comme un rôle proche d’un responsable qui recadre l’agent lorsqu’il s’écarte de la direction prise ou s’engage dans une impasse. Cette couche de supervision s’ajoute à une gestion de mémoire perfectionnée, les deux éléments combinés expliquant l’essentiel du gain de score observé sur ARC-AGI-3.
Adel El Hallak, vice-président produit de l’unité IA de Nvidia, a présenté ces résultats vendredi. L’entreprise ne prétend pas que le modèle importe peu : elle affirme plutôt que le modèle, la partie qui sert de « cerveau » à l’agent, ne représente qu’une fraction du système agentique complet, en particulier sur les tâches longues.
Une tendance déjà observée ailleurs
Ce résultat fait écho à des constats similaires chez d’autres acteurs. OpenAI avait déjà expliqué comment l’activation de deux réglages avait permis de tripler ses scores sur ce même benchmark ARC-AGI-3. Des travaux de Databricks montrent de leur côté que le choix du harnais peut, à lui seul, doubler le coût d’exploitation d’un système agentique, indépendamment du modèle utilisé. Pour les équipes qui construisent des agents en production, la conclusion pratique est la même : optimiser uniquement le choix du modèle laisse une grande partie de la performance sur la table.
Qu’est-ce qu’un harnais IA (agent harness) ?
C’est la couche logicielle autour d’un modèle brut : les outils qu’il peut utiliser, la gestion de sa mémoire et les règles qui encadrent son comportement, pour le transformer en agent capable d’agir de façon autonome.
Quel gain Nvidia a-t-il obtenu avec son harnais AVO ?
Claude Opus 5 est passé de 30 % à 100 % sur le benchmark ARC-AGI-3 en ajoutant le harnais personnalisé de Nvidia, contre le modèle utilisé seul.
Qu’est-ce que le composant superviseur du harnais AVO ?
C’est un élément qui recadre l’agent lorsqu’il s’écarte de sa tâche ou explore une impasse, un rôle que Nvidia compare à celui d’un responsable qui supervise le travail.

