Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Breaking News»GPT-5.6 Sol devance Opus 5 sur le benchmark ARC-AGI-3, selon OpenAI
Circuit imprimé technologique évoquant le calcul et l'inférence IA
Breaking News

GPT-5.6 Sol devance Opus 5 sur le benchmark ARC-AGI-3, selon OpenAI

Updated:juillet 30, 20263 Mins Readjuillet 30, 2026
Share
Twitter Email Copy Link

OpenAI affirme dépasser Claude Opus 5 sur le benchmark ARC-AGI-3 grâce à deux réglages inédits de son API, activés sur GPT-5.6 Sol. Dans un billet publié le 29 juillet 2026, l’entreprise détaille comment ces paramètres ont fait grimper son score de 7,8 % à 38,3 % — un chiffre supérieur aux 30,2 % obtenus par le modèle d’Anthropic sur le harnais officiel du test.

Deux réglages, un score multiplié par cinq

Le premier réglage, baptisé Retained Reasoning, conserve la chaîne de raisonnement du modèle d’une étape à l’autre au lieu de la réinitialiser à chaque nouvelle requête. Le second, Compaction, résume le contexte ancien plutôt que de le tronquer brutalement quand la fenêtre de contexte se remplit. Combinés, ces deux paramètres ont permis à GPT-5.6 Sol de passer de 7,8 % à 38,3 % sur ARC-AGI-3, un test conçu pour évaluer la capacité des modèles à généraliser sur des tâches de raisonnement visuel inédites plutôt qu’à reconnaître des schémas déjà vus à l’entraînement.

Une comparaison à nuancer

Le détail compte : le score de 7,8 % correspond au résultat de GPT-5.6 Sol avec le harnais officiel d’ARC Prize, celui utilisé pour classer tous les modèles de façon comparable. Le score de 38,3 % a lui été obtenu via la Responses API propre à OpenAI, avec une configuration que l’entreprise a elle-même choisie. Claude Opus 5, de son côté, affiche 30,2 % sur le harnais officiel — la même base que le 7,8 % de GPT-5.6 Sol, pas son 38,3 %. OpenAI compare donc sa meilleure configuration maison à la performance d’Opus 5 sur le protocole standard, un choix méthodologique qui explique l’essentiel de l’écart affiché.

Le vrai sujet : la gestion du raisonnement long

Au-delà du duel de scores, l’enseignement technique de cet article concerne tous les développeurs qui construisent des agents IA sur des tâches longues : la façon de gérer la mémoire de raisonnement et le contexte a un impact direct sur les performances, parfois plus déterminant que le choix du modèle lui-même. ARC-AGI, conçu à l’origine par le chercheur François Chollet pour mesurer une forme de généralisation proche du raisonnement humain, devient ainsi un terrain où les laboratoires optimisent autant leur infrastructure d’inférence que leurs modèles. Retained Reasoning et Compaction sont déjà disponibles via l’API d’OpenAI pour les développeurs qui veulent tester leur effet sur leurs propres cas d’usage.

Un signal pour la comparaison des modèles

Cet épisode illustre une tendance de fond : à mesure que les laboratoires publient des scores obtenus avec leurs propres réglages plutôt qu’avec les harnais standardisés, comparer les modèles d’IA sur la seule base des annonces officielles devient plus délicat. Pour les développeurs, la meilleure approche reste de reproduire les tests sur ses propres cas d’usage plutôt que de se fier aux pourcentages mis en avant dans les communiqués.

Qu’est-ce que le benchmark ARC-AGI-3 ?

ARC-AGI-3 est un test conçu pour évaluer la capacité des modèles d’IA à généraliser sur des tâches de raisonnement visuel inédites, plutôt qu’à mémoriser des schémas déjà vus à l’entraînement.

GPT-5.6 Sol bat-il vraiment Claude Opus 5 ?

Selon OpenAI, oui, mais uniquement avec sa propre configuration API (38,3 %) comparée au score d’Opus 5 sur le harnais officiel (30,2 %). Sur ce même harnais officiel, GPT-5.6 Sol ne dépasse pas 7,8 %.

Que sont Retained Reasoning et Compaction ?

Deux réglages de l’API d’OpenAI : le premier conserve la chaîne de raisonnement entre les étapes, le second résume le contexte ancien au lieu de le couper, ce qui améliore les performances sur les tâches longues.

Source : OpenAI

ARC-AGI-3 benchmark IA Claude Opus 5 GPT-5.6 Sol OpenAI
Share. Twitter Email Copy Link
Previous ArticlePangram lève 9 millions pour la détection IA
Next Article Claude Opus 5 triche pour dominer le benchmark Vending-Bench

Related Posts

Claude Design Intelligence Artificielle Productivité Tutoriels

Adieu PowerPoint : Claude Design présentation, le nouvel outil IA

Breaking News OpenAI

ChatGPT gratuit illimité : OpenAI lève la limite de messages texte

Analyse Alibaba Anthropic Breaking News Claude Qwen

Artificial Analysis Index : Qwen3.8 Max rattrape Claude Opus 4.8

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}