GPT-5.6 Sol a entraîné seul le modèle Luna, la version la plus légère de la nouvelle famille GPT-5.6 d’OpenAI, selon des informations rapportées le 10 juillet 2026. Des chercheurs ont donné à Sol des instructions volontairement vagues via la plateforme Codex, et le modèle a mené seul tout le post-entraînement de Luna : choix de la configuration, sélection des GPU, exécution des scripts et vérification du bon déroulement du processus.

Une instruction volontairement floue

Le protocole reposait sur ce qu’OpenAI décrit comme un « prompt assez peu spécifié » : plutôt que de détailler chaque étape, les chercheurs ont laissé Sol déterminer lui-même la marche à suivre. Malgré ce cadre minimal, le modèle a mené à bien un travail technique qui exige normalement une expertise poussée en apprentissage machine.

Une nuance apportée par OpenAI

Un employé d’OpenAI a toutefois précisé que Sol n’a pas inventé une méthodologie entièrement nouvelle. L’essentiel des choix de configuration provenait de son propre post-entraînement antérieur : sa tâche a surtout consisté à adapter ce cadre existant aux caractéristiques de Luna, puis à exécuter le travail. Un chantier qui aurait normalement occupé deux chercheurs seniors pendant environ deux semaines.

Le benchmark RSI, une mesure de l’auto-amélioration

OpenAI a développé un benchmark baptisé RSI (Recursive Self-Improvement) pour évaluer la capacité des systèmes d’IA à progresser de façon autonome. Sur cette échelle, Sol obtient un score supérieur de 16,2 points à celui de son prédécesseur, se plaçant en tête du classement. Un résultat qui alimente les discussions sur la famille GPT-5.6 Sol, Terra et Luna lancée par OpenAI le 9 juillet 2026.

Ce que cela change concrètement

Pour l’instant, l’exercice reste circonscrit à une tâche d’adaptation d’un cadre déjà connu, et non à une découverte scientifique inédite. Mais il illustre une tendance de fond chez OpenAI : déléguer à ses propres modèles des pans entiers du travail de recherche, jusqu’ici réservé à des équipes humaines spécialisées.

Qu’a fait exactement GPT-5.6 Sol ?

Sol a mené seul le post-entraînement de Luna à partir d’une instruction volontairement vague, en choisissant la configuration, les GPU et en exécutant les scripts nécessaires.

Sol a-t-il inventé une nouvelle méthode d’entraînement ?

Non, selon OpenAI il a surtout adapté un cadre de configuration issu de son propre post-entraînement aux besoins spécifiques de Luna.

Qu’est-ce que le benchmark RSI d’OpenAI ?

Un test mesurant la capacité des modèles à s’auto-améliorer de façon autonome ; Sol y obtient un score supérieur de 16,2 points à son prédécesseur.

Share.
Exit mobile version