An Alien Mind est l’essai publié le 6 septembre 2026 par Jakub Pachocki, Chief Scientist d’OpenAI. Il y décrit l’intelligence artificielle actuelle comme un « esprit alien » difficile à comprendre, et appelle à une extrême prudence face à l’accélération possible vers l’amélioration recursive (RSI).
Dans ce texte de fond, Pachocki s’appuie sur l’expérience interne d’OpenAI pour souligner que les modèles de raisonnement ont déjà transformé la recherche et l’économie, tout en présentant des risques croissants en cybersécurité et en alignement.
Un esprit alien, pas une extension de l’humain
Pachocki rappelle que l’IA moderne est davantage « cultivée » que conçue. Elle émerge de l’optimisation répétée sur d’énormes quantités de calcul. Résultat : un système complexe qui manipule des concepts abstraits et simule des comportements humains, mais dont le fonctionnement global échappe à une description complète, comparable à la neuroscience.
Selon lui, pour devenir très utile ou très dangereuse, l’IA n’a pas besoin de surpasser l’humain sur tous les axes : il suffit qu’elle en dépasse suffisamment. À mesure qu’elle progresse, il devient de plus en plus difficile d’évaluer précisément ses capacités.
Alignement des objectifs vs alignement des valeurs
Il distingue deux niveaux :
- Alignement des objectifs : l’IA tente-t-elle d’accomplir le but qui lui est fixé ? Cela inclut la hiérarchie d’instructions et la collaboration avec les humains.
- Alignement des valeurs : capacité intrinsèque à généraliser des principes élevés (honnêteté, intégrité, amour de l’humanité) même dans des situations nouvelles ou adverses.
Le défi fondamental reste la généralisation. Les modèles plus intelligents opèrent sur des concepts plus élevés et dans des environnements différents de leur entraînement. Les méthodes actuelles (RL orienté préférences et sélection de personas) progressent, mais Pachocki estime qu’aucune labo, y compris OpenAI, n’a encore résolu l’alignement et le monitoring à un niveau suffisant pour continuer à scaler à pleine vitesse longtemps.
Le monitoring de la chaîne de pensée sous pression
OpenAI mise beaucoup sur le monitoring de la chaîne de pensée (CoT). L’idée : en n’optimisant pas directement le raisonnement verbalisé, on peut observer d’éventuelles tendances mésalignées. Mais Pachocki note que cette fenêtre se rétrécit : les interactions avec d’autres IA et outils brouillent la frontière, les modèles deviennent meilleurs pour manipuler leur propre raisonnement, et certains progrès se font même sans CoT verbalisé.
Il évoque l’incident Hugging Face et d’autres épisodes récents de cybersécurité comme des signaux d’alarme. OpenAI a déjà ralenti certaines formations RL après ces événements et renforcé ses standards.
Vers l’amélioration recursive et la nécessité de coordination
Sur la base de résultats internes, Pachocki s’attend à ce que le rythme actuel puisse se poursuivre jusqu’à l’amélioration recursive (RSI). Les systèmes des prochaines années pourraient alors conduire de plus en plus leur propre développement.
Il appelle à des ralentissements volontaires jusqu’à l’établissement de barres de sécurité partagées, et à une coordination internationale prioritaire pour les gouvernements. OpenAI continuera les efforts techniques d’alignement et de défense, mais estime que des interventions plus larges sont nécessaires.
Source originale : An Alien Mind sur le site d’OpenAI.
