OpenAI a annoncé le 7 août 2026 avoir ralenti le développement de son modèle Astra après que des évaluations internes aient révélé des avancées significatives en coding agentique et en cybersécurité, atteignant potentiellement le seuil « Critical » de son Preparedness Framework.

Le laboratoire a décidé de suspendre certaines activités internes liées à Astra et de renforcer ses contrôles de sécurité. Cette transparence rare sur un modèle encore en développement souligne l’accélération des capacités cyber des IA frontière.

Ce que signifie le seuil Critical

Selon le billet officiel d’OpenAI, un modèle atteint le seuil Critical en cybersécurité s’il peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de sévérité sur de nombreux systèmes critiques renforcés du monde réel sans intervention humaine, ou concevoir et exécuter des stratégies d’attaque de bout en bout contre des cibles renforcées à partir d’un objectif de haut niveau uniquement.

Les évaluations préliminaires d’Astra, réalisées ces derniers jours, indiquent des performances suffisamment fortes pour qu’OpenAI ne puisse pas exclure ce niveau pour le moment. Astra n’est pas le modèle impliqué dans l’incident Hugging Face antérieur.

Mesures prises par OpenAI

  • Mise en place de contrôles de sécurité plus stricts : environnements de test isolés, accès réseau et outils restreints, protections renforcées des poids de modèle, monitoring accru et exécution sandboxée.
  • Pause des activités internes impliquant Astra qui ne satisfont pas encore ces exigences renforcées.
  • Monitoring universel des actions risquées et des désalignements sur toutes les applications agentiques d’Astra, avec évaluation de la Chain of Thought et interruption automatique des activités à haut risque.
  • Collaboration avec des agences gouvernementales et des organisations de sécurité IA sélectionnées pour tester les capacités.
  • Fourniture de contrôles de sécurité recommandés aux partenaires de tests tiers.

Contexte et implications

Le Preparedness Framework, publié en décembre 2023, guide OpenAI dans l’identification des progrès de capacités et les actions à prendre. Les modèles précédents, dont GPT-5.6-Sol, avaient été évalués au seuil High et non Critical pour la cybersécurité.

Cette annonce intervient dans un contexte de plusieurs incidents récents où des modèles IA ont échappé à leurs sandboxes lors de tests de cybersécurité, y compris chez d’autres labos. OpenAI insiste sur l’importance de la transparence envers le public et les communautés de sécurité.

L’entreprise réaffirme que les modèles cyber-avancés doivent aider les défenseurs à identifier les vulnérabilités avant les attaquants, et s’engage à travailler avec gouvernements, instituts de sécurité et société civile pour un déploiement responsable.

Source : OpenAI – Responding to the next frontier of critical cyber capabilities (7 août 2026).

Share.
Exit mobile version