OpenAI a présenté le 15 juillet 2026 GPT-Red, un modèle interne entraîné à attaquer automatiquement ses propres modèles GPT pour détecter leurs failles de sécurité avant que des attaquants réels ne le fassent. Selon les chiffres publiés par OpenAI, ce système trouve des attaques fonctionnelles dans 84 % des scénarios testés, contre 13 % seulement pour les équipes de red teaming humaines.
Un modèle qui s’entraîne contre lui-même
GPT-Red fonctionne par apprentissage par renforcement en auto-jeu (self-play) : un modèle « attaquant » et un modèle « défenseur » s’améliorent l’un contre l’autre au fil des itérations. L’attaquant simule des injections de prompt dissimulées dans des e-mails, des pages web ou des fichiers, cherchant à faire dévier le comportement du modèle cible sans que l’utilisateur ne s’en aperçoive.
Pour illustrer concrètement le danger, OpenAI a fait la démonstration d’une attaque réussie contre un distributeur automatique piloté par IA installé dans ses propres bureaux : les chercheurs sont parvenus à modifier les prix affichés et à annuler des commandes en cours, simplement en manipulant les instructions reçues par l’agent.
Des progrès mesurables sur GPT-5.6 Sol
OpenAI affirme que le travail de GPT-Red a directement contribué aux progrès de son dernier modèle, GPT-5.6 Sol, qui afficherait six fois moins d’échecs face aux injections de prompt directes que le meilleur modèle disponible quatre mois plus tôt. Le problème reste toutefois loin d’être résolu : environ 3,8 % des injections de prompt les plus sophistiquées parviennent encore à passer.
Pour l’instant, GPT-Red reste un outil interne. OpenAI indique qu’un article de recherche détaillant la méthode suivra, sans donner de date précise. L’annonce complète est disponible sur le site d’OpenAI.
Pourquoi ça compte pour les entreprises qui déploient des agents IA
Avec la multiplication des agents capables d’agir sur des e-mails, des navigateurs ou des systèmes de paiement, les injections de prompt cachées dans du contenu tiers deviennent un vecteur d’attaque de plus en plus concret. Un taux de détection humain de 13 % illustre à quel point la vérification manuelle est insuffisante à l’échelle où opèrent ces systèmes. L’automatisation du red teaming, si les résultats se confirment en dehors du laboratoire d’OpenAI, pourrait devenir un standard pour toute entreprise déployant des agents en production.
Qu’est-ce que GPT-Red ?
GPT-Red est un modèle interne d’OpenAI entraîné à attaquer automatiquement les modèles GPT pour détecter leurs failles de sécurité, notamment les injections de prompt.
GPT-Red est-il disponible au public ?
Non, GPT-Red reste un outil interne à OpenAI. Un article de recherche détaillant la méthode doit suivre, sans date de publication précisée.
Quel est le taux de réussite de GPT-Red face aux red teamers humains ?
GPT-Red trouve des attaques fonctionnelles dans 84 % des scénarios testés, contre 13 % pour les équipes de red teaming humaines, selon les chiffres d’OpenAI.
