Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»News»GPT-Red : l’IA d’OpenAI qui pirate GPT pour le blinder
    Code binaire vert sur un écran d'ordinateur symbolisant la cybersécurité
    News juillet 16, 20263 Mins Read

    GPT-Red : l’IA d’OpenAI qui pirate GPT pour le blinder

    3 Mins Read
    Share
    Twitter Email Copy Link

    OpenAI a présenté le 15 juillet 2026 GPT-Red, un modèle interne entraîné à attaquer automatiquement ses propres modèles GPT pour détecter leurs failles de sécurité avant que des attaquants réels ne le fassent. Selon les chiffres publiés par OpenAI, ce système trouve des attaques fonctionnelles dans 84 % des scénarios testés, contre 13 % seulement pour les équipes de red teaming humaines.

    Un modèle qui s’entraîne contre lui-même

    GPT-Red fonctionne par apprentissage par renforcement en auto-jeu (self-play) : un modèle « attaquant » et un modèle « défenseur » s’améliorent l’un contre l’autre au fil des itérations. L’attaquant simule des injections de prompt dissimulées dans des e-mails, des pages web ou des fichiers, cherchant à faire dévier le comportement du modèle cible sans que l’utilisateur ne s’en aperçoive.

    Pour illustrer concrètement le danger, OpenAI a fait la démonstration d’une attaque réussie contre un distributeur automatique piloté par IA installé dans ses propres bureaux : les chercheurs sont parvenus à modifier les prix affichés et à annuler des commandes en cours, simplement en manipulant les instructions reçues par l’agent.

    Des progrès mesurables sur GPT-5.6 Sol

    OpenAI affirme que le travail de GPT-Red a directement contribué aux progrès de son dernier modèle, GPT-5.6 Sol, qui afficherait six fois moins d’échecs face aux injections de prompt directes que le meilleur modèle disponible quatre mois plus tôt. Le problème reste toutefois loin d’être résolu : environ 3,8 % des injections de prompt les plus sophistiquées parviennent encore à passer.

    Pour l’instant, GPT-Red reste un outil interne. OpenAI indique qu’un article de recherche détaillant la méthode suivra, sans donner de date précise. L’annonce complète est disponible sur le site d’OpenAI.

    Pourquoi ça compte pour les entreprises qui déploient des agents IA

    Avec la multiplication des agents capables d’agir sur des e-mails, des navigateurs ou des systèmes de paiement, les injections de prompt cachées dans du contenu tiers deviennent un vecteur d’attaque de plus en plus concret. Un taux de détection humain de 13 % illustre à quel point la vérification manuelle est insuffisante à l’échelle où opèrent ces systèmes. L’automatisation du red teaming, si les résultats se confirment en dehors du laboratoire d’OpenAI, pourrait devenir un standard pour toute entreprise déployant des agents en production.

    Qu’est-ce que GPT-Red ?

    GPT-Red est un modèle interne d’OpenAI entraîné à attaquer automatiquement les modèles GPT pour détecter leurs failles de sécurité, notamment les injections de prompt.

    GPT-Red est-il disponible au public ?

    Non, GPT-Red reste un outil interne à OpenAI. Un article de recherche détaillant la méthode doit suivre, sans date de publication précisée.

    Quel est le taux de réussite de GPT-Red face aux red teamers humains ?

    GPT-Red trouve des attaques fonctionnelles dans 84 % des scénarios testés, contre 13 % pour les équipes de red teaming humaines, selon les chiffres d’OpenAI.

    OpenAI
    Share. Twitter Email Copy Link
    Previous ArticleBonsai 27B : un modèle IA de raisonnement qui tient sur un iPhone
    Next Article Codex Micro : OpenAI veut remplacer le clavier par un joystick pour piloter vos agents IA
    Steve
    • Website

    Related Posts

    News

    Samsung Mistral : discussions pour un investissement jusqu’à 1 milliard d’euros

    News

    Substack détection IA : la plateforme identifie le contenu généré par Pangram

    News Emploi

    France Travail IA : un algorithme pour cibler les chômeurs à contrôler

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}