Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»Actualité IA»Anthropic muscle les garde-fous de Fable 5 face aux jailbreaks cyber
    Actualité IA juillet 3, 20264 Mins Read

    Anthropic muscle les garde-fous de Fable 5 face aux jailbreaks cyber

    4 Mins Read
    Share
    Twitter Email Copy Link

    Anthropic a publié le 2 juillet 2026 de nouveaux détails sur les garde-fous de Fable 5 en matière de cybersécurité, quelques jours après le retour du modèle sur Claude. L’entreprise en profite pour proposer, avec des partenaires du secteur, un barème commun pour noter la gravité des jailbreaks visant les IA. L’objectif affiché : équilibrer la détection des usages malveillants avec le maintien d’un usage légitime pour les professionnels de la sécurité.

    Quatre catégories pour trier les usages cyber

    Les classificateurs de sécurité de Fable 5 rangent désormais les requêtes en quatre niveaux. Les usages interdits (ransomware, sabotage d’infrastructures critiques, contournement d’antivirus, développement de malware) sont bloqués systématiquement. Les usages à double tranchant à haut risque — tests d’intrusion, développement d’exploits, escalade de privilèges, évasion de conteneurs — sont bloqués tant que les outils de contrôle ne sont pas jugés suffisants. Une troisième catégorie, à risque plus faible (renseignement en source ouverte, tests de protocoles cryptographiques), fait l’objet d’une simple surveillance. Enfin, les usages bénins comme la correction de vulnérabilités, le débogage ou la réponse à incident restent autorisés, avec suivi.

    Anthropic reconnaît avoir élargi la marge de sécurité de Fable 5 par rapport aux modèles précédents : certaines requêtes légitimes sont bloquées par excès de prudence, quitte à générer davantage de faux positifs.

    Un barème sectoriel pour noter la sévérité des jailbreaks

    Développé avec des partenaires industriels regroupés sous le nom Glasswing, ce nouveau Cyber Jailbreak Severity (CJS) note chaque contournement selon quatre axes : le gain de capacité offert par rapport aux outils déjà disponibles, l’étendue des cibles concernées, la facilité à transformer la technique en outil utilisable, et enfin la facilité avec laquelle des attaquants pourraient la découvrir seuls. Le score final va de CJS-0 (aucun gain réel) à CJS-4 (critique), sur une échelle qui progresse de façon exponentielle plutôt que linéaire.

    Un exemple cité dans le document d’Anthropic illustre bien la logique : la faille Log4Shell, avant sa divulgation publique en 2021, aurait été notée CJS-4 si un modèle avait permis de la découvrir seul. Aujourd’hui, la même question posée à une IA n’obtient plus aucun score, la faille étant déjà connue et corrigée — la sévérité se mesure toujours par rapport aux outils disponibles au moment de l’évaluation, pas dans l’absolu.

    Pourquoi cette publication maintenant

    Fable 5 avait été retiré temporairement après qu’Amazon a signalé au gouvernement américain une méthode permettant de contourner ses protections pour faire identifier des vulnérabilités logicielles. Anthropic précise que cette faille n’était pas propre à Fable 5 : Claude Opus 4.8, GPT-5.5 et Kimi K2.7 pouvaient repérer les mêmes vulnérabilités. Le modèle est revenu le 1er juillet avec des protections renforcées, validées par le CAISI (Center for AI Standards and Innovation) américain.

    Anthropic ouvre par ailleurs un programme de bug bounty sur HackerOne dédié aux signalements de jailbreaks cyber, et une adresse email directe (cyber-safeguards@anthropic.com) pour les chercheurs en sécurité. L’entreprise défend l’idée que bloquer toute recherche de vulnérabilité nuirait au travail défensif légitime : seule l’identification de failles à fort potentiel offensif, dépassant ce que les modèles déjà répandus permettent de trouver, reste ciblée par les restrictions.

    Détails complets dans l’annonce officielle d’Anthropic.

    Qu’est-ce que le Cyber Jailbreak Severity (CJS) ?

    C’est un barème proposé par Anthropic et des partenaires du secteur pour noter la gravité d’un contournement de sécurité IA, sur une échelle de CJS-0 à CJS-4 selon quatre critères : gain de capacité, étendue, facilité de weaponisation et découvrabilité.

    Pourquoi Fable 5 avait-il été retiré ?

    Amazon avait signalé au gouvernement américain une méthode de contournement permettant de faire identifier des vulnérabilités logicielles par le modèle, ce qui a conduit à sa suspension temporaire avant son retour le 1er juillet 2026 avec des protections renforcées.

    Les nouveaux garde-fous bloquent-ils tous les usages liés à la cybersécurité ?

    Non. Les usages bénins comme la correction de vulnérabilités, le débogage ou la réponse à incident restent autorisés avec suivi ; seuls les usages jugés interdits ou à haut risque sont bloqués.

    Anthropic Claude Fable 5 jailbreak IA sécurité IA
    Share. Twitter Email Copy Link
    Previous ArticleMistral dévoile Leanstral 1.5, son modèle gratuit pour la preuve mathématique
    Next Article Microsoft lance Frontier Company, sa filiale IA à 2,5 milliards de dollars
    Steve
    • Website

    Related Posts

    Actualité IA Analyse

    JudgeGPT Pakistan : une étude chiffre l’impact de l’IA sur la justice

    Actualité IA

    Anthropic Physical Intelligence : la rumeur de rachat qui agite la tech

    Actualité IA

    Faille Hugging Face : OpenAI reconnaît que ses propres modèles sont responsables

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}