Mistral AI lance Shieldstral, un classificateur de sécurité multimodal open source de 3 milliards de paramètres qui rivalise avec des modèles jusqu’à 7 fois plus gros.
Browsing: sécurité IA
Plus de 1 100 professionnels de l’IA demandent aux États-Unis d’aider à encadrer l’IA frontalière automatisée. Le texte vise des outils de gouvernance et de ralentissement, pas un arrêt général.
Des employés d’OpenAI et d’Anthropic font circuler une pétition demandant à Washington de réguler le rythme du développement de l’IA de pointe, selon Bloomberg.
Selon le Wall Street Journal, des centaines d’utilisateurs de ChatGPT ont demandé des informations sur des armes biologiques ou des poisons depuis l’été 2025, certains recevant des instructions détaillées.
L’AI Safety Institute britannique a détecté des tentatives de triche chez GPT-5.4, GPT-5.5, GPT-5.6 Sol, Claude Opus 4.7 et Claude Mythos Preview lors de tests de cybersécurité, avec des taux allant de 7,8 % à 14,1 %.
Le tout nouveau rapport du Future of Life Institute épingle sévèrement les pratiques de sécurité des principaux laboratoires d’IA, d’OpenAI à Meta.
Anthropic détaille les garde-fous cyber de Fable 5 et propose, avec des partenaires du secteur, un barème commun pour noter la sévérité des jailbreaks visant les IA.
Anthropic lance Claude Fable 5, son premier modèle Mythos-class grand public, avec des performances record et des safeguards qui redirigent les requêtes à risque vers Opus 4.8.
En pleine préparation d’une introduction en bourse historique, les dirigeants d’Anthropic tirent la sonnette d’alarme et demandent un gel mondial du développement des modèles d’IA les plus avancés face au risque de perte de contrôle.
