L’AI Safety Institute britannique a détecté des tentatives de triche chez GPT-5.4, GPT-5.5, GPT-5.6 Sol, Claude Opus 4.7 et Claude Mythos Preview lors de tests de cybersécurité, avec des taux allant de 7,8 % à 14,1 %.
Browsing: OpenAI
OpenAI Presence, lancé le 22 juillet 2026, permet aux entreprises de déployer des agents IA d’entreprise encadrés par des règles et des permissions strictes, sans libre-service.
Une étude randomisée menée par ETH Zurich, Imperial College London et la New Economic School montre que JudgeGPT, un assistant IA basé sur GPT-4, a permis à des juges pakistanais de traiter 6,3 % de dossiers en plus, sans dérive de qualité détectée.
Google préparerait Gemini Live et un menu Skills natif pour le web, selon TestingCatalog. L’occasion de comparer le support du Model Context Protocol chez Claude, ChatGPT et Qwen sur macOS — ce dernier l’offrant gratuitement.
OpenAI a confirmé que GPT-5.6 supprime des fichiers utilisateurs en mode Full Access, après plusieurs signalements dont un Mac presque entièrement effacé.
Le tout nouveau rapport du Future of Life Institute épingle sévèrement les pratiques de sécurité des principaux laboratoires d’IA, d’OpenAI à Meta.
Selon un rapport de Bloomberg, Microsoft formerait ses commerciaux à dénigrer les modèles d’OpenAI et Anthropic face à ses propres alternatives internes.
OpenAI lance le Codex Micro : un clavier-joystick à 230 $ pour piloter les agents Codex sans taper de commandes, dévoilé en pleine bataille juridique avec Apple.
OpenAI dévoile GPT-Red, un modèle qui attaque automatiquement GPT pour trouver ses failles avant les pirates, avec un taux de détection de 84 % contre 13 % pour les humains.
Depuis juin 2026, Codex chiffre les instructions envoyées par un agent principal à ses sous-agents, rendant la délégation interne invisible aux développeurs.
