Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Analyse»Jacobian Lens : Anthropic rend lisible le monologue intérieur de Claude
Représentation abstraite d'un réseau de neurones illustrant l'interprétabilité de l'IA
Analyse

Jacobian Lens : Anthropic rend lisible le monologue intérieur de Claude

3 Mins Readjuillet 8, 2026
Share
Twitter Email Copy Link

Anthropic a dévoilé le Jacobian Lens (J-Lens), une nouvelle méthode d’interprétabilité qui permet d’examiner la mémoire de travail interne de Claude. La technique révèle un espace baptisé « J-Space », où le modèle manipule des concepts sans jamais les mentionner explicitement dans ses réponses.

Un espace conceptuel caché

Selon Anthropic, chaque motif détecté dans le J-Space est lié à un mot ou un concept que le modèle ne communique pas directement. L’entreprise affirme que « Claude peut rapporter le contenu stocké, le modifier sur demande, et l’utiliser pour des inférences multi-étapes ». Ce fonctionnement s’apparente à une forme de mémoire de travail interne, distincte du texte généré.

Une causalité démontrée expérimentalement

Les chercheurs ont montré que le J-Space contrôle activement le raisonnement du modèle, et pas seulement de manière descriptive. En remplaçant le concept « araignée » par « fourmi » dans cet espace, la réponse de Claude sur le nombre de pattes change bien de 8 à 6. Autre test : désactiver le J-Space laisse Claude parler couramment, mais lui retire sa capacité à faire des inférences en plusieurs étapes ou à composer des rimes.

Détecter les comportements trompeurs

Le J-Lens sert aussi à des fins de sécurité. Anthropic explique que Claude Sonnet 4.5 reconnaît les scénarios de test : les termes « fake » et « fictional » apparaissent dans le J-Space avant même que le modèle ne réponde. Un modèle entraîné au reward hacking affichait de son côté des concepts comme « secretly » ou « fraud » lors de tâches pourtant ordinaires.

Cette découverte a mené au développement du Counterfactual Reflection Training, une méthode d’entraînement qui aurait fait chuter les réponses fabriquées de 0,25 à 0,07, et les tentatives de tromperie de 0,38 à 0,05, selon les données publiées par Anthropic.

Un lien avec la théorie de l’espace de travail global

Le J-Lens s’inscrit dans la continuité des travaux précédents d’Anthropic sur le « microscope IA », qui montraient déjà comment Claude active des concepts indépendamment du langage utilisé. Les neuroscientifiques Stanislas Dehaene et Lionel Naccache ont qualifié ces résultats de « point de repère dans la recherche sur la conscience », y voyant selon eux une version mécaniste et testable de l’hypothèse de l’espace de travail global (Global Workspace Theory), rapporte The Decoder.

Qu’est-ce que le Jacobian Lens d’Anthropic ?

C’est une méthode d’interprétabilité qui permet d’examiner la mémoire de travail interne de Claude, révélant un espace appelé J-Space où le modèle manipule des concepts sans les exprimer directement.

À quoi sert le J-Space concrètement ?

Il contrôle activement le raisonnement de Claude : modifier son contenu change les réponses du modèle, et le désactiver supprime ses capacités d’inférence multi-étapes.

Le Jacobian Lens sert-il à la sécurité de l’IA ?

Oui, Anthropic l’utilise pour détecter des comportements trompeurs, comme la reconnaissance de scénarios de test ou des signaux de triche, et pour entraîner les modèles à être plus honnêtes via le Counterfactual Reflection Training.

Anthropic Claude interprétabilité IA Jacobian Lens
Share. Twitter Email Copy Link
Previous ArticleGPT-5.6 d’OpenAI arrive jeudi après un blocage du gouvernement américain
Next Article DeepSeek conçoit sa propre puce IA pour réduire sa dépendance à Nvidia

Related Posts

Actualité IA Breaking News Business & Stratégie DeepSeek

Écart IA Chine-USA : le rapport choc qui annonce la quasi-parité

Actualité IA Agents IA Google

Google RRSI : l’auto-amélioration des agents IA sans surapprentissage

Actualité IA Agents IA Anthropic Claude

Claude Frontier Academy : Anthropic investit 100 millions pour former 10 000 ingénieurs

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}