Google DeepMind a présenté le 27 août 2026 ses premières évaluations en double aveugle pour un modèle d’IA propriétaire, une méthode qui vise à supprimer la contamination des benchmarks : le fait qu’un modèle ait déjà croisé les questions d’un test avant d’y être soumis. Le laboratoire a expérimenté ce protocole sur Gemini Flash Lite, en misant sur le calcul confidentiel de Google Cloud pour isoler les deux parties de l’évaluation.

Une boîte cryptographique entre l’évaluateur et le modèle

Le dispositif repose sur Confidential Space, une brique de calcul confidentiel de Google Cloud. Concrètement, l’évaluateur externe ne voit jamais les poids du modèle Gemini, et Google ne voit jamais les questions de test envoyées par l’évaluateur. Les deux parties opèrent dans un environnement chiffré dont ni l’une ni l’autre ne détient la clé complète, ce qui empêche toute triche des deux côtés : ni fuite des questions vers le laboratoire, ni accès du testeur au modèle lui-même.

Quatre organisations associées au pilote

DeepMind a associé quatre structures à ce premier test : le Singapore AI Safety Institute, l’organisation à but non lucratif OpenMined, AVERI et MLCommons, le consortium à l’origine des benchmarks MLPerf. Leur rôle est de valider que le protocole tient ses promesses de confidentialité tout en produisant des résultats exploitables pour comparer les modèles entre eux.

Le problème que veut résoudre DeepMind

Les benchmarks publics utilisés pour classer les grands modèles de langage souffrent d’un défaut connu : une fois publiés, leurs questions finissent presque toujours par apparaître, sous une forme ou une autre, dans les données d’entraînement des générations suivantes de modèles. Un score élevé sur un test contaminé ne dit alors plus grand-chose des capacités réelles du système. Les évaluations en double aveugle contournent ce problème en gardant les questions secrètes vis-à-vis du laboratoire, sans pour autant obliger celui-ci à livrer les poids de son modèle à un tiers — un compromis qui bloquait jusqu’ici ce genre d’audit indépendant pour les modèles fermés.

Une méthode encore jeune

Cette approche cryptographique n’est pas gratuite en complexité : elle suppose que les infrastructures de calcul confidentiel utilisées soient elles-mêmes dignes de confiance, et que les organismes évaluateurs disposent des compétences techniques pour interagir avec ce type d’environnement. DeepMind ne communique pour l’instant aucun résultat de performance issu de ce premier test avec Gemini Flash Lite, l’annonce se concentrant sur la méthode elle-même plutôt que sur un classement. Le laboratoire présente ce pilote comme une première étape, potentiellement étendue à d’autres modèles de la famille Gemini et à d’autres partenaires évaluateurs.

Plus de détails dans l’annonce officielle de Google DeepMind.

Qu’est-ce qu’une évaluation en double aveugle en IA ?

C’est une méthode de test où l’évaluateur ne voit jamais les poids du modèle et le laboratoire ne voit jamais les questions du test, grâce à un environnement de calcul confidentiel qui isole les deux parties.

Quel modèle Google DeepMind a-t-il testé avec ce protocole ?

Le pilote a porté sur Gemini Flash Lite, testé via Confidential Space, la technologie de calcul confidentiel de Google Cloud.

Quels organismes ont participé à ce premier test ?

Le Singapore AI Safety Institute, OpenMined, AVERI et MLCommons ont pris part à ce pilote annoncé le 27 août 2026.

Share.
Exit mobile version