Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Actualité IA»Google DeepMind lance les évaluations en double aveugle
Blocs en bois formant le mot encryption, symbolisant la sécurité et la confidentialité des données
Actualité IA

Google DeepMind lance les évaluations en double aveugle

3 Mins Readaoût 27, 2026
Share
Twitter Email Copy Link

Google DeepMind a présenté le 27 août 2026 ses premières évaluations en double aveugle pour un modèle d’IA propriétaire, une méthode qui vise à supprimer la contamination des benchmarks : le fait qu’un modèle ait déjà croisé les questions d’un test avant d’y être soumis. Le laboratoire a expérimenté ce protocole sur Gemini Flash Lite, en misant sur le calcul confidentiel de Google Cloud pour isoler les deux parties de l’évaluation.

Une boîte cryptographique entre l’évaluateur et le modèle

Le dispositif repose sur Confidential Space, une brique de calcul confidentiel de Google Cloud. Concrètement, l’évaluateur externe ne voit jamais les poids du modèle Gemini, et Google ne voit jamais les questions de test envoyées par l’évaluateur. Les deux parties opèrent dans un environnement chiffré dont ni l’une ni l’autre ne détient la clé complète, ce qui empêche toute triche des deux côtés : ni fuite des questions vers le laboratoire, ni accès du testeur au modèle lui-même.

Quatre organisations associées au pilote

DeepMind a associé quatre structures à ce premier test : le Singapore AI Safety Institute, l’organisation à but non lucratif OpenMined, AVERI et MLCommons, le consortium à l’origine des benchmarks MLPerf. Leur rôle est de valider que le protocole tient ses promesses de confidentialité tout en produisant des résultats exploitables pour comparer les modèles entre eux.

Le problème que veut résoudre DeepMind

Les benchmarks publics utilisés pour classer les grands modèles de langage souffrent d’un défaut connu : une fois publiés, leurs questions finissent presque toujours par apparaître, sous une forme ou une autre, dans les données d’entraînement des générations suivantes de modèles. Un score élevé sur un test contaminé ne dit alors plus grand-chose des capacités réelles du système. Les évaluations en double aveugle contournent ce problème en gardant les questions secrètes vis-à-vis du laboratoire, sans pour autant obliger celui-ci à livrer les poids de son modèle à un tiers — un compromis qui bloquait jusqu’ici ce genre d’audit indépendant pour les modèles fermés.

Une méthode encore jeune

Cette approche cryptographique n’est pas gratuite en complexité : elle suppose que les infrastructures de calcul confidentiel utilisées soient elles-mêmes dignes de confiance, et que les organismes évaluateurs disposent des compétences techniques pour interagir avec ce type d’environnement. DeepMind ne communique pour l’instant aucun résultat de performance issu de ce premier test avec Gemini Flash Lite, l’annonce se concentrant sur la méthode elle-même plutôt que sur un classement. Le laboratoire présente ce pilote comme une première étape, potentiellement étendue à d’autres modèles de la famille Gemini et à d’autres partenaires évaluateurs.

Plus de détails dans l’annonce officielle de Google DeepMind.

Qu’est-ce qu’une évaluation en double aveugle en IA ?

C’est une méthode de test où l’évaluateur ne voit jamais les poids du modèle et le laboratoire ne voit jamais les questions du test, grâce à un environnement de calcul confidentiel qui isole les deux parties.

Quel modèle Google DeepMind a-t-il testé avec ce protocole ?

Le pilote a porté sur Gemini Flash Lite, testé via Confidential Space, la technologie de calcul confidentiel de Google Cloud.

Quels organismes ont participé à ce premier test ?

Le Singapore AI Safety Institute, OpenMined, AVERI et MLCommons ont pris part à ce pilote annoncé le 27 août 2026.

benchmark IA Google DeepMind Google Gemini
Share. Twitter Email Copy Link
Previous ArticleGLM-5.3-Flash : Z.ai sort un modèle multimodal open source sous licence MIT
Next Article Amazon triple sa commande de puces Nvidia

Related Posts

Actualité IA

Faille NemoClaw : des agents IA locaux piratables

Actualité IA News Open Weight Z.ai

GLM-5.3-Flash : Z.ai sort un modèle multimodal open source sous licence MIT

Breaking News Actualité IA Nvidia Open Weight Rumeurs

Nvidia aurait accepté de racheter Hugging Face pour 12,9 milliards

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}