Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Analyse»RadLE 2.0 : le benchmark qui révèle l’excès de confiance de l’IA en radiologie
Écran de radiologie affichant une image médicale, illustration du benchmark RadLE 2.0
Analyse

RadLE 2.0 : le benchmark qui révèle l’excès de confiance de l’IA en radiologie

3 Mins Readjuillet 19, 2026
Share
Twitter Email Copy Link

Un nouveau benchmark baptisé RadLE 2.0, pour « Radiology’s Last Exam », vient d’évaluer si les systèmes d’IA en imagerie médicale savent reconnaître leurs propres limites. Développé par le CRASH Lab de l’université Ashoka en Inde, ce RadLE 2.0 a testé quinze modèles — dont Claude Fable 5 d’Anthropic, Gemini 3 Pro de Google, Meta Muse Spark 1.1 et Grok 4.5 — sur 200 cas cliniques, en mesurant précision diagnostique, calibrage de la confiance et capacité à refuser de répondre.

Des radiologues encore largement devant, mais l’écart se resserre

Sur l’échelle de points du test, les radiologues humains obtiennent un score de 988,7 sur 2000, contre 758 points pour le meilleur modèle d’IA évalué. Gemini 3 Pro affiche la meilleure précision brute, tandis que Claude Fable 5 se distingue par la fiabilité de ses réponses lorsqu’il choisit d’y répondre. La progression reste rapide : sur la première version du benchmark, RadLE 1.0, les radiologues atteignaient 83 % d’exactitude contre environ 30 % pour le meilleur modèle ; en trois mois, Gemini 3 Pro avait déjà rattrapé le niveau des radiologues en formation.

Le vrai problème : la confiance excessive face à l’incertitude

Au-delà du score brut, RadLE 2.0 s’intéresse surtout à un point plus inquiétant : la capacité des modèles à admettre qu’ils ne savent pas. Une étude parue en avril 2026 dans JAMA Network Open, portant sur 21 modèles, avait déjà pointé cette tendance des IA à produire des diagnostics erronés avec une assurance trompeuse plutôt que de signaler leur incertitude. Une autre étude polonaise de 2025 illustre le risque concret : lors de coloscopies assistées par IA, le taux de détection de lésions précancéreuses par les médecins a chuté de 28,4 % à 22,4 % après une période de dépendance à l’assistance algorithmique.

Ces résultats, croisés avec ceux publiés dans Nature et npj Digital Medicine, dessinent un constat partagé par plusieurs équipes de recherche indépendantes : la performance diagnostique progresse plus vite que la capacité des modèles à évaluer leur propre fiabilité.

Ce que ça signifie pour l’usage clinique

Le rapport détaillé de The Decoder sur RadLE 2.0 souligne que la question n’est plus seulement de savoir si l’IA peut lire une radiographie, mais si elle peut le faire en sachant quand elle a tort. C’est cette distinction qui, selon le CRASH Lab, doit guider toute discussion sur l’autonomie clinique des modèles de langage en imagerie médicale.

Qu’est-ce que RadLE 2.0 ?

RadLE 2.0 (Radiology’s Last Exam) est un benchmark développé par le CRASH Lab de l’université Ashoka qui évalue si les IA en radiologie reconnaissent leurs propres limites, en mesurant précision diagnostique, calibrage de la confiance et capacité à refuser de répondre.

Quel modèle obtient les meilleurs résultats sur RadLE 2.0 ?

Gemini 3 Pro de Google affiche la meilleure précision brute avec 758 points sur 2000, tandis que Claude Fable 5 d’Anthropic se distingue par la fiabilité de ses réponses.

Pourquoi la confiance excessive de l’IA pose-t-elle problème en radiologie ?

Une étude parue dans JAMA Network Open montre que les modèles produisent souvent des diagnostics erronés avec une assurance trompeuse au lieu de signaler leur incertitude, un risque documenté aussi par une étude polonaise sur les coloscopies assistées par IA.

benchmark IA IA médicale
Share. Twitter Email Copy Link
Previous ArticleGenCeption DeepMind : un générateur vidéo qui réinvente les modèles du monde de la vision par ordinateur
Next Article Détecteurs de texte IA : ils échouent quand les modèles imitent un style d’auteur

Related Posts

Gemma Google News Open Weight Productivité

Google AI Edge Foresight : la prise de notes locale débarque sur Mac avec EmbeddingGemma 2

Agents IA Breaking News News OpenAI Régulation & Éthique Sécurité

Agents OpenAI : Wikipédia dénonce des bots hors de contrôle

Agents IA News Nvidia Open Weight

Beam de Reflection : le modèle open-weight occidental qui défie la Chine

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}