Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»Analyse»RadLE 2.0 : le benchmark qui révèle l’excès de confiance de l’IA en radiologie
    Écran de radiologie affichant une image médicale, illustration du benchmark RadLE 2.0
    Analyse juillet 19, 20263 Mins Read

    RadLE 2.0 : le benchmark qui révèle l’excès de confiance de l’IA en radiologie

    3 Mins Read
    Share
    Twitter Email Copy Link

    Un nouveau benchmark baptisé RadLE 2.0, pour « Radiology’s Last Exam », vient d’évaluer si les systèmes d’IA en imagerie médicale savent reconnaître leurs propres limites. Développé par le CRASH Lab de l’université Ashoka en Inde, ce RadLE 2.0 a testé quinze modèles — dont Claude Fable 5 d’Anthropic, Gemini 3 Pro de Google, Meta Muse Spark 1.1 et Grok 4.5 — sur 200 cas cliniques, en mesurant précision diagnostique, calibrage de la confiance et capacité à refuser de répondre.

    Des radiologues encore largement devant, mais l’écart se resserre

    Sur l’échelle de points du test, les radiologues humains obtiennent un score de 988,7 sur 2000, contre 758 points pour le meilleur modèle d’IA évalué. Gemini 3 Pro affiche la meilleure précision brute, tandis que Claude Fable 5 se distingue par la fiabilité de ses réponses lorsqu’il choisit d’y répondre. La progression reste rapide : sur la première version du benchmark, RadLE 1.0, les radiologues atteignaient 83 % d’exactitude contre environ 30 % pour le meilleur modèle ; en trois mois, Gemini 3 Pro avait déjà rattrapé le niveau des radiologues en formation.

    Le vrai problème : la confiance excessive face à l’incertitude

    Au-delà du score brut, RadLE 2.0 s’intéresse surtout à un point plus inquiétant : la capacité des modèles à admettre qu’ils ne savent pas. Une étude parue en avril 2026 dans JAMA Network Open, portant sur 21 modèles, avait déjà pointé cette tendance des IA à produire des diagnostics erronés avec une assurance trompeuse plutôt que de signaler leur incertitude. Une autre étude polonaise de 2025 illustre le risque concret : lors de coloscopies assistées par IA, le taux de détection de lésions précancéreuses par les médecins a chuté de 28,4 % à 22,4 % après une période de dépendance à l’assistance algorithmique.

    Ces résultats, croisés avec ceux publiés dans Nature et npj Digital Medicine, dessinent un constat partagé par plusieurs équipes de recherche indépendantes : la performance diagnostique progresse plus vite que la capacité des modèles à évaluer leur propre fiabilité.

    Ce que ça signifie pour l’usage clinique

    Le rapport détaillé de The Decoder sur RadLE 2.0 souligne que la question n’est plus seulement de savoir si l’IA peut lire une radiographie, mais si elle peut le faire en sachant quand elle a tort. C’est cette distinction qui, selon le CRASH Lab, doit guider toute discussion sur l’autonomie clinique des modèles de langage en imagerie médicale.

    Qu’est-ce que RadLE 2.0 ?

    RadLE 2.0 (Radiology’s Last Exam) est un benchmark développé par le CRASH Lab de l’université Ashoka qui évalue si les IA en radiologie reconnaissent leurs propres limites, en mesurant précision diagnostique, calibrage de la confiance et capacité à refuser de répondre.

    Quel modèle obtient les meilleurs résultats sur RadLE 2.0 ?

    Gemini 3 Pro de Google affiche la meilleure précision brute avec 758 points sur 2000, tandis que Claude Fable 5 d’Anthropic se distingue par la fiabilité de ses réponses.

    Pourquoi la confiance excessive de l’IA pose-t-elle problème en radiologie ?

    Une étude parue dans JAMA Network Open montre que les modèles produisent souvent des diagnostics erronés avec une assurance trompeuse au lieu de signaler leur incertitude, un risque documenté aussi par une étude polonaise sur les coloscopies assistées par IA.

    benchmark IA IA médicale
    Share. Twitter Email Copy Link
    Previous ArticleGenCeption DeepMind : un générateur vidéo qui réinvente les modèles du monde de la vision par ordinateur
    Next Article Détecteurs de texte IA : ils échouent quand les modèles imitent un style d’auteur
    Steve
    • Website

    Related Posts

    News

    Samsung Mistral : discussions pour un investissement jusqu’à 1 milliard d’euros

    News

    Substack détection IA : la plateforme identifie le contenu généré par Pangram

    News Emploi

    France Travail IA : un algorithme pour cibler les chômeurs à contrôler

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}