Inception Labs a lancé Mercury 2.5 le 8 septembre 2026, présenté comme le modèle par diffusion le plus capable du marché. Il atteint 1 107 tokens par seconde sur des GPU Nvidia grand public, tout en gagnant 40 % en intelligence par rapport à Mercury 2.

Une architecture par diffusion, pas autorégressive

Contrairement à GPT, Claude ou Gemini, qui génèrent le texte token par token dans l’ordre, Mercury 2.5 s’appuie sur une architecture par diffusion : le modèle affine un brouillon complet par itérations successives, comme le fait un modèle de génération d’image. Cette approche explique son débit élevé, revendiqué jusqu’à dix fois supérieur à celui de modèles autorégressifs comparables.

Le modèle gère désormais une fenêtre de contexte de 260 000 tokens, permet des appels d’outils en parallèle, un raisonnement ajustable et une sortie JSON alignée sur un schéma — des fonctionnalités pensées pour les agents de recherche, les pipelines RAG, les applications vocales et les assistants de code.

Des performances comparables aux modèles économiques des géants

Inception Labs positionne Mercury 2.5 comme comparable aux modèles frontières optimisés pour le coût, citant GPT-5.6 Luna, Gemini 3.5 Flash-Lite et Claude Haiku 4.5 comme points de comparaison. Ces chiffres proviennent de l’entreprise elle-même ; aucun test indépendant à grande échelle n’est encore disponible à ce stade.

Tarifs et disponibilité

Le modèle est accessible via l’API d’Inception Labs, ainsi que sur les plateformes Baseten et OpenRouter. Le tarif standard est de 0,20 $ par million de tokens en entrée et 0,75 $ en sortie, mais une promotion de lancement de 80 % ramène ces prix à 0,04 $ et 0,15 $. Un quota gratuit de 100 millions de tokens est proposé pour les tests, et une interface de chat est disponible sur chat.inceptionlabs.ai. Des déploiements entreprise avec capacité dédiée et contrôles de conformité sont également proposés.

Plus de détails sur le blog officiel d’Inception Labs.

Qu’est-ce qu’un modèle par diffusion appliqué au texte ?

Contrairement à un LLM autorégressif qui génère le texte mot par mot, un modèle par diffusion part d’un brouillon bruité et l’affine par itérations jusqu’à obtenir la réponse finale, une méthode empruntée à la génération d’image.

Mercury 2.5 est-il gratuit ?

Inception Labs propose un quota gratuit de 100 millions de tokens pour les tests via son API, au-delà duquel les tarifs standards ou la promotion de lancement à 80 % de réduction s’appliquent.

Sur quelles plateformes trouver Mercury 2.5 ?

Le modèle est disponible via l’API d’Inception Labs, sur Baseten, sur OpenRouter, ainsi que via une interface de chat dédiée à l’adresse chat.inceptionlabs.ai.

Share.
Exit mobile version