Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Actualité IA»LFM2.5 DSpark : Liquid AI accélère l’inférence jusqu’à 3,18x
Serveurs de data center illustrant l'accélération de l'inférence IA
Actualité IA

LFM2.5 DSpark : Liquid AI accélère l’inférence jusqu’à 3,18x

3 Mins Readaoût 20, 2026
Share
Twitter Email Copy Link

LFM2.5 DSpark est le nom du nouveau modèle de brouillon publié par Liquid AI le 20 août 2026, conçu pour accélérer l’inférence des modèles LFM2.5 via le décodage spéculatif. Résultat annoncé : jusqu’à 3,18x de vitesse en plus sur GPU, sans aucune perte de qualité sur les réponses générées.

Comment fonctionne le décodage spéculatif

Le principe du décodage spéculatif consiste à faire générer des tokens candidats par un petit modèle de brouillon, rapide et léger, que le modèle principal se contente ensuite de vérifier plutôt que de générer token par token depuis zéro. LFM2.5 DSpark combine trois composants : un backbone parallèle inspiré de l’architecture DFlash, une tête séquentielle chargée de modéliser les dépendances entre tokens, et un vérificateur doté d’une prédiction de confiance. Le modèle de brouillon pèse environ 300 millions de paramètres, largement plus léger que les modèles LFM2.5 principaux qu’il accompagne.

Des gains mesurés sur GPU comme en local

Sur un GPU H100, Liquid AI mesure jusqu’à 3,18x d’accélération : pour LFM2.5-2.6B testé sur le benchmark MATH500, le débit passe de 326 à 1 000 tokens par seconde. Sur un MacBook M4 Max, donc en exécution locale sur puce Apple, le gain atteint 2,87x, avec un débit moyen qui grimpe de 61 à 139 tokens par seconde pour le même modèle. Pour les appels de fonction, un cas d’usage central pour les agents IA, la latence chute de 57 %. Point important : la sortie du modèle reste, par construction, identique à celle d’un décodage glouton classique — aucune dégradation de qualité n’est introduite par l’accélération.

Open source et déjà intégré aux outils courants

Les modèles sont publiés en formats SafeTensors et GGUF sur Hugging Face, et bénéficient d’une intégration native dans llama.cpp et SGLang, deux moteurs d’inférence très utilisés par la communauté open source. Cette disponibilité immédiate dans les outils déjà installés par de nombreux développeurs facilite l’adoption sans configuration complexe. Pour les utilisateurs qui font tourner des modèles en local, sur laptop ou sur des GPU personnels, ce type d’optimisation représente un gain concret en réactivité, notamment pour les usages d’agents qui enchaînent de nombreux appels de fonction. Détails techniques complets sur le blog Hugging Face de Liquid AI.

Qu’est-ce que LFM2.5 DSpark ?

LFM2.5 DSpark est un modèle de brouillon publié par Liquid AI qui accélère l’inférence des modèles LFM2.5 grâce au décodage spéculatif, sans perte de qualité sur les réponses.

Quel gain de vitesse apporte LFM2.5 DSpark ?

Jusqu’à 3,18x plus rapide sur GPU H100 et 2,87x sur MacBook M4 Max, avec une réduction de latence de 57 % pour les appels de fonction.

Où trouver LFM2.5 DSpark ?

Les modèles sont disponibles en formats SafeTensors et GGUF sur Hugging Face, avec une intégration native dans llama.cpp et SGLang.

Décodage spéculatif Inférence IA Liquid AI Open Source
Share. Twitter Email Copy Link
Previous ArticleAgentic Search Mistral : la fin annoncée du RAG classique
Next Article Pages web IA : un tiers du web écrit par ChatGPT selon Pew Research

Related Posts

Actualité IA

Faille NemoClaw : des agents IA locaux piratables

Actualité IA

Google DeepMind lance les évaluations en double aveugle

Actualité IA News Open Weight Z.ai

GLM-5.3-Flash : Z.ai sort un modèle multimodal open source sous licence MIT

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}