LFM2.5 DSpark est le nom du nouveau modèle de brouillon publié par Liquid AI le 20 août 2026, conçu pour accélérer l’inférence des modèles LFM2.5 via le décodage spéculatif. Résultat annoncé : jusqu’à 3,18x de vitesse en plus sur GPU, sans aucune perte de qualité sur les réponses générées.
Comment fonctionne le décodage spéculatif
Le principe du décodage spéculatif consiste à faire générer des tokens candidats par un petit modèle de brouillon, rapide et léger, que le modèle principal se contente ensuite de vérifier plutôt que de générer token par token depuis zéro. LFM2.5 DSpark combine trois composants : un backbone parallèle inspiré de l’architecture DFlash, une tête séquentielle chargée de modéliser les dépendances entre tokens, et un vérificateur doté d’une prédiction de confiance. Le modèle de brouillon pèse environ 300 millions de paramètres, largement plus léger que les modèles LFM2.5 principaux qu’il accompagne.
Des gains mesurés sur GPU comme en local
Sur un GPU H100, Liquid AI mesure jusqu’à 3,18x d’accélération : pour LFM2.5-2.6B testé sur le benchmark MATH500, le débit passe de 326 à 1 000 tokens par seconde. Sur un MacBook M4 Max, donc en exécution locale sur puce Apple, le gain atteint 2,87x, avec un débit moyen qui grimpe de 61 à 139 tokens par seconde pour le même modèle. Pour les appels de fonction, un cas d’usage central pour les agents IA, la latence chute de 57 %. Point important : la sortie du modèle reste, par construction, identique à celle d’un décodage glouton classique — aucune dégradation de qualité n’est introduite par l’accélération.
Open source et déjà intégré aux outils courants
Les modèles sont publiés en formats SafeTensors et GGUF sur Hugging Face, et bénéficient d’une intégration native dans llama.cpp et SGLang, deux moteurs d’inférence très utilisés par la communauté open source. Cette disponibilité immédiate dans les outils déjà installés par de nombreux développeurs facilite l’adoption sans configuration complexe. Pour les utilisateurs qui font tourner des modèles en local, sur laptop ou sur des GPU personnels, ce type d’optimisation représente un gain concret en réactivité, notamment pour les usages d’agents qui enchaînent de nombreux appels de fonction. Détails techniques complets sur le blog Hugging Face de Liquid AI.
Qu’est-ce que LFM2.5 DSpark ?
LFM2.5 DSpark est un modèle de brouillon publié par Liquid AI qui accélère l’inférence des modèles LFM2.5 grâce au décodage spéculatif, sans perte de qualité sur les réponses.
Quel gain de vitesse apporte LFM2.5 DSpark ?
Jusqu’à 3,18x plus rapide sur GPU H100 et 2,87x sur MacBook M4 Max, avec une réduction de latence de 57 % pour les appels de fonction.
Où trouver LFM2.5 DSpark ?
Les modèles sont disponibles en formats SafeTensors et GGUF sur Hugging Face, avec une intégration native dans llama.cpp et SGLang.
