Liquid AI a publié le 4 août 2026 Liquid AI LFM2.5, un modèle de langage compact de 2,6 milliards de paramètres pensé pour faire tourner des agents IA complets directement sur l’appareil de l’utilisateur. Entraîné sur environ 34 000 milliards de tokens avec une fenêtre de contexte de 128 000 tokens, il gère l’appel d’outils et le raisonnement multi-étapes tout en restant assez léger pour un ordinateur portable ou un smartphone.
Des scores proches de modèles quatre fois plus gros
Sur les benchmarks publiés par Liquid AI, LFM2.5-2.6B rivalise avec des modèles nettement plus volumineux. Il obtient 51,87 sur AIME25 contre 34,27 pour Gemma-4-8B, et 59,17 sur IFBench contre 39,24 pour ce même modèle. Face à Qwen-9.7B, l’écart se resserre mais LFM2.5-2.6B reste compétitif sur ToolSandbox (77,83 contre 76,44) et BrowseComp+ (26,89 contre 27,23), deux benchmarks qui mesurent la capacité d’un modèle à utiliser des outils et à naviguer sur le web de façon autonome. Liquid AI positionne donc son modèle non pas contre d’autres petits modèles, mais contre des systèmes jusqu’à quatre fois plus lourds à faire tourner.
Assez rapide pour tourner sur un téléphone
Liquid AI annonce une vitesse d’inférence de 220 tokens par seconde sur processeur Apple M5 Max et 113 tokens par seconde sur un AMD Ryzen, sans GPU dédié. Sur un téléphone, le modèle atteint environ 30 tokens par seconde, une vitesse suffisante pour faire fonctionner un agent en continu. Sur un GPU H100, LFM2.5-2.6B peut à l’inverse délivrer jusqu’à 15 000 tokens par seconde en sortie à forte concurrence, ce qui ouvre aussi la porte à un déploiement serveur à bas coût pour des charges à fort volume.
Un entraînement en quatre étapes pensé pour l’usage agentique
L’entraînement s’est fait en quatre étapes : deux passes de fine-tuning supervisé, une spécialisation par un modèle enseignant, une distillation multi-domaines sur les propres réponses du modèle, puis un apprentissage par renforcement directement au sein de harnais d’agents réels. Cette dernière étape distingue LFM2.5-2.6B d’un simple modèle compressé : il n’a pas seulement appris à répondre, mais à enchaîner des appels d’outils dans des scénarios agentiques concrets, ce qui explique ses scores sur ToolSandbox et BrowseComp+.
Compatible avec les principaux frameworks d’agents
Le modèle est disponible en deux versions, LFM2.5-2.6B et LFM2.5-2.6B-Base, sur Hugging Face, avec un support pour llama.cpp, MLX, vLLM, SGLang et ONNX. Liquid AI le présente comme compatible avec les harnais d’agents OpenClaw, Hermes Agent et Pi. « Déployer des agents partout, garder les données privées sur l’appareil, et faire évoluer l’usage sans facture d’inférence cloud », résume Liquid AI pour justifier l’intérêt de cette approche, qui s’inscrit dans un mouvement plus large vers des modèles capables de tourner en local plutôt que de dépendre systématiquement d’une API distante. Détails complets dans le billet officiel de Liquid AI sur Hugging Face.
Qu’est-ce que Liquid AI LFM2.5 ?
LFM2.5-2.6B est un modèle de langage compact de 2,6 milliards de paramètres, conçu par Liquid AI pour exécuter des agents IA directement sur l’appareil de l’utilisateur, sans dépendre d’un serveur cloud.
LFM2.5-2.6B peut-il tourner sur un smartphone ?
Oui, Liquid AI annonce une vitesse d’environ 30 tokens par seconde sur mobile, suffisante pour faire fonctionner un agent en continu.
Quels outils sont compatibles avec LFM2.5-2.6B ?
Le modèle fonctionne avec llama.cpp, MLX, vLLM, SGLang et ONNX, et s’intègre aux harnais d’agents OpenClaw, Hermes Agent et Pi.

