ZML LLMD est le nouveau serveur d’inférence gratuit publié en juillet 2026 par la start-up parisienne ZML, fondée par Steeve Morin, ancien vice-président ingénierie de Zenly, racheté par Snapchat pour neuf chiffres en 2017. L’outil permet de faire tourner de grands modèles de langage sur plusieurs architectures de puces à la fois, sans réécrire le code d’inférence pour chacune.

Faire tourner un même modèle sur Nvidia, AMD, TPU ou Apple Metal

ZML LLMD prend en charge les puces Nvidia, AMD, les TPU de Google, le Metal d’Apple et les puces Arc d’Intel. L’objectif affiché par l’équipe est de permettre aux entreprises de mélanger les fournisseurs de puces selon le coût ou la disponibilité, sans dépendre d’un seul écosystème matériel pour faire tourner leurs modèles à pleine vitesse, voire plus vite que sur certaines stacks propriétaires existantes.

Steeve Morin résume l’intention : « L’idée est de redonner aux gens le pouvoir de créer leur propre système et d’obtenir de vrais gains d’efficacité. » ZML LLMD est gratuit, mais n’est pas publié en open source.

Une équipe restreinte, des soutiens reconnus

ZML a levé 20 millions de dollars auprès d’investisseurs dont 20VC, commit, AALVC, Drysdale Ventures, Kima Ventures, Kindred Capital, LocalGlobe et Puzzle Ventures. La start-up compte une vingtaine de personnes basées à Paris. Parmi les noms présents au capital figurent Solomon Hykes, fondateur de Docker et Dagger, ainsi que Clément Delangue et Julien Chaumond, cofondateurs de Hugging Face, et le lauréat du prix Turing Yann LeCun.

Face aux plateformes d’inférence établies

ZML se positionne face à des plateformes d’inférence comme Baseten, Inferact ou RadixArk, tout en misant sur le soutien aux fabricants de puces IA européens émergents. Pour un secteur où la dépendance à Nvidia reste un point de friction régulièrement cité par les entreprises qui déploient des modèles à grande échelle, ce type d’outil d’abstraction matérielle répond à une demande concrète du marché.

Plus de détails sur TechCrunch.

Qu’est-ce que ZML LLMD ?

C’est un serveur d’inférence gratuit publié par la start-up française ZML, capable de faire tourner des modèles de langage sur plusieurs architectures de puces : Nvidia, AMD, TPU, Apple Metal et Intel Arc.

ZML LLMD est-il open source ?

Non, le logiciel est gratuit mais n’est pas publié en open source.

Qui a fondé ZML ?

ZML a été fondée par Steeve Morin, ancien vice-président ingénierie de Zenly, racheté par Snapchat en 2017.

Share.
Exit mobile version