Kimi et GLM, deux familles de modèles ouverts très suivies par la communauté technique, tournent en production chez Cloudflare grâce à trois optimisations détaillées dans un billet technique publié le 3 août 2026. Résultat : un contexte multiplié par deux pour Kimi K2.6 et un débit en hausse de 55 % pour GLM.
Trois optimisations concrètes
L’équipe d’inférence de Cloudflare, qui s’appuie sur le framework open source SGLang, a détaillé trois changements techniques appliqués à ses déploiements de Kimi (Moonshot AI) et GLM (Z.ai) sur des GPU H200 et Blackwell :
- Quantification du cache KV : passage de 16 bits (BF16) à 8 bits (FP8) pour stocker davantage de contexte dans la même mémoire GPU.
- Compression des poids de GLM : réduction de FP8 à INT4, ce qui libère de la bande passante mémoire au moment de l’inférence.
- Vérification d’intégrité du cache : un mécanisme de contrôle contre les erreurs d’accès mémoire, pour un coût inférieur à 1 % sur le débit et la latence.
Des chiffres qui parlent
Selon Cloudflare, la quantification du cache KV fait passer la fenêtre de contexte exploitable de Kimi K2.6 de 686 000 à 1,37 million de tokens. Sur GLM, le passage à INT4 se traduit par un gain de débit de 55 % lorsqu’une seule requête est traitée à la fois, avec des scores quasi identiques sur les benchmarks GSM8K, ARC et MMLU par rapport à la version FP8.
Pourquoi ça compte pour les modèles ouverts chinois
Kimi et GLM font partie des modèles ouverts chinois les plus utilisés par les développeurs, aux côtés de Qwen et DeepSeek. Le travail publié par Cloudflare montre qu’un fournisseur cloud occidental prend ces modèles suffisamment au sérieux pour investir dans leur optimisation dédiée, plutôt que de se limiter aux modèles propriétaires américains. Pour les équipes qui font tourner ces modèles en local ou via une API, ces gains de mémoire et de débit se traduisent directement par une facture d’inférence réduite ou par la possibilité de traiter des documents plus longs sans découpage.
Le détail technique complet, avec les courbes de benchmark, est disponible sur le blog de Cloudflare.
Qu’est-ce que la quantification du cache KV ?
C’est une technique qui réduit la précision numérique (de 16 à 8 bits) des données mémorisées par le modèle pendant la génération de texte, ce qui libère de la mémoire GPU et permet de traiter un contexte plus long.
Kimi et GLM sont-ils des modèles ouverts ?
Oui, Kimi est développé par Moonshot AI et GLM par Z.ai (ex-Zhipu AI), deux laboratoires chinois qui publient les poids de leurs modèles, contrairement à des modèles fermés comme GPT ou Claude.
Ces optimisations changent-elles le comportement du modèle ?
Non : Cloudflare précise que les scores sur les benchmarks GSM8K, ARC et MMLU restent quasi identiques après compression, l’objectif étant de gagner en vitesse et en capacité mémoire sans perte de qualité mesurable.
