Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»News»Kimi et GLM : Cloudflare optimise leur inférence à grande échelle
Baies de serveurs dans un centre de données, illustrant l'infrastructure d'inférence IA
News

Kimi et GLM : Cloudflare optimise leur inférence à grande échelle

3 Mins Readaoût 3, 2026
Share
Twitter Email Copy Link

Kimi et GLM, deux familles de modèles ouverts très suivies par la communauté technique, tournent en production chez Cloudflare grâce à trois optimisations détaillées dans un billet technique publié le 3 août 2026. Résultat : un contexte multiplié par deux pour Kimi K2.6 et un débit en hausse de 55 % pour GLM.

Trois optimisations concrètes

L’équipe d’inférence de Cloudflare, qui s’appuie sur le framework open source SGLang, a détaillé trois changements techniques appliqués à ses déploiements de Kimi (Moonshot AI) et GLM (Z.ai) sur des GPU H200 et Blackwell :

  • Quantification du cache KV : passage de 16 bits (BF16) à 8 bits (FP8) pour stocker davantage de contexte dans la même mémoire GPU.
  • Compression des poids de GLM : réduction de FP8 à INT4, ce qui libère de la bande passante mémoire au moment de l’inférence.
  • Vérification d’intégrité du cache : un mécanisme de contrôle contre les erreurs d’accès mémoire, pour un coût inférieur à 1 % sur le débit et la latence.

Des chiffres qui parlent

Selon Cloudflare, la quantification du cache KV fait passer la fenêtre de contexte exploitable de Kimi K2.6 de 686 000 à 1,37 million de tokens. Sur GLM, le passage à INT4 se traduit par un gain de débit de 55 % lorsqu’une seule requête est traitée à la fois, avec des scores quasi identiques sur les benchmarks GSM8K, ARC et MMLU par rapport à la version FP8.

Pourquoi ça compte pour les modèles ouverts chinois

Kimi et GLM font partie des modèles ouverts chinois les plus utilisés par les développeurs, aux côtés de Qwen et DeepSeek. Le travail publié par Cloudflare montre qu’un fournisseur cloud occidental prend ces modèles suffisamment au sérieux pour investir dans leur optimisation dédiée, plutôt que de se limiter aux modèles propriétaires américains. Pour les équipes qui font tourner ces modèles en local ou via une API, ces gains de mémoire et de débit se traduisent directement par une facture d’inférence réduite ou par la possibilité de traiter des documents plus longs sans découpage.

Le détail technique complet, avec les courbes de benchmark, est disponible sur le blog de Cloudflare.

Qu’est-ce que la quantification du cache KV ?

C’est une technique qui réduit la précision numérique (de 16 à 8 bits) des données mémorisées par le modèle pendant la génération de texte, ce qui libère de la mémoire GPU et permet de traiter un contexte plus long.

Kimi et GLM sont-ils des modèles ouverts ?

Oui, Kimi est développé par Moonshot AI et GLM par Z.ai (ex-Zhipu AI), deux laboratoires chinois qui publient les poids de leurs modèles, contrairement à des modèles fermés comme GPT ou Claude.

Ces optimisations changent-elles le comportement du modèle ?

Non : Cloudflare précise que les scores sur les benchmarks GSM8K, ARC et MMLU restent quasi identiques après compression, l’objectif étant de gagner en vitesse et en capacité mémoire sans perte de qualité mesurable.

Cloudflare GLM 5.2 Kimi K2.6 Modèles ouverts
Share. Twitter Email Copy Link
Previous ArticleIA cybercriminalité Afrique : Interpol alerte sur 484 M$ de pertes
Next Article ChatGPT au Congrès : l’IA préférée des élus américains

Related Posts

News

Suno watermark : la plateforme muscle sa lutte anti-spam

News ByteDance

SeedRealtime : ByteDance lance son IA audio-visuelle en temps réel

News Google

Prévision des cyclones : Google DeepMind franchit un cap avec WeatherNext

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}