GLM-5.3-Flash est le nouveau modèle de Z.ai (Zhipu AI), lancé le 26 août 2026. Première version nativement multimodale de la famille GLM-5, il combine raisonnement visuel et textuel, poids ouverts sous licence MIT, et un coût d’inférence réduit. Disponible dès maintenant pour les utilisateurs du GLM Coding Plan, avec trois fois le quota de GLM-5.3.

Le modèle, un mixture-of-experts de 320 milliards de paramètres au total et 18 milliards actifs, se positionne comme une option plus économique pour le coding, les tâches agentiques et le raisonnement visuel. Z.ai indique qu’il surpasse GLM-5.2 sur plusieurs benchmarks internes tout en approchant Claude Opus 4.8 sur son test de coding.

Architecture et performances

Entraîné sur un corpus multimodal de 30 000 milliards de tokens, GLM-5.3-Flash mêle attention linéaire pour les dépendances locales et attention sparse pour le contexte global. À des longueurs de contexte allant jusqu’à un million de tokens, le mécanisme IndexPool compresse les vecteurs de clés pour limiter la latence et la mémoire. Z.ai rapporte trois fois moins de calcul d’attention et une réduction par 4,4 de la taille du KV cache par rapport à GLM-5.3.

Sur Artificial Analysis Intelligence Index v4.1.1, le modèle obtient un score de 57 pour un coût de 0,045 $ par tâche. Il atteint 63,4 sur DeepSWE v1.1 (contre 46,2 pour GLM-5.2) et 48,8 sur AutomationBench (contre 26,2). Les comparaisons restent dépendantes des harnesses et des réglages utilisés.

Raisonnement multimodal et déploiement local

Le raisonnement visuel est au cœur de cette version. Le modèle a été entraîné à inspecter des interfaces rendues, des parties de jeux ou des sorties 3D, puis à évaluer et réviser son travail à partir du retour visuel. La même approche s’applique aux documents, tableurs, présentations, tableaux de bord et supports de réunion.

Avant l’annonce officielle, le modèle est apparu anonymement sous le nom ox-alpha sur OpenCode et OpenRouter, où il est devenu le plus populaire de la semaine. Le trafic était servi sur des puces IA chinoises. Z.ai a développé une stack basée sur SGLang qui sépare encodage, prefill et decoding, avec un gain de performance end-to-end multiplié par trois.

Les poids sont disponibles sur Hugging Face. Le déploiement local est supporté via SGLang, vLLM et TokenSpeed. Les capacités multimodales sont accessibles dans ZCode via Browser Use et Computer Use.

Disponibilité et positionnement

GLM-5.3-Flash est désormais accessible à tous les abonnés du GLM Coding Plan, avec un quota multiplié par trois par rapport à GLM-5.3. Il s’inscrit dans la stratégie de Z.ai de proposer des modèles ouverts performants à coût maîtrisé, capables de rivaliser avec des solutions propriétaires sur des tâches concrètes de coding et d’agent.

Source : blog officiel Z.ai et couverture TestingCatalog.

Share.
Exit mobile version