Qwen Image 3.0 est le nouveau modèle de génération d’images dévoilé par Alibaba, repéré le 21 juillet 2026 par The Decoder. Sa particularité : il rend du texte lisible jusqu’à dix pixels et compose des grilles d’infographies complètes en une seule passe, sans avoir besoin d’assembler plusieurs images générées séparément.
Du texte minuscule et des formules mathématiques
Qwen Image 3.0 accepte des prompts allant jusqu’à 4 500 tokens et prend en charge nativement douze langues. Le modèle sait générer des formules mathématiques complexes, avec indices, exposants et symboles spécialisés correctement positionnés, ainsi que des mises en page denses comme des unes de journaux, des documents académiques simulés ou des interfaces d’applications. Cette capacité à produire du texte net à très petite échelle, dans un contexte visuel cohérent, reste un point faible classique des modèles de génération d’images — c’est précisément ce qu’Alibaba cherche à corriger avec cette version.
Son prédécesseur, Qwen-Image-2.0, sorti en mai 2026, se classait déjà juste derrière les modèles d’OpenAI et de Google dans les arènes de test internes d’Alibaba. Avec la version 3.0, l’entreprise dit privilégier le réalisme et les usages pratiques — mise en page, infographie, documentation — plutôt que la seule qualité esthétique des images produites.
Un accès restreint, contrairement à la version précédente
Contrairement à Qwen-Image original, qui avait été diffusé en open source, Qwen Image 3.0 n’est pour l’instant accessible que via une API sur invitation, selon The Decoder. Alibaba prévoit une intégration progressive dans Qwen Chat et ses autres applications propriétaires, mais il est peu probable que les poids du modèle soient un jour publiés sous licence ouverte — un choix qui tranche avec la stratégie habituelle d’Alibaba sur ses modèles de langage Qwen, largement diffusés en open source.
Cette restriction d’accès illustre une tendance plus large chez les laboratoires chinois : garder les modèles de génération d’image et de vidéo les plus avancés sous contrôle plus étroit, même quand les modèles de langage équivalents restent ouverts, probablement pour limiter les usages détournés (deepfakes, contrefaçon de documents) que ces capacités de rendu de texte ultra-précis pourraient faciliter.
Qwen Image 3.0 est-il disponible en open source ?
Non. Contrairement à la première version Qwen-Image, Alibaba ne prévoit pas de diffuser les poids du modèle sous licence ouverte ; l’accès se fait pour l’instant via une API sur invitation.
Quelles langues Qwen Image 3.0 prend-il en charge ?
Le modèle gère nativement douze langues et accepte des prompts allant jusqu’à 4 500 tokens.
En quoi Qwen Image 3.0 diffère-t-il de la version précédente ?
Qwen-Image-2.0, sorti en mai 2026, se classait déjà juste derrière les modèles d’OpenAI et Google ; la version 3.0 privilégie le réalisme et les usages pratiques, comme les infographies et la mise en page, plutôt que l’esthétique pure.

