Qwen-Image-2.1 est le nouveau modèle de génération et d’édition d’images d’Alibaba, publié en poids ouverts le 20 septembre 2026. Avec 7 milliards de paramètres pour sa partie visuelle, il gère la transparence nativement, accepte jusqu’à dix images de référence et occupe aujourd’hui la première place des modèles non propriétaires sur LMArena. Mais son score indépendant ne confirme pas entièrement les promesses d’Alibaba, et sa licence interdit tout usage commercial sans accord séparé.
Ce que fait Qwen-Image-2.1
Selon la fiche officielle sur Hugging Face, un seul modèle couvre la génération d’images à partir de texte et l’édition. Sa partie visuelle compte 7 milliards de paramètres, répartis sur 32 couches DiT à flux unique. D’après MarkTechPost, il s’appuie sur un autoencodeur RGBA à 64 canaux avec une compression spatiale de 16x.
- Transparence native : le modèle produit des images RGBA (PNG à fond transparent), édite des calques transparents et détoure un sujet sur une photo. Qwen recommande un modèle de prompt fixe pour ce mode.
- Édition multi-références : jusqu’à 10 images de référence, par exemple pour une photo de groupe, un essayage virtuel ou un aménagement de pièce, en conservant l’identité des personnes et des produits.
- Retouches locales : on indique la zone à modifier par un cercle, une annotation peinte ou un masque séparé.
- Haute définition : jusqu’à 2048 x 2048 pixels en carré et 2752 x 1536 en 16:9, d’après les exemples de code officiels.
Alibaba a aussi publié deux modèles d’aide, Qwen-Image-2.1-PE-T2I et PE-I2I. Le premier est une version affinée de Qwen3.5-VL 9B qui convertit une demande courte, dans n’importe quelle langue, en prompt anglais détaillé avec un format d’image recommandé.
Conçu pour tourner en local
Le format compact est l’argument principal. Selon The Decoder, le modèle fonctionne sur une carte graphique grand public performante de type RTX 3090. Le dépôt GitHub annonce une prise en charge dès le premier jour par Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V, ainsi que des images prêtes à l’emploi pour huit plateformes de puces via la pile FlagOS. Pour les machines limitées, Diffusers propose un déchargement vers le processeur.
Scores et réputation : ce que disent les classements indépendants
Le benchmark maison d’Alibaba donne à Qwen-Image-2.1 un score global de 60,28 sur Qwen-Image-Bench. Il passe ainsi devant Nano Banana 2.0 de Google (59,82) et FLUX 2 Max (55,33), selon MarkTechPost. Six modèles fermés restent devant, emmenés par GPT Image 2.5 Sunburst d’OpenAI (67,01). C’est sur cette base que plusieurs médias ont titré sur un « Nano Banana 2 à domicile ».
Les votes à l’aveugle de LMArena, relevés le 24 septembre, nuancent ce résultat :
- Édition d’image : 16e place avec 1 367 points (4 841 votes). C’est le meilleur modèle non propriétaire du classement, loin devant Qwen-Image-Edit-2511 (1 235) et FLUX.2 dev (1 226). Il reste derrière Nano Banana 2 (1 388) et Nano Banana Pro (1 390).
- Génération à partir de texte : 17e place avec 1 228 points (2 843 votes, score encore marqué « préliminaire »). Là aussi, il devance tous les modèles ouverts, dont Ideogram 4.0 (1 204) et Qwen-Image-2512 (1 125), mais reste sous Nano Banana 2 (1 260).
En clair, le vote public ne confirme pas pour l’instant la victoire sur Nano Banana 2 affichée par Alibaba. En revanche, il confirme un saut important pour l’open source : environ 130 points de plus que la génération précédente de Qwen en édition. Le modèle n’apparaissait pas encore dans le classement d’Artificial Analysis lors de notre relevé. Côté communauté, la fiche Hugging Face comptait plus de 2 100 « likes » et environ 37 600 téléchargements au 24 septembre.
La limite : une licence de recherche
Qwen-Image-2.1 n’est pas sous Apache 2.0 comme plusieurs anciens modèles Qwen. Il est publié sous la Qwen Research License, qui autorise l’usage, la modification et la redistribution à des fins non commerciales uniquement, c’est-à-dire la recherche ou l’évaluation. Toute exploitation commerciale nécessite une licence distincte à demander à Alibaba. Pour une agence, un e-commerçant ou un créateur qui vend ses visuels, le modèle n’est donc pas utilisable tel quel.
Ce choix s’inscrit dans une stratégie à deux niveaux : Alibaba garde fermé son haut de gamme, Qwen-Image-3.0, lancé sans poids ouverts et classé 11e sur LMArena en génération, et ouvre un modèle plus léger sous conditions. Pour comparer avec les autres outils du marché, voir notre comparatif des générateurs d’images IA.
Qwen-Image-2.1 est-il gratuit et utilisable commercialement ?
Les poids sont téléchargeables gratuitement sur Hugging Face, GitHub et ModelScope, mais la Qwen Research License limite l’usage à la recherche et à l’évaluation. Un usage commercial exige une licence séparée d’Alibaba (sources : fiche Hugging Face, The Decoder).
Qwen-Image-2.1 bat-il Nano Banana 2 ?
Sur le benchmark interne d’Alibaba, oui : 60,28 contre 59,82 (source : MarkTechPost). Sur LMArena, au 24 septembre 2026, non : 1 367 contre 1 388 en édition et 1 228 contre 1 260 en génération. Il est en revanche le mieux classé des modèles non propriétaires sur les deux classements.
Quel matériel faut-il pour faire tourner Qwen-Image-2.1 ?
Selon The Decoder, une carte graphique grand public performante comme une RTX 3090 suffit. Le modèle est pris en charge par Diffusers et ComfyUI dès sa sortie, avec une option de déchargement vers le processeur pour réduire la mémoire vidéo nécessaire (source : dépôt GitHub officiel).

