FLUX 3 Image est officiel. Black Forest Labs lance un nouveau modèle de génération d’images qui promet de « contrôler chaque pixel » : placement des éléments par boîtes englobantes, retouches successives sans modifier le reste de l’image, sortie jusqu’en 4K et jusqu’à 10 références pour composer une scène. Une version à poids ouverts est annoncée « dans les prochaines semaines ».
Les points clés à retenir
- Mise en page par boîtes englobantes : tu dessines l’emplacement de chaque élément et tu décris ce qu’il contient.
- Retouches multi-tours : Black Forest Labs promet des modifications précises « sans changer aucun autre pixel ».
- Jusqu’en 4K pour préserver les détails, et jusqu’à 10 références pour composer une image.
- Poids commerciaux disponibles pour les entreprises qui génèrent des images à grande échelle.
- Poids ouverts annoncés pour « les prochaines semaines », sans date précise à ce stade.
FLUX 3 Image : ce que propose le nouveau modèle
Selon la page officielle de Black Forest Labs et son annonce sur X, FLUX 3 Image mise sur une idée simple : arrêter de tirer à pile ou face avec un prompt et laisser l’utilisateur décider de la composition. Le laboratoire allemand, déjà derrière le modèle multimodal FLUX 3, l’a présenté début octobre 2026.
| Fonction | Ce qu’annonce Black Forest Labs |
|---|---|
| Mise en page | Placement exact des éléments grâce à des boîtes englobantes |
| Retouche | Modifications multi-tours précises, sans toucher aux autres pixels |
| Résolution | Génération jusqu’en 4K |
| Références | Jusqu’à 10 images pour composer une scène |
| Cohérence | Plusieurs retouches ciblées en une fois, en restant cohérent d’une édition à l’autre |
| Licence | Poids commerciaux pour les entreprises ; poids ouverts « dans les prochaines semaines » |
Les boîtes englobantes, la vraie nouveauté
C’est l’argument central. Au lieu de décrire une scène en espérant que le modèle place chaque objet au bon endroit, tu traces un rectangle pour chaque élément important et tu décris son contenu. Puis une phrase unique relie l’ensemble. D’après AlphaSignal, côté développeurs, chaque canevas est converti en une grille normalisée de 0 à 1 000, indépendante du format de l’image, et chaque élément reçoit un identifiant, une description et des coordonnées au format [y_min, x_min, y_max, x_max].
La même logique s’applique à la retouche : on modifie l’image finie boîte par boîte, sans relancer toute la génération. Pour les maquettes publicitaires, les visuels de produits ou les mises en page éditoriales, c’est la fonction qui manquait aux générateurs d’images.
4K et 10 références : jusqu’où ça va ?
Toujours selon AlphaSignal, la sortie maximale atteint environ 16,8 mégapixels, soit des dimensions autour de 5 456 × 3 072 pixels, avec un rendu au format demandé pour ne pas adoucir les petits textes et les textures fines. Côté références, jusqu’à dix images peuvent guider la composition.
Le modèle est déjà intégré dans ComfyUI sous forme de nœud partenaire. D’après la documentation de ComfyUI, il propose 16 formats d’image et cinq paliers de résolution, de 0,75K à 4K, avec trois modes : texte vers image, retouche avec références et retouche par boîtes englobantes.
| Résolution | Coût par image (crédits ComfyUI) |
|---|---|
| 0,75K | 12,37 |
| 1K | 14,48 |
| 1,5K | 21,12 |
| 2K | 30,17 |
| 4K | 183,15 |
Le constat saute aux yeux : passer de 2K à 4K multiplie le coût par six environ. La 4K est là, mais elle se paie.
Poids commerciaux maintenant, poids ouverts bientôt
Black Forest Labs applique une stratégie à deux vitesses. Les poids commerciaux sont disponibles dès maintenant pour les entreprises qui font tourner la génération d’images à grande échelle. Une version à poids ouverts arrivera « dans les prochaines semaines », sans précision sur la licence ni sur la taille du modèle. Le laboratoire a pris cette habitude : FLUX 3 Action, son modèle de robotique, a été publié en poids téléchargeables sur Hugging Face fin septembre. À suivre donc, en particulier pour les conditions d’usage commercial, qui font souvent la différence entre « ouvert » et « libre ».
Un lancement dans un marché très occupé
FLUX 3 Image arrive face à des concurrents bien installés. Muse Image de Meta s’est hissé au deuxième rang de l’Arena, Qwen-Image-2.1 domine les modèles ouverts, et notre comparatif des meilleurs générateurs d’images 2026 montre un marché où la qualité brute se vaut de plus en plus. Black Forest Labs choisit donc un autre terrain : non plus l’image la plus belle, mais l’image la plus pilotable. Reste à vérifier, en conditions réelles et sur des benchmarks indépendants, si la promesse « sans changer un seul pixel » tient dans la durée. Aucun résultat chiffré n’a été publié à ce stade dans les sources consultées.
FAQ
Qu’est-ce que FLUX 3 Image ?
C’est le nouveau modèle de génération et de retouche d’images de Black Forest Labs. Il permet de placer les éléments par boîtes englobantes, d’enchaîner des retouches précises, de générer jusqu’en 4K et d’utiliser jusqu’à 10 références.
FLUX 3 Image est-il open source ?
Pas encore. Les poids commerciaux sont disponibles pour les entreprises, et une version à poids ouverts est annoncée « dans les prochaines semaines », sans date ni licence précisées.
À quoi servent les boîtes englobantes ?
Elles permettent de définir précisément où se trouve chaque élément de l’image et de décrire son contenu, puis de retoucher l’image boîte par boîte sans tout régénérer.
Où utiliser FLUX 3 Image ?
Le modèle est accessible via Black Forest Labs et déjà intégré à ComfyUI sous forme de nœud partenaire, avec cinq résolutions de 0,75K à 4K.
Sources
- Black Forest Labs — FLUX 3 Image : maximum control over every pixel
- Black Forest Labs sur X — Introducing FLUX 3 Image
- AlphaSignal — Black Forest Labs’ FLUX 3 Image lets developers place objects with exact coordinates
- ComfyUI — documentation du nœud partenaire FLUX 3 Image
À lire aussi : FLUX 3 Video en disponibilité générale, notre comparatif des modèles d’intelligence artificielle et le meilleur générateur d’images IA en 2026.
