Black Forest Labs a annoncé le 23 juillet 2026 Flux 3, son premier modèle multimodal capable de générer des images, des vidéos, de l’audio et des prédictions d’actions dans une seule architecture. Le modèle est disponible uniquement en accès anticipé, sans tarification publique communiquée.
Un modèle unique pour quatre modalités
Flux 3 joint l’apprentissage sur des images, des vidéos et de l’audio dans un réseau unique [[39]]. Contrairement aux modèles spécialisés actuels, il ne sépare plus les modalités : le même modèle peut produire une image, une vidéo de 20 secondes avec audio synchronisé [[40]], ou prédire des actions pour des robots [[41]]. Black Forest Labs parle de « modèle monde », une approche proche de celle explorée par DeepMind ou xAI ces derniers mois.
Accès anticipé, tarifs non publiés
Flux 3 est accessible sur demande uniquement [[35]]. Black Forest Labs n’a pas encore communiqué de tarification publique pour le modèle complet. La version vidéo commence toutefois à apparaître via certains revendeurs à 0,17 $ la seconde générée [[37]]. Une version open weights devrait suivre la phase d’accès anticipé, mais aucune date n’a été annoncée [[45]].
Ce que ça change
Flux 3 marque une rupture dans la stratégie de Black Forest Labs, connu jusqu’ici pour ses modèles image (Flux.1, Flux.2) publiés en open weights. Le passage au multimodal place le studio allemand en concurrence directe avec OpenAI, Google et xAI sur un terrain bien plus large que la seule génération d’images. Pour les utilisateurs français, l’accès reste pour l’instant conditionné à une demande d’early access auprès de l’éditeur.

