DeepSeek Vision Exp entre dans la course à l’IA multimodale. Le laboratoire chinois a dévoilé le 21 août 2026 DeepSeek-V4-Flash-Vision-Exp, une version expérimentale capable de comprendre des images, et affirme réduire nettement l’écart avec Claude Opus 4.8 d’Anthropic sur plusieurs benchmarks.
Un modèle texte qui apprend à voir
DeepSeek Vision Exp reprend l’architecture du modèle texte V4-Flash déjà existant chez DeepSeek et lui ajoute la compréhension d’images. Le modèle conserve les capacités de raisonnement et de connaissances générales de la version texte, tout en intégrant la lecture d’images : description de photos, extraction de texte depuis des captures d’écran, ou encore analyse de graphiques.
Techniquement, le modèle accepte les formats JPEG, PNG, GIF et WebP, avec une détection basée sur le contenu réel du fichier plutôt que sur son extension. Trois méthodes d’envoi sont proposées : image encodée en base64, URL publique (jusqu’à 32 Mio, 60 secondes de délai de téléchargement) ou passage par une API de fichiers permettant de réutiliser une image déjà envoyée via un identifiant. Chaque requête peut contenir jusqu’à 600 images, avec une limite de 8 192 pixels par côté.
Les chiffres du benchmark ApexBench
Selon les propres mesures de DeepSeek, l’écart de performance avec la concurrence se resserre. Sur ApexBench, DeepSeek Vision Exp obtient un score de 36,5 en Pass@1, contre 39,4 pour Claude Opus 4.8 — un écart de moins de trois points sur ce test de raisonnement multimodal et agentique. Le laboratoire présente ce résultat comme la preuve que sa stratégie, consistant à faire évoluer un modèle texte existant plutôt qu’à repartir de zéro, permet de rattraper les ténors du secteur à moindre coût.
Cette sortie s’inscrit dans un contexte plus large : DeepSeek prépare une introduction en bourse très attendue, et chaque publication de modèle sert aussi de démonstration de force face aux investisseurs comme face aux laboratoires américains.
Un accès ouvert dès maintenant
Le modèle est disponible dès aujourd’hui via des points d’accès compatibles avec les API OpenAI et Anthropic, ainsi que via la Responses API. La documentation technique complète, avec les limites de tokens par image (384 tokens maximum après redimensionnement automatique à environ 800×800 pixels), est publiée sur le site officiel de DeepSeek.
Pour les développeurs qui suivent de près l’écart de performance entre modèles ouverts chinois et modèles propriétaires américains, DeepSeek Vision Exp constitue un nouveau point de repère à surveiller dans les prochaines semaines, notamment si des benchmarks indépendants viennent confirmer ou nuancer les chiffres communiqués par le laboratoire.
Qu’est-ce que DeepSeek Vision Exp ?
DeepSeek Vision Exp (DeepSeek-V4-Flash-Vision-Exp) est une version expérimentale multimodale du modèle texte V4-Flash de DeepSeek, capable de comprendre des images en plus du texte.
DeepSeek Vision Exp est-il aussi performant que Claude Opus 4.8 ?
Sur le benchmark ApexBench, DeepSeek Vision Exp obtient 36,5 en Pass@1 contre 39,4 pour Claude Opus 4.8 d’Anthropic, un écart resserré mais toujours en faveur du modèle d’Anthropic selon les chiffres communiqués par DeepSeek.
Comment accéder à DeepSeek Vision Exp ?
Le modèle est accessible via des points d’accès API compatibles OpenAI et Anthropic, ainsi que via la Responses API, avec une documentation complète publiée sur le site officiel de DeepSeek.

