DeepSeek V4.1-Flash est disponible depuis le 10 septembre 2026 en téléchargement libre sur Hugging Face, sous licence MIT. Après une bêta interne testée en direct la veille, le modèle passe donc au statut de version stable, avec des scores qui dépassent de justesse ceux de Claude Opus 5 et de GPT-5.6 Sol sur le benchmark de code DeepSWE v1.1, et une empreinte mémoire nettement réduite par rapport à son prédécesseur V4-Flash, selon The Decoder.
Une architecture pensée pour économiser la mémoire
Le modèle compte 552 milliards de paramètres au total, mais n’en active que 8 milliards en lecture et 16 milliards en génération — une architecture à activation différenciée qui limite le calcul nécessaire à chaque étape. Sa fenêtre de contexte grimpe jusqu’à un million de tokens.
DeepSeek a surtout retravaillé la gestion du cache clé-valeur (KV cache), la mémoire tampon qui stocke le contexte d’une conversation pendant l’inférence. La portion stockée en mémoire GPU rapide ne représente plus qu’un quart de celle de V4-Flash, et la portion déportée sur un stockage plus lent tombe à un huitième. Le cache est désormais encodé en FP4 plutôt qu’en FP8, ce qui réduit quasiment de moitié son poids en mémoire. Au total, la taille du cache par token aurait chuté d’un facteur 437 par rapport à la toute première version de la famille V1. Le calcul nécessaire au traitement de l’entrée a lui aussi été quasiment divisé par deux grâce à une architecture encodeur-décodeur.
Des scores solides en code, plus mitigés ailleurs
Sur le benchmark de programmation DeepSWE v1.1, DeepSeek V4.1-Flash atteint 74,2 %, un score qui dépasse de peu Claude Opus 5 et GPT-5.6 Sol. L’écart se resserre nettement sur ProgramBench, où le modèle reste en retrait par rapport aux références du marché, ainsi que sur les tâches d’analyse d’image complexe ou à forte exigence scientifique. Le modèle a été entraîné à partir de zéro sur 45 000 milliards de tokens de texte et d’images ; selon The Decoder, l’essentiel du gain de performance viendrait moins de nouveaux algorithmes que d’un jeu de données plus vaste et mieux contrôlé, plutôt que d’une rupture technique dans l’entraînement lui-même.
Cette progression, même modeste face aux modèles fermés occidentaux, confirme la trajectoire de DeepSeek depuis le lancement de la série V4 en avril 2026 : viser la parité de performance sur les tâches les plus demandées par les développeurs — le code en tête — plutôt qu’une suprématie généralisée sur tous les types de tâches.
Disponibilité et tarifs
DeepSeek V4.1-Flash est accessible via l’API du laboratoire, au même tarif que V4-Flash, avec un prix qui peut descendre à 0,003 $ par million de tokens en entrée mis en cache lors des heures creuses, selon VentureBeat. Les poids du modèle sont aussi librement téléchargeables sur Hugging Face sous licence MIT, ce qui permet de l’héberger soi-même. V4-Pro, la version précédente la plus capable de la gamme, doit être retirée du service le 14 septembre, ce qui laisse aux utilisateurs actuels quelques jours pour migrer vers la nouvelle version avant la bascule définitive.
Quelle est la taille de DeepSeek V4.1-Flash ?
Le modèle compte 552 milliards de paramètres au total, mais n’en active que 8 milliards en lecture et 16 milliards en génération, ce qui limite le calcul nécessaire à chaque requête.
DeepSeek V4.1-Flash est-il gratuit ?
Le modèle est open source sous licence MIT et peut être téléchargé librement sur Hugging Face. Via l’API officielle de DeepSeek, il est facturé au même tarif que V4-Flash, avec un prix pouvant descendre à 0,003 dollar par million de tokens en entrée mise en cache aux heures creuses.
DeepSeek V4.1-Flash bat-il Claude Opus 5 et GPT-5.6 Sol ?
Sur le benchmark de code DeepSWE v1.1, DeepSeek V4.1-Flash obtient un score légèrement supérieur à Claude Opus 5 et GPT-5.6 Sol. Sur d’autres tests comme ProgramBench, il reste en revanche derrière ces modèles.

