Nvidia a publié le 11 août 2026 Nemotron 3.5 Lightning, un nouveau modèle open-weight de sa famille Nemotron, conçu pour privilégier la vitesse d’inférence plutôt que le score brut d’intelligence. Le modèle, disponible sous licence permissive OpenMDW-1.1, cible les usages agentiques où la latence compte autant que la qualité des réponses.

Une architecture hybride taillée pour la vitesse

Nemotron 3.5 Lightning compte 31,6 milliards de paramètres au total, mais seuls 3,6 milliards sont activés à chaque étape d’inférence grâce à une architecture hybride Mamba-Transformer, héritée des précédentes générations Nemotron. Résultat : une vitesse d’inférence mesurée à 670 tokens par seconde, la plus élevée de son groupe de comparaison, pour une fenêtre de contexte pouvant atteindre 1 million de tokens (texte uniquement).

Des performances qui rattrapent les modèles plus gros

Sur l’indice Intelligence Index, Nemotron 3.5 Lightning obtient un score de 24, à égalité avec gpt-oss-120b d’OpenAI. Sur le benchmark agentique GDPval-AA v2, il atteint un Elo de 824, devançant à la fois gpt-oss-120b (800) et le plus gros Nemotron 3 Super (698) — une progression notable pour un modèle nettement plus léger. Sur Terminal-Bench v2.1, il obtient 24,3 %, proche des 26,2 % de gpt-oss-120b.

Nvidia indique que le modèle gagne neuf points sur les benchmarks d’intelligence par rapport à son prédécesseur Nemotron 3 Nano, tout en conservant un nombre de tokens générés par tâche similaire — un gain attribué à l’efficacité de l’architecture plutôt qu’à une simple augmentation de la taille.

Disponibilité immédiate

Les poids du modèle sont disponibles en formats BF16 et NVFP4 sur Hugging Face, et l’inférence serverless est déjà proposée par plusieurs fournisseurs, dont DeepInfra, Fireworks, FriendliAI et CoreWeave.

Une licence pensée pour l’adoption en entreprise

Le modèle est publié sous licence OpenMDW-1.1, une licence permissive qui autorise la modification et la redistribution, y compris à des fins commerciales. Ce choix s’inscrit dans la stratégie plus large de Nvidia, qui multiplie les publications open-weight depuis plusieurs mois pour ancrer ses puces comme la plateforme de référence pour faire tourner ces modèles, qu’ils soient signés Nvidia, Meta, Alibaba ou Z.ai.

Pourquoi ce choix de positionnement

En misant sur la vitesse plutôt que sur le score maximal, Nvidia répond à une demande concrète des équipes qui déploient des agents IA en production : un modèle plus rapide réduit le coût et la latence perçue sur des tâches répétitives ou des boucles d’outils, même s’il n’égale pas les meilleurs modèles fermés sur les benchmarks les plus exigeants. C’est une stratégie de niche assumée, complémentaire aux modèles Nemotron plus lourds déjà disponibles chez Nvidia.

Qu’est-ce que Nemotron 3.5 Lightning ?

C’est un modèle open-weight de Nvidia, doté de 31,6 milliards de paramètres au total dont 3,6 milliards actifs par inférence, optimisé pour la vitesse plutôt que pour le score maximal d’intelligence.

Où trouver les poids de Nemotron 3.5 Lightning ?

Les poids sont disponibles en formats BF16 et NVFP4 sur Hugging Face, avec une inférence serverless proposée par DeepInfra, Fireworks, FriendliAI et CoreWeave.

Sous quelle licence Nemotron 3.5 Lightning est-il publié ?

Le modèle est publié sous licence OpenMDW-1.1, une licence permissive autorisant la modification et la redistribution commerciale.

Share.
Exit mobile version