Nemotron 3 Embed, la nouvelle famille de modèles d’embedding de Nvidia, se classe numéro un toutes catégories sur le benchmark RTEB (Retrieval Text Embedding Benchmark), selon l’annonce publiée le 16 juillet 2026 sur le blog de Hugging Face.

Trois modèles, poids ouverts et recettes d’entraînement publiées

La collection comprend trois versions : Nemotron-3-Embed-8B-BF16, Nemotron-3-Embed-1B-BF16 et une variante compressée Nemotron-3-Embed-1B-NVFP4. Nvidia publie non seulement les poids, mais aussi les jeux de données et les recettes d’entraînement utilisées, une démarche d’ouverture assez rare pour ce type de modèle destiné aux systèmes de recherche et de récupération d’information, notamment le RAG et la recherche agentique.

Sur le benchmark RTEB, le modèle 8B atteint un score de 78,5 %, contre 72,4 % pour la version 1B. Sur MMTEB Retrieval, les scores s’établissent respectivement à 75,5 % et 71,0 %. Le modèle 1B réduirait par ailleurs son taux d’erreur de 27 % par rapport à son prédécesseur. La variante compressée NVFP4 conserverait plus de 99 % de la précision de récupération de la version BF16, tout en offrant un débit jusqu’à deux fois supérieur.

Un usage pensé pour la récupération agentique

Nvidia met en avant un cas d’usage précis : le fine-tuning sur sa propre documentation technique (NV Docs), qui fait passer le score NDCG@10 de 56,7 % à 63,3 %, soit un gain de 11,6 points. Ce type d’amélioration cible directement les architectures RAG et les agents qui doivent retrouver l’information pertinente dans de grandes bases documentaires avant de générer une réponse.

Les modèles sont d’ores et déjà disponibles sur Hugging Face et via le microservice NVIDIA NIM, avec un support annoncé chez plusieurs fournisseurs d’inférence : Baseten, Bitdeer AI, DeepInfra, Friendli AI et OpenRouter, ainsi qu’une compatibilité native avec vLLM. Plusieurs entreprises citées, dont Automation Anywhere, IBM, Palantir, ServiceNow, Zoom et You.com, évalueraient déjà le modèle pour leurs propres cas d’usage.

Pourquoi ça compte

  • Les modèles d’embedding sont la brique invisible qui alimente la recherche sémantique et les agents RAG
  • La publication complète des poids, données et recettes facilite la reproductibilité et l’adoption par la communauté open source
  • Un score RTEB en tête de classement renforce la position de Nvidia sur ce segment discret mais stratégique

Qu’est-ce qu’un modèle d’embedding comme Nemotron 3 Embed ?

Il s’agit d’un modèle qui convertit du texte en représentations numériques permettant de mesurer la similarité entre documents, une brique essentielle pour la recherche sémantique et les systèmes RAG utilisés par les agents IA.

Où peut-on récupérer Nemotron 3 Embed ?

Les trois modèles sont disponibles en téléchargement libre sur Hugging Face, ainsi que via le microservice NVIDIA NIM et plusieurs fournisseurs d’inférence comme OpenRouter ou DeepInfra.

Qu’est-ce que le benchmark RTEB ?

RTEB (Retrieval Text Embedding Benchmark) est un test de référence qui évalue la capacité des modèles d’embedding à retrouver les documents pertinents pour une requête donnée.

Share.
Exit mobile version