NVIDIA a mis en ligne le 8 juillet 2026, via Hugging Face, une série de jeux de données pour les agents IA d’entreprise. L’objectif affiché : donner aux développeurs de quoi entraîner des agents capables de gérer la complexité du monde réel, au-delà des benchmarks académiques classiques.

Cinq jeux de données Nemotron en accès libre

La publication regroupe plusieurs ressources sous la marque Nemotron :

  • Nemotron-CC-v2 : une version enrichie de Common Crawl comptant 8,79 milliards d’entrées, destinée au pré-entraînement de modèles.
  • Nemotron-CC-Math-v1 : 190 millions de questions mathématiques synthétiques, pensées pour améliorer les capacités de raisonnement.
  • Nemotron Pre-Training Collection : plus de 10 000 milliards de tokens de pré-entraînement répartis en 15 ensembles couvrant le langage général, le code, les mathématiques et des données synthétiques.
  • Nemotron Post-Training v3 : plusieurs millions d’exemples de post-entraînement, accompagnés d’un outil de visualisation interactif baptisé Prompt Atlas.
  • Nemotron-Personas : des personas synthétiques multilingues et régionalisés, couvrant dix pays et représentant plus de 2,4 milliards de personnes.

Pourquoi des données spécifiques pour les agents

L’argument mis en avant par NVIDIA est que l’ouverture des poids d’un modèle ne suffit pas à construire de bons agents. Selon le billet publié sur Hugging Face : « Open weights matter. But for agents, weights are only part of the story » (les poids ouverts comptent, mais pour les agents, ce n’est qu’une partie de l’histoire). Bryan Catanzaro, vice-président de la recherche en deep learning appliqué chez NVIDIA, insiste sur le fait que ce sont les données propres à chaque usage qui rendent un système d’IA réellement utile en entreprise.

Un outil pour visualiser les données de post-entraînement

Le Prompt Atlas associé à Nemotron Post-Training v3 permet d’explorer visuellement la composition des exemples utilisés pour affiner un modèle après son pré-entraînement — une manière de rendre plus transparent un processus souvent opaque pour les équipes qui réutilisent ces données.

Licence ouverte et disponibilité immédiate

L’ensemble des jeux de données et outils est disponible publiquement sur Hugging Face sous licence ouverte, ce qui permet à n’importe quelle équipe de recherche ou entreprise de les télécharger et de les intégrer directement dans ses propres pipelines d’entraînement.

Retrouvez le détail de la publication sur le blog Hugging Face de NVIDIA.

Quels jeux de données NVIDIA a-t-il publiés sur Hugging Face ?

NVIDIA a publié cinq ressources sous la marque Nemotron : Nemotron-CC-v2 (8,79 milliards d’entrées), Nemotron-CC-Math-v1 (190 millions de questions), la Nemotron Pre-Training Collection (plus de 10 000 milliards de tokens), Nemotron Post-Training v3 et Nemotron-Personas.

Ces données sont-elles gratuites et ouvertes ?

Oui, l’ensemble des jeux de données et outils associés est disponible publiquement sur Hugging Face sous licence ouverte.

À quoi servent ces données pour les agents IA ?

Elles visent à entraîner des agents capables de gérer la complexité du monde réel en entreprise, au-delà des benchmarks académiques classiques, en couvrant le pré-entraînement, le post-entraînement et des personas synthétiques régionalisées.

Share.
Exit mobile version