IBM publie Granite 4.2, une famille de modèles de langage open source conçus pour le raisonnement et les agents d’entreprise. Disponibles en 3B, 8B et 30B paramètres, ces modèles intègrent une chaîne de pensée native et sortent sous licence Apache 2.0.
Les points clés à retenir
- Trois tailles : granite-4.2-3b, 8b et 30b, architectures dense decoder-only.
- Raisonnement natif : chaîne de pensée avant la réponse finale, avec modes thinking, non-thinking et low-effort.
- Contexte : 128K tokens sur toute la famille, extension 512K sur le 30B.
- Licence Apache 2.0 : usage commercial autorisé, signatures cryptographiques IBM.
- Agents : tool calling guidé par le raisonnement ; RL agentique sur les 8B et 30B.
Ce que change Granite 4.2
Annoncés le 25 août 2026 par IBM Research, les modèles Granite 4.2 ajoutent un raisonnement intégré à la lignée Granite. Le modèle planifie, compare des options et vérifie une étape avant d’agir, plutôt que de répondre en un seul jet.
Le mode thinking est activé par défaut. Le mode non-thinking répond directement. Le mode low-effort limite le budget de réflexion sur les questions simples, pour réduire la latence. Selon IBM, le 3B vise l’edge, le 8B les usages entreprise courants, et le 30B les tâches de raisonnement et de code plus lourdes.
Benchmarks et entraînement
Les chiffres publiés par IBM (pass@1) incluent notamment :
- SWE-Bench Verified : 47,67 (8B) et 57,00 (30B).
- AIME25 : 78,33 (3B), 86,67 (8B), 89,17 (30B).
- GPQA : 54,80 / 64,14 / 66,41.
- MMLU-Pro (5-shot) : 67,84 / 74,04 / 77,60.
- BFCL v4 : 52,41 / 50,29 / 61,39.
Le blog technique Hugging Face d’IBM décrit un pré-entraînement d’environ 15 000 milliards de tokens, un fine-tuning supervisé sur des traces de raisonnement et d’agents, puis un pipeline de reinforcement learning. Les 8B et 30B passent par un bloc RL agentique dans des environnements sandboxés. IBM mentionne aussi un milliard de tokens de code synthétique via CodeAlchemy, plus une étape de mid-training.
Usage entreprise et disponibilité
IBM cible des workflows multi-étapes : outils, terminal, ingénierie logicielle, recherche. La licence Apache 2.0 permet de télécharger, fine-tuner et mettre en production sans restriction propriétaire. Les poids sont sur Hugging Face (organisation ibm-granite), avec des variantes quantifiées. IBM liste aussi Ollama, watsonx.ai, vLLM et LM Studio.
Dans la même séquence, IBM présente Granite Speech 5.0 Turbo CTC, des modèles parole plus petits (environ 470 millions de paramètres) orientés transcription haute cadence. Ils complètent Granite 4.2 sans le remplacer.
Sources
- IBM Research — Granite 4.2 brings native reasoning to enterprise agents
- Documentation officielle Granite 4.2
- Hugging Face — How Granite 4.2 LLMs are built
- Page produit IBM Granite (benchmarks)
FAQ
Granite 4.2 est-il open source ?
Oui. Les poids sont publiés sous licence Apache 2.0, ce qui autorise l’usage commercial, la modification et le redéploiement.
Quelles tailles sont disponibles ?
Trois : 3B (compact), 8B (usage général) et 30B (tâches plus complexes), avec des variantes quantifiées annoncées par taille.
Peut-on désactiver le raisonnement ?
Oui. IBM documente enable_thinking (true par défaut) et un mode low_effort. L’intégration dépend du runtime (vLLM, Ollama, API compatible OpenAI).
Où télécharger Granite 4.2 ?
Sur Hugging Face, organisation ibm-granite. IBM liste également Ollama, watsonx.ai et plusieurs runtimes communautaires.
