Inkling Small est le second modèle open-weights de Thinking Machines Lab : un MoE de 276 milliards de paramètres au total, dont 12 milliards actifs, présenté comme comparable à Inkling pour environ un quart de la taille. Les poids complets sont publiés, avec fine-tuning sur Tinker et essai multimodal sur Tinker Playground.

Annoncé le 30 juillet 2026 sur le site de Thinking Machines Lab, Inkling Small s’adresse surtout aux usages où le coût de calcul et le débit comptent autant que le score brut — code agentique, raisonnement et outils — tout en restant dans la famille open-weights lancée deux semaines plus tôt avec Inkling.

Fiche technique : MoE compact, multimédia natif

Selon l’annonce officielle, Inkling-Small est un transformeur Mixture-of-Experts entraîné sur des systèmes NVIDIA GB300 NVL72. Points retenus :

  • 276B paramètres totaux, 12B actifs par token (contre 975B / 41B pour Inkling) ;
  • raisonnement natif sur audio et images, effort de réflexion variable ;
  • fenêtre de contexte jusqu’à 1 million de tokens ;
  • poids complets libérés, fine-tuning via Tinker, chat texte/image/audio sur Tinker Playground.

L’architecture multimodale reprend celle d’Inkling (encodeur « encoder-free ») : l’audio passe en spectrogrammes dMel, les images en patches 40×40 via un hMLP à quatre couches, puis le tout est traité avec le texte.

Benchmarks : parfois devant le grand frère

Thinking Machines indique qu’Inkling-Small a commencé son entraînement après Inkling, avec un mix de pré-entraînement et une recette ML revus. Un checkpoint « preview » a notamment été post-entraîné en distillation on-policy avec Inkling comme enseignant, puis deux semaines de RL agentique axé code. Résultat revendiqué : le petit modèle dépasse Inkling sur plusieurs tests de raisonnement et de code agentique, tandis qu’Inkling garde l’avantage sur la couverture de connaissances et la factualité.

  • Humanity’s Last Exam (texte seul, sans outils) : 31,6 % pour Inkling-Small contre 29,7 % pour Inkling ;
  • SWE-bench Verified : score annoncé au-dessus de 80 % ;
  • courbes effort minimal → xhigh : Inkling-Small reste compétitif en performance par TFLOP de sortie sur Terminal-Bench 2.1, HLE et IFBench.

Des mesures tierces d’Artificial Analysis, relayées notamment par The Decoder, placent le modèle autour de 40 sur l’Intelligence Index (41 pour Inkling), avec une consommation de tokens en sortie nettement plus basse que plusieurs rivaux « flash » du moment.

Audio, vision et épistémiques

Côté multimédia, le lab met en avant l’audio (VoiceBench à 90,1 % dans son tableau interne) et une meilleure utilisation de Python pour des tâches visuelles (crop, zoom, inspection programmatique de documents ou graphiques). Sur le volet « épistémiques », Inkling-Small reprend l’accent d’Inkling sur la calibration et le forecasting : indices Brier de type ForecastBench annoncés dans la même fourchette que le grand modèle.

La sécurité reprend la même recette de post-training et de red-teaming qu’Inkling (StrongREJECT, FORTRESS). Comme pour tout modèle open-weights, le déploiement réel dépendra du runtime, des garde-fous locaux et du harness agent choisi.

Pourquoi c’est utile maintenant

Pour un lecteur qui suit déjà DeepSeek V4 Flash, Qwen ou Kimi, Inkling Small ajoute une option open-weights « efficacité d’abord », signée Thinking Machines (Mira Murati), avec un chemin clair : télécharger les poids, affiner sur Tinker, ou tester le playground multimodal. Ce n’est pas un modèle « plus gros pour le spectacle » : le message du lab est explicite — viser le bon ratio performance / tokens / coût pour le code et les agents.

Source principale : Introducing Inkling-Small — Thinking Machines Lab.

Share.
Exit mobile version