Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Actualité IA»Quantization-Aware Healing : un GPT-OSS compressé qui bat l’original
Écran d'ordinateur affichant du code source en gros plan
Actualité IA

Quantization-Aware Healing : un GPT-OSS compressé qui bat l’original

3 Mins Readaoût 26, 2026
Share
Twitter Email Copy Link

Des chercheurs de Multiverse Computing ont publié le 25 août 2026 une technique baptisée Quantization-Aware Healing, capable de compresser le modèle open source GPT-OSS 120B en une version 4 bits quatre fois plus légère — tout en dépassant les performances de l’original sur la majorité des benchmarks testés. Un résultat qui inverse l’idée reçue selon laquelle compresser un modèle se paie toujours en précision.

Distiller depuis l’original, pas depuis la version dégradée

La méthode se distingue des approches classiques de récupération post-quantification, qui entraînent le modèle compressé à corriger ses propres erreurs à partir de la version déjà dégradée. Quantization-Aware Healing fait l’inverse : elle distille directement depuis le modèle original en pleine précision, non compressé, en utilisant une divergence de Kullback-Leibler comme signal d’apprentissage plutôt qu’une simple perte de tâche. Le modèle compressé n’est ainsi jamais « ancré » sur une cible déjà appauvrie.

GPT-OSS 120B réduit à 60B, en MXFP4

Appliquée à GPT-OSS 120B, la technique réduit le modèle à l’équivalent de 60 milliards de paramètres actifs, quantifiés en MXFP4, pour une empreinte mémoire environ quatre fois inférieure à la version bfloat16 de référence. Malgré cette compression sévère, le modèle obtenu dépasse son propre équivalent pleine précision sur 7 des 9 benchmarks testés : +7,4 points en raisonnement long contexte (AA-LCR), +5,6 points en mathématiques (AIME 2025), +2,7 points en codage agentique (Aider), +2,3 points en usage d’outils (τ²-bench), ainsi que des gains plus modestes sur GPQA Diamond, IFBench et LiveCodeBench.

Pourquoi ça compte pour l’IA locale

Un modèle quatre fois plus léger en mémoire, tout en étant plus performant sur le raisonnement et le codage, change directement l’équation du déploiement local : moins de VRAM nécessaire, une inférence plus rapide, sans sacrifier la qualité sur les tâches agentiques les plus exigeantes. Pour la communauté qui fait tourner des modèles ouverts sur du matériel grand public, ce type de technique de compression pourrait devenir aussi déterminant que la taille brute des modèles eux-mêmes.

Détails techniques complets sur Hugging Face.

Qu’est-ce que Quantization-Aware Healing ?

C’est une technique de compression de modèles de langage qui distille directement depuis le modèle original en pleine précision, plutôt que depuis une version déjà dégradée, pour limiter la perte de qualité lors de la quantification.

Quel modèle a été compressé avec cette technique ?

GPT-OSS 120B, réduit à l’équivalent de 60 milliards de paramètres actifs et quantifié en MXFP4, soit environ quatre fois moins de mémoire que la version bfloat16 de référence.

Le modèle compressé est-il moins performant que l’original ?

Non : il dépasse son équivalent pleine précision sur 7 des 9 benchmarks testés, notamment en raisonnement long contexte, en mathématiques et en codage agentique.

GPT-OSS Hugging Face OpenAI Quantification
Share. Twitter Email Copy Link
Previous ArticleBill Gates IA : l’alerte inédite du cofondateur de Microsoft
Next Article Licenciements IA Meta : le plan d’agents abandonné

Related Posts

Actualité IA

Faille NemoClaw : des agents IA locaux piratables

Actualité IA

Google DeepMind lance les évaluations en double aveugle

Actualité IA News Open Weight Z.ai

GLM-5.3-Flash : Z.ai sort un modèle multimodal open source sous licence MIT

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}