Des chercheurs de Multiverse Computing ont publié le 25 août 2026 une technique baptisée Quantization-Aware Healing, capable de compresser le modèle open source GPT-OSS 120B en une version 4 bits quatre fois plus légère — tout en dépassant les performances de l’original sur la majorité des benchmarks testés. Un résultat qui inverse l’idée reçue selon laquelle compresser un modèle se paie toujours en précision.
Distiller depuis l’original, pas depuis la version dégradée
La méthode se distingue des approches classiques de récupération post-quantification, qui entraînent le modèle compressé à corriger ses propres erreurs à partir de la version déjà dégradée. Quantization-Aware Healing fait l’inverse : elle distille directement depuis le modèle original en pleine précision, non compressé, en utilisant une divergence de Kullback-Leibler comme signal d’apprentissage plutôt qu’une simple perte de tâche. Le modèle compressé n’est ainsi jamais « ancré » sur une cible déjà appauvrie.
GPT-OSS 120B réduit à 60B, en MXFP4
Appliquée à GPT-OSS 120B, la technique réduit le modèle à l’équivalent de 60 milliards de paramètres actifs, quantifiés en MXFP4, pour une empreinte mémoire environ quatre fois inférieure à la version bfloat16 de référence. Malgré cette compression sévère, le modèle obtenu dépasse son propre équivalent pleine précision sur 7 des 9 benchmarks testés : +7,4 points en raisonnement long contexte (AA-LCR), +5,6 points en mathématiques (AIME 2025), +2,7 points en codage agentique (Aider), +2,3 points en usage d’outils (τ²-bench), ainsi que des gains plus modestes sur GPQA Diamond, IFBench et LiveCodeBench.
Pourquoi ça compte pour l’IA locale
Un modèle quatre fois plus léger en mémoire, tout en étant plus performant sur le raisonnement et le codage, change directement l’équation du déploiement local : moins de VRAM nécessaire, une inférence plus rapide, sans sacrifier la qualité sur les tâches agentiques les plus exigeantes. Pour la communauté qui fait tourner des modèles ouverts sur du matériel grand public, ce type de technique de compression pourrait devenir aussi déterminant que la taille brute des modèles eux-mêmes.
Détails techniques complets sur Hugging Face.
Qu’est-ce que Quantization-Aware Healing ?
C’est une technique de compression de modèles de langage qui distille directement depuis le modèle original en pleine précision, plutôt que depuis une version déjà dégradée, pour limiter la perte de qualité lors de la quantification.
Quel modèle a été compressé avec cette technique ?
GPT-OSS 120B, réduit à l’équivalent de 60 milliards de paramètres actifs et quantifié en MXFP4, soit environ quatre fois moins de mémoire que la version bfloat16 de référence.
Le modèle compressé est-il moins performant que l’original ?
Non : il dépasse son équivalent pleine précision sur 7 des 9 benchmarks testés, notamment en raisonnement long contexte, en mathématiques et en codage agentique.
