Bonsai 27B, le modèle IA de raisonnement développé par la startup PrismML, tient dans moins de 4 Go de stockage et fonctionne directement sur un iPhone, tout en conservant jusqu’à 90 % des performances du modèle original, selon les propres benchmarks de l’entreprise.
Une compression radicale pour tenir sur un smartphone
PrismML, fondée par une équipe de chercheurs de Caltech, a construit Bonsai 27B à partir de Qwen3.6-27B d’Alibaba, un modèle de 27 milliards de paramètres. L’entreprise affirme qu’il conserve le raisonnement multi-étapes, l’usage d’outils, la compréhension d’image et les capacités agentiques du modèle original. Un modèle de cette taille occupe habituellement environ 54 Go, ou encore 18 Go avec une compression standard. PrismML propose deux versions bien plus légères : une variante orientée qualité d’environ 5,9 Go pour les ordinateurs portables, et une variante compacte d’environ 3,9 Go, assez petite pour tenir dans le stockage limité d’un iPhone 17 Pro Max.
Plutôt que de stocker chaque poids du réseau de neurones sur 16 bits, PrismML n’en utilise qu’un seul, voire un peu moins de deux, sur l’ensemble du modèle de langage. Selon l’entreprise, la variante à 1 bit atteint une densité d’intelligence de 0,530 par Go, largement devant les modèles ternaires ou en FP16.
Apple déjà en discussion avec PrismML
Selon un rapport de CNBC relayé par The Decoder, PrismML est en discussion avec Apple à propos de cette technologie de compression. Babak Hassibi, PDG de PrismML, confirme qu’Apple et d’autres entreprises testent les modèles pour la vitesse, la consommation énergétique et la performance. Les échanges seraient encore à un stade « très précoce », mais « progressent bien » selon lui.
PrismML défend l’idée que les applications d’IA modernes ont de plus en plus besoin de modèles puissants tournant en local : un agent peut enchaîner des centaines d’appels au modèle, chacun portant du contexte, produisant une sortie structurée et alimentant l’étape suivante. Dans le cloud, le coût par token s’accumule, chaque appel ajoute de la latence réseau, et les données privées (contenu d’écran, documents) quittent l’appareil. En local, ce coût marginal tombe à zéro et les données restent sur le téléphone.
Des pertes de performance limitées, selon les tests internes
Sur 15 benchmarks internes, la variante la plus lourde conserve 95 % des performances du modèle original, et la plus compacte 90 %. Les mathématiques et le code restent « quasiment inchangés », selon PrismML, tandis que les baisses les plus marquées touchent la compréhension d’image, le suivi d’instructions et l’usage agentique d’outils sur la variante la plus compressée. La version compacte de 3,9 Go génère environ 11 tokens par seconde sur un iPhone 17 Pro Max, pour une autonomie extrapolée à environ 67 000 tokens sur une charge complète.
Qu’est-ce que Bonsai 27B ?
Bonsai 27B est un modèle IA à 27 milliards de paramètres, développé par PrismML à partir de Qwen3.6-27B d’Alibaba, compressé pour fonctionner directement sur un smartphone.
Apple utilise-t-il déjà Bonsai 27B ?
Selon CNBC, PrismML est en discussion avancée avec Apple, qui teste la technologie de compression pour la vitesse, la consommation énergétique et la performance, mais aucun accord commercial n’est confirmé.
Quelles pertes de performance entraîne la compression ?
Selon les benchmarks internes de PrismML, la version la plus compacte (3,9 Go) conserve environ 90 % des performances du modèle original, avec un impact limité en mathématiques et en code, mais plus marqué en compréhension d’image.

