Grâce à Bonsai 2 27B, PrismML réduit Qwen3.8 27B à 5,9 Go pour l'IA locale, en pariant que les LLM capables de raisonnement et hautement performants ne doivent pas nécessairement être volumineux
Un modèle construit à partir de Qwen3.8 27B peut désormais tenir dans un paquet de poids de 5,9 Go. PrismML a publié Ternary Bonsai 2 27B, une version compressée qui, selon l’entreprise, conserve 98,2 % des performances globales de référence du modèle en pleine précision, pour un encombrement plus de neuf fois plus petit. Cette version est conçue pour un déploiement local plutôt que pour un flux de travail exclusivement dans le cloud. Bonsai 2 n’est pas un modèle de base plus petit.
PrismML est une start-up spécialisée dans l’intelligence artificielle qui crée des modèles de langage ultra-denses et hautement compressés, conçus pour fonctionner en local sur des smartphones, des ordinateurs portables et des appareils en périphérie. Qwen est une famille de modèles de langage, grands et petits (LLM et SLM), à poids principalement ouverts, développée par Alibaba Cloud. Sa dernière version, Qwen 3.8, un modèle de 2 400 milliards de paramètres, était le deuxième plus grand et le deuxième plus puissant des modèles de langage à poids ouverts et des modèles de langage chinois publiés au 12 août 2026, après Kimi K3.
Fin août, Alibaba Cloud a lancé Qwen3.8-Flash-Next, un modèle d'intelligence artificielle (IA) multimodal de type « mixture-of-experts », offrant un premier aperçu de l'architecture de la future famille Qwen4. Cette refonte architecturale porte à la fois sur le mécanisme d'attention, les connexions résiduelles, l’intégration et l’optimisation. Qwen3.8-Flash-Next dispose d'un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires, dont seuls 6 milliards sont activés par token. Alibaba revendique de meilleurs résultats en matière de codage et dans les tâches bureautiques par rapport à Qwen3.7-Plus, pour un coût d'entraînement environ neuf fois moindre, avec un contexte s'étendant jusqu'à 1 million de tokens via YaRN.
Un modèle construit à partir de Qwen3.8 27B peut désormais tenir dans un paquet de poids de 5,9 Go. PrismML a publié Ternary Bonsai 2 27B, une version compressée qui, selon l’entreprise, conserve 98,2 % des performances globales de référence du modèle en pleine précision, pour un encombrement plus de neuf fois plus petit. Cette version est conçue pour un déploiement local plutôt que pour un flux de travail exclusivement dans le cloud. Bonsai 2 accepte du texte et des images, prend en charge une fenêtre de contexte de 262 000 tokens et est disponible sous licence Apache 2.0. PrismML indique qu’il fonctionne sur les GPU NVIDIA via CUDA et sur les appareils Apple via MLX, avec une démo WebGPU accessible via un navigateur
.
Bonsai 2 n’est pas un modèle de base plus petit. PrismML représente les poids de Qwen3.8 27B à l’aide de trois valeurs : moins un, zéro et plus un. La mise à l’échelle FP16 au niveau des groupes permet à la représentation compressée de se rapprocher d’une plage numérique plus large, produisant une densité effective de 1,76 bit par poids. Le chiffre phare concernant la rétention est une moyenne communiquée par l’entreprise, calculée sur le raisonnement, les mathématiques, le codage, le suivi d’instructions, la vision et l’utilisation d’outils par les agents. Le tableau de PrismML attribue au codage un score de 81,58, contre 82,17 pour le modèle en précision pleine. L’utilisation d’outils et l’agentique ont obtenu un score de 77,57 contre 79,74, tandis que la vision a enregistré la plus forte baisse répertoriée : 78,59 contre 81,64.
PrismML indique que son premier modèle Bonsai 27B conservait environ 95 % des performances globales de référence de son modèle de base ; Bonsai 2 porte ce résultat déclaré à plus de 98 %. L’entreprise positionne cette nouvelle version pour la programmation d’agents, les systèmes d’utilisation d’ordinateurs, l’analyse de documents et d’images privés, ainsi que les configurations hybrides qui envoient certaines tâches à des modèles distants.
PrismML fait état de vitesses de génération maximales pouvant atteindre 143 tokens par seconde sur une Nvidia GeForce RTX 5090 et 46,8 tokens par seconde sur un M5 Max. Ces chiffres spécifiques au matériel ne permettent pas de déterminer comment le modèle se comportera dans toutes les applications locales. Le test pratique consistera à vérifier si ses écarts plus faibles au niveau des tâches restent acceptables lorsqu’un flux de travail repose sur l’interprétation d’images ou l’exécution d’actions répétitives.
Voici l'annonce de Bonsai 2 27B :
Présentation de Bonsai 2 27B : une compression quasi sans perte pour un encombrement 9 fois plus petit
Il y a deux mois, nous avons lancé nos premiers modèles Bonsai 27B et démontré qu’un modèle multimodal de classe 27B pouvait être suffisamment compressé pour fonctionner efficacement sur un appareil local. Aujourd’hui, nous lançons Ternary Bonsai 2 27B, notre modèle le plus performant à ce jour.
Basé sur Qwen3.8 27B, le Bonsai 2 27B ternaire apporte à la série Bonsai des capacités renforcées en matière de raisonnement, de codage, de vision et d’agentique, tout en conservant le profil de déploiement qui la caractérise : une empreinte mémoire considérablement réduite, un débit local élevé et une meilleure efficacité énergétique.
Ternary Bonsai 2 27B utilise des poids ternaires {−1, 0, +1} avec une mise à l'échelle par groupe en FP16, pour 1,76 bit effectif par poids et un encombrement total du modèle de 5,9 Go. La représentation à faible nombre de bits est appliquée de bout en bout à l’ensemble du modèle linguistique. Il prend en charge une fenêtre de contexte de 262 000 tokens, des entrées multimodales (texte et image), et est distribué sous licence Apache 2.0.
Par rapport à son équivalent en précision pleine, le modèle Ternary Bonsai 2 27B est plus de 9 fois plus petit tout en conservant 98,2 % des performances globales mesurées lors des benchmarks. Avec un tel niveau de conservation, la compression devient un levier de déploiement : des capacités pratiquement identiques, dans un encombrement permettant une exécution dans bien plus d’environnements.
Ce qui a changé depuis la première version de Bonsai 27B
Notre première version de Bonsai 27B a constitué une étape importante, offrant un moyen pratique d’exécuter une intelligence de classe 27 milliards sur des appareils locaux. Bonsai 2 27B se concentre sur l’étape suivante : améliorer la qualité du modèle et les performances d’exécution nécessaires aux applications locales concrètes. Par rapport à la génération précédente de Bonsai 27B, Bonsai 2 27B apporte :
- un modèle de base plus puissant, Qwen3.8 27B
- une meilleure conservation des capacités globales (98,2 %) par rapport au modèle en précision complète
- des performances améliorées en matière de raisonnement, de programmation, de vision et d’agentique à long terme
Des capacités accrues pour un même point de déploiement
Sur une suite de tests de référence couvrant le raisonnement, les mathématiques, la programmation, l’exécution d’instructions, la vision et l’utilisation d’outils par des agents, Ternary Bonsai 2 27B obtient un score de 83,9, conservant ainsi 98,2 % des performances globales de Qwen3.8 27B.
Le résultat clé ne réside pas seulement dans le score global, mais aussi dans les domaines où les capacités sont préservées. Les agents de programmation, les systèmes d’utilisation d’outils, les flux de travail multimodaux et les tâches à long terme sont particulièrement sensibles à la dégradation du modèle, car de petites erreurs peuvent s’accumuler au fil de nombreuses étapes. Bonsai 2 27B conserve une grande partie des performances du modèle à pleine précision précisément dans ces domaines, tout en fonctionnant avec une empreinte mémoire nettement réduite.
Comparé au modèle en précision pleine et à d’autres alternatives à faible nombre de bits, Bonsai 2 27B se distingue par sa densité d’intelligence exceptionnelle. De nombreuses alternatives à faible nombre de bits ne deviennent déployables qu’en renonçant à des capacités significatives en matière de codage, de vision ou d’utilisation d’outils par des agents. Bonsai 2 27B repousse les limites vers à la fois des capacités supérieures et une consommation de mémoire réduite.
Grâce à Bonsai 2 27B, les modèles locaux peuvent commencer à prendre en charge de véritables tâches intellectuelles : boucles de codage-agent, workflows d’utilisation de l’ordinateur, analyse de documents privés, débogage multimodal et orchestration hybride, dans laquelle les modèles locaux gèrent les tâches sensibles ou à haute fréquence tout en s’appuyant de manière sélective sur le cloud.
Débit et efficacité énergétique
Le modèle ternaire Bonsai 2 27B atteint jusqu’à 143 tokens/seconde sur une NVIDIA GeForce RTX 5090 et 46,8 tokens/seconde sur un M5 Max. Sur une RTX 4090, Ternary Bonsai 2 27B ne consomme que 0,714 mWh/token, ce qui le rend 40 % plus économe en énergie qu’un modèle 8B fonctionnant en précision totale.
Pour les assistants de codage, un débit plus élevé se traduit par des boucles d’édition-débogage plus rapides. Pour les agents multimodaux, cela signifie des itérations plus rapides sur les captures d’écran, les documents...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.