مدل ۲۷ میلیاردی حالا تو ۵.۹ گیگ جا میشه
خلاصهٔ کاملتر
شرکت PrismML که دو ماه پیش نسل اول Bonsai 27B رو داده بود، حالا Ternary Bonsai 2 27B رو منتشر کرده. این مدل بر پایهٔ Qwen3.8 27B ساخته شده و ادعای اصلی تیم اینه که همون پروفایل استقرار سبک رو نگه داشته ولی تو استدلال، کدنویسی، بینایی و کارهای ایجنتی جلو رفته. مدل ورودی متن و تصویر رو با هم میگیره، پنجرهٔ متنش ۲۶۲ هزار توکنه و تحت لایسنس Apache 2.0 منتشر شده.
ترفند اصلی، وزنهای ternary هست، یعنی هر وزن فقط یکی از سه مقدار منفییک، صفر یا مثبتیک رو میگیره و مقیاسدهی گروهی با FP16 کنارش میشینه. نتیجهش میشه ۱.۷۶ بیت مؤثر به ازای هر وزن و کل مدل روی ۵.۹ گیگابایت. این فشردهسازی سرتاسر مدل زبانی اعمال شده، نه فقط بخشی ازش. یعنی چیزی که قبلاً کارت گرافیک گرون میخواست، حالا روی سختافزارهای خیلی بیشتری جا میشه.
عدد کلیدی این انتشار ۹۸.۲٪ه: نمرهٔ کلی مدل روی مجموعهای از بنچمارکهای استدلال، ریاضی، کدنویسی، پیروی از دستور، بینایی و استفاده از ابزار ۸۳.۹ شده، در برابر ۸۵.۴ نسخهٔ تمامدقت Qwen3.8 27B. برای مقایسه، نسل قبلی Bonsai حدود ۹۵٪ کارایی رو نگه میداشت، پس فاصله تا نسخهٔ کامل بیش از نصف کم شده. تو یه مورد مدل فشرده حتی جلو زده: پیروی از دستور ۸۲.۶۶ در برابر ۸۱.۲۵ مدل پایه. بیشترین افت هم مال بیناییه، ۷۸.۵۹ در برابر ۸۱.۶۴.
به گفتهٔ تیم، مهمتر از نمرهٔ کلی اینه که افت کجا اتفاق افتاده. ایجنتهای کدنویسی، سیستمهای ابزارمحور و کارهای طولانی به افت کیفیت خیلی حساسان، چون خطاهای کوچیک تو دهها قدم روی هم جمع میشن. ادعای PrismML اینه که برخلاف خیلی از گزینههای کمبیت دیگه که دقیقاً تو همین زمینهها کم میآرن، این مدل بیشتر تواناییش رو همونجا حفظ کرده.
سمت سرعت و مصرف هم عدد داده شده: تا ۱۴۳ توکن بر ثانیه روی NVIDIA GeForce RTX 5090 و ۴۶.۸ توکن بر ثانیه روی M5 Max. روی RTX 4090 مصرفش ۰.۷۱۴ میلیواتساعت به ازای هر توکنه که به گفتهٔ تیم ۴۰٪ کممصرفتر از یه مدل ۸ میلیاردی تمامدقته. برای دستیار کدنویسی این یعنی حلقهٔ ویرایش و دیباگ سریعتر، و برای لپتاپ یعنی عمر باتری بیشتر.
نویسندهٔ پست معتقده حرف اصلی فراتر از اجرای محلیه: وقتی مدلهای کمبیت تقریباً بدون افت کار میکنن، اقتصاد کل ماجرا عوض میشه، چون میشه مدل بزرگتر رو تو همون حافظه جا داد و کاربر بیشتری رو با همون سختافزار سرویس داد. مدل روی GPUهای NVIDIA با CUDA و روی دستگاههای اپل (مک، آیفون و آیپد) با MLX اجرا میشه و برای هر کدوم کرنل کمبیت اختصاصی نوشتن.
نکات کلیدی:
- وزنهای ternary با مقیاسدهی FP16 گروهی، ۱.۷۶ بیت مؤثر به ازای هر وزن و حجم کل ۵.۹ گیگابایت.
- نمرهٔ کلی ۸۳.۹ در برابر ۸۵.۴ مدل تمامدقت Qwen3.8 27B، یعنی حفظ ۹۸.۲٪ کارایی.
- نسل قبلی Bonsai ۹۵٪ کارایی رو نگه میداشت؛ این نسل به بالای ۹۸٪ رسیده.
- سرعت: تا ۱۴۳ توکن بر ثانیه روی RTX 5090 و ۴۶.۸ توکن بر ثانیه روی M5 Max.
- مصرف ۰.۷۱۴ میلیواتساعت بر توکن روی RTX 4090، حدود ۴۰٪ کممصرفتر از یه مدل ۸ میلیاردی تمامدقت.
- پنجرهٔ متن ۲۶۲ هزار توکن، ورودی متن و تصویر، لایسنس Apache 2.0، اجرا روی CUDA و MLX.




