بونسای ۲: مدل ۲۷ میلیاردی که تو ۸ گیگ جا میشه
خلاصهٔ کاملتر
تو این مقاله اومده که Bonsai 2 27B یه نسخه فشردهشده از مدل Qwen3.8-27B هست. مدل اصلی با دقت کامل حدود ۵۴ گیگابایت جا میگیره، ولی این نسخه بسته به فرمت بستهبندی بین ۵.۹۵ تا ۸.۶۰ گیگه. ترفندش ternary quantization هست، یعنی هر وزن مدل بهجای یه عدد اعشاری ۱۶ بیتی فقط یکی از سه مقدار ۱-، ۰ یا ۱+ رو نگه میداره، که نرخ مؤثرش حدود ۱.۷۲ بیت بهازای هر وزنه.
قبل از این فشردهسازی یه Hadamard rotation روی وزنها اعمال میشه، یعنی یه جابهجایی ریاضی ثابت که کاری میکنه هیچ وزنی بیش از حد بار اطلاعات رو به دوش نکشه؛ همون چیزی که معمولاً باعث فروپاشی دقت تو بیتهای خیلی پایین میشه. این چرخش هزینه ذخیرهسازی اضافه نداره چون آفلاین تو خود وزنها تا میخوره، ولی در عوض llama.cpp استاندارد نمیتونه این فایلها رو اجرا کنه و باید از fork نگهدارنده استفاده کنی. با لودر معمولی MLX هم خروجی بیسروصدا غلط میشه و اصلاً ارور نمیده.
ادعای زیر ۶ گیگ با مصرف واقعی فرق داره. تو تست، سرو کردن مدل با llama.cpp و تنظیمات پیشفرض کمی بیشتر از ۱۲ گیگ VRAM برد، چون llama.cpp بهصورت پیشفرض برای چهار اسلات درخواست موازی جا رزرو میکنه. با یه اسلات، مصرف به حدود ۸ گیگ میرسه. روی مک هم کارت مدل (یعنی همون برگه مشخصاتی که خود سازنده منتشر میکنه) حدود ۴۷ توکن بر ثانیه روی M5 Max و ۲۸ تا ۲۹ توکن روی M5 Pro رو گزارش کرده.
جایی که فاصله بنچمارک و واقعیت خودش رو نشون داد، تست دیباگ بود. یه باگ عمدی تو یه اپ داکری باعث میشد یه گیج فعالیت ۲۴ ساعته برش زمانیش رو با ساعت محلی سرور حساب کنه نه UTC، و سه ساعت آخر داده رو بیصدا بندازه دور. مدل تو زنجیره استدلالش دقیقاً به همین مشکل رسید و حتی حسابش رو هم کرد، ولی بعد خودش رو منصرف کرد و رفت یه اختلاف نامربوط تو یه نمودار دیگه رو درست کرد. تو تولید کد هم یه فایل HTML ساده ساخت که دکمه ریستش کار نمیکرد و بعد از سه بار تذکر هنوز درست نشده بود.
توصیف تصویر بهترین نتیجه رو داد و مدل هم صحنه رو دقیق شناخت و هم لحن طنز خواستهشده رو درآورد. ترجمه چندزبانه اما کامل شکست خورد و مدل روی زبانهایی مثل تامیل تو یه حلقه استدلال تکراری گیر کرد، که نسبت به نسخه قبلی بونسای یه پسرفت حساب میشه. نویسنده میگه جواب نهایی به نوع کار شما بستگی داره: یه مدل کلاس ۲۷B با پنجره ۲۶۲ هزار توکنی که زیر ۸ گیگ حافظه میچرخه برای اجرای محلی واقعاً مهمه، ولی عدد ۹۸.۲ درصد رو باید میانگین بنچمارک دید نه تضمین اینکه هر دسته کار به همون خوبی میمونه.
نکات کلیدی:
- حجم روی دیسک بین ۵.۹۵ گیگ با بستهبندی GGUF PTQ1_0 تا ۸.۶۰ گیگ با MLX بههمراه vision tower، در برابر حدود ۵۴ گیگ نسخه FP16.
- کارت مدل میانگین ۸۴.۷۸ تو ۱۴ بنچمارک حالت thinking رو گزارش میکنه که خودش اون رو معادل ۹۸.۲ درصد نسخه دقت کامل میدونه.
- پنجره کانتکست ۲۶۲ هزار توکنه، به لطف معماری هیبریدی با حدود ۷۵ درصد linear attention و ۲۵ درصد full attention.
- llama.cpp استاندارد این فایلها رو اجرا نمیکنه و fork اختصاصی لازمه؛ لودر MLX معمولی هم بدون ارور خروجی غلط میده.
- مصرف واقعی VRAM با تنظیمات پیشفرض llama.cpp بیشتر از ۱۲ گیگ بود و با یک اسلات موازی به حدود ۸ گیگ رسید.




