بونسای ۲؛ مدل ۲۷ میلیاردی روی لپتاپ
خلاصهٔ کاملتر
Prism ML مدلی به اسم Bonsai 2 27B منتشر کرده که نسخه ternary-quantized (یعنی هر وزن مدل فقط یکی از سه مقدار -۱، ۰ یا +۱ رو میگیره) از Qwen3.8-27B ـه. کل پک ۸.۶ گیگابایته: ۷.۶۷ گیگ برای خود مدل زبانی و ۰.۹۲ گیگ برای بخش بینایی که فشرده نشده. نسخه FP16 همین مدل حدود ۵۴ گیگ جا میخواد، پس چیزی که قبلاً روی لپتاپ اصلاً بالا نمیاومد، الان توی حافظه یکپارچه یه مکبوک جا میشه.
چیزی که این وسط غیرعادیه، افت کیفیت خیلی کمشه. کارت مدل میگه میانگین ۸۴.۷۸ توی ۱۴ بنچمارک حالت thinking گرفته، یعنی ۹۸.۲ درصد کیفیت FP16، در حالی که یه فشردهسازی معمولی زیر ۴ بیت روی همون مدل پایه فقط ۷۲.۵۹ گرفته. ریاضی ۹۶.۵۷، کدنویسی ۸۹.۴۲ و tool-calling (یعنی وقتی خود مدل ابزارها رو صدا میزنه) ۷۴.۹۲ اعلام شده. هزینه واقعی هر وزن هم با گروههای ۱۲۸تایی و یه ضریب FP16 برای هر گروه، حدود ۱.۷۲ بیت درمیاد.
روی این وزنها یه چرخش Hadamard بلوکی هم سوار شده، یعنی هر ماتریس وزن قبل از سهحالتی شدن با یه تبدیل ثابت چرخونده میشه و موقع اجرا همون تبدیل روی activationها (ورودی هر لایه) اعمال میشه. این کار حجم یا پهنای باند اضافه نمیخواد، ولی یه دردسر مهم هم داره: اگه با لودر معمولی MLX بارش کنی، هیچ خطایی نمیده و در عوض خروجی غلط تولید میکنه. پس باید از لودر خودِ پک یعنی vision_artifact.load_vl_model استفاده کنی.
سرعتش با قدرت GPU بالا و پایین میره: حدود ۴۷ توکن بر ثانیه روی M5 Max، ۲۸ تا ۲۹ روی M5 Pro و ۱۸ روی M4 Pro، با حدود ۷.۲ گیگ حافظه مصرفی. از نظر رم، ۱۶ گیگ کف عملیه و ۳۲ گیگ برای کانتکست بلند راحتتره. یه نسخه GGUF هم برای llama.cpp هست با دو بستهبندی PTQ1_0 (۵.۹۵ گیگ) و PQ2_0 (۷.۲۱ گیگ)، ولی اون مسیر به بیلد پچشده llama.cpp نیاز داره، نه نسخه رسمی.
نویسنده تأکید میکنه مقایسه درست، نسبت سرعت با FP16 نیست، چون FP16 اصلاً روی لپتاپ جا نمیشه؛ بردِ واقعی اینه که یه مدل از این کلاس بهصورت تعاملی روی سختافزار مصرفی کار میکنه. در عین حال اعدادِ جدول بقیه پلتفرمهای اپل روی یه بیلد قبل از چرخش اندازهگیری شدن و قراره دوباره سنجیده بشن، پس بهتره تقریبی حسابشون کنی.
نکات کلیدی:
- حجم کل پک ۸.۶ گیگابایت (۷.۶۷ گیگ مدل زبانی) در برابر حدود ۵۴ گیگ نسخه FP16
- وزنهای سهحالته با ضریب گروهی FP16، در عمل ۱.۷۲ بیت برای هر وزن
- میانگین ۸۴.۷۸ در ۱۴ بنچمارک thinking، یعنی ۹۸.۲ درصد کیفیت FP16
- حدود ۴۷ توکن بر ثانیه روی M5 Max و ۱۸ توکن روی M4 Pro
- لودر معمولی MLX خروجی غلط میده؛ باید لودر همراه پک استفاده بشه
- پیشفرض نمونهبرداری حالت thinking: دمای ۱.۰، top_p ۰.۹۵ و top_k ۲۰، با تلاش استدلالی xhigh




