Bonsai 2 27B؛ مدل ۲۷ میلیاردی در ۸ گیگابایت
خلاصهٔ کاملتر
Bonsai 2 27B یه نسخهٔ ternary-quantized از مدل Qwen3.8-27B هست، یعنی هر وزن مدل بهجای عدد ۱۶ بیتی فقط یکی از سه مقدار منفی یک، صفر یا مثبت یک رو میگیره. همین باعث میشه مدلی که تو دقت FP16 حدود ۵۴ گیگابایت حافظه میخواد، بسته به فرمت بین ۶ تا ۸ گیگابایت جا بشه. سازندهش Prism ML ادعا میکنه حدود ۹۸ درصد نمرهٔ بنچمارک مدل اصلی حفظ شده. لایسنسش Apache 2.0 هست و پنجرهٔ زمینهش ۲۶۲ هزار توکنه.
فشردهسازی روی سه تکنیک سواره. اول همون سهحالته کردن وزنها که هزینهٔ ذخیره رو از ۱۶ بیت به حدود ۱.۷۲ تا ۲.۲۵ بیت برای هر وزن میرسونه. دوم، قبل از این تبدیل، وزنها از یه چرخش Hadamard رد میشن، یعنی یه بازچینش ریاضی که اطلاعات رو یکنواختتر بین ماتریس پخش میکنه تا بار روی یه وزن خاص نیفته. سوم، معماری پایه از توجه ترکیبی استفاده میکنه: حدود ۷۵ درصد لایهها linear attention و بقیه full attention، و همین پنجرهٔ ۲۶۲ هزار توکنی رو شدنی میکنه.
همین چرخش Hadamard دلیل اینه که نمیشه مدل رو با llama.cpp معمولی بالا آورد؛ لودر استاندارد اون تبدیل رو روی activationها اعمال نمیکنه و خروجی آشغال درمیآد. باید فورک llama.cpp از Prism ML رو بیلد کنی، یا روی مک فورک MLX رو. تو تست عملی با تنظیمات پیشفرض، سرور llama.cpp کمی بیش از ۱۲ گیگ VRAM مصرف کرد، چون پیشفرض برای چهار اسلات موازی KV cache رزرو میکنه. با --parallel 1 مصرف میره زیر ۸ گیگ.
دو بستهبندی GGUF وجود داره: PTQ1_0 با ۵.۹۵ گیگابایت که چیدمان فشردهتریه و PQ2_0 با ۷.۲۱ گیگابایت که هر مقدار رو تو یه اسلات ۲ بیتی میذاره و باز کردنش ارزونتره. هیچکدوم مطلقاً سریعتر نیستن و بستگی به کارت گرافیک داره. روی RTX 5090 سرعت با PQ2_0 به حدود ۱۳۰ توکن بر ثانیه میرسه، و روی لپتاپ M5 Max با بیلد MLX حدود ۴۷ توکن بر ثانیه گزارش شده.
اینجاست که ماجرا پیچیدهتر از چیزیه که اعداد فشردهسازی نشون میدن. تو یه تست، مدل باید یه باگ کاشتهشدهٔ timezone رو تو یه اپ FastAPI و Postgres پیدا میکرد؛ رد استدلالش درست تا خود باگ رفت، بعد خودش رو قانع کرد که کد سالمه و رفت سراغ یه مورد دیگه. تو یه تست ساخت صفحهٔ HTML هم دکمهای که کار نمیکرد، بعد از چند بار اصلاح باز هم درست نشد. در عوض تو تست تصویر و نامهنویسی خوب عمل کرد.
نکات کلیدی:
- حجم از حدود ۵۴ گیگابایت FP16 به ۵.۹۵ تا ۷.۲۱ گیگابایت GGUF میرسه، یعنی حدود ۹.۳ برابر فشردهتر.
- اجرا به فورک llama.cpp یا MLX از Prism ML نیاز داره؛ نسخهٔ رسمی خروجی خراب میده.
- مصرف واقعی VRAM با تنظیمات پیشفرض کمی بیش از ۱۲ گیگه و با --parallel 1 زیر ۸ گیگ.
- پنجرهٔ زمینه ۲۶۲ هزار توکنه و لایسنس مدل Apache 2.0 هست.
- ادعای حفظ ۹۸ درصد کارایی از بنچمارک داخلی خود Prism ML میآد و مستقل تأیید نشده.
- تو تستهای مستقل، مدل باگ کاشتهشده رو پیدا نکرد و تو ترجمهٔ چندزبانه هم روی بعضی زبانها مثل تامیلی گیر کرد.




