بونسای ۲۷B؛ اولین مدل ۲۷ میلیاردی که رو گوشی جواب میده
خلاصهٔ کاملتر
شرکت پریزمامال از بونسای ۲۷B رونمایی کرده؛ مدلی که رو پایهی Qwen3.6 27B ساخته شده و به گفتهی این شرکت اولین مدل تو ردهی ۲۷ میلیارد پارامتریه که میتونه مستقیم رو گوشی موبایل اجرا بشه. تا حالا اجرای این سایز از مدلها رو دستگاههای محلی عملاً غیرممکن بود، چون یه مدل ۲۷ میلیاردی تو حالت ۱۶ بیتی حدود ۵۴ گیگابایت جا میگیره و حتی نسخهی ۴ بیتیش هم با ۱۸ گیگ، برای گوشی و اکثر لپتاپها خیلی بزرگه.
بونسای ۲۷B با دو نسخه عرضه شده: Ternary Bonsai 27B با وزنهای سهتایی (−۱، ۰، +۱) و حجم ۵.۹ گیگابایت، که کیفیت کامل استدلال، فراخوانی ابزار و کار عاملمحور رو رو یه لپتاپ معمولی نگه میداره؛ و 1-bit Bonsai 27B با وزنهای دودویی و حجم فقط ۳.۹ گیگابایت، که تو محدودهی حافظهی آیفون ۱۷ پرو جا میشه و برای اولین بار یه مدل تو این رده رو روی گوشی میبره.
طبق ادعای شرکت، تو یه مجموعهی ۱۵ تایی از بنچمارکها (دانش، استدلال، ریاضی، کدنویسی، فراخوانی ابزار و بینایی)، نسخهی سهتایی حدود ۹۵٪ و نسخهی یکبیتی حدود ۹۰٪ از عملکرد مدل کاملدقت رو حفظ کردهن. جالب اینکه افت کیفیت تو کدنویسی و ریاضی خیلی کمه، دقیقاً همون تواناییهایی که کارهای عاملمحور (agentic) بهشون وابستهست.
نویسندهی مقاله میگه دلیل اصلی اهمیت این کار اینه که بار کاری هوش مصنوعی داره از «یه پاسخ ساده» به «کار مداوم و چندمرحلهای» جابهجا میشه؛ یه ایجنت بهجای یه درخواست، صدها درخواست پشت سر هم میفرسته. وقتی این کار رو کلاود انجام بشه، هزینهی هر توکن جمع میشه و اطلاعات خصوصی کاربر هم مدام از شبکه رد میشه. اما وقتی مدل رو خود دستگاه اجرا بشه، هزینهی هر مرحله عملاً صفر میشه و داده هیچوقت از دستگاه بیرون نمیره.
از نظر سرعت، بونسای ۲۷B رو یه RTX 5090 تا ۱۶۳ توکن بر ثانیه (نسخهی یکبیتی) و ۱۳۴ توکن بر ثانیه (نسخهی سهتایی) میده؛ رو یه M5 Max هم به ترتیب ۸۷ و ۵۸ توکن بر ثانیه میرسه. مدل از context طولانی ۲۶۲ هزار توکنی هم پشتیبانی میکنه و از speculative decoding برای سرعت بیشتر استفاده میکنه.
طبق گفتهی مقاله، فیت شدن رو گوشی سختتر از چیزیه که فقط حجم فایل نشون میده؛ چون یه گوشی هیچوقت کل حافظهش رو در اختیار یه اپ نمیذاره و مدل باید سهمی از این حافظه رو با KV cache و activations هم تقسیم کنه. برای همینه که شرکت دو نسخهی جدا ساخته: یکی برای کیفیت رو لپتاپ، یکی برای فیت شدن رو گوشی.
هر دو نسخه با لایسنس Apache 2.0 منتشر شدهن و از طریق MLX رو دستگاههای اپل و از طریق CUDA رو کارتهای گرافیک انویدیا اجرا میشن. پریزمامال از یه تیم پژوهشگر کلتک شروع شده و از خوسلا ونچرز، سربروس، گوگل و سامسونگ حمایت مالی گرفته.
نکات کلیدی:
- بونسای ۲۷B رو پایهی Qwen3.6 27B ساخته شده و در دو نسخهی سهتایی (۵.۹ گیگ) و یکبیتی (۳.۹ گیگ) عرضه شده.
- نسخهی یکبیتی اولین مدل تو ردهی ۲۷ میلیارد پارامتریه که رو گوشی (آیفون ۱۷ پرو) جا میشه.
- کیفیت با ۹۰ تا ۹۵ درصد از عملکرد مدل کاملدقت حفظ شده، مخصوصاً تو کدنویسی و ریاضی.
- اجرای محلی هزینهی هر مرحلهی کار عاملمحور رو تقریباً صفر میکنه و دادهی کاربر رو دستگاه نگه میداره.
- مدل با لایسنس Apache 2.0 و روی MLX (اپل) و CUDA (انویدیا) در دسترسه.




