مدلی ۳۵ میلیارد پارامتری که با کمتر از ۳ گیگ رم اجرا میشه
خلاصهٔ کاملتر
Edge0-35B-A3B یه مدل زبانی مخلوط-اکسپرت (MoE) با ۳۵ میلیارد پارامتره که رو Qwen3.6-35B-A3B ساخته شده و زیر ۳ گیگابایت حافظهٔ فعال لازم داره؛ در حالی که معمولاً یه مدل تو این سایز دهها گیگابایت رم میخواد. مدل ۲۵۶ تا اکسپرت داره ولی فقط ۴ تاشون برای هر توکن فعال میشن (همون A3B تو اسمش، یعنی حدود ۳ میلیارد پارامتر فعال). فریمورک Edge0 کل وزنهای ۴ بیتی رو رو دیسک نگه میداره و فقط همون ۴ اکسپرتی که لازمه رو در لحظه میخونه، بهجای اینکه کل مدل رو از اول تو رم بریزه.
چون خوندن مداوم از دیسک میتونه کند باشه، Edge0 یه ماژول کوچیک به اسم prerouter (یعنی پیشبین مسیریابی) داره که یه قدم جلوتر حدس میزنه توکن بعدی به کدوم اکسپرتها نیاز داره. اینجوری خوندن از دیسک همزمان با محاسبات فعلی انجام میشه، نه بعدش. طبق کارت مدل، این کار تا ۵۹ درصد سرعت خروجی (decode) رو بیشتر میکنه و هرچی دیسک کندتر یا مدل بزرگتر باشه، فایدهش بیشتر میشه.
برای جبران افت کیفیت ناشی از فشردهسازی ۴ بیتی، از تکنیکی به اسم Recover-LoRA استفاده شده: مدل پایهٔ int4 ثابت نگه داشته میشه و چندتا adapter روی اون از مدل fp16 اصلی، دیستیل (تقطیر) میشن. رو پنج بنچمارک (مثل AIME 2026، HumanEval، MMLU-Pro)، میانگین امتیاز مدل به ۷۹.۲ میرسه در برابر ۸۳.۲ مدل اصلی fp16؛ یعنی فقط ۳.۹ امتیاز افت، که برای یه فشردهسازی اینقدر شدید عدد کمیه.
رو یه Mac mini M4 Pro با ۲۴ گیگ رم مشترک، مدل با سرعت ۱۵ تا ۱۸ توکن در ثانیه خروجی میده و پرامپتهای طولانی رو با سرعت ۱۱۳ تا ۱۴۰ توکن در ثانیه پردازش میکنه. چون اکسپرتها هر بار از SSD خونده میشن، سرعت بالای استوریج عملاً یه پیشنیازه، نه یه امتیاز اضافه. فعلاً فقط بکاند MLX رو تراشههای اپل ساپورت میشه و بکاندهای دیگه هنوز تو نقشهٔ راهن.
این نسخه فعلاً پریویو حساب میشه: تو کارهای ایجنتی مثل استفاده از ابزار و برنامهریزی چندمرحلهای هنوز ضعیفه، و اصلیترین کاربردش الان چت و استدلال روی دستگاههای اپل با رم محدوده، نه ساخت یه ایجنت تمامعیار. مدل و فریمورکش با لایسنس Apache 2.0 منتشر شدن، پس محدودیت لایسنسی برای تست کردنش وجود نداره.
نکات کلیدی:
- ۳۵ میلیارد پارامتر، ۲۵۶ اکسپرت که فقط ۴ تاشون در هر توکن فعال میشن
- حافظهٔ فعال حدود ۲.۹ تا ۳ گیگابایت با استریم کردن اکسپرتها از SSD
- prerouter با پیشبینی یک قدم جلوتر، سرعت decode رو تا ۵۹٪ بالا میبره
- افت کیفیت نسبت به نسخهٔ fp16 اصلی فقط ۳.۹ امتیاز روی میانگین پنج بنچمارک
- فعلاً فقط روی اپل سیلیکون با MLX کار میکنه و در کارهای ایجنتی ضعیفه




