WASTE؛ اجرای مدل ۲.۷۸ تریلیون پارامتری روی یه مکبوک
خلاصهٔ کاملتر
به نوشتهی مارکو بامبینی، تیم SQLite AI موتور استنتاج متنبازی به اسم WASTE رو با لایسنس Apache 2.0 بیرون داده که برای اجرای مدلهایی طراحی شده که وزنهاشون خیلی بزرگتر از حافظهی دستگاهن. اولین مدلی که کامل پشتیبانی میشه Kimi K3 با ۲.۷۸ تریلیون پارامتره: چکپوینت ۱.۴۲ ترابایتی اصلی به یه کانتینر ۹۸۲ گیگابایتی تبدیل شده و کل مدل روی یه مکبوک پرو با ۶۴ گیگ حافظهی یکپارچه اجرا شده — نه یه نسخهی تقطیرشده یا هرسشده.
ترفند اصلی از ساختار mixture-of-experts میآد. K3 با اینکه ۸۹۶ اکسپرت مسیریابیشده داره، تو هر لایه فقط ۱۶ تاشون برای هر توکن انتخاب میشن، پس بیشتر وزنها هر لحظه بیکارن. WASTE تنهی مدل رو تو رم نگه میداره، وزن اکسپرتها رو روی NVMe میذاره و بقیهی رم رو به یه کش محدود اکسپرت اختصاص میده. ماتریسهای هر اکسپرت کنار هم چیده شدن تا با یه خوندن موقعیتی بیان بالا، و موتور هم کش صفحهی سیستمعامل رو دور میزنه و خودش کش رو مدیریت میکنه.
برای هر توکن حدود ۱۷ گیگابایت دادهی اکسپرت خونده میشه، برای همین پهنای باند استوریج و رفتار کش تعیینکنندهن. نویسنده میگه اگه کش از این حجم کوچیکتر باشه نرخ هیت عملاً صفره، ولی بزرگکردن بیحساب کش هم جواب نمیده: سیستمعامل شروع به فشردهسازی و پیجینگ میکنه و کار کندتر میشه. روی ماشین تست، بودجهی حدود ۴۶ گیگابایت از تخصیصهای بزرگتر نتیجهی بهتری داد. یه اندازهگیری دیگه هم محل نگهداری فایل رو عوض کرد: SSD خارجی حدود ۰.۹۴ گیگابایت بر ثانیه بود و SSD داخلی ۱۲.۷۸.
سرعت فعلی K3 حدود ۰.۳ توکن بر ثانیهست که هنوز برای کاربرد تعاملی مناسب نیست؛ برآورد اولیهی خود تیم ۱ تا ۱.۵ توکن بود و نویسنده توضیح میده چرا اون تخمین اشتباه از آب دراومد. در عوض همین موتور، مدل Kimi-Linear 48B رو از یه کانتینر ۱۹ گیگی با حدود ۸.۹ توکن بر ثانیه اجرا میکنه. چند ایدهی بهظاهر منطقی هم رد شدن: تنهی سهبیتی کیفیت تولید رو خراب کرد، دقت متغیر برای هر اکسپرت سود معناداری نداشت و بکاند Metal روی این بار کاری ۲۲٪ کندتر از مسیر CPU بود.
انگیزهی کار به گفتهی نویسنده کنترله: اجرای محلی یعنی پرامپت و خروجی روی دستگاه میمونه، اپلیکیشن بدون شبکه هم کار میکنه و هزینه بهجای مصرف توکن به سختافزار خودت گره میخوره. جالب اینکه تیم یه سند به اسم «چیزی که میدونیم و از کجا میدونیم» تو مخزن نگه داشته که فرضهای غلط و بهینهسازیهای شکستخورده هم توش ثبت شدن، با این قاعدهی ساده که قبل از هر کار گرون، یه تست کوچیک واقعی بزنی که بتونه فرضت رو باطل کنه.
نکات کلیدی:
- WASTE موتور استنتاج متنباز و نوشتهشده با C، با لایسنس Apache 2.0 و بدون وابستگی استنتاج خارجی
- تنهی مدل تو رم، وزن اکسپرتها روی NVMe و بقیهی رم بهعنوان کش محدود
- Kimi K3 با ۲.۷۸ تریلیون پارامتر از یه کانتینر ۹۸۲ گیگی روی مکبوک ۶۴ گیگی، با حدود ۰.۳ توکن بر ثانیه
- Kimi-Linear 48B روی همون ماشین حدود ۸.۹ توکن بر ثانیه میده
- API قابلجاسازی C، کلاینت خط فرمان و سرور HTTP سازگار با OpenAI روی مک، لینوکس و ویندوز




