FreeToken؛ مدل ۷۵۳ میلیاردی روی یک GPU
خلاصهٔ کاملتر
مقالهٔ FreeToken که ۱۷ آگوست ۲۰۲۶ روی arXiv منتشر شده، از یه تناقض ساده شروع میکنه: وزن مدلهای قدرتمند open-weight الان در دسترسه، ولی سرو کردنشون هنوز فرض رو بر زیرساخت دیتاسنتر میذاره. به گفتهٔ نویسندهها، FreeToken یه سیستم سرو edge-native برای مدلهای MoE هست، یعنی مدلهایی که برای هر توکن فقط چندتا expert رو روشن میکنن نه کل شبکه رو.
ایدهٔ اصلی اینه که کامپیوتر شخصی رو یه GPU کوچیک نبینیم، بلکه یه پلتفرم استنتاج یکپارچه و کشسان حسابش کنیم. نویسندهها کل استک سرو رو با هم طراحی کردن: چیدمان و لود مدل، اینکه کدوم expertها ساکن حافظه بمونن، تقسیم اجرا بین CPU و GPU، استفادهٔ دوباره از state ایجنت، و مدیریت حافظه در زمان اجرا.
دلیل این طراحی دوتا واقعیته که تو مقاله بهش اشاره شده. اول اینکه بار کاری ایجنتها مدام الگوی اجراش عوض میشه، دوم اینکه سختافزار edge منابع ناهمگنی داره و ترکیبش از یه دستگاه به دستگاه بعدی فرق میکنه. برای همین FreeToken به یه استراتژی offload ثابت متعهد نمیمونه و مدام محاسبات و state مدل رو روی منابعی که واقعاً آزادن نگاشت میکنه.
عددها هم اینه: FreeToken بیش از ۲۰ مدل MoE و ایجنتهای واقعی کدنویسی و tool-use رو روی سختافزاری از یه GPU لپتاپی ۸ گیگابایتی تا یه GPU ورکاستیشن اجرا کرده. مهمتر از اون، سقف کاری که این ماشینها عملاً میتونن انجام بدن رو بالا برده: مدل ۳۵ میلیاردی روی لپتاپ، ۲۸۴ میلیاردی روی دسکتاپ گیمینگ، و GLM-5.2 با ۷۵۳ میلیارد پارامتر روی یه GPU ورکاستیشن.
جمعبندی نویسندهها اینه که با این کار وزنهای باز تبدیل میشن به نرمافزاری که واقعاً میشه محلی نصبش کرد، و همون ماشینی که کاربر الان داره میتونه بستر اجرای مدلهای فرانتیر باشه. سیستم رو هم بهصورت عمومی منتشر کردن.
نکات کلیدی:
- بیش از ۲۰ مدل MoE پشتیبانی میشه، روی سختافزاری از GPU لپتاپی ۸ گیگابایتی تا GPU ورکاستیشن
- GLM-5.2 با ۷۵۳ میلیارد پارامتر روی یه GPU ورکاستیشن اجرا شده
- مدل ۳۵ میلیاردی روی لپتاپ و مدل ۲۸۴ میلیاردی روی دسکتاپ گیمینگ اجرا شده
- استراتژی offload ثابت نیست و در زمان اجرا با منابع موجود تطبیق پیدا میکنه
- شناسهٔ مقاله arXiv:2608.16157 و تاریخ انتشارش ۱۷ آگوست ۲۰۲۶ هست




