fuse-1 Lite؛ پیوند ۹۶۰ متخصص کدنویسی به یه مدل کوچیک
خلاصهٔ کاملتر
توی این مقاله معرفی شده که fuse-1 Lite یه مدل mixture-of-experts با ۵.۷۲ میلیارد پارامتره که مدل عمومی و کوچیک LFM2.5-2.6B از LiquidAI رو با ۹۶۰ متخصص کدنویسیِ استخراجشده از Qwen3.6-35B-A3B ترکیب میکنه. ایدهش اینه که بهجای انتقال دانش از راه بازآموزی، وزنهای واقعی اون متخصصها مستقیم کپی و توی مدل میزبان کاشته بشه.
به گفتهٔ نویسنده، سه روش رایج ترکیب مدل اینجا جواب نمیداد: distillation کُند و پرهزینهست و فقط رفتار خروجی مدل معلم رو منتقل میکنه، merge کردن وزنها فقط وقتی جواب میده که معماری و ابعاد دو مدل سازگار باشه، و fine-tune کامل هم گرونه و خطر فراموشی فاجعهبار داره. کاری که اینجا شده «پیوند جراحیگونهٔ متخصصها با مسیریابی یادگرفتهشده»ست: وزنهای استخراجشده نرمالسازی میشن و بهشکل افزودنی به جریان باقیمانده اضافه میشن، بدون اینکه وزن اصلی مدل میزبان تغییر کنه.
تنها بخش آموزشدیده یه روتر سبک بههمراه ضریبهای مقیاس هر لایهست؛ رویهم حدود ۲ میلیون پارامتر، یعنی کمتر از ۰.۰۴ درصد کل مدل. توی هر کدوم از ۳۰ لایه، روتر توکنهای ورودی رو امتیاز میده و از بین ۳۲ متخصص اون لایه ۸ تای برتر رو برمیداره. جالب اینکه بعد از آموزش، روتر فقط توی ۱۱ لایه متخصصها رو فعال نگه داشته و توی ۱۹ لایهٔ دیگه ضریب مقیاس رو نزدیک صفر گذاشته — یه جور تقسیم کار: لایههای میانی بار اصلی استدلال کد رو میکشن و بیشترین ضریب (۶.۶۶) مال لایهٔ ۱۹ـه.
کل خط لولهٔ ساخت سه فاز داشته و رویهم حدود ۳ دلار خرج برداشته: پروفایلکردن و استخراج متخصصها حدود ۱.۹ دلار روی یه A100 هشتاد گیگی، مونتاژ حدود ۰.۵ دلار و آموزش روتر حدود ۰.۶ دلار روی یه GPU مدل L4. داده آموزشی روتر هم فقط ۵۵ نمونه بوده و کل ۳۰۰ گام آموزشش حدود ۸ دقیقه طول کشیده. برای اجرا، نسخهٔ bfloat16 حدود ۱۲ گیگ حافظه میخواد، نسخهٔ ۸ بیتی ۶ گیگ و نسخهٔ ۴ بیتی حدود ۳.۳۶ گیگ.
راه انداختنش کاملاً بیدردسر نیست: معماریش سفارشیه و موقع لود شدن با Transformers به trust_remote_code=True نیاز داره، پشتیبانی vLLM از یه پلاگین جدا میاد و GGUF هم یه فورک اختصاصی llama.cpp میخواد. نویسنده محدودیتها رو هم صریح گفته: ۵۵ نمونه برای تعمیمپذیری روتر کمه و KV cache توی لایههای افزوده درست منتقل نمیشه. در عوض یه سوئیچ set_coding_enabled(False) هست که متخصصهای کدنویسی رو خاموش میکنه تا مدل مثل همون LFM2.5 ساده کار کنه.
نکات کلیدی:
- ۹۶۰ متخصص کدنویسی مستقیم از Qwen3.6-35B-A3B به LFM2.5-2.6B پیوند خورده، بدون distillation یا merge
- مدل میزبان و متخصصهای پیوندی هر دو فریز میمونن؛ فقط ~۲ میلیون پارامتر روتر آموزش میبینه
- روتر بعد از آموزش فقط توی ۱۱ لایه از ۳۰ لایه متخصصها رو فعال نگه داشته
- کل هزینهٔ سه فاز ساخت حدود ۳ دلار، با ۸ دقیقه آموزش روتر روی یه L4
- نسخههای ۴ بیتی (۳.۳۶ گیگ)، ۸ بیتی (۶ گیگ)، bfloat16، MLX و GGUF موجوده ولی چندتاشون کد سفارشی میخوان




