fuse-1 Lite: مدل کدنویسی که تو ۳.۳ گیگ جا میشه
خلاصهٔ کاملتر
به گفتهی مطلبی که این مدل رو بررسی کرده، fuse-1 Lite برخلاف مدلهای کوچیک معمول نه دیستیل شده و نه فاینتیون. وزن ۹۶۰ اکسپرت واقعی — ۳۲ تا در هر لایه، در ۳۰ لایه — از Qwen3.6-35B-A3B برداشته شده و بهشکل جمع باقیموندهی فریزشده روی لایههای دیکودر LFM2.5-2.6B سوار شده.
چیزی که واقعاً آموزش میبینه فقط یه روتر حدوداً ۲ میلیون پارامتریه که تصمیم میگیره برای هر توکن کدوم اکسپرتها فعال بشن. میزبان و اکسپرتها فریز میمونن، برای همین آموزش فقط ۳۰۰ استپ و طبق مستندات مدل حدود ۸ دقیقه روی یه GPU از نوع L4 طول کشیده. نتیجهش اینه که مدل بیشتر وقتها مثل LFM2.5 رفتار میکنه و فقط روی توکنهای کدمحور اکسپرتهاش رو بیدار میکنه؛ کارت مدل نشون میده تو ۱۹ لایه از ۳۰ لایه اسکیل تقریباً صفره و اوج فعالیت تو لایه ۱۹ اتفاق میافته.
مصرف حافظه الگوی سادهای داره: دقت کامل هر مسیری که بری حدود ۱۲ گیگابایت میخواد — transformers با bfloat16، vLLM، یا MLX با float16 — ولی کوانتایز کردن میبردش بین ۳ تا ۴ گیگ. حالت ۸ بیتی با ۶ گیگابایت وسط میشینه و Q4_K_M روی GGUF حدود ۴ گیگ میخواد.
سادهترین راه شروع همون bitsandbytes چهاربیتیه، چون به هیچ بیلد سفارشی نیاز نداره و با پکیجهای استاندارد transformers و torch کار میکنه:
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True,
)نکته اینه که trust_remote_code=True تو هر سطحی از کوانتایز لازمه، چون مدل یه کلاس معماری سفارشی به اسم Fuse3ForCausalLM داره و تو کتابخونهی پایه وجود نداره.
مسیر GGUF و MLX اما دردسر بیشتری داره. فایل GGUF این مدل از معماری سفارشی fuse3 استفاده میکنه که llama.cpp استاندارد نمیتونه لودش کنه و باید یه فورک پچشده بیلد بشه؛ MLX هم یه فایل مدل اختصاصی داره و با trust_remote_code=True لود میشه. برای vLLM هم پشتیبانی نیتیو وجود نداره و یه پلاگین جدا کلاس مدل رو ثبت میکنه، ضمن اینکه فلگ --mamba-cache-mode align لازمه چون لایههای short-conv در LFM2 همترازی کش متفاوتی میخوان. یه قابلیت جالب هم اینه که با set_coding_enabled(False) میشه اکسپرتهای کدنویسی رو موقع اجرا خاموش کرد و بدون لود دوبارهی وزنها به رفتار LFM2 عادی برگشت.
نکات کلیدی:
- ۹۶۰ اکسپرت کدنویسی از Qwen3.6-35B-A3B روی میزبان فریزشدهی LFM2.5-2.6B پیوند خورده
- فقط یه روتر ~۲ میلیون پارامتری آموزش دیده: ۳۰۰ استپ، حدود ۸ دقیقه روی L4
- VRAM از ۳.۳۶ گیگ (۴ بیتی NF4) تا حدود ۱۲ گیگ (bfloat16) بالا و پایین میشه
- کمدردسرترین مسیر شروع، کوانتایز چهاربیتی bitsandbytes روی transformers استاندارده
- GGUF و MLX به کد و بیلد سفارشی نیاز دارن؛ vLLM هم فقط با پلاگین کار میکنه
- با set_coding_enabled(False) میشه اکسپرتها رو خاموش کرد و مدل رو عمومی نگه داشت




