متا مدل ۳۰ میلیاردی Muse Glimmer رو باز کرد
خلاصهٔ کاملتر
متا سوپراینتلیجنس لبز مدل جدیدش Muse Glimmer رو معرفی کرد و وزنهاش رو با لایسنس باز Apache 2.0 روی Hugging Face گذاشت. این مدل ۳۰ میلیارد پارامتر داره و برای ورکفلوهای ایجنتیِ محلی و همیشهروشن بهینه شده — یعنی چیزی که روی یه مک یا PC با یه GPU معمولی هم اجرا میشه. تو اعلامیه اومده که هدف، استفاده از هوش مصنوعی بدون وابستگی به فضای ابری و حتی بدون اینترنته.
به گفتهٔ متا، مدل با یه دستور پخت تازهٔ دیستیلیشن آموزش دیده: تو پیشآموزش با logit distillation از خروجیهای مدل بزرگتر Muse Spark یاد گرفته، تو میانآموزش دادههای کانتکستبلند و ایجنتمحور با ردپای استدلالی غنیتر دیده، و تو پسآموزش ترکیبی از فاینتیون نظارتشده، دیستیلیشن on-policy و یادگیری تقویتی روی حوزههای کدنویسی و استدلال و ایجنت خورده.
قابلیتهایی که متا روشون مانور میده اینان: انجام تسک ایجنتی از اول تا آخر (روی بنچمارکهایی مثل SWE-Bench، MCP-Atlas و DeepSearch QA)، فراخوانی ابزار با اسکیمای دقیق تو ورکفلوهای طولانی، برنامهریزی چندمرحلهای، و مهمتر از همه جبران خطا: وقتی یه tool call شکست میخوره، مدل یاد گرفته خطا رو تشخیص بده و دوباره تلاش کنه بهجای اینکه وایسه. ورودی چندوجهی متن و تصویر و پشتیبانی از بیش از ۱۰۰ زبان هم داره.
دو تا بهینهسازی باعث شده روی سختافزار خونگی روون کار کنه. اول کوانتیزیشن: مدل با دقت کامل بیشتر از ۵۵ گیگابایت حافظه میخواد، ولی فشردهسازی وزنها به حدود ۴ بیت حجمش رو میرسونه زیر ۲۰ گیگ، طوری که تو یه بودجهٔ ۲۴ یا ۳۲ گیگابایتی هم KV cache جا شه هم انکودر تصویر. متا میگه این فشردهسازی تقریباً هیچ افتی تو تسکهای ایجنتی نداشته.
دومی هم speculative decoding هست: یه مدل کوچیک «drafter» بر پایهٔ DFlash کنار مدل اصلی میذارن که بهجای تولید تکتوکنی، بلوکهای کامل توکن رو پیشنهاد میده و مدل اصلی موازی تأییدشون میکنه. نتیجهش تولید متن خیلی سریعتر با همون کیفیت خروجیه. متا میگه تو مقایسه با Gemma4-31B و Qwen3.6-27B هم مدل تو همردهی خودش خوب ظاهر شده و سرعتش روی مکبوک M4-Max و M5-Max و کارت RTX-5090 اندازهگیری شده.
نکات کلیدی:
- Muse Glimmer یه مدل ۳۰ میلیارد پارامتری از متا با وزنهای باز و لایسنس Apache 2.0 هست
- هدفش اجرای ایجنتهای محلی روی مک یا PC با یه GPU معمولیه، بدون نیاز به اینترنت
- کوانتیزیشن ۴ بیتی حجم مدل رو از بالای ۵۵ گیگ به زیر ۲۰ گیگ میرسونه
- drafter مبتنی بر DFlash با speculative decoding سرعت تولید متن رو بالا میبره
- پشتیبانی llama.cpp، MLX، ExecuTorch و شریکهایی مثل Ollama و LM Studio و vLLM تو راهه




