Muse Glimmer 30B؛ بازگشت متا به وزنهای باز
خلاصهٔ کاملتر
تو این مقاله اومده که متا مدل Muse Glimmer رو منتشر کرده: یه مدل ۳۰ میلیارد پارامتری با لایسنس Apache 2.0 که برخلاف موج این روزها معماری mixture-of-experts نداره و متراکمه، یعنی توی هر پاس همهٔ ۳۰ میلیارد پارامتر فعال میشن. متا اینو مشخصاً برای کار ایجنتی ساخته: استدلال چندمرحلهای، ابزارگیری، مسیرهای طولانی انجام کار و سازگاری با فریمورکهای ایجنت و هارنسهای کدنویسی. لایسنس Apache 2.0 هم محدودیتی برای استفادهٔ تجاری نمیذاره.
به گفتهٔ گزارش خود متا، آموزش Glimmer بیشتر به distillation تکیه داره تا آموزش از صفر روی دادهٔ خام وب: پیشآموزشش از خروجیهای مدل بزرگتر Muse Spark تغذیه شده و پسآموزشش ترکیبی از on-policy distillation و یادگیری تقویتیه. نویسنده تذکر میده که این یه شمشیر دولبهست — مدل تقطیرشده میتونه بالاتر از وزن پارامتریش ظاهر بشه، ولی ممکنه نقطهکورها و لحن مدل معلم رو هم به ارث ببره.
متا نسخهٔ ۴ بیتی رسمی رو عمداً جوری کوچیک کرده که توی ۲۴ تا ۳۲ گیگابایت حافظهٔ گرافیکی جا بشه؛ یعنی RTX 3090 و 4090 و 5090 و کارتهای ورکاستیشن ۳۲ گیگی AMD. نکتهٔ مهمتر اینه که فقط مدل رو تو این سقف نچپونده، بلکه برای KV cache هم جا گذاشته — بدون این فضا، مدل بهمحض اینکه یه ترنسکریپت طولانی ایجنت بهش بدی عملاً غیرقابل استفاده میشه. روی مک هم متا اجرای مدل رو روی یه مکبوک پرو با ۶۴ گیگ حافظهٔ یکپارچه نشون داده.
نسخهٔ کوانتایزشده از speculative decoding پشتیبانی میکنه که متا اسمش رو D-Flash گذاشته. تو این روش یه مدل کوچیکتر و سریعتر چند توکن جلوتر رو حدس میزنه و مدل اصلی همهشون رو تو یه پاس دستهای تأیید میکنه؛ چون تأیید نهایی هنوز دست مدل اصلیه، کیفیت خروجی افت نمیکنه. نویسنده میگه گنجوندن این قابلیت از همون روز انتشار نشون میده متا انتظار داره Glimmer توی حلقههای ایجنتی حساس به تأخیر استفاده بشه، جایی که هر کار میتونه دهها فراخوانی پشتسرهم داشته باشه.
تو بنچمارکهای خود متا، Glimmer بهجای یه جهش قاطع، بیشتر بهعنوان یه رقیب نزدیک برای Qwen 3.6 27B معرفی شده: تو بعضی تستها میبره و تو بعضی میبازه، ولی از Gemma 4 با فاصلهٔ بیشتری جلو میزنه. نویسنده به تایمینگ هم اشاره میکنه — Qwen 3.8 27B قراره چند روز بعد برسه و این سؤال رو پیش میآره که متا عجله کرده تا قبل از جابهجا شدن تیر دروازه بردش رو ثبت کنه. زاکربرگ هم تأیید کرده وزنهای مدل بزرگتر Muse Spark 1.2 باز میشه؛ مدلی که رتبهبندیهای مستقل امتیازش رو نزدیک Claude Opus 4.5 گذاشتن.
نکات کلیدی:
- Muse Glimmer یه مدل متراکم ۳۰ میلیارد پارامتری با لایسنس Apache 2.0 هست، نه mixture-of-experts
- آموزشش روی کار ایجنتی متمرکزه: ابزارگیری، استدلال چندمرحلهای و مسیرهای طولانی
- نسخهٔ ۴ بیتی رسمی برای ۲۴ تا ۳۲ گیگ حافظهٔ گرافیکی، با جای اضافه برای KV cache
- پشتیبانی از speculative decoding با نام D-Flash برای کم کردن تأخیر تو حلقههای ایجنتی
- متا وعدهٔ باز کردن وزنهای Muse Spark 1.2 رو هم داده




