MiMo-V2.6 و آموزش تقویتی در مقیاس بزرگ
خلاصهٔ کاملتر
گزارش فنی سری MiMo-V2.6 منتشر شده و حرف اصلیش اینه که بزرگتر کردن آموزش تقویتی فقط به معنی تولید تلاشهای بیشتر نیست، بلکه به معنی بهتر کردن خود سیگنال بازخورده. نویسندهها میگن وقتی یه ایجنت باید دهها نوبت پشت سر هم کد بخونه، پچ بنویسه و تست اجرا کنه، پاداش دودویی «تست پاس شد یا نشد» کم میآره، چون یه پچ تمیز و کمینه با یه پچ شلخته که استثناها رو قورت میده دقیقاً یه نمره میگیرن.
راهحلشون GAR ـه، یعنی Groupwise Advantage Redistribution. هر تسک شونزده بار تلاش میشه و به جای اینکه هر تلاش جدا نمره بگیره، هر شونزدهتا با هم جلوی یه مدل داور گذاشته میشن. داور پچهای قبولشده رو روی پنج محور مقایسه میکنه: تناسب راهحل با مسئله، دقت پیادهسازی بدون fallback اضافی، کمینه بودن تغییرات، دست نخوردن چیزهای خارج از محدوده تسک، و هماهنگی سبک کد با بقیه پروژه. بعد رتبهبندی میشن و بالاییها تقویت بیشتری میگیرن.
اگه معلوم بشه یه پچ نمرهشو با تقلب گرفته، مثلاً وصله منتشرشده رو از اینترنت برداشته، قبل از هر رتبهبندی صفر میشه و مثل شکست حساب میشه. نویسندهها این رو مستقیم تست کردن: بدون نمرهدهی گروهی، تعداد نوبتها و طول پاسخها سریع بالا میره، تلاشهای بیشتری به سقف context (طول متن قابل پردازش) میخورن و رشد نرخ موفقیت میخوابه. با نمرهدهی گروهی، رشد تا قدم ۵۲ ادامه پیدا میکنه و طول پاسخها آرومتر زیاد میشه. البته خود داور حدود ۱۲.۷ درصد هزینه کل RL رو میبلعه، پس مجانی نیست.
یه درس پایداری هم تو گزارش هست. معماری مدل MoE ـه، یعنی هر لایه چندتا زیرشبکه متخصص داره و یه router تصمیم میگیره هر توکن سراغ کدوم بره. وقتی وزنهای router هم آموزش میدیدن، بار روی چند متخصص تلنبار میشد: ضریب تغییرات بار از ۰.۷۸ به ۲.۰ رسید، اوج بار از ۶ برابر میانگین به ۱۶ برابر و سهم متخصصهای بیکار از ۰.۵ به ۲۲ درصد. برگردوندن وزنهای اولیه router تو قدم ۲۰ تعادل رو فوری برگردوند بدون اینکه نمره بنچمارکها تکون بخوره.
از نظر نتیجه، روی DeepSWE v1.1 که ۱۱۳ تسک طولانی مهندسی مخزن تو پنج زبونه، نمره average@3 (میانگین نرخ قبولی در سه تلاش) مدل Pro از ۵۸.۴ به ۷۲.۶ و مدل Flash از ۴۸.۷ به ۶۵.۷ رسیده. هزینه پسآموزش RL هم ۲.۶ میلیون دلار برای مدل بزرگ و ۰.۹ میلیون برای کوچیکه. برای اینکه کار تکرارپذیر باشه یه مدل ۹ میلیاردی هم منتشر کردن که روی پایه Qwen3.5-9B و با خروجیهای خود MiMo فاینتیون شده و با همون محیطها SWE-bench Verified رو از ۶۱.۱ به ۶۶.۲ برده.
نویسندهها خودشون هم حواسشون به محدودیتها هست: سهتا از بنچمارکهای شاخص داخلیان، مقایسه با مدلهای رقیب سهم RL رو از سهم معماری و پیشآموزش جدا نمیکنه، و بهبودها معمولاً با مصرف توکن بیشتر همراه بودن. یعنی نتیجه «توانایی بیشتر» ـه، نه لزوماً «جواب ارزونتر».
نکات کلیدی:
- GAR شونزده تلاش هر تسک رو با هم نمره میده و پچهای قبولشده رو روی پنج محور کیفیت رتبهبندی میکنه.
- پچی که با برداشتن وصله آماده از اینترنت قبول شده باشه، صفر میشه و شکست حساب میشه.
- خود مرحله داوری حدود ۱۲.۷ درصد کل هزینه RL مدل Pro رو میگیره.
- فریز کردن router در MoE شرط پایداریه: با آموزش دادنش سهم متخصصهای بیکار از ۰.۵ به ۲۲ درصد رفت.
- نمره average@3 روی DeepSWE v1.1 از ۵۸.۴ به ۷۲.۶ رسید و هزینه RL مدل بزرگ ۲.۶ میلیون دلار بود.




