راهنمای Mercor برای آموزش RL یه مدل ۳۹۷ میلیاردی
خلاصهٔ کاملتر
Mercor و تیم SkyRL تو سومین پست از سری مقالاتشون، کل مسیر پستترینینگ (یعنی آموزش تکمیلی روی یه مدل ازپیشآموزشدیده) مدل باز Qwen3.5-397B-A17B با یادگیری تقویتی رو باز کردن. به گفتهٔ نویسندهها این بار برخلاف دفعات قبل از استک اختصاصی خودشون استفاده نکردن و همهچیز روی SkyRL عمومی اجرا شده. اسکریپت آموزش، وزنهای مدل و ترِیسهای ارزیابی هم کامل منتشر شده.
بنچمارک کار APEX-Agents هست: ۴۸۰ تسک واقعی از جنس کارهای دانشی که هر کدوم توی یه «دنیا»ی شبیهسازیشده با دهها PDF و اکسل و اسلاید و سرور چت و ایمیل اجرا میشن. دیتاست آموزش هم ۱۹۲۸ تسک جداگونه تو مشاورهٔ مدیریت، بانکداری سرمایهگذاری و حقوق شرکتی بوده. مدل ۳۹۷ میلیاردی Pass@1 خودش رو از ۱۶.۱۱٪ به ۲۷.۲۹٪ رسونده، یعنی حدود ۷۰ درصد رشد نسبی.
به گفتهٔ نویسندهها سه مرحلهٔ اول اصلاً آموزش نیست، ریسکزداییه. اول باید محیط و هارنس (همون حلقهای که ابزارها رو به مدل وصل میکنه) درست بشه: روی هر چیزی تایماوت بذار، هر ارور رو دستهبندی کن و هر حلقهٔ ایجنت رو تو پروسهٔ جدای خودش اجرا کن. فقط با رفع باگهای هارنس، مدل ۳۵ میلیاردی بدون هیچ آموزشی از ۲۲.۷۴٪ به ۲۸.۶۹٪ رسید، یعنی تقریباً اندازهٔ یه دور کامل آموزش.
دو تا نکتهٔ فنی هم برجستهست. یکی TITO یعنی توکنشماری دقیق بین موتور اینفرنس و ترینر؛ اگه خروجی متنی موتور دوباره توکنایز بشه توکنها فرق میکنن و آموزش بیسروصدا off-policy میشه، برای همین هارنس رو روی /completions بازنویسی کردن. دوم، عوض کردن میانگینگیری لاس از token_mean به prompt_mean تنهایی ۳.۹ امتیاز آورد و یه تلنگر کانتکست موقع ته کشیدن بودجه هم ۳ امتیاز.
جمعبندی نویسندهها دو تاست. اول اینکه انتخاب الگوریتم خیلی کمتر از داده اثر داشته: بهترین گزینهٔ الگوریتمی ۳.۹ امتیاز داد ولی خود پستترینینگ هر دو مدل رو ۱۰ تا ۱۲ امتیاز جابهجا کرد. دوم اینکه دستاورد به هارنس نمیچسبه؛ وقتی هارنس MCP رو با OpenCode عوض کردن بیشتر بهبود سرجاش موند و مدل کوچیکتر حتی بهتر منتقل شد، چون یاد گرفته بود بیشتر از اجرای کد استفاده کنه تا از سرورهای MCP.
نکات کلیدی:
-
مدل Qwen3.5-397B-A17B بعد از پستترینینگ، Pass@1 رو از ۱۶.۱۱٪ به ۲۷.۲۹٪ رسوند.
-
دیتاست آموزش ۱۹۲۸ تسک تخصصی بود و هیچ همپوشانی با ۴۸۰ تسک بنچمارک نداشت.
-
فقط اصلاح باگهای هارنس، مدل ۳۵ میلیاردی رو از ۲۲.۷۴٪ به ۲۸.۶۹٪ رسوند.
-
تغییر میانگینگیری لاس به prompt_mean سه و نه دهم امتیاز و تلنگر کانتکست سه امتیاز اضافه کرد.
-
همزمانی رولاوت با سقف KV cache تعیین شد: ۵۵۰ برای مدل ۳۵ میلیاردی و ۳۰۰ برای ۳۹۷ میلیاردی.
-
اسکریپت آموزش، وزنها و ترِیسها روی GitHub و Hugging Face منتشر شدن.




