Never Give Up: راهی که RL سراغ مسئلههای سخت هم بره
خلاصهٔ کاملتر
Michael Noukhovitch تو این پست مقالهی جدیدش دربارهی post-training مدلهای زبانی با RL (یادگیری تقویتی، یعنی مدل با پاداش گرفتن برای جواب درست بهتر میشه) رو توضیح میده. سؤال شروع سادهست: وقتی نمودار eval بالا میره، دقیقاً چی بهتر شده؟ تیم ۳۰ سؤال AIME رو تو آموزش Olmo 3.1 RL-Zero Math به سه دستهی آسون، متوسط و سخت تقسیم کرد. سخت یعنی سؤالی که مدل اولیه تو ۳۲ تلاش (pass@32) هیچوقت حلش نکرده بود.
نتیجه این بود که بیشتر پیشرفت از سؤالهای آسونی میاد که از نیمهحلشده به تقریباً حلشده رسیدن، و سؤالهای سخت تقریباً تکون نخوردن. همین الگو تو RL برای کد (DeepCoder) و agentها (DeepSWE) هم دیده شد. نویسندهها اسمش رو Matthew Effect گذاشتن: RL کارایی مدل رو به نسبت توانایی اولیهش بهتر میکنه. یعنی کار آسون آسونتر میشه و کار سخت سخت میمونه.
شاید فکر کنی مشکل از GRPO باشه، الگوریتمی که برای هر سؤال k جواب میگیره و اونا رو با هم مقایسه میکنه. اگه هیچکدوم درست نباشه، سیگنالی برای یادگیری نیست، پس k بزرگتر باید کمک کنه. ولی آزمایش روی Qwen 2.5 0.5B و GSM8k نشون داد k=4 از ۸، ۱۶ و ۳۲ بهتره.
دلیلش اینه که سؤالهایی که همهی جوابهاشون درسته فیلتر میشن. با k=4 یه سؤال آسون راحت چهار از چهار میگیره و کنار میره، ولی با k=32 احتمال یه جواب غلط اتفاقی زیاده و سؤال آسون تو batch میمونه. به گفتهی نویسنده، مشکل فقط کم نمونه گرفتن از سؤال سخت نیست، هدر دادن compute روی سؤال آسونه.
روش پیشنهادیشون Never Give Up (NGU) سادهست: با k کوچیک شروع کن. اگه همهی جوابها غلط بود، با احتمال p تسلیم نشو و سؤال رو برگردون تا k جواب دیگه بگیره. وقتی بالاخره حل شد، روی همهی جوابها آموزش بده. اینطوری سؤال آسون زود فیلتر میشه و compute آزادشده تو ساختار async RL خرج سؤال سخت میشه. روی GSM8k، k=4 با p=0.9 از همهی حالتهای GRPO معمولی بهتر بود.
تو مقیاس بزرگتر، روی Qwen 3 4B با DeepScaler، NGU بالای یه baseline قوی با k=16 نتیجه رو بهتر کرد، مخصوصاً روی سختترین سؤالهای AIME و BRUMO 2025. تو بنچمارک کدنویسی Manufactoria هم NGU فقط جوابهایی رو قبول میکنه که تستهای بیشتری پاس کنن و جایی که GRPO گیر میکنه، مدل رو جلو میبره. محدودیتش اینه که اگه بیشتر داده خیلی سخت باشه، احتمالاً کمکی نمیکنه.
نکات کلیدی:
- سؤالهای سخت AIME (با pass@32 صفر در مدل اولیه) تو آموزش RL تقریباً بهتر نشدن.
- روی GSM8k، GRPO با k=4 از k=32 بهتر بود، چون compute کمتری روی سؤال آسون هدر میده.
- NGU با k=4 و p=0.9 از همهی تنظیمات GRPO معمولی روی GSM8k بهتر عمل کرد.
- برای جوابهای کهنه (stale)، آستانهی عمر T=4 بهترین نتیجه رو داد.
- آزمایشها نشون داد Matthew Effect از مشکل plasticity شبکه نمیاد و مدل میتونه از گیر کردن دربیاد.




