SAO: آموزش پایدارتر عاملهای هوش مصنوعی با یادگیری تقویتی
خلاصهٔ کاملتر
این مقاله (یه مقالهٔ پژوهشی تو arXiv) روشی به اسم Single-rollout Asynchronous Optimization یا همون SAO رو معرفی میکنه که برای آموزش پایدارترِ عاملهای هوش مصنوعی با یادگیری تقویتی (RL) طراحی شده. به گفتهٔ نویسندهها، یادگیری تقویتی داره برای مرحلهٔ post-training مدلهای زبانی بزرگ مهمتر میشه، ولی خطلولههای قدیمی که همگام (synchronous) و دستهای بودن، برای کارهای عاملیِ طولانی کند و ناکارآمدن.
راهحل جدیدتر، RL ناهمگام (asynchronous) هست که مدل رو بهمحض رسیدن هر rollout بهروز میکنه و سریعتره. ولی نویسندهها میگن سیستمهای ناهمگام فعلی بیشتر رو throughput تمرکز دارن و پایداری آموزش و اثربخشی روی خود کار رو کم بررسی کردن. یه مشکل کلیدی اینه که نمونهگیری گروهی (group-wise) تو فریمورک پرکاربرد GRPO با آموزش عاملیِ ناهمگام جور در نمیاد.
ایدهٔ اصلی SAO اینه که بهجای نمونهگیری گروهی، از نمونهگیری تکrollout استفاده کنه؛ یعنی برای هر prompt فقط یه rollout. به گفتهٔ نویسندهها این کار اثر off-policy رو کم میکنه و تعمیمپذیری رو بهتر میکنه، و اونها این استراتژی رو با طراحیهای عملیِ آموزش مدل ارزش (value-model) تقویت کردن.
برای پایداری بیشتر هم یه استراتژی برش (clipping) سختگیرانهٔ دوطرفه در سطح توکن معرفی کردن. نتیجه اینه که SAO میتونه هزار گام پایدار آموزش ببینه و بهطور مداوم از GRPO و نسخههاش روی بنچمارکهای کدنویسی و استدلال عاملی مثل SWE-Bench Verified، BeyondAIME و IMOAnswerBench بهتر عمل کنه.
نویسندهها نشون میدن که RL تکrollout مخصوصاً تو یه حالت یادگیری آنلاینِ شبیهسازیشده مؤثره؛ جایی که مدل باید با محیطهای در حال تغییر وفق پیدا کنه. همچنین SAO با موفقیت تو خطلولهٔ آموزش عاملیِ مدل باز GLM-5.2 (با ابعاد 750B-A40B) بهکار گرفته شده، که نشون میده این روش تو مقیاس واقعی هم جواب داده.
نکات کلیدی:
- SAO مشکل ناپایداری و off-policy رو تو یادگیری تقویتیِ ناهمگام هدف گرفته
- بهجای نمونهگیری گروهیِ GRPO، برای هر prompt فقط یه rollout میگیره
- یه برش دوطرفهٔ سطحتوکن آموزش رو تا هزار گام پایدار نگه میداره
- روی SWE-Bench Verified، BeyondAIME و IMOAnswerBench از GRPO بهتره
- تو آموزش مدل باز GLM-5.2 (750B-A40B) بهکار رفته




