DAPO: سیستم متنباز یادگیری تقویتی از ByteDance و Tsinghua
خلاصهٔ کاملتر
تیم ByteDance Seed و Tsinghua AIR یه سیستم کامل و متنباز برای یادگیری تقویتی (RL) روی مدلهای زبانی بزرگ منتشر کردن. RL یعنی مدل با گرفتن پاداش برای جواب درست، کمکم بهتر میشه. اسم الگوریتمشون DAPO هست، مخفف Decoupled Clip and Dynamic sAmpling Policy Optimization. به گفتهٔ تیم، هدف اینه که RL در مقیاس بزرگ برای همهٔ پژوهشگرها قابل دسترس بشه، نه فقط آزمایشگاههای بزرگ.
نتیجهٔ اصلی روی آزمون ریاضی AIME 2024 هست. مدل پایهٔ Qwen2.5-32B بعد از آموزش با DAPO به ۵۰ امتیاز رسیده و از DeepSeek-R1-Zero-Qwen-32B، که قبلاً بهترین بود، با فقط ۵۰ درصد قدمهای آموزش بهتر عمل کرده. یه نسخهٔ اولیه که دو بخش Token-level PG Loss و Dynamic Sampling رو نداشت، ۴۴ امتیاز گرفته بود؛ یعنی همین دو تکه حدود ۶ امتیاز اضافه کردن.
تیم سه تا شاخص رو موقع آموزش زیر نظر داشته. اول، طول جوابها که یکنواخت بیشتر میشه و به مدل جا میده استدلال پیچیدهتری یاد بگیره. دوم، امتیاز پاداش که باید بدون نوسان شدید بالا بره. سوم، entropy (یعنی میزان تنوع و تصادفی بودن خروجی مدل) که اول کم میشه و بعد کنترلشده بالا میره؛ این تعادل بین امتحان کردن راههای تازه و استفاده از چیزهایی که مدل بلده رو نگه میداره.
همهچیز برای تکرار نتیجه منتشر شده: وزنهای مدل DAPO-Qwen-32B روی Hugging Face، دیتاست آموزشی DAPO-Math-17k که یه مجموعهٔ ریاضی دستچینشدهست، و اسکریپتهای آموزش روی فریمورک verl. برای اجرا و ارزیابی هم از vLLM و Ray Serve استفاده کردن. سوابق کامل آموزش هم روی wandb گذاشته شده، پس میشه مسیر آموزش رو قدم به قدم دید.
نکات کلیدی:
- DAPO روی Qwen2.5-32B تو AIME 2024 امتیاز ۵۰ گرفته
- از DeepSeek-R1-Zero-Qwen-32B با ۵۰ درصد قدمهای آموزش جلو زده
- نسخهٔ بدون Token-level PG Loss و Dynamic Sampling فقط ۴۴ امتیاز داشت
- دیتاست آموزشی DAPO-Math-17k و وزنهای مدل روی Hugging Face منتشر شده
- کد آموزش بر پایهٔ فریمورک متنباز verl نوشته شده




