SpyRL؛ خودآموزی مدلها با بازی «جاسوس کیه؟»
خلاصهٔ کاملتر
این پروژه که به COLM 2026 پذیرفته شده، روشی به اسم RLSVR رو معرفی میکنه: یادگیری تقویتی با پاداش خودراستیآزما. به گفتهٔ نویسندهها ایده از یادگیری خودنظارتی وام گرفته شده؛ همونطور که اونجا یه تسک ساختگی از دل خود داده ساخته میشه تا سیگنال آموزش دربیاد، اینجا هم یه کار باز به یه محیط پروکسی تبدیل میشه که قوانین داخلیش خودشون پاداش تولید میکنن.
پیادهسازیش SpyRL هست، یه محیط خودبازی چندعاملی با الهام از بازی «جاسوس کیه؟». چند مدل همزمان یه کار مشترک انجام میدن، ولی یکیشون که نقش جاسوس رو داره ورودی ناقص میگیره: تو خلاصهنویسی و داستاننویسی ۲۰ درصد و تو ریاضی ۴۰ درصد از متن ورودی ماسک میشه. بعد همه رأی میدن که کدوم بازیکن جاسوسه و جواب رو داخل \boxed{...} مینویسن تا پارسر پاداش بخوندش.
دو تا پاداش تو کارن. پاداش تشخیص کاملاً تأییدپذیره، چون خود محیط از اول میدونه جاسوس کیه و فقط کافیه رأی رو با اون تطبیق بده. پاداش اجرا هم مجموعصفره و فقط از شمارش رأیها درمیاد: جاسوس و شهروندها مستقیم مقابل هم قرار میگیرن و هر شهروندی که بیشتر از بقیه مظنون بشه جریمه میشه. چون توزیع پاداش این دو نقش با هم قابل مقایسه نیست، یه خط پایهٔ EMA جدا برای هر نقش کم میشه.
نویسندهها همین رو مزیت اصلی نسبت به روشهای قبلی مثل R-Zero و Absolute Zero میدونن: اونها حلقهٔ پیشنهاددهنده-حلکنندهن و به یه سیگنال تأییدپذیر از سمت حلکننده نیاز دارن، ولی اینجا پاداش از خود قوانین بازی درمیاد. رأی جمعی هم بهجای قضاوت تکنقطهای میشینه، پس اشتباه یه داور تو رأی بقیه گم میشه. دادهٔ لازم هم فقط سند خامه، بدون برچسب و بدون جفت ترجیحی؛ عوضکردن دامنه یعنی عوضکردن پیکره.
تو نتایج، SpyRL روی Qwen3-8B نرخ برد A/B برابر ۷۵.۴ درصد تو خلاصهنویسی و ۷۷.۳ درصد تو داستاننویسی گرفته، و روی استدلال ریاضی هم Qwen3-4B و 8B رو بهترتیب ۸.۹۷ و ۶.۱۶ درصد تو هفت بنچمارک بهتر کرده؛ درحالیکه دو روش رقیب رو کارهای باز تقریباً بیاثر بودن. یه مشاهدهٔ جالب هم اینه که تو صد بازی، بازیکنهایی که رأی مشکوک بیشتری گرفتن، از نظر GPT-4o هم کیفیت پایینتری داشتن.
نکات کلیدی:
- RLSVR کار باز رو به محیطی تبدیل میکنه که خودش پاداش تأییدپذیر میسازه
- SpyRL همون ایده رو با بازی «جاسوس کیه؟» و اطلاعات نامتقارن پیاده کرده
- پاداش تشخیص از هویت از پیش معلوم جاسوس و پاداش اجرا از شمارش رأیها درمیاد
- روی Qwen3-8B نرخ برد ۷۵.۴ و ۷۷.۳ درصد و روی ریاضی تا ۸.۹۷ درصد بهبود
- کد روی verl سواره، چکپوینتها روی Hugging Face هستن و آموزش یه نود ۸ کارتی میخواد




