مدلهای زبانی بازگشتی کوچک، نتایج بزرگ
خلاصهٔ کاملتر
مدل زبانی بازگشتی (RLM) چیه؟ در این معماری، یک مدل زبانی میتونه در یک محیط برنامهنویسی (اینجا یک Python REPL) کد بنویسه، اون رو اجرا کنه، نتیجه رو بخونه و در صورت نیاز نسخههای فرزند از خودش رو با پرامپتهای متفاوت فراخوانی کنه. این معماری برای مسائلی که زمینه (context) بلند یا قابل موازیسازی دارن خیلی قدرتمنده — چون مدل میتونه وظیفه رو تقسیم کنه، هر بخش رو به یه «فرزند» بده و نتایج رو جمعبندی کنه.
تیم NovaSky بهجای اینکه دو مدل جداگانه برای نقش «مدر» و «فرزند» آموزش بده، یک مدل ۴ میلیارد پارامتری رو با یادگیری تقویتی (RL) روی هر دو نقش همزمان فاینتیون کرده. در فرایند آموزش، رولاوتهای مدل فرزند از مزیت (advantage) مدل مادری که اونها رو اسپاون کرده ارث میبرن. این طراحی ساده یه مشکل بزرگ رو حل میکنه: دیگه نیازی به سیگنال پاداش جداگانه برای هر مسیر اجرای فرزند نیست.
محیط REPL چند تابع توکار به مدل میده. مهمترینهاشون اینان:
rlm_query(prompt, context=None)— یک RLM فرزند رو با پرامپت مشخص اجرا میکنه و جواب نهاییاش رو برمیگردونه.rlm_query_batched(prompts, context_list=None)— همون کار رو برای چند پرامپت موازی انجام میده.FINAL(answer)/FINAL_VAR(variable_name)— پایان رولاوت رو علامتگذاری میکنه.
تسک انتخابشده برای ارزیابی، evidence selection از مقالات علمی هست: به مدل یه سوال و چند مقاله arXiv داده میشه و باید اسنیپتهای متنی مرتبط رو از اون مقالات پیدا کنه. زمینه کامل تمام مقالات داخل REPL ذخیرهست و مدل میتونه با توابعی مثل search و extract_section روش عملیات برنامهنویسی انجام بده. مدل مادر میتونه کاغذهای مرتبط رو شناسایی کنه و بهصورت موازی به مدلهای فرزند بفرسته تا هر کدوم یه مقاله رو بررسی کنن.
یه نکته مهم درباره داده: مجموعه داده آموزشی بهصورت سینتتیک تولید شده. ابتدا یه مقاله تصادفی از alphaXiv انتخاب میشه، تا ۹ مقاله مشابه ازنظر معنایی بهش اضافه میشن، یه مدل OCR متن مقالات رو به پاراگراف تبدیل میکنه، و یه مدل مرزی سوالها و شواهد مربوطه رو تولید میکنه. نکته جالب: در زمان تست، مدل متن نویزی از یه PDF parser معمولی میبینه — نه OCR دقیق — تا شرایط واقعیتر شبیهسازی بشه.
نتیجه تجربی قابل توجهه: مدل ۴B فاینتیونشده با RL روی همین تسک بهاندازه Claude Sonnet 4.6 با همون هارنس RLM و محیط REPL عمل میکنه. این یعنی یه مدل کوچیک با آموزش هدفمند میتونه رفتار RLM رو یاد بگیره — رفتاری که از طریق پرامپتنویسی یا حتی SFT ساده نمیشه ازش کشید.
نکات کلیدی:
- RLMها مدلهایی هستن که میتونن خودشون رو بازگشتی فراخوانی کنن و وظایف رو موازیسازی کنن
- یک پالیسی RL مشترک هم نقش مدل مادر و هم فرزند رو بازی میکنه
- مدل فرزند از advantage مدل مادر ارث میبره — نیازی به پاداش جداگانه نیست
- مدل ۴B فاینتیونشده در تسک evidence selection همسطح Claude Sonnet 4.6 عمل میکنه
- کد آموزش و محیط در مخزن SkyRL بهصورت عمومی منتشر شده




