RRSI؛ خودبهبودی ایجنت بدون تقلب روی بنچمارک
خلاصهٔ کاملتر
این مقاله سراغ یه مشکل شناختهشده میره: هارنس ایجنت (یعنی همون لایهٔ ابزار و پرامپت و حلقهای که دور مدل پیچیده میشه) وقتی خودش رو تکامل میده، بیشتر یاد میگیره همون بنچمارکی که باهاش سنجیده میشه رو بهتر بزنه. به گفتهٔ نویسندهها، دو تا از روشهای قبلی حتی پایینتر از هارنس دستنخوردهٔ اولیه (H0) تموم کردن.
ایدهٔ RRSI اینه که بهجای بستن دست هارنس، حلقهای که ویرایشش میکنه رو مهار کنه. سمت پیشنهاد سه قاعده داره: بودجهٔ ویرایش دور به دور کمتر میشه، یعنی دورهای اول میتونن چند تغییر هماهنگ رو با هم امتحان کنن ولی دورهای آخر فقط یه تغییر قابلردیابی میگیرن. هر کاندیدا هم با فرضیه، دیف، امتیاز و تغییر هزینهش لاگ میشه تا چیزی که یه بار شکست خورده دوباره تست نشه.
قاعدهٔ سوم اینه که وقتی پیشرفت توی باند نویز گیر میکنه، بودجه میره سمت بخشهایی از هارنس که تا حالا اصلاً دست نخوردن. یعنی بهجای ور رفتن با همون یکی دو جای همیشگی، جستوجو پخش میشه.
سمت انتخاب سختگیرتره. اول یه منتقد نشتی (leakage critic) هست که قبل از اینکه کاندیدا اصلاً امتیاز بگیره، هر چیزی رو که اسم تسک یا موجودیت یا جواب یا منطق مخصوص بنچمارک توش باشه رد میکنه. بعدش یه کف نویز هست: هر بهبودی باید از واریانسی که روی هارنس پایه اندازه گرفته شده بزنه بالاتر. یه قاعدهٔ هزینه هم میگه توکن اضافه باید با بهبود واقعی پولش رو دربیاره، و هر جزئی که دیگه بهدردنخور شده برای حذف علامت میخوره.
توی آزمایشها روی یه سوییت از هر دامنه تکامل انجام شده و بعد همون هارنس بدون تغییر همهجای دیگه اجرا شده، با همون ابزار و داور و تعداد تلاش H0 و با پالیسی Claude Opus 4.8. همهٔ بنچمارکهای کنارگذاشته بهتر شدن و اختلاف با میانگین روشهای قبلی تا ۲۲.۹٪ رسیده. جالبتر اینکه RRSI سبکترین هارنس تکاملیافته هم هست، چون قاعدهٔ هزینه جلوی رشد بیدلیل رو موقع پیشنهاد میگیره و هرس، چیزی که دیگه نمیارزه رو برمیداره.
نکات کلیدی:
- RRSI بهجای خود هارنس، حلقهٔ جستوجو رو رگولاریزه میکنه و همهٔ اجزای هارنس قابلویرایش میمونن
- روی بنچمارکهای کنارگذاشته تا ۲۲.۹٪ بالاتر از میانگین روشهای قبلی
- منتقد نشتی (leakage critic)، اسم تسک و جواب و منطق مخصوص بنچمارک رو قبل از امتیازدهی رد میکنه
- هر بهبود باید از کف نویزِ هارنس پایه بزنه بالاتر تا ثبت بشه
- آزمایشها با پالیسی Claude Opus 4.8 انجام شده و مقاله با شناسهٔ arXiv 2609.24972 منتشر شده




