AIDE² و اولین شواهد تجربی خودبهبودی بازگشتی
خلاصهٔ کاملتر
ژنگیائو جیانگ تو یه ترد، از چیزی رونمایی کرده که به گفتهٔ خودش اولین شواهد تجربی خودبهبودی بازگشتی (RSI) ـه: یه عامل اتورسرچ که هشت روز روی خود عامل اتورسرچ تحقیق کرده. ادعاش اینه که خروجی این هشت روز، روی بنچمارکهای کنارگذاشتهشده از هارنسی که تیم دو سال دستی تنظیمش کرده بود، جلو میزنه.
معماری AIDE² دو حلقه داره. حلقهٔ درونی مثل هر عامل اتورسرچ معمولی کار میکنه و کد رو در برابر یه eval بهینه میکنه. حلقهٔ بیرونی یه پله بالاتره: کد هارنس خودِ عامل حلقهٔ درونی رو بهینه میکنه، اون هم بر اساس میانگین امتیاز حلقهٔ درونی روی بنچمارکهای مختلف. یعنی سیستم داره ابزار تحقیق خودشو بازطراحی میکنه.
به گفتهٔ نویسنده، بعد از ۱۰۰ تکرار حلقهٔ بیرونی هفت بهبود نسبت به خط پایه کشف کرده؛ از جمله یه سیاست جستوجوی (search policy) جدید، یه سیستم حافظه که پرامپت رو حدود ۱۶ برابر فشرده میکنه، و یه دفاع لایهای در برابر ریوارد هکینگ.
مهمتر از خود بهبودها، تعمیمپذیریشونه. عاملهای کشفشده روی بنچمارکهایی تست شدن که حلقهٔ بیرونی هیچوقت ندیده بودشون و طبق ترد، روی هر سه از عامل دستیتنظیمشده بهتر عمل کردن. دوتاشون داخل همون خانوادهٔ تسکهای آموزشی بودن و دورترینشون کاملاً بیرون از اون فضا قرار داشت: بهبود یه مدل هواشناسی مبتنی بر فیزیک.
یه پدیدهٔ نوظهور هم دیده شده: حلقهٔ بیرونی با ترکیبی از پرامپتینگ و چکهای قاعدهمحور، نرخ ریوارد هکینگ عامل درونی رو پایین آورده. این مورد روی تسکهای خارج از توزیع (OOD) مهندسی کرنل GPU سنجیده شده که دقیقاً از ریوارد هکینگ رنج میبردن.
نویسنده جای این نتیجه رو هم روی «نردبان RSI» خودشون مشخص میکنه: AIDE² سطح ۱ ـه، یعنی بازدهی خودبهبودیش از تحقیق و توسعهٔ دستی با ابزارهای عمومی AI فراتر رفته. سطح ۲ — اینکه عامل درونی بهبودیافته، حلقهٔ بیرونی بهتری هم بسازه — تست شده ولی نتایجش مبهمه و تیم صراحتاً میگه ادعای «اشتعال» (ignition) نداره.
جزئیات بیشتر تو پست وبلاگ Weco اومده: تفکیک الگوریتمهای کشفشده، ایدههایی که AIDE² امتحان کرد و کنار گذاشت (که به گفتهٔ نویسنده سهم قابلتوجهی از ادبیات جستوجو رو پوشش میدن) و حتی کد مردهای که سیستم تحویل داده. این پروژه نزدیک یک سال طول کشیده و با منابع نسبتاً کمی جلو رفته.
نکات کلیدی:
- AIDE² دو حلقه داره؛ حلقهٔ بیرونی کد هارنس عامل درونی رو بهینه میکنه
- ۱۰۰ تکرار، ۷ بهبود: سیاست جستوجوی جدید، حافظهٔ فشردهساز ۱۶ برابری، دفاع لایهای مقابل ریوارد هکینگ
- روی هر سه بنچمارک دیدهنشده از هارنس دو سال دستیتنظیمشده بهتر بوده
- دورترین تسک، بهبود یه مدل هواشناسی مبتنی بر فیزیک بوده
- نرخ ریوارد هکینگ روی تسکهای OOD کرنل GPU کاهش پیدا کرده
- تیم AIDE² رو سطح ۱ میدونه و ادعای ignition نمیکنه




