Dream-RSI: ایجنتهایی که با «خواب دیدن» جستجوشون رو بهتر میکنن
خلاصهٔ کاملتر
تو این مقاله، Dream-RSI معرفی شده که یه فریمورک برای recursive self-improvement (یعنی ایجنتی که پشت سر هم از نتیجهٔ کار خودش برای بهتر شدن استفاده میکنه) هست. نویسندهها میگن تو این مسیر، پیشرفت به exploration بستگی داره. یعنی اینکه ایجنت چطور بین راهحلهای ممکن بگرده تا راهحلهای باارزش رو پیدا کنه. به گفتهٔ اونا، مدیریت و بهتر کردن همین استراتژی جستجو الان گلوگاه اصلیه.
طبق مقاله، سیستمهای فعلی گیر یه دوراهی افتادن. استراتژی ثابت وقتی فضای جستجو بزرگ میشه دیگه جواب نمیده. از اون طرف، بهینهسازی آنلاین سیاست جستجو یعنی باید تو یه فضای خیلی بزرگ از استراتژیها گشت. فیدبک هم دیر و گرون میرسه، چون هر آزمایش یه اجرای طولانی لازم داره.
راهحل Dream-RSI یه لایهٔ orchestration سبکه (یعنی لایهای که بالای ایجنت میشینه و تصمیم میگیره چی امتحان بشه). این لایه exploration رو صریح و برنامهپذیر میکنه و به خود ایجنت کدنویس دست نمیزنه. نکتهٔ کلیدی نویسندهها اینه که تاریخچهٔ کشفهای قبلی، که به شکل درخت ذخیره شده، میتونه نقش replay simulator رو بازی کنه. یعنی محیطی که میشه تصمیمهای تازه رو روی دادههای قبلی دوباره اجرا کرد.
اسم «dreaming» از همینجا میاد. سیستم استراتژیهای جستجو رو داخل این شبیهساز امتحان میکنه و فیدبک فوری و ارزون off-policy میگیره (یعنی سیاست تازه رو با دادهای که سیاستهای قبلی جمع کردن ارزیابی میکنه). مثل آدمی که تو ذهنش تجربههای قبلی رو مرور میکنه تا دفعهٔ بعد بهتر عمل کنه. بعد سیاست بهترشده دوباره آنلاین اجرا میشه، کشفهای تازه به مجموعهٔ شبیهسازها اضافه میشن و این چرخه ادامه پیدا میکنه.
نویسندهها روش رو روی سه حوزه تست کردن: algorithm engineering، بهینهسازی ریاضی و مهندسی GPU kernel (یعنی نوشتن کدهای سطح پایین و سریع برای کارت گرافیک). طبق مقاله، کیفیت کشفها همسطح یا بهتر بوده و تو چندتا از تنظیمات، هزینهٔ کشف بهشکل قابلتوجهی کم شده. کدش روی GitHub تو مخزن zhengkid/dream-rsi منتشر شده و تو صفحهٔ مقاله، Google بهعنوان سازمان مرتبط اومده.
نکات کلیدی:
- سیاست جستجو داخل یه replay simulator که از درختهای کشف قبلی ساخته شده اصلاح میشه
- به خود ایجنت کدنویس دست نمیزنه و فقط یه لایهٔ orchestration بالاش اضافه میکنه
- فیدبک off-policy فوری و ارزون، جای ارزیابیهای آنلاین تکراری و گرون رو میگیره
- روی algorithm engineering، بهینهسازی ریاضی و مهندسی GPU kernel تست شده
- کد پروژه تو مخزن zhengkid/dream-rsi روی GitHub در دسترسه




