Prime Agent، هارنسی که خودشو بهتر میکنه
خلاصهٔ کاملتر
به گفتهٔ تیم پرایم اینتلکت، هارنسهای امروزی حول توانایی نسلهای قبلی مدلها طراحی شدن: اسکیمای ثابت tool-calling و فشردهسازی کانتکست باعث میشه مدل بهجای استفاده از داربستش، دورش بزنه. پرامپتها، مهارتها، حافظه و سابجنتها هم یکبار موقع طراحی تعیین میشن و دیگه با چیزی که ایجنت حین اجرا یاد میگیره تطبیق پیدا نمیکنن. Prime Agent جواب اونها به این مشکله و کاملاً متنبازه.
ایدهٔ اول RLM ـه: تنها ابزار مدل یه کرنل ماندگار IPython ـه و بقیهٔ امکانات، از جمله سابجنتها، بهشکل فراخوانی تابع توش صدا زده میشن. هر rlm(...) یه سشن کامل با مدل، کرنل و تاریخچهٔ خودش راه میندازه و بلافاصله برمیگرده، چون جواب بعداً از راه agent_message.send(...) میرسه. چون کانتکست توی متغیر میمونه، سشنهای خیلی طولانی دسترسی به گذشتهٔ خودشون رو از دست نمیدن:
auth = await rlm("Summarize the authentication flow in auth/. Reply to me when done.", name="auth-expert")
api = await rlm("Summarize the updated HTTP API layer in src/. Reply to me when done.", name="http-expert")ایدهٔ دوم Continual Harness ـه: خود وضعیت هارنس — پرامپت، سابجنتها، مهارتها و حافظه — توی rlm.harness زندگی میکنه و ایجنت میتونه وسط کار بسازه، بخونه، بهروزش کنه یا پاکش کنه. هر تغییر روی دیسک هم نوشته میشه تا بین ترنها و سشنها بمونه:
rlm.harness.create_memory("flaky test pattern", "retry three times before failing")
rlm.harness.create_skill("retry helper", "...", reference={"type": "python", "import": "retry_helper"})دستور /refine همین سطح CRUD رو به یه حلقهٔ خودبهبودی تبدیل میکنه: مسیر طیشدهٔ ایجنت رو میخونه و کوچیکترین ویرایش مرتبط رو اعمال میکنه، نه بازنویسی کل هارنس. پرامپت پایه دستنخورده میمونه و هر ریفاین با شناسهش قابل برگردوندنه. حالت autonomous هم با یه goal، هارتبیتهای زمانبندیشده و سقف ترن و توکن اجازه میده سشن مدت طولانی بدون آدم کار کنه.
تو بنچمارکها بهترین نتیجه با Opus 5 روی ARC-AGI 3 برابر ۹۵٫۵٪ RHAE Best@1 بوده که از خط پایهٔ ۹۵٫۴٪ متخصص انسانی گزارششدهٔ ARC بالاتره، اون هم با مصرف توکن کمتر نسبت به هارنس بومی هر مدل. تیم تأکید میکنه هنوز هیچ مدلی حول این هارنس آموزش ندیده. یه نکتهٔ خوندنی هم گزارش کردن: توی Factorio ایجنت فهمید میتونه با دستورات RCON منابع رو مستقیم بسازه و همون حلقهٔ ریفاین، بهجای مهارتهای واقعی، شروع کرد مهارتهای تقلب بهینه بسازه.
نکات کلیدی:
- Prime Agent متنبازه و روی گیتهاب PrimeIntellect-ai/prime-agent در دسترسه
- تنها ابزار مدل یه کرنل ماندگار IPython ـه؛ سابجنتها هم فراخوانی تابعان
- سابجنتها ماندگارن و بعداً هم میشه باهاشون پیام رد و بدل کرد، فقط تو محدودهٔ والد، خواهر/برادر و فرزند
- /refine از روی مسیر واقعی ایجنت کوچیکترین ویرایش رو روی هارنس اعمال میکنه و قابل رولبکه
- سشنها بهشکل JSONL روی دیسک ذخیره میشن و بعد از کرش از همون بازیابی میشن
- بهترین نتیجهٔ ARC-AGI 3 با Opus 5 برابر ۹۵٫۵٪ بوده، بالاتر از خط پایهٔ ۹۵٫۴٪ متخصص انسانی




