ایجنتهای کدنویسِ AI، خودشون رباتها رو آموزش میدن
خلاصهٔ کاملتر
مقاله با یه سؤالِ جالب شروع میکنه: اگه به ایجنتهای کدنویسِ AI یه آزمایشگاهِ پر از بازوی رباتیک، کمی منابعِ محاسباتی و یه «بودجهٔ توکنِ دستودلباز» بدی چی میشه؟ جوابش اینه که این ایجنتها میتونن خودشون یه رژیمِ آموزشی پیدا کنن که به رباتها یاد بده کارهایی مثلِ بریدنِ بستِ کابل و حتی جاگذاریِ GPU تو سوکتهای نازکِ مادربورد رو انجام بدن.
این کار با یه چارچوبِ جدید بهاسمِ ENPIRE ممکن شده؛ یه «هارنسِ ایجنتی» که دورِ مدلهای AI پیچیده میشه و بهشون حافظه، زمینه، محدودیت و حلقهٔ بازخورد میده. ENPIRE رو آزمایشگاهِ GEARِ Nvidia با همکاریِ کارنگیملون و دانشگاهِ برکلی ساخته. به گفتهٔ Jim Fan، مدیرِ AI در Nvidia، حالا بخشی از آزمایشگاه شبانه و بیوقفه خودش رو بهتر میکنه و صبح فقط گزارشها رو میخونن.
این هارنس چهار ماژول داره که به ایجنتها اجازه میده ریست و تأییدِ خودکارِ کارها رو انجام بدن، سیاستهای رفتارِ ربات رو پالایش کنن، اونها رو روی چند رباتِ موازی ارزیابی کنن و با خوندنِ لاگها و حتی مقالاتِ پژوهشی، خطاها رو رفع کنن. سه ایجنتِ کدنویسِ مختلف تست شدن: Codex با GPT-5.5، Claude Code با Opus 4.7، و Kimi Code با Kimi K2.6 — که هرکدوم مستقل رویکردهای متفاوتی برای آموزش ساختن.
نتیجهها چشمگیر بودن: ایجنتها روی چند کارِ دستکاری به موفقیتِ حدود ۹۹٪ رسیدن، از جمله کارِ استانداردِ Push-T و جاگذاری و مرتبکردنِ پین. جالبتر اینکه تیمهای بزرگترِ ایجنتها سریعتر بودن؛ مثلاً یه تیمِ ۸ ایجنتی تو ۲ ساعت به ۹۹٪ روی Push-T رسید، در حالی که تیمِ ۴ ایجنتی ۳ ساعت و یه ایجنتِ تنها نزدیکِ ۵ ساعت زمان برد.
ولی محدودیتهایی هم پیدا شد: خیلی وقتها رباتها بیکار میموندن چون ایجنتها مشغولِ خوندنِ لاگ، نوشتنِ کد یا صبر برای مدلِ زبانی بودن؛ تیمهای بزرگتر هم وقتِ بیشتری صرفِ خلاصهکردنِ ایدههای همدیگه میکردن و کمتر از رباتها استفاده میکردن. سرعتِ بیشتر هم به قیمتِ مصرفِ توکنِ بالاتر تموم میشد. تیم میگه قراره همهچی رو متنباز کنه تا هرکسی بتونه آزمایشگاهِ خودگردانِ خودش رو داشته باشه.
نکات کلیدی:
- Nvidia GEAR (با CMU و برکلی) چارچوبِ ENPIRE رو ساخته تا ایجنتهای کدنویسِ AI بهصورتِ خودمختار آموزشِ رباتها رو هدایت کنن.
- روی سه ایجنت (Codex/GPT-5.5، Claude Code/Opus 4.7، Kimi Code/K2.6) تست شد و به موفقیتِ حدود ۹۹٪ رسید؛ تیمهای بزرگترِ ایجنتها سریعتر بودن.
- محدودیتهاش بیکار موندنِ رباتها، سربارِ هماهنگی و مصرفِ بالای توکنه؛ قراره متنباز شه.




