چرا ایجنتهای هوش مصنوعی هنوز شکست میخورن
خلاصهٔ کاملتر
جرمی تیان تو مقالهای دادهمحور سراغ این سؤال رفته که چرا با وجود پیشبینی ۴۵۰ میلیارد دلار ارزش اقتصادی برای ایجنتهای AI تا ۲۰۲۸، استقرار واقعیشون هنوز تکرقمیه. به نوشتهٔ او ایجنتهای کدنویسی استثنان و از حالت تکمیل خودکار عبور کردن، ولی بقیه عقب موندن؛ پژوهش مشترک استنفورد و برکلی و IBM هم نشون داده ۶۸ درصد ایجنتهای مستقرشده بیشتر از ۱۰ قدم بدون دخالت آدم دووم نمیارن.
اولین دلیل واریانسه. اگه احتمال موفقیت هر قدم ۹۰ درصد باشه، یه فرایند ۱۰ قدمی فقط ۳۴ درصد مواقع کامل جواب میده و ۳۰ قدمی میرسه به ۴.۲ درصد. واریانس بین اجراهای مختلف هم هست: تو دامنهٔ بانکی بنچمارک τ³، بهترین مدل با pass^1 برابر ۲۵.۵۲ درصد، تو pass^4 افتاد به ۱۳.۴ درصد. نویسنده pass@k رو سقف توانایی و pass^k رو کف قابلاتکا تو پروداکشن میدونه؛ برای gpt-4o این دوتا حدود ۹۵ و ۳۰ درصدن.
دومین دلیل خود دیتاسته. حتی τ-bench که استاندارد صنعته، موقع بازنویسی به نسخهٔ τ³ باید ۵۳ تا از ۱۶۴ وظیفهش (بیشتر از ۳۰ درصد) اصلاح میشد و WebArena هم بعد از تعمیر، ۱۱ درصد از منفیهای کاذبش کم شد. به گفتهٔ نویسنده حتی اگه دیتاست خودت رو از دادههای واقعی بسازی، بعد از انتشار کهنه میشه و انتخاب اینکه چه ردپاهایی واردش بشن خودش یه مسئلهٔ سخته.
سومین دلیل اینه که خطاها از بین نرفتن، فقط جاشون عوض شده. تو تحلیل ۲۰۲۴ بیشتر خطاها مکانیکی بودن، مثل صدا زدن ابزار درست با آرگومان غلط. اما تو بررسی تازه روی مدلهای نسل جدید، ۲۷ تا ۷۸ درصد از «موفقیتها» دستکم یه تخطی داشتن: نقل قیمت اشتباه، ساختن سیاستی که وجود نداره، یا ادعای انجام کاری که اصلاً انجام نشده. این خطاها چون تست رو پاس میکنن، بیسروصدا به پروداکشن میرسن.
آخرین و به نظر نویسنده «ابدیترین» مشکل، همراستایی با ترجیح آدمهاست. مثالش قرار ملاقاته: میگی یه بازهٔ ۳۰ دقیقهای بعد از ۱۰ صبح پیدا کن، ولی نگفتی وسط وقت ناهار نباشه یا نیمساعت قبل جلسهٔ مهم رو اشغال نکنه. نویسنده معتقده مدل بهتر این شکاف رو پر نمیکنه، چون هیچ مدلی نمیتونه ترجیحی رو بخونه که اصلاً بیان نشده.
نکات کلیدی:
- ۶۸ درصد ایجنتهای مستقرشده قبل از ۱۰ قدم به دخالت آدم نیاز دارن
- با دقت ۹۰ درصد در هر قدم، یه فرایند ۳۰ قدمی فقط ۴.۲ درصد مواقع کامل جواب میده
- کف قابلاتکا pass^k هست نه pass@k؛ برای gpt-4o فاصلهٔ این دو از ۹۵ به ۳۰ درصد میرسه
- بیشتر از ۳۰ درصد وظیفههای τ-bench اصلی موقع بازنگری نیاز به اصلاح داشت
- خطاهای تازه از جنس وفاداری به سیاست و دادهان و چون تست رو پاس میکنن، دیرتر لو میرن
- ناهمراستایی با ترجیحهای بیاننشده با مدل بهتر حل نمیشه




