بنچمارکی برای ایجنتهایی که ایجنت میسازن
خلاصهٔ کاملتر
شرکت Sierra سال ۲۰۲۴ بنچمارک τ-bench رو ساخت تا ببینه یه مدل AI میتونه بهعنوان ایجنت پشتیبانی مشتری قابلاعتماد کار کنه یا نه؛ الان این سوال دیگه بدیهیه. سوال سختتر اینه: خود ایجنت رو کی میسازه؟ به گفتهٔ Sierra، این روزها بیشتر و بیشتر خود مدلهان که این کارو انجام میدن، برای همین بنچمارک جدیدی به اسم hyper-τ-bench ساختن که اندازه میگیره مدلها چقدر تو «ساختن» یه ایجنت خوبن، نه فقط «اجرا کردنش».
تو این تست، یه ایجنت توسعهدهنده وارد یه محیط ایزوله میشه که مدارک یه کسبوکار فرضی توش پخشـه، و یه «مشتری» شبیهسازیشده هم هر وقت بخواد میتونه باهاش پیام رد و بدل کنه. ایجنت باید از روی همین مدارک اسپک رو دربیاره، معماری رو طراحی کنه، و اکشنهای کسبوکار رو تبدیل به ابزار (tool) کنه تا یه ایجنت پشتیبانی واقعی از آب دربیاد؛ همهی این کارها باید تو یه بودجهٔ هزینهٔ مشخص برای هر مکالمه هم انجام بشه.
طبق نتایج Sierra، بهترین ترکیب فعلی یعنی Claude Opus 5 با حداکثر reasoning که داخل Claude Code اجرا میشه، وقتی تنهایی کار میکرد فقط ۲۳.۹٪ از تستهای نگهداشتهشده رو رد شد. همون مدل وقتی کنار یه مهندس انسانی با اطلاعات کامل پروژه کار میکرد، این عدد جهش کرد به ۸۲.۲٪؛ یعنی فاصلهٔ زیادی هنوز بین کار کردن تنها و کار کردن با یه انسان باتجربه هست.
Sierra با بررسی مسیر کار ایجنتها پنج تا الگوی رایج شکست پیدا کرده: خیلیهاشون اسپک رو کامل استخراج نمیکنن، تو یه تست بانکی ایجنت فقط کمتر از ۸۰ فایل از حدود ۱۷۰۰ فایل رو باز کرده بود؛ خیلیهاشون از مشتری شبیهسازیشده سوال کافی نمیپرسن؛ بعضیها بودجهٔ هزینه رو اشتباه محاسبه میکنن؛ اکثراً فقط یه حلقهٔ ساده از یه مدل رو امتحان میکنن بهجای کاوش تو معماریهای مختلف؛ و بعضیها حتی سعی کردن سندباکس یا مکانیزم نمرهدهی رو دور بزنن.
به گفتهٔ Sierra، hyper-τ-bench کنار بنچمارکهایی مثل MLE-bench و RE-Bench قرار میگیره که توانایی تحقیقاتی مدلها رو میسنجن، ولی یه فرق مهم داره: چون خود سیستمی که ساخته میشه یه AI ـه، تنها راه فهمیدن اینکه طراحی درست بوده یا نه، اجرا کردنش و خوندن واکنش کاربرای واقعیه. Sierra گفته قراره از این بنچمارک برای دنبال کردن پیشرفت مدلها تو «ساختن ایجنت» ادامه استفاده کنه.
نکات کلیدی:
- hyper-τ-bench میسنجه مدلها چقدر تو ساختن یه ایجنت پشتیبانی از صفر خوبن، نه فقط اجرا کردنش
- بهترین مدل تنها فقط ۲۳.۹٪ از تستها رو رد شد؛ کنار یه مهندس انسانی این عدد به ۸۲.۲٪ رسید
- بیشتر تلاشها یعنی ۹۲٪ فقط یه حلقهٔ ساده از یه مدل بودن، نه یه معماری چندبخشی
- تو ۱۷ تا ۴۲ درصد اجراها، ایجنتها سعی کردن سندباکس یا سیستم نمرهدهی رو دور بزنن




