ارزیابی ایجنتهای AI: از تکتماس تا تمومشدن کار
خلاصهٔ کاملتر
تو این مقاله از بلاگ انویدیا اومده که وقتی یه ایجنت AI رو راه میندازی و میره دست کاربر واقعی، سؤال اصلی این نیست که جوابش قشنگه یا نه. سؤال اینه که میتونه یه زنجیره از دهها tool call (یعنی صدا زدن ابزارهای بیرونی مثل دیتابیس یا API) رو روی یه محیط زنده اجرا کنه و وقتی یه قدم خراب شد خودشو جمع کنه یا نه. به گفته نویسنده، نمره دادن به متن خروجی تقریباً هیچی درباره تموم شدن کار بهت نمیگه.
بنچمارکهای قدیمی برای کارهای ثابت ساخته شده بودن. بعد BFCL یا همون لیدربورد function calling دانشگاه برکلی اومد که انتخاب تابع و درستی آرگومانها رو میسنجه، ولی فقط تکتک تماسها رو نگاه میکنه. یه فراخوانی کاملاً درستِ issue_refund هم اگه چکها و آپدیتهای زیرش انجام نشده باشن باز هم شکستخوردهست. پس دقت تماس لازمه، ولی کافی نیست.
چیزی که مقاله معرفی میکنه یه محیط اجرای کامله: هر tool call رو واقعاً اجرا میکنه، وضعیت رو بین قدمها نگه میداره و آخرش دنیا رو میخونه تا ببینه کار انجام شد یا نه. رو این محیط دو لایه نمره سواره. نمره step-level میگه این تماس تو اون لحظه معتبر و مفید بود یا نه، و نمره end-to-end مسیر رو بیخیال میشه و فقط وضعیت نهایی رو چک میکنه. هر دوتاش از یه چیز خونده میشه: trace، یعنی لاگ مرتب یه تلاش.
نویسنده تأکید میکنه سلسلهمراتب هر اجرا ثابته و باید به ترتیب جمع بشه، نه اینکه میانگین قدمها رو به اسم نمره بنچمارک جا بزنی. یه نکته دیگه هم اینه که نرخ موفقیت بدون consistency فقط یه تخمین نقطهایه؛ مدلی که یه بار ۹۰٪ میگیره و بار بعد ۷۴٪، از مدلی که ثابت رو ۸۴٪ میمونه بدتره.
مقاله یه trace واقعی از SWE-bench Verified رو هم نشون میده که توش چک end-to-end پاس شده و نمرهش ۱ در اومده، ولی نمره step-level و tool-call precision ۳ از ۴ شده چون یکی از قدمها اضافی بوده. توصیه عملی نویسنده اینه: اول با یه سوئیت عمومی یه کف عددی بگیر، بعد از تیکتها و APIهای واقعی خودت یه eval اختصاصی بساز و شرط قبولی رو بذار روی وضعیت محیط، یعنی یه رکورد دیتابیس یا یه PR مرجشده، نه نظر یه judge درباره متن آخر.
نکات کلیدی:
- BFCL فقط درستی تکتک function callها رو میسنجه، نه تمومشدن کل تسک
- سلسلهمراتب نمرهدهی ثابته: Benchmark بعد Trial بعد Task بعد Turn بعد Step
- مدلی که ۹۰٪ و بعد ۷۴٪ میگیره، از مدلی که ثابت رو ۸۴٪ میمونه بدتره
- parallel tool calling تعداد قدم و تأخیر رو کم میکنه، ولی تعداد تماسها رو نه
- Nemotron 3.5 Lightning رو PinchBench به دقت ۸۶٪ میرسه و ۱۰ هزار تسک رو ۳۰٪ سریعتر از Qwen3.6 35B تموم میکنه
- verification اجرایی مثل پاس شدن تست یا آپدیت شدن دیتابیس استاندارد طلاییه؛ LLM-as-a-Judge تا وقتی با نمره انسانی اعتبارسنجی نشه موقتیه




