Agent Evals اینجست: امتیاز به ایجنتها بر اساس نتیجهٔ واقعی
خلاصهٔ کاملتر
اینجست (Inngest) ابزارِ جدیدی به اسمِ Agent Evals معرفی کرده که هدفش امتیازدهی به ایجنتهای هوش مصنوعی بر اساسِ نتیجهٔ واقعیه، نه فقط ظاهرِ خروجی. به گفتهٔ نویسنده، مشکلِ بزرگِ ابزارهای فعلی اینه که فقط میسنجن خروجیِ ایجنت «درست به نظر میرسه یا نه»، ولی نمیتونن بگن که اون خروجی واقعاً به نتیجهای که میخواستی رسید یا نه؛ مثلاً مشتری خرید کرد، موند، یا برگشت.
تو این مقاله اومده که یه ایجنت میتونه جوابِ بهظاهر عالی بده، پاسخِ کدِ ۲۰۰ برگردونه، ولی از نظرِ کاربردی کاملاً بیفایده باشه. طبقِ نظرسنجیِ خودِ اینجست، ۳۵٪ مهندسهایی که هوش مصنوعی رو تو محیطِ واقعی اجرا میکنن اصلاً از eval استفاده نمیکنن و ۲۸٪ میگن نوشتنِ evalِ درستوحسابی خیلی سخته.
نویسنده معتقده دلیلِ ساختاریِ این ضعف اینه که ابزارهای معمولیِ eval بیرون از اپلیکیشنِ تو میشینن و فقط trace هایی رو که براشون میفرستی میخونن. برای همین اگه بخوای روی نتیجهای امتیاز بدی که مثلاً سه روز بعد اتفاق میافته، باید خودت بخشِ منتظرموندن و وصلکردنِ شناسهٔ run رو بسازی. اون ابزار امتیازِ دیرهنگام رو قبول میکنه، ولی خودش نمیتونه بهشکلِ پایدار منتظرش بمونه.
راهحلِ اینجست از اجرای پایدار (durable execution) شروع میشه. چون خودِ اینجست کدِ تو رو اجرا میکنه، هر مرحله همون لحظه که اتفاق میافته ثبت میشه. قابلیتی به اسمِ Defer اجازه میده یه scorer بهعنوانِ کارِ پیگیریِ پایدار بعد از تمومشدنِ run اجرا شه و منتظرِ نتیجهای بمونه که هنوز نیومده، بعد امتیاز رو به همون run برمیگردونه.
سه تیکهٔ اصلیِ Agent Evals یعنی Scoring، Experiments و Defer کنارِ هم کار میکنن. با Experiments میتونی دو نسخهٔ مختلف از یه prompt یا مدل رو روی ترافیکِ واقعیِ production بذاری و بر اساسِ خودِ نتیجه مقایسهشون کنی، نه حدس. Traces for AI هم رکوردِ سطحِ span از هر run نگه میداره تا وقتی امتیازی پایین اومد بفهمی run کجا خراب شده.
همهٔ این دادهها تو Insights با SQL قابلِ query هست، پس سوالهایی که اولش نمیدونستی باید بپرسی، بعداً هم میشه جوابشون رو داد. نویسنده میگه راهاندازیش سه قدمه: نتیجهای که موفقیت رو تعریف میکنه انتخاب کن، با createScorer و step.waitForEvent یه scorer بنویس که منتظرش بمونه، بعد با group.experiment یه نسخهٔ رقیب رو روش امتحان کن. همهٔ اینا تو نسخهٔ v4.8.0 از TS SDK در دسترسه.
نکات کلیدی:
- Agent Evals بر اساسِ نتیجهٔ واقعی امتیاز میده، نه فقط ظاهرِ خروجی
- Defer اجازه میده scorer بهشکلِ پایدار منتظرِ نتیجهای بمونه که روزها بعد میاد
- Experiments دو نسخه از prompt یا مدل رو روی ترافیکِ واقعیِ production مقایسه میکنه
- Traces for AI رکوردِ سطحِ span از هر run نگه میداره
- امکاناتش تو نسخهٔ v4.8.0 از TS SDK اومده




