Jev زیر ذرهبین: ۱۰۰ فراخوان واقعی ایجنت
خلاصهٔ کاملتر
تیم Archestra تو بلاگش نوشته که موقع ساختن annotator برای OpenAPPA، مدل Jev رو با Sonnet 5 و یه دسته مدل متنباز روی ۱۰۰ فراخوان ابزار از جلسههای واقعی Claude Code سنجیده. Jev یه مدل بهاصطلاح «System 1» هست، یعنی بهجای تولید توکنبهتوکن، مستقیم چند برچسب با نمرهٔ اطمینان برمیگردونه. همین باعث میشه حدود ۳۰۰ میلیثانیه جواب بده و ارزون باشه. ورودیش هم پرامپت آزاد نیست، بلکه وضعیت ساختیافته و چندتا سؤال تایپدار میگیره:
response = client.predict(
state={"tool": "Bash", "arguments": {"command": "cargo test"}},
questions=[
{"id": "delta_trust", "type": "choice",
"criteria": {"trusted": "Local computation over trusted working tree",
"suspicious": "Fetches data from unverified external networks"}}
]
)کاری که این طبقهبند باید بکنه امنیتیه. OpenAPPA از IFC (کنترل جریان اطلاعات، یعنی ردگیری اینکه داده از کجا اومده و کجا میتونه بره) استفاده میکنه و برای ابزارهای پویا مثل bash هر فراخوان رو در لحظه برچسب میزنه: خروجیش رو کی میتونه ببینه، خروجی قابلاعتماده یا مشکوک، و خود این فراخوان به جلسهٔ تمیز نیاز داره یا نه. اگه یه کار خطرناک رو امن برچسب بزنه، OpenAPPA اجازهش میده.
نویسنده اسم مشکل اصلی رو میذاره «تلهٔ ثابت ۷۹ درصد»: تو trace واقعی جلسهها، ۷۹٪ فراخوانها بیخطرن و محلی میمونن، پس یه کد چندخطی که همیشه بگه «بیخطر» هم ۷۹٪ دقت میگیره. نتیجهها این شکلیه: Sonnet 5 با ۹۸٪، Jev با ۹۳٪ (و ۹۵٪ وقتی ۹ مثال بهش بدی)، Bespoke-Nimble-9B با ۸۳٪ و Laya با ۴۸٪. ولی روی ۹ فراخوان واقعاً خطرناک، Jev هفتتا رو گرفت و Sonnet فقط چهارتا.
ضعف Sonnet یه جای مشخص بود: جستوجوی بیرونی. هر پنج خطاش روی همین برچسب افتاد، چون search رو خوندنِ بیضرر حساب میکرد. در حالی که متن جستوجو از محیط میره بیرون و اگه context ایجنت آلوده شده باشه، میشه از همون رشتهٔ جستوجو برای بیرونبردن داده استفاده کرد. هر سه داور مستقل هم همین رو تأیید کردن. برعکسش، Reranker-4B زیادی سختگیر بود و خروجی دستورهای عادی رو بیدلیل محدود میکرد.
چندتا درس روشی هم از کار درمیاد. داوری مدل روی جواب خودش تقلبه: مدلها به خودشون ۲ تا ۳ نمره بیشتر دادن و Gemini به خودش ۱۰۰٪ داد. مدلهای کوچیک بهجای خود کار، جای گزینه رو یاد گرفته بودن و با جابهجاکردن ترتیب گزینهها کاملاً به هم میریختن. خود Jev هم برچسبهاش پایداره ولی احتمالهاش شناوره و تو سؤالهای سهگزینهای حدود ۴ تصمیم از هر ۱۰۰ فقط بهخاطر ترتیب گزینه عوض میشه.
نکات کلیدی:
- ۷۹٪ فراخوانهای واقعی بیخطرن، پس هر مدلی که زیر ۷۹٪ دقت بگیره از یه جواب ثابت بدتره
- Sonnet 5 دقت ۹۸٪ گرفت ولی هر ۸ خطاش «نشتی» بود، یعنی اجازهدادن به فراخوان خطرناک
- Jev دقت ۹۳٪ (۹۵٪ با ۹ مثال) و پاسخ حدود ۳۰۰ میلیثانیه داره و روی پیشبینیهای با اطمینان ۰٫۷ و بالاتر هیچ خطایی نداشت
- تو سؤالهای سهگزینهای، فقط جابهجایی ترتیب گزینهها حدود ۴ تصمیم از هر ۱۰۰ رو عوض میکنه
- مدلها به جواب خودشون ۲ تا ۳ نمره بیشتر میدن، پس داور باید از خانوادهٔ دیگهای باشه




