Jev در برابر دستهبندهای کلاسیک: کی میبره؟
خلاصهٔ کاملتر
تو این مقاله اومده که Jev با اینکه مثل یه دستاورد تازه ازش حرف زده میشه، تو زمینی بازی میکنه که از ۲۰۱۸ وجود داشته: دستهبندهای BERTـی فاینتیونشده، دستهبندهایی با embedding فریزشده و یه لایهٔ رگرسیون لجستیک، و پایپلاینهای zero-shot مبتنی بر NLI (یعنی سوال رو عوض میکنن به اینکه متن، برچسب کاندید رو تأیید میکنه یا نه). بنچمارک روی چهار دیتاست اجرا شده: Banking77، نقدهای Yelp، یه مجموعهٔ احساسات و یه مجموعهٔ ایمیل فیشینگ.
روی Banking77 که ۷۷ دستهٔ همپوشان داره، ترتیب این شد: پایپلاین zero-shot کلاسیک ۴۸.۸ درصد، نسخهٔ بهروزترش ۶۶.۷ درصد، Jev بدون هیچ نمونهٔ آموزشی ۸۰.۱ درصد با هزینهٔ حدود ۲۲ سنت برای کل بنچمارک، و یه انکودر ۲۲ میلیون پارامتری با سر رگرسیون لجستیک ۹۳.۲ درصد که فقط ۸ میلیثانیه روی CPU جواب میده. روی احساسات و فیشینگ هم مدل آموزشدیده با فاصله برد، ولی روی Yelp ورق برگشت: ۶۷.۲ درصد Jev مقابل ۵۱.۹ درصد.
جایی که Jev واقعاً جلو میزنه، عوض شدن قانون وسط کاره. تو تست مسیریابی پیامها، وقتی سیاست پیشفرض این بود که درخواست لغو بره به واحد مالی، همه درست جواب دادن. بعد سیاست عوض شد: لغوهای بالای ۱۰۰ صندلی باید مستقیم برن پیش اکانت منیجر. Jev بلافاصله خودشو تطبیق داد، ولی مدلهای کلاسیک همون الگوی قبلی رو ادامه دادن، چون دارن با رشتههای ثابت تطبیق معنایی میکنن نه اینکه خودِ دستور رو تفسیر کنن.
یه مزیت ساختاری دیگه fanout سواله. یه سوال از Jev حدود ۱۵۰ میلیثانیه طول میکشه و ۳۰ تا سوال تو همون یه تماس هم تقریباً همونقدر، چون داخلی batch میشه؛ برای دستهبندهای کلاسیک هزینه با هر دستهٔ جدید خطی بالا میره. در عوض Jev یهکم بیش از حد به خودش مطمئنه: میانگین اطمینان اعلامی ۸۸ درصد در برابر دقت واقعی حدود ۸۰ درصد روی Banking77. نویسنده میگه temperature scaling این خطای کالیبراسیون رو حدود دو سوم کم کرده.
جمعبندی مقاله ترکیبیه. وقتی مستقیم ازش پرسیدن این ایمیل فیشینگه یا نه، دقت حدود ۶۰ درصد شد که برای production کافی نیست. ولی وقتی همون سوال به هشت نشانهٔ مشخص شکسته شد و نتیجهها رفت به یه دستهبند سبک پاییندستی، دقت رسید به ۹۴ درصد. یعنی اگه دادهٔ برچسبخورده داری، مدل کوچیک محلی هنوز انتخاب بهتریه؛ اگه نداری یا قانونهات مدام عوض میشه، جای Jev همینجاست.
نکات کلیدی:
- Banking77: انکودر ۲۲ میلیونی آموزشدیده ۹۳.۲ درصد و ۸ میلیثانیه روی CPU، در برابر ۸۰.۱ درصد برای Jev
- zero-shot کلاسیک NLI ۴۸.۸ درصد و نسخهٔ بهروزترش ۶۶.۷ درصد روی همون دیتاست
- روی Yelp ورق برگشت: Jev ۶۷.۲ درصد مقابل ۵۱.۹ درصد مدل آموزشدیده
- ۳۰ سوال تو یه تماس تقریباً همون ۱۵۰ میلیثانیهٔ یه سوال رو میگیره
- الگوی پیشنهادی بنچمارک: Jev شواهد ساختاریافته دربیاره، یه دستهبند سبک تصمیم نهایی رو بگیره




