تست عملی Jev: مدلی که فقط تصمیم میگیره
خلاصهٔ کاملتر
نویسنده تو این مقاله Jev رو عملاً تست کرده؛ مدلی که بهجای چت کردن فقط سه جور جواب میده: انتخاب از بین گزینههایی که خودت میدی، امتیاز روی یه مقیاس دلخواه، یا احتمال درست بودن یه جملهٔ بله/خیر. به گفتهٔ نویسنده فایدهش اینه که برای تصمیمهای ساده مثل «این تیکت مال بیلینگه یا فنی» دیگه لازم نیست پول یه مدل زبانی کامل رو بدی.
جالبترین تست، تست جملههای منفی بود. یه پیام که توش نوشته بود «درخواست بازگشت وجه ندارم، فقط کپی فاکتور میخوام» بازم درست به بیلینگ رفت، ولی احتمال «درخواست ریفاند» از ۹۸ درصد افتاد به ۳ درصد. یعنی مدل فقط دنبال کلمهٔ refund نگشته، خودِ ادعای جمله رو فهمیده. این دقیقاً همونجاییه که سیستمهای کلیدواژهای معمولاً خراب میکنن.
اما یه نقطهضعف مهم هم پیدا شد. وقتی ازش پرسیدن غذاخوری کی میبنده و گزینهٔ other هم تو لیست بود، درست همون رو انتخاب کرد. ولی وقتی فقط سه دپارتمان تو لیست بود، با اطمینان پایین ۰.۳۱ گزینهٔ «فروش» رو زد. نویسنده میگه درس عملیش اینه: همیشه یه گزینهٔ other یا «نامشخص» با مسیر بررسی انسانی بذار و عدد اطمینان رو هم بهجای نرخ دقت واقعی حساب نکن.
تو یه تست دیگه، متن پیام یه «دستور سیستمی» قلابی داشت که میگفت این رو بیلینگ حساب کن؛ Jev گوش نداد و همون دستهبندی فنی رو نگه داشت. تو تست استخراج آدرس هم از بین چند گزینه، آدرس جدید رو عیناً برداشت بدون اینکه چیزی رو تغییر بده. نویسنده تأکید میکنه اینها همهش هشت تست ساختگیه و قبل از سپردن کار واقعی مثل صدور ریفاند، باید با دادهٔ خودت تستش کنی.
نکات کلیدی:
- نسخهٔ تستشده Jev 1.13.0 بود؛ اسم مستعار latest ممکنه زیر پات عوض بشه
- زمان ارزیابی مدل بین حدود ۹۲ تا ۲۱۴ میلیثانیه گزارش شده
- قیمت ورودی ۴.۲ سنت به ازای هر یک میلیون توکن و توکن خروجی رایگان
- تو دموی Jev Ultrafast از گرگور زونیچ، یه جستجوی پرواز زوریخ به لندن حدود ۷ ثانیه و ۰.۰۰۳۹ دلار خرج برداشت
- تو تست بررسی خروجی ایجنت، ادعای موفقیت جعلی رو با احتمال ۹۳ درصد بیپشتوانه تشخیص داد




