Jev؛ مدل زبانیای که بهجای متن، عدد برمیگردونه
خلاصهٔ کاملتر
TypeSafe AI هفتهٔ پیش مدل Jev رو معرفی کرد، اولین نمونه از دستهای که خودشون اسمش رو «System One models» گذاشتن. Simon Willison تو این پست میگه اسم «decision models» (مدلهای تصمیمگیر) براش مناسبتره. فرقش با LLMهای معمولی اینه که هنوز متن ورودی میگیره، ولی خروجیش متن نیست: فقط عددهای اعشاری برمیگردونه که نشوندهندهٔ دسته، جواب بله/نه، امتیاز و میزان اطمینان مدله.
قیمتش هم خیلی پایینه. LLMهای معمولی برای ورودی و خروجی جدا پول میگیرن و خروجی معمولاً گرونتره، ولی Jev فقط ورودی رو حساب میکنه و خروجی مجانیه. قیمت ورودی اولین مدلش ۰.۰۴۲ دلار برای هر میلیون توکنه، که حتی از GPT-5 Nano با ۰.۰۵ دلار هم ارزونتره.
روش کار اینه که یه «state» میسازی: یه رشته، آرایهای از رشتهها یا چند جفت اسم و مقدار که مثلاً یه مقاله یا یه مشتری رو توصیف میکنه. بعد با یه یا چند سؤال میفرستیش به API. سه نوع سؤال داری:
- سؤال بله/نه که اسمش «Noul» هست (مخفف Bernoulli): یه جمله میدی و یه عدد بین ۰ و ۱ میگیری که یعنی مدل چقدر مطمئنه اون جمله درسته
- سؤال چندگزینهای که یه گزینه رو انتخاب میکنه و توزیع احتمال روی همهٔ گزینهها رو هم میده
- سؤال امتیازی که چند سطح عددی با توضیح بهش میدی و یه نمره جایی بین اونها میگیری
سؤالها موازی بررسی میشن، پس فرستادن دهتا سؤال تقریباً به اندازهٔ یکی طول میکشه. به گفتهٔ نویسنده Jev برای هر کاری که بشه به شکل دستهبندی درآورد عالیه: تشخیص اسپم، پیشنهاد برچسب، اولویتبندی و رتبهبندی. خودش هم برای reranking جستوجو امتحانش کرده، یعنی اول با یه الگوریتم ارزون مثل BM25 صد نتیجهٔ محتمل رو پیدا میکنی و بعد Jev به هرکدوم نسبت به سؤال اصلی نمرهٔ ارتباط میده.
ولی نویسنده یه نگرانی جدی هم داره: Jev یه قدم دیگه به سمت سیستمهای «جعبه سیاه» هست. از LLM حداقل میشه پرسید چرا این تصمیم رو گرفتی، ولی Jev فقط یه عدد پس میده و معلوم نیست چی باعث شده مثلاً یه متن رو اسپم تشخیص بده. برای همین میگه امیدواره کسی ازش برای رتبهبندی متقاضیهای کار استفاده نکنه، چون اون عدد میتونه کلی سوگیری پنهان توش داشته باشه. تو یه آزمایش هم ازش پرسیده کدوم شهرهای Bay Area «شهر خوب» هستن و Cupertino اول و East Palo Alto آخر شده.
نتیجهای که نویسنده میگیره اینه که eval و آزمایش ساختاریافته (یعنی تست منظم خروجی مدل روی نمونههای زیاد) اینجا حتی از پروژههای LLM معمولی مهمتره؛ خوشبختانه با این قیمت، هزاران آزمایش فقط چند سنت خرج داره. تو همین چند روز هم کارهای جالبی باهاش شده: jevchat که Jev رو به یه چتبات (بد!) تبدیل کرده، jev-leftpad که left-pad رو با یه سؤال چندگزینهای پیاده کرده، و jev-2048 که بازی 2048 رو باهاش بازی میکنه. پروژههایی مثل Kev هم با Qwen 3.5 نسخههای open weight با اندازههای 0.8B، 4B و 9B ساختن.
نکات کلیدی:
- Jev متن میگیره و فقط عدد اعشاری (احتمال، انتخاب یا امتیاز) برمیگردونه
- قیمت: ۰.۰۴۲ دلار برای هر میلیون توکن ورودی، خروجی رایگان
- سه نوع سؤال: بله/نه (Noul)، چندگزینهای و امتیازی
- سؤالها موازی اجرا میشن، پس چندتا سؤال تقریباً همزمان جواب میگیرن
- هیچ توضیحی برای تصمیمش نمیده، پس خطر سوگیری پنهان بالاست
- Kev نسخهٔ open weight مشابه بر پایهٔ Qwen 3.5 در اندازههای 0.8B، 4B و 9B هست




