Kev، بدل اوپنسورس Jev
خلاصهٔ کاملتر
Kev رو جرد پالمر منتشر کرده: سه تا مدل تصمیمگیر کوچیک روی پایهٔ Qwen3.5، با اندازههای ۰.۸، ۴ و ۹ میلیارد پارامتر. کارشون تولید متن نیست؛ یه متن میگیرن و به چندتا سوال دربارهٔ همون متن جواب میدن: بله/خیر (noul)، چندگزینهای (choice) و امتیازدهی (score). سوالها ورودی رو مشترک دارن ولی همدیگه رو نمیبینن، پس جواب یکی روی اون یکی اثر نمیذاره. نمونهٔ درخواست با SDK پایتون این شکلیه:
response = client.system_one(
state="I was charged twice. Please fix this ASAP.",
questions={
"billing": Noul(instructions="Is this ticket about billing?"),
"urgency": Score(instructions="How urgent is this ticket?",
criteria=["can wait", "this week", "today"]),
},
)چون API عیناً با System One شرکت TypeSafe یکیه، همون SDK رسمی رو میشه به سرور محلی خودت وصل کنی. زیر پوسته، هر checkpoint یه آداپتور LoRA با رنک ۱۶ ـه بهعلاوهٔ یه pointer head کوچیک، یعنی یه لایهٔ سبک که بهجای ساختن کلمه، فقط بین گزینهها یکی رو انتخاب میکنه. این لایه حالت پنهان هر گزینه رو در برابر توکن تصمیم امتیاز میده و یه softmax اون امتیازها رو به احتمال تبدیل میکنه. وزنهای پایه دستنخورده میمونن.
روی منابعی که مدل باهاشون آموزش ندیده، Kev-9B روی مجموعهٔ توسعه ۰.۸۲۲ میگیره که ۳.۵ واحد پایینتر از Jev ـه، و روی تست به ۰.۸۵۲ میرسه؛ تستی که Jev اصلاً روش اجرا نشده. احتمالها هم پیشفرض کالیبرهان: هر checkpoint یه دمای حدود ۲.۱ تا ۲.۴ ذخیره میکنه که جواب رو عوض نمیکنه، ولی خطای کالیبراسیون رو از ۰.۱۰۶ میرسونه به ۰.۰۴۲ و خطاهای بااعتماد (جواب غلط با احتمال بالای ۰.۹) رو از ۸.۷ درصد به ۴ درصد. یعنی وقتی مدل میگه مطمئنم، بیشتر میشه بهش تکیه کرد.
نکتهٔ کاربردی برای کسی که میخواد روی دادهٔ خودش فاینتیون کنه اینه که حتماً با --init_from از یه checkpoint منتشرشده شروع کنه، نه از مدل پایه. توی تست یکی از کاربرها روی ۸۳۶ تصمیم واقعی، فاینتیون از پایه روی ارزیابی خود Kev افتاد به ۰.۳۳؛ همون داده با --init_from هم ۰.۸۳ رو اونجا نگه داشت و هم روی دامنهٔ جدید رسید به ۰.۸۸. نرخ یادگیری کوچیکتر (حدود 2e-5) هم پیشنهاد شده.
سرور روی CUDA، ROCm و اپل سیلیکون (از راه MLX) بالا میآد. روی یه مک M5 با ۳۲ گیگ رم، Kev-4B برای پنج سوال روی یه متن ۲۷۰ توکنی حدود ۷۲۱ میلیثانیه وقت میگیره و اگه همون متن تکرار بشه، به لطف کش پیشوند میافته روی ۱۳۶ میلیثانیه. یه نکتهٔ امنیتی هم توی مستندات هست: سرور فقط روی 127.0.0.1 گوش میده و هیچ احراز هویتی نداره، پس تا خودت احراز هویت اضافه نکردی باید محلی بمونه.
نکات کلیدی:
- سه مدل ۰.۸B، ۴B و ۹B روی پایهٔ Qwen3.5، همراه با کد آموزش و دادهٔ ارزیابی.
- API سازگار با System One شرکت TypeSafe، پس SDK رسمی به سرور محلی وصل میشه.
- Kev-9B روی منابع جدید ۰.۸۵۲ روی تست میگیره؛ Jev روی مجموعهٔ توسعه ۰.۸۵۷ داره.
- کالیبراسیون پیشفرض خطاهای بااعتماد رو از ۸.۷ به ۴ درصد میرسونه، بدون افت دقت.
- KEV_DATE_FACTS=1 دقت سوالهای مهلتدار Kev-9B رو از ۰.۸۰ به ۰.۹۰ میبره.




