Kev: مدلهای کوچیک تصمیمگیری که خودت آموزش میدی
خلاصهٔ کاملتر
Kev یه خانواده مدل کوچیک تصمیمگیریه که jaredpalmer منتشرش کرده و روی پایههای Qwen3.5 ساخته شده. تو سه اندازه ۰.۸، ۴ و ۹ میلیارد پارامتر میآد و وزنها، کد آموزش و داده ارزیابی همش بازه. به گفته نویسنده، APIش دقیقا مثل System One شرکت TypeSafe کار میکنه، یعنی میتونی همون SDK پایتون رو به سرور لوکال خودت وصل کنی و هیچ دادهای بیرون نره.
کاری که میکنه سادهست: یه متن بهش میدی (مثلا یه تیکت پشتیبانی) و چندتا سوال کنارش. سه نوع سوال داره: بله/خیر با noul، چندگزینهای با choice و امتیازی با score. سوالها متن مشترک رو میبینن ولی همدیگه رو نمیبینن. جواب هم فقط یه برچسب نیست، احتمال هر گزینه هم برمیگرده؛ نویسنده میگه نکته اصلی همینه، چون تیکتی که هم مرجوعی داره هم تاخیر ارسال هم مشکل پرداخت، تو همین احتمالها خودشو نشون میده.
وصل شدن بهش از پایتون چند خط بیشتر نیست:
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8009", model="kev-latest")
response = client.system_one(
state="I was charged twice. Please fix this ASAP.",
questions={"billing": Noul(instructions="Is this ticket about billing?")},
)
print(response.nouls["billing"].noul)روی دیتاستهایی که مدل باهاشون آموزش ندیده، Kev-9B دقت ۰.۸۵۲ روی مجموعه تست گرفته و Kev-4B عدد ۰.۸۳۷؛ Jev که مدل میزبانیشده مرجعه، روی مجموعه توسعه ۰.۸۵۷ بوده. خود نویسنده تاکید میکنه این مقایسه کنترلشده نیست، چون معلوم نیست Jev با چه دادهای آموزش دیده. احتمالها هم پیشفرض کالیبرهان: خطای کالیبراسیون Kev-9B از ۰.۱۰۶ به ۰.۰۴۲ اومده پایین و خطاهای با اطمینان بالا از ۸.۷٪ به ۴.۰٪، بدون اینکه دقت تکون بخوره.
از نظر معماری، هر چکپوینت یه آداپتور LoRA با رنک ۱۶ بهعلاوه یه pointer head کوچیکه که روی مدل پایه Qwen سوار میشه و بقیه وزنها دستنخورده میمونن. ماسک توجه طوری بسته شده که هر توکن فقط متن و سوال خودشو ببینه، نه سوالهای دیگه رو. تو Qwen3.5 که لایههای Gated DeltaNet داره و ماسک رو نادیده میگیره، هر سوال تو ردیف جدا اجرا میشه و سرور کش متن رو بین ردیفها به اشتراک میذاره.
کاربردیترین نکته مقاله فاینتیون کردنه. نویسنده میگه به جای شروع از مدل پایه، با --init_from از یه چکپوینت منتشرشده شروع کن: تو تست یکی از کاربرها روی ۸۳۶ تصمیم واقعی، فاینتیون از پایه روی مجموعه ارزیابی خود Kev فقط ۰.۳۳ گرفته در برابر ۰.۸۴ مدل منتشرشده، ولی با --init_from هم اون ۰.۸۳ حفظ شده هم روی دامنه جدید به ۰.۸۸ رسیده.
نکات کلیدی:
- سه اندازه ۰.۸، ۴ و ۹ میلیارد پارامتری روی پایه Qwen3.5؛ دوتای بزرگتر تو bf16 روی مک ۳۲ گیگی جا میشن
- یه درخواست میتونه همزمان سوال بله/خیر، چندگزینهای و امتیازی داشته باشه و هر کدوم احتمال برمیگردونه
- Kev-9B روی منابع جدید ۰.۸۵۲ گرفته، Jev روی مجموعه توسعه ۰.۸۵۷
- روی اپل سیلیکون کرنل سریعی برای DeltaNet نیست: Kev-9B حدود ۲ ثانیه، ولی نسل قبلی Qwen3 حدود ۳۰۰ میلیثانیه
- تنظیم KEV_DATE_FACTS=1 فاصله روزهای بین دو تاریخ رو اضافه میکنه و دقت سوالهای ددلاین Kev-9B رو از ۰.۸۰ به ۰.۹۰ میبره




