لایا: مدل تصمیمگیری متنباز و فوقسریع
خلاصهٔ کاملتر
نویسنده میگه مشکل بیشتر پایپلاینهای AI اینه که برای تصمیمهای ساده و بازتابی از LLMهای مولد استفاده میکنن؛ مثلاً برای اینکه یه تیکت به کدوم دپارتمان بره یا یه ایمیل فیشینگه یا نه. صدا زدن یه مدل ۸ تا ۷۰ میلیاردی برای این کارها زیادیه: هم ۵۰۰ تا ۲۰۰۰ میلیثانیه طول میکشه، هم پول میبره و هم مدل ممکنه اعتمادبهنفس الکی نشون بده. Laya مثل «System 1» مغز کار میکنه، یعنی تصمیمهای آنی و بازتابی با احتمالهای صادقانه.
به گفتهی نویسنده، Laya هر حالتی (متن، ایمیل، تیکت یا سند JSON) رو توی یه forward pass (یعنی یه بار عبور از مدل) با سه primitive بررسی میکنه: choice که یه گزینه از بین چند تا انتخاب میکنه، score که ورودی رو روی یه مقیاس رتبهای میذاره، و noul که یه سؤال بولی رو با احتمال کالیبرهی P(true) جواب میده. چون خروجی فقط عدد و احتماله، مدل اصلاً متن تولید نمیکنه و نقض اسکیما یا JSON خراب از نظر فیزیکی غیرممکنه.
جالبترین یافتهی مقاله دربارهی زبانه: مدل انگلیسی روی خطهای غیرلاتین خیلی بد کار میکنه، ولی با اعتمادبهنفس بالا. مثلاً روی زبان خمری صفر درصد درست جواب داده، اون هم با میانگین اطمینان ۰.۹۵. یعنی خودِ confidence هیچ هشداری نمیده که مدل نمیتونه خط ورودی رو بخونه. برای همین Laya یه Router داره که اول اسکریپت یونیکد متن رو تشخیص میده و بعد مدل مناسب رو انتخاب میکنه، با سرباری زیر یک میلیثانیه:
from laya import Router
router = Router(preload=True)
res = router.predict({"body": "I was charged twice, please refund."}, questions)طبق مثال، با preload=True مدلها توی حافظه میمونن تا جریمهی ۷ تا ۱۰ ثانیهای سوییچ زبان حذف بشه.
این پروژه یه پسزمینهی جالب هم داره: نویسنده میگه یه سال قبل همین ایده رو با مقالهی arXiv و وزنهای باز منتشر کرده بود، بعد یه لبِ فرانتیری به اسم TypeSafe AI مدل بستهی Jev رو بدون مقاله و بدون وزن باز عرضه کرد، و Laya جوابِ بازِ اونه. طبق بنچمارکهای خودشون، Laya روی AG News دقت ۰.۹۵ و خطای کالیبراسیون (ECE) سه برابر بهتر داره و در تأخیر تا حدود ۸ برابر سریعتره.
نویسنده محدودیتها رو هم صادقانه میگه: سؤالهای choice با بیش از ۲۰ گزینه افت میکنن (روی Banking77 با ۷۷ برچسب فقط ۰.۴۲ گرفته)، مدل پایه بهصورت zero-shot حدود ۰.۳۵ یعنی نزدیک تصادفیه و برای رسیدن به ۰.۷۶۶ باید fine-tune بشه، و کالیبراسیونِ دما هم خطا رو از ۰.۴۶ به ۰.۰۸ میرسونه.
نکات کلیدی:
- سه primitive: choice، score و noul؛ خروجی فقط احتمال، بدون تولید متن
- زیر ۳۳ میلیثانیه روی یک GPU، ادعای ۶ تا ۸ برابر سریعتر از Jev
- بیش از ۱۰۰ زبان، وزنهای متنباز Apache 2.0، بدون هزینهی API
- Router قبل از forward pass اسکریپت یونیکد رو تشخیص میده، چون confidence روی خط غیرلاتین گمراهکنندهست
- محدودیت: choice بالای ۲۰ گزینه افت میکنه و مدل پایه برای دقت خوب باید fine-tune بشه




