Ling-3.0-Flash-VL: مدل چندوجهی رایگان با لایسنس MIT
خلاصهٔ کاملتر
InclusionAI مدل چندوجهی (یعنی مدلی که هم متن میفهمه هم تصویر و ویدیو) به اسم Ling-3.0-Flash-VL رو منتشر کرده و فعلاً از طریق API خودش رایگان در اختیار توسعهدهندهها گذاشته. وزنهای مدل هم با لایسنس MIT بیرون اومده، یعنی هرکسی میتونه دانلودش کنه، تغییرش بده، یا حتی توی محصول تجاری استفادهش کنه بدون اینکه مجوز بگیره یا پولی بده.
از نظر معماری، این مدل به سبک mixture-of-experts (یعنی بهجای فعالکردن کل شبکه، فقط چند بخش تخصصی رو برای هر ورودی روشن میکنه) ساخته شده. کل مدل 124 میلیارد پارامتر داره، ولی برای هر توکن فقط حدود 5.5 میلیارد تاش فعال میشه؛ همین باعث میشه هزینه پردازش نسبت به اندازه واقعی مدل خیلی پایینتر بمونه.
نکته مهم اینه که تصویر و ویدیو از همون اول وارد همون مسیر استدلال متن میشن، نه اینکه جدا پردازش بشن و بعد به مدل وصل بشن. طبق ادعای InclusionAI همین باعث شده امتیاز مدل روی یه بنچمارک از 38 (نسخه فقط-متنی) به 42 برسه، یعنی اضافهشدن دید تصویری حتی استدلال کلی مدل رو هم بهتر کرده.
نویسنده تأکید میکنه که این رایگانبودن قطعی نیست؛ لبهای آزاد API معمولاً برای جمعکردن بازخورد و تست اولیه باز میشن و ممکنه بعداً محدود یا پولی بشن. از طرفی چون مدل با روش mixture-of-experts کار میکنه، برای اجرای محلی باید حافظه کافی برای کل 124 میلیارد پارامتر رو داشته باشی، حتی اگه فقط بخش کوچیکیش در لحظه فعال باشه.
نکات کلیدی:
- 124 میلیارد پارامتر کل، فقط ۵.۵ میلیارد فعال در هر توکن
- دسترسی API رایگان فعلاً بدون هزینه بهازای توکن
- وزنهای مدل با لایسنس MIT قابل دانلود و استفاده تجاریه
- امتیاز بنچمارک از 38 به 42 رسیده بعد از اضافهشدن دید تصویری
- اجرای محلی نیاز به سختافزار قابلتوجهی داره چون کل پارامترها باید در حافظه بمونن




