Ling-3.0-Flash-VL: مدلی که تصویر رو مثل متن استدلال میکنه
خلاصهٔ کاملتر
این مقاله یه بررسی دستاول از Ling-3.0-Flash-VL هست، مدل چندوجهی InclusionAI که هم متن میفهمه هم تصویر و ویدیو. بر خلاف مدلهایی که یه رمزگذار تصویر رو به یه مدل متنی وصل میکنن، این مدل تصویر و ویدیو رو از همون اول وارد همون لایههای استدلال، برنامهریزی و خودارزیابی متن میکنه.
از نظر ساختار داخلی، مدل 42 لایه داره که به نسبت پنجبهیک بین دو نوع توجه (attention) تقسیم شده: پنج لایه Kimi Delta Attention (که این تکنیک از مدلهای Kimi شرکت Moonshot AI گرفته شده) بهازای هر یک لایه توجه سنگینتر latent attention. لایههای اول سریع و سبکان، لایههای دوم هر چند وقت یکبار وارد میشن تا زمینه طولانیمدت رو نگه دارن.
یه نسخه ویژه از position embedding هم اضافه شده که علاوه بر ترتیب کلمات، جای هر چیز رو توی فضا و زمان هم دنبال میکنه؛ همین باعث میشه مدل بتونه حرکت توی ویدیو رو بفهمه، نه فقط فریمهای جدا از هم.
نویسنده چند تست عملی رو گزارش کرده: مدل با دیدن یه عکس از غذا تونست یه شبیهسازی HTML متحرک باهاش بسازه که شکل، چرخش و حتی آتیش متحرک رو تا حد خوبی درست دربیاره. توی یه اسکرینشات چت هم تونست منظور پنهون و طنزآمیز یه جمله رو تشخیص بده. توی خوندن یه نمودار تیتراسیون شیمی هم مقدارها رو درست استخراج کرد، محاسبهش رو با اصول شیمی چک کرد، و وسط کار یه اشتباه محاسباتی خودش رو پیدا کرد و اصلاح کرد؛ رفتاری که خیلی از مدلهای دیگه ندارن.
توی ترجمه هم مدل به 80 زبان تست شده؛ برای زبانهای پرکاربرد مثل چینی، هندی، عربی، ژاپنی و کرهای دقتش بالا بوده، ولی برای زبانهای کممنبع مثل زولو و ایگبو افت کرده، که طبق نویسنده این افت توی اکثر مدلهای بزرگ فعلی دیده میشه. نویسنده در نهایت میگه بزرگترین نقطه قوت مدل، همین خودارزیابی و اصلاح خطاست، نه صرفاً فهمیدن تصویر.
نکات کلیدی:
- 42 لایه با نسبت پنجبهیک بین Kimi Delta Attention و latent attention
- امتیاز بنچمارک از 38 (نسخه فقط-متنی) به 42 رسیده
- تست ترجمه روی 80 زبان؛ افت کیفیت در زبانهای کممنبع مثل زولو و ایگبو
- مدل وسط حل یه مسئله شیمی، خطای محاسباتی خودش رو پیدا و اصلاح کرد
- هیچ بنچمارک مستقل شخصثالثی غیر از عدد اعلامشده توسط InclusionAI وجود نداره




