Mage؛ مدلهای چندوجهی سبک مایکروسافت
خلاصهٔ کاملتر
تیم Mage تو مایکروسافت یه خانواده مدل چندوجهی منتشر کرده که همهشون روی یه بودجهٔ ثابت ۴ میلیارد پارامتر بسته شدن. فلسفهای که تیم روش تأکید میکنه اینه که ظرفیت بازنمایی رو جایی خرج کن که سیگنال هست — چیزی که خودشون بهش میگن codec-aligned efficiency — و همین ایده تو هر دو سمتِ درک و تولید تصویر تکرار شده. به گفتهٔ تیم، این مدلها انقدر جمعوجورن که روی سختافزار معمولی آموزش، فاینتیون و دیپلوی بشن، ولی هنوز جلوی سیستمهای اپنسورس خیلی بزرگتر رقابتی بمونن.
عضو اول، Mage-VL ـه: یه مدل زبانی-تصویری که از صفر و بهصورت codec-native آموزش دیده و برای فهم تصویر و ویدیو ساخته شده. جالبترین نکتهش اینه که ویدیو رو همونطوری میخونه که یه کدک میخونه — با فریمهای anchor و predicted و پچهای ۱۶×۱۶ — و یه استریمینگ فعال با الهام از سیستم بینایی زنده هم داره.
عضو دوم، Mage-Flow ـه که سمت تولید رو پوشش میده: یه استک ۴ میلیارد پارامتری متشکل از Mage-VAE و یه MMDiT با رزولوشن اصلی، برای ساخت تصویر از متن و ویرایش تصویر با دستور. سه نسخه ازش هست — Base، RL و یه نسخهٔ Turbo چهارمرحلهای برای وقتی که سرعت مهمتره. کد و وزنهای مدلها هم روی GitHub و Hugging Face منتشر شدن.
نکات کلیدی:
- Mage یه خانواده مدل چندوجهی سبک از مایکروسافت با بودجهٔ ثابت ۴ میلیارد پارامتره
- Mage-VL برای درک تصویر و ویدیو، با خوانش codec-native از ویدیو (فریم anchor/predicted، پچ ۱۶×۱۶)
- Mage-Flow برای تولید و ویرایش تصویر تو رزولوشن اصلی، با نسخههای Base، RL و Turbo چهارمرحلهای
- تمرکز روی اجرا و فاینتیون روی سختافزار معمولی، با کد و مدلهای منتشرشده




