Awesome NMM: نقشهراه مدلسازی چندوجهی بومی
خلاصهٔ کاملتر
مدلسازی چندوجهی بومی (NMM) به روشی گفته میشه که در اون متن، تصویر، صدا و ویدیو از ابتدا در یه فضای یکپارچه پردازش میشن — نه اینکه مدلهای جداگانهای ساخته بشن و بعد به هم وصل بشن. مخزن Awesome NMM این گذار معماری رو از روشهای قدیمیتر (که بهشون Modular Assembly میگن) به سمت مدلهای بومی ردیابی میکنه و با یه پیپر همراه به اسم «بهسوی مدلسازی چندوجهی بومی: یک نقشهراه» پشتیبانی میشه.
معماریها رو میشه از دو بُعد بررسی کرد: عمق ادغام (mid-fusion در مقابل early-fusion) و نوع ورودی-خروجی. بر این اساس سه دستهبندی اصلی تعریف شده:
- M2T (Multi-to-Text): ورودی چندوجهی، خروجی متنی. مدلهایی مثل LLaVA، Qwen2.5-VL و InternVL-3.5 اینجا قرار میگیرن.
- M2G (Multi-to-Target): تولید مستقیم خروجی مختص هر مودالیتی — مثلاً ویدیو یا صدا — بدون دیکودر جداگانه. HunyuanVideo و OmniVoice نمونههای این دستهان.
- M2M (Multi-to-Multi): یکپارچهترین شکل، جایی که درک و تولید همزمان در یه شبکه واحد اتفاق میافته. مدلهایی مثل Chameleon (متا)، Emu3 و BAGEL-7B اینجان.
در دسته M2M، مفهوم early-fusion مهمه: بهجای اینکه هر مودالیتی ابزار جداگانهای داشته باشه، همهشون از همون ابتدا در یه فضای embedding مشترک قرار میگیرن. مدلهایی مثل Transfusion، AnyGPT و Janus-Pro این رویکرد رو پیاده میکنن. Moshi هم یه مثال جالبه که پردازش همزمان صدا و متن رو بهصورت real-time انجام میده.
نقشهراه فنی این حوزه پنج بُعد اصلی داره: معماری (طراحی backbone یکپارچه)، داده (ترکیب متن، صدا و ویدیو برای پیشآموزش)، استراتژیهای آموزش (ترکیب autoregressive و diffusion)، استنتاج و استقرار (پردازش real-time با تأخیر زیر ۱۰۰ میلیثانیه) و بنچمارکهای ارزیابی متناسب با سیستمهای چندوجهی.
نکات کلیدی:
- NMM یعنی ادغام واقعی مودالیتیها از پایه، نه چسباندن مدلهای جداگانه به هم
- سه پارادایم اصلی: M2T (خروجی متنی)، M2G (خروجی مودالیتیمحور)، M2M (درک و تولید یکجا)
- early-fusion پیشرفتهترین شکل معماری NMM محسوب میشه
- مدلهایی مثل Chameleon، Emu3، BAGEL و Janus-Pro از پیشگامان M2M هستن
- این مخزن با یه پیپر آکادمیک رسمی همراهه و بهصورت community-driven نگهداری میشه




