Moebius: مدل سبک اینپینتینگ با کیفیت غولها
خلاصهٔ کاملتر
مقالهٔ Moebius یه چارچوب سبک و بهینه برای اینپینتینگ تصویر معرفی میکنه؛ یعنی همون کاری که هوش مصنوعی برای پر کردن یا بازسازی هوشمند بخشهای حذفشدهٔ یه عکس (مثل حذف یه شیء) انجام میده. به گفتهٔ نویسندهها، مدلهای صنعتی ۱۰ میلیاردی مرزهای این حوزه رو جلو بردن، ولی هزینهٔ محاسباتی سنگینشون استفادهٔ عملی رو خیلی سخت میکنه.
نقطهٔ فروش اصلی Moebius کارایی شدیدشه. این مدل فقط ۰.۲۲ میلیارد (۲۲۶ میلیون) پارامتر داره که کمتر از ۲٪ حجمِ غول صنعتی FLUX.1-Fill-Dev با ۱۱.۹ میلیارد پارامتره. با این حال، به گفتهٔ تیم، تأخیر استنتاجش فقط حدود ۲۶ میلیثانیه در هر گامه و در مجموع بیش از ۱۵ برابر سریعتر از مدلهای ۱۰ میلیاردی اجرا میشه.
نکتهٔ مهم اینه که کوچیک شدن به معنی افت کیفیت نبوده. تیم میگه Moebius تو ۶ بنچمارک جامع که هم صحنههای طبیعی (Places2) و هم صحنههای پرتره (CelebA-HQ و FFHQ) رو پوشش میدن، همتراز مدلهای SOTAِ ۱۰ میلیاردی مثل FLUX.1-Fill-Dev و SD3.5 Large-Inpainting عمل میکنه و تو بعضی موقعیتها مثل بافتهای پیچیده و باورپذیری چهره، حتی ازشون بهتره.
دو تا نوآوری هستهٔ این نتیجه رو ممکن کردن. اولی یه بلوک معماری جدید به اسم Local-λ Mix Interaction یا همون LλMI هست که بهجای مکانیزم attention سنگین (که هزینهاش با مربعِ اندازه بالا میره)، زمینهٔ فضایی و اطلاعات معنایی سراسری رو تو ماتریسهای خطیِ با اندازهٔ ثابت خلاصه میکنه و اینطوری تعداد زیادی پارامتر رو کنار میذاره.
نوآوری دوم یه استراتژی «تقطیر چندسطحیِ تطبیقی» هست. تو این روش، ظرفیت نمایشیِ یه مدل معلمِ پرقدرت (PixelHacker) به مدل سبکِ Moebius منتقل میشه، اون هم کاملاً داخل فضای latent تا نیازی به دیکد کردن گرونقیمتِ فضای پیکسل نباشه. این استراتژی چند تا loss مبتنی بر گرادیان رو بهصورت پویا متعادل میکنه تا شکافِ بزرگِ ظرفیت بین معلم و دانشآموز پر بشه. جمعبندی نویسندهها اینه که بهجای بزرگتر کردنِ کورکورانهٔ مدل، وقتی یه وظیفه دقیق تعریف بشه، مدل میتونه همزمان باهوشتر، سبکتر و سریعتر باشه و همین اینپینتینگ باکیفیت رو روی دستگاههای مصرفی و لبه هم در دسترس میکنه.
نکات کلیدی:
- Moebius فقط ۰.۲۲ میلیارد پارامتر داره، کمتر از ۲٪ حجمِ FLUX.1-Fill-Dev با ۱۱.۹ میلیارد
- تأخیر استنتاج حدود ۲۶ میلیثانیه در هر گام و بیش از ۱۵ برابر سریعتر در مجموع
- تو ۶ بنچمارک صحنههای طبیعی و پرتره همتراز یا بهتر از مدلهای ۱۰ میلیاردیه
- بلوک LλMI بهجای attention سنگین، زمینه رو تو ماتریسهای خطیِ ثابت خلاصه میکنه
- تقطیر چندسطحی از مدل معلم PixelHacker داخل فضای latent انجام میشه




