TUNA-2: وقتی پیکسلها از انکودر دیداری قویتر میشن
خلاصهٔ کاملتر
TUNA-2 آخرین نسخه از خانواده مدلهای چندوجهی یکپارچهست که توسط تیم مشترک Meta، دانشگاه هنگکنگ و دانشگاه واترلو معرفی شده. این مدل میتونه همزمان تصویر رو درک کنه و تولید کنه، یعنی یه مدل واحد برای هر دو وظیفهای که معمولاً نیاز به معماریهای جداگانه داشتن.
ایده اصلی پشت TUNA-2 اینه که معماری رو هرچقدر ممکنه سادهتر کنن. نسخه اولیه TUNA از VAE (که برای فشردهسازی تصویر استفاده میشه) و یه انکودر بازنمایی بصری استفاده میکرد. در مرحله اول، VAE حذف شد و TUNA-R به دست اومد که فقط روی پیکسلها کار میکنه ولی هنوز یه انکودر بازنمایی داره. در مرحله دوم، اون انکودر هم حذف شد و TUNA-2 متولد شد که مستقیماً از لایههای patch embedding برای پردازش تصویر خام استفاده میکنه.
جالبترین بخش داستان اینجاست: با اینکه TUNA-2 سادهترین معماری رو داره، توی مجموعه بنچمارکهای چندوجهی از هر دو نسخه قبلی بهتر عمل میکنه. این نشون میده که گاهی اضافه کردن اجزای پیچیدهتر لزوماً به نتیجه بهتری نمیرسه.
مدل در دو سایز ۲ میلیارد و ۷ میلیارد پارامتری ارائه میشه و از رزولوشنهای مختلف از ۵۱۲x۵۱۲ تا ۱۰۲۴x۱۰۲۴ پشتیبانی میکنه. علاوه بر تولید تصویر، قابلیت ویرایش تصویر هم داره. یه اسکریپت یکپارچه برای تمام انواع استنتاج وجود داره که استفاده ازش رو ساده میکنه:
bash scripts/launch/predict.sh \
--ckpt /path/to/tuna_2_pixel_7b.pt \
--prompt "your prompt here"برای انتخاب وریانت مختلف (TUNA-2، TUNA-R یا TUNA اصلی با VAE) هم میشه از فلگ --variant استفاده کرد:
bash scripts/launch/predict.sh \
--variant vae --size 2b \
--ckpt /path/to/tuna_2b.pt \
--prompt "your prompt here"کدبیس ویدئو هم در مخزن موجوده، هرچند به دلیل محدودیتهای سازمانی وزنهای مدل ویدئو فعلاً منتشر نمیشه. تیم برنامه داره کانفیگهای آموزشی و استنتاجی ویدئو رو در دسترس قرار بده تا کسایی که میخوان مدل ویدئویی خودشون رو بسازن بتونن از این زیرساخت آماده استفاده کنن.
یه نکته مهم در مورد انتشار وزنها: به دلیل محدودیتهای سیاست Meta، وزنهای کامل production منتشر نمیشه. در عوض یه checkpoint پایه با تعداد کمی لایه حذفشده از LLM backbone و diffusion head منتشر میشه. بقیه اجزا کاملاً حفظ میشن و با یه fine-tuning کوتاه روی داده خودتون میشه مدل رو به کیفیت کامل رسوند.
نکات کلیدی:
- TUNA-2 با حذف VAE و انکودر بصری، مستقیماً از patch embedding روی پیکسل خام استفاده میکنه
- علیرغم سادهتر بودن معماری، عملکرد بهتری نسبت به TUNA و TUNA-R داره
- از هر دو وظیفه درک و تولید تصویر در یه مدل واحد پشتیبانی میکنه
- در دو سایز ۲B و ۷B و رزولوشنهای مختلف تا ۱۰۲۴x۱۰۲۴ قابل استفادهست
- کدبیس ویدئو هم ارائه شده ولی وزنهای مدل ویدئو هنوز منتشر نشده
- وزنهای کامل به دلیل محدودیتهای Meta در دسترس نیست؛ یه checkpoint ناقص با امکان fine-tuning منتشر میشه




