FLAT؛ ساخت صحنهٔ سهبعدی از ویدیوی مدل انتشاری
خلاصهٔ کاملتر
پژوهشگرهای Google Research بههمراه دانشگاه آکسفورد و دانشگاه فنی مونیخ روشی به اسم FLAT معرفی کردن. ایدهٔ اصلی اینه که latentهای فشردهٔ یه مدل انتشاری ویدیو (video diffusion) رو مستقیم به پارامترهای صریح صحنهٔ سهبعدی نگاشت کنن؛ اونهم تو یه پاس رفت، بدون مسیر معمول «تولید و بعد بهینهسازی».
بهجای اینکه مثل خیلی از روشها خروجی رو گاوسیهای سهبعدی بذارن، FLAT «مثلث اسپلت» (triangle splat) پیشبینی میکنه. مقاله میگه این کار دقت هندسی رو بالا میبره، در حالی که کیفیت تصویری رقابتی میمونه و میشه صحنه رو با یه رندرر سادهٔ مثلثی نمایش داد.
کار با مثلث سختتر از گاوسیه، چون به جهتگیری خیلی حساسه و یه خطای کوچیک تو زاویه میتونه جریان گرادیان رو خراب کنه. برای همین FLAT چرخشها رو حول پرتوهای دید مرکز میکنه و از یه تابع پنجرهٔ حاصلضربی استفاده میکنه تا رندر مشتقپذیر پایدار بمونه.
خروجی خام مدل یه «سوپ مثلث»ـه که فقط برای دقت هندسی بهینه شده. بعدش یه مرحلهٔ پالایش سبک زمان تست، این مثلثها رو به یه بازنمایی کاملاً مات (opaque) تبدیل میکنه که راحت توی گرافیک استاندارد و شبیهسازی فیزیکی جسم صلب جا میشه؛ بدون اینکه به یه پروکسی برخورد جداگانه نیاز باشه.
نکتهٔ جالب دیگه انعطافپذیریشه. FLAT روی latentهای denoiseشدهٔ Wan-2.1 آموزش دیده، پس موقع اجرا میتونه جای دیکودر تصویر معمول (VAE) بشینه. یعنی هر نسخهای از Wan-2.1 که از مدل پایه فاینتیون شده باشه، بهجای فریم RGB میتونه مستقیم هندسهٔ سهبعدی از جنس مثلث تولید کنه.
به گفتهٔ نویسندهها، همین یه دیکودر برای حالتهای مختلف مثل text-to-video و image-to-video کار میکنه و لازم نیست برای هر حالت یه مدل جدا آموزش بدی. هر قابلیت تازهای هم که مدل ویدیوی بالادست بگیره، خودبهخود به همین دیکودر صحنه منتقل میشه.
نکات کلیدی:
- FLAT از Google Research، آکسفورد و TUM ـه و latent مدل انتشاری ویدیو رو به هندسهٔ سهبعدی تبدیل میکنه
- بهجای گاوسی سهبعدی، مثلث اسپلت پیشبینی میکنه تا دقت هندسی بالاتر بره
- برای پایداری آموزش، چرخشها رو حول پرتوی دید مرکز میکنه و از تابع پنجرهٔ حاصلضربی استفاده میکنه
- بعد از پالایش سبک، خروجی توی رندرر ساده و شبیهسازی فیزیکی قابلاستفادهست
- روی latentهای Wan-2.1 سواره و میتونه جای دیکودر VAE بشینه




