GenCeption؛ یک مدل ویدیوساز برای همهٔ کارهای بینایی
خلاصهٔ کاملتر
مقالهٔ «مدلهای تولید ویدیو، یادگیرندههای عمومی بینایی هستن» که برای ECCV 2026 پذیرفته شده، حرف بلندپروازانهای میزنه: همونطور که پردازش زبان طبیعی از مدلهای تککاره به هوش زبانی عمومی رسید، بینایی کامپیوتری هم باید از دوران مدلهای تخصصی عبور کنه. نویسندهها از گوگل دیپمایند و دانشگاههای تورنتو، UCL، آکسفورد، MIT و لوند هستن.
روش کارشون اینه که یه مدل انتشاری تولید ویدیو رو بهعنوان پایهٔ پیشآموزش بگیرن. منطقش اینه که این مدلها برای ساختن ویدیوی باورپذیر، ناچار شدن پیشینههای غنی فضایی-زمانی از دنیا و همترازی بومی بین تصویر و زبان یاد بگیرن. GenCeption همون دانش رو با پسآموزش چندوظیفهای به کار ادراک میکشونه.
نکتهٔ فنی مهم اینه که مدل مولد چندمرحلهای به یه مدل تکمرحلهایِ پیشخور تبدیل میشه، یعنی جواب با یه بار عبور از شبکه درمیاد نه با دهها گام نمونهگیری. کارهای متراکم مثل عمق تو همون فضای تصویری RGB یکپارچه میشن و کارهای پراکنده با اضافه کردن توکنهای یادگیرنده به ترنسفورمر انتشاری انجام میشن.
روی نتایج، تیم میگه مدلشون با مدلهای اختصاصی هر کار مثل DepthAnything3، VGGT-Ω، SAM3 و Sapiens رقابت میکنه یا ازشون جلو میزنه — و این مقایسه هم برای نسخهٔ متخصص (آموزشدیده روی یه کار) و هم نسخهٔ عمومی (یه مدل واحد روی چند کار) برقراره.
ادعای دوم دربارهٔ کارایی دادهست. با دادهٔ فاینتیونِ برابر، پایهٔ ویدیو-مولد از روشهای دیگهٔ پیشآموزش مثل V-JEPA و VideoMAE V2 بهتر عمل کرده، و به گفتهٔ نویسندهها با ۷ تا ۵۰۰ برابر دادهٔ آموزشی کمتر به کارایی مدلهای مرجع رسیده.
جذابترین بخش، رفتارهای نوظهوره. مدل عمدتاً روی ویدیوهای مصنوعی از انسان فاینتیون شده، ولی بدون آموزش اضافه روی ویدیوی واقعی هم کار میکنه؛ از تکشیء به چند شیء تعمیم میده؛ و با اینکه فقط انسان دیده، به دستههای ندیده مثل حیوان و ربات هم تعمیم پیدا میکنه. نویسندهها اینو نشونهای از وجود یه «مدل جهان» جهانشمول داخل شبکههای مولد ویدیو میدونن.
نمونههای دیگهای که آوردن شامل قطعهبندی شیء بر اساس توصیف زبانی (با استدلال روی رنگ، رابطهٔ مکانی و حرکت)، پیشبینی نقاط کلیدی چهاربعدی بدن انسان زیر انسداد و حرکت پیچیده، و بازسازی چهاربعدی صحنه از یه ویدیوی تکیه که اجازهٔ پرواز آزاد دوربین تو صحنه رو میده.
نکات کلیدی:
- مدل انتشاری تولید ویدیو بهعنوان پایهٔ پیشآموزش برای ادراک بینایی
- یه مدل واحد و تکمرحلهای که با دستور متنی بین کارهای مختلف جابهجا میشه
- رقابت با مدلهای تخصصی مثل SAM3 و DepthAnything3
- رسیدن به کارایی مشابه با ۷ تا ۵۰۰ برابر دادهٔ آموزشی کمتر
- انتقال بدون آموزش از ویدیوی مصنوعی به واقعی و تعمیم به دستههای ندیده




