Atlas: مدل جهانیِ تازهٔ World Labs
خلاصهٔ کاملتر
تیم World Labs تو معرفی Atlas میگه این مدل یه world model (یعنی مدلی که ساختار و رفتار یه فضا رو میفهمه، نه فقط ظاهر یه عکس) عمومیه که از صفر آموزش دیده. Atlas بهشکل بومی روی متن، عکس، ویدیو، موقعیت دوربین و نقشهٔ عمق کار میکنه و همهشون رو تو یه spatial context مشترک میریزه. یعنی هر عکس یه جای مشخص تو فضای سهبعدی داره، نه فقط یه جای مشخص تو صف ورودی.
اولین کارش تولید با کنترل دوربینه. برخلاف مدلهای ویدیویی که مسیر دوربین رو باید با جمله توصیف کنی، Atlas هندسهٔ دوربین رو مستقیم بهعنوان ورودی میگیره، پس میتونی هر قاب و هر حرکت رو دقیق بچینی. خروجی تا یک دقیقه ویدیوی 1440p از تعداد کمی عکس مرجعه. میشه دو عکس کاملاً بیربط رو تو فضا کنار هم گذاشت و مدل خودش راهرو و درگاه بینشون میسازه تا به هم وصلشون کنه.
بخش بازسازی فضا سراغ یه مسئلهٔ قدیمی بینایی کامپیوتر میره: ساختن نمای جدید از تعداد کم عکس. به گفتهٔ تیم، Atlas معمولاً با همون دو سه عکس بازسازی وفادار میده و هر عکس بیشتری که بهش بدی، سهم تخیلش کمتر میشه؛ تا بیش از صد عکس هم تو کانتکستش جا میشه. خروجی هم فقط تصویر نیست: point cloud و 3D Gaussian splat میده، همون نمایشی که محصول Marble ازش استفاده میکنه.
کاربرد سومش شبیهسازی فضا و زمانه. با فیلم سه تا پنج دوربین معمولی (تیم میگه با موبایل روی سهپایه ضبطشون کردن) میشه زمان رو فریز کرد و صحنه رو از زاویههای غیرممکن دوباره قاب گرفت، چیزی شبیه bullet time. تو رباتیک هم Atlas علاوه بر بازسازی محیط، همون تصویر و عمقی رو میسازه که سنسور ربات موقع حرکت میدید. یعنی دنیا و دید ربات هر دو از یه مدل واحد در میآن.
از نظر معماری، Atlas یه multimodal autoregressive diffusion transformer هست: مثل LLM عنصرها رو یکییکی و شرطی به گذشته تولید میکنه، و مثل مدلهای تصویری با نویززدایی تدریجی (rectified flow) به خروجی میرسه. همین دورگهبودن باعث میشه هم از ترفندهای سرو LLM مثل KV-caching استفاده کنه، هم از distillation و classifier-free guidance. تیم میگه تو داوری انسانی، Atlas تو دنبالکردن مسیر دوربین از مدلهای ویدیویی روز جلو زده.
نکات کلیدی:
- تولید ویدیو با کنترل دقیق دوربین، تا یک دقیقه و با کیفیت 1440p
- بازسازی وفادار صحنه معمولاً از ۲ تا ۳ عکس، با پشتیبانی از بیش از ۱۰۰ عکس ورودی
- خروجی سهبعدی بهشکل point cloud و 3D Gaussian splat، همون نمایش محصول Marble
- معماری multimodal autoregressive diffusion transformer، آموزشدیده از صفر
- در بازسازی سهبعدی از تصاویر کم، بهتر از بهترین مدلهای تخصصی متنباز
- فعلاً فقط دسترسی زودهنگام برای شرکای منتخب؛ قراره نسخههای بعدی Marble رو هم بچرخونه




