GWM Worlds 2: دنیای تعاملی که همون لحظه ساخته میشه
خلاصهٔ کاملتر
رانوی سوم سپتامبر ۲۰۲۶ نسخهٔ دوم مدل جهانش رو با اسم GWM Worlds 2 منتشر کرد. این مدل بهصورت بلادرنگ ویدیوی ۷۲۰p با ۲۴ فریم بر ثانیه و صدای ۴۸ هزار هرتز تولید میکنه و همون لحظه به کاری که میکنی واکنش میده. نسخهٔ اول دسامبر پارسال اومده بود و بیشتر روی ثبات فضایی تو حرکتهای طولانی تمرکز داشت؛ چیزی که این بار اضافه شده تولید صدا و کنترل دقیقتر روی شخصیتها و خود صحنهست.
قالب ورودی اسمش WorldPrompt هست و دو لایه داره. لایهٔ اول context ماندگاره: یه genesis prompt که محیط و چیدمان و متریال و نورپردازی و صدای محیط رو توصیف میکنه، بهعلاوهٔ سوژهها و قوانین دنیا مثل گرانش و برخورد و تواناییهای شخصیتها، و یه فریم اول برای اینکه تصویر پایه مشخص باشه. لایهٔ دوم یه جریان رویداد زمانداره: هر اکشن یه متن آزاد با زمان شروع و پایانه که خطاب به یه سوژه یا کل صحنه نوشته میشه و میتونه با اکشنهای دیگه همپوشانی داشته باشه.
از نظر فنی، رانوی اول مدل پایهٔ صوتوتصویرش رو روی قالب WorldPrompt فاینتیون کرده، ولی اون مدل دوطرفه (bidirectional) و کنده. برای همین با post-training تبدیلش کردن به یه مدل autoregressive بلادرنگ که دیگه به طول ثابت محدود نیست. مدل تو هر قدم سهجور context میبینه: context سراسری (genesis prompt و فریم اول)، ورودیهای همون فریم (دوربین و متن اکشنها) و فریمهای قبلی که تو یه پنجرهٔ لغزان KV-cache نگه داشته میشن و قدیمیترها حذف میشن.
نویسندههای پست سه جور استفاده رو از هم جدا میکنن: از پیش، که کل جریان رویداد اول نوشته میشه و مناسب فیلمسازی و تبلیغاته؛ نوبتی، که تولید تا لحظهٔ تصمیم پیش میره و مناسب رمان تصویری و فیلم تعاملیه؛ و بلادرنگ، که سختترینه چون متن باید با تأخیر خیلی کم برسه. تو دموی خودشون کلیدها به prompt های آماده وصل شدن، مثلاً W یعنی «شخصیت جلو میره». به گفتهٔ خودشون روش «از پیش» هنوز کیفیت بهتری میده، چون متن میتونه صحنه رو خیلی کاملتر توصیف کنه.
چند قابلیت دیگه هم نشون دادن: ادامه دادن بازی از یه ویدیوی موجود بهجای شروع از یه تصویر، کنترل سوژهها توسط ایجنتها (تو یه تست، ایجنت با موفقیت ربات رو به پرچم قرمز و بعد آبی رسوند) و حالت چندنفره با نقشهای جدا که پخشش رو LiveKit انجام میده. ساخت دنیا هم با کمک یه LLM انجام میشه: یه جملهٔ ساده مینویسی و فریم اول و genesis prompt و اکشنهای وصلشده به کلیدها برات ساخته میشن.
نکات کلیدی:
- خروجی بلادرنگ: ویدیوی ۷۲۰p با ۲۴ فریم بر ثانیه و صدای ۴۸٬۰۰۰ هرتز، بدون طول ثابت برای جلسه
- WorldPrompt دو لایه داره: context ماندگار (genesis prompt و فریم اول) و جریان رویداد زماندار
- معماری مدل autoregressive diffusion با دیکودرهای علّی و پنجرهٔ لغزان KV-cache روی فریمهای قبلیه
- شخصیتها میتونن حرف بزنن و لحن و زبان و حرکت لبهاشون هم تولید میشه
- محدودیتها: چرخش سریع دوربین بافت و هندسه رو خراب میکنه و حافظهٔ بلندمدت هنوز ناقصه




