Odyssey-3؛ یه مدل جهان برای ربات، ماشین، پهپاد و بازی
خلاصهٔ کاملتر
شرکت Odyssey که سال ۲۰۲۳ راه افتاده، از Odyssey-3 رونمایی کرده و اون رو قویترین foundation world model خودش میدونه. world model یعنی مدلی که یاد میگیره دنیا چطور رفتار میکنه و میتونه اتفاق بعدی رو شبیهسازی کنه. Odyssey-3 یه autoregressive diffusion transformer هست که روی حجم خیلی زیادی مشاهدهی تصویری از دنیا آموزش دیده. به گفتهی نویسندهها، مدل از همین راه فیزیک، دینامیک، علت و معلول و رفتار آدمها رو یاد گرفته.
نکتهی اصلی اینه که مدل برای هر کار جدید فقط چند ساعت تا چند ده ساعت experiential data لازم داره، یعنی دادهای که نشون میده سیستم چی دیده و در جوابش چه حرکتی کرده. یه action decoder (یه بخش خروجی که به مدل وصل میشه) با همین مثالها آموزش میبینه تا برداشت داخلی مدل رو به فرمانهای واقعی ربات یا ماشین تبدیل کنه. نویسندهها معتقدن روش رایج رباتیک، که هر کار رو با هزاران ساعت نمایش تکراری آموزش میده، داره مسئله رو با زور داده حل میکنه.
روی بازوی رباتیک، مدل با چند ده ساعت نمایش کارهایی مثل ریختن قهوه تو فنجون یا چیدن وسایل تو جعبه رو انجام داده. جالبتر اینه که رفتارهای جبرانیای دیده شده که تو دادهی آموزشی نبوده، مثل تنظیم دوبارهی گیره بعد از یه گرفتن ناموفق. Odyssey برای سنجش مدل روی رباتهای مختلف با Poke & Wiggle همکاری میکنه. شرکت Flexion هم روی همین مدل، کنترل ربات انساننما ساخته که به گفتهی مقاله با تغییر نور بهتر از مدلهای VLA (مدلهای بینایی، زبان و حرکت) دووم میاره.
برای رانندگی، مدل فقط با ۲۰ ساعت دادهی شبیهسازیشده ماشین رو تو خیابونهای هند خودکار روند. اینجا world model ثابت (frozen) میمونه و فقط یه driving policy کوچیک، یعنی بخشی که تصمیم حرکت رو میگیره، روی خروجیش آموزش میبینه و نقطههای مسیر جلوی ماشین رو پیشبینی میکنه. تو جادهی واقعی، policyیی که فقط با شبیهسازی آموزش دیده بود، بین دو دخالت رانندهی ایمنی حدود ۷۷٪ مسافتی رو رفت که policy آموزشدیده با فیلم واقعی میرفت.
پهپاد هم با همین روش و چند ده ساعت دادهی شبیهسازیشده، تو یه محیط داخلی شبیهسازیشده پایدار پرواز کرد و از کنار موانع رد شد. تو بازیها، policyها با فیلم گیمپلی و ورودی کیبورد و ماوس آموزش دیدن و تو GTA V جلسههای طولانی بازی کردن. نشونهی انتقال هم دیده شده: یه policy حرکتی که با حدود دو ساعت فیلم GTA آموزش دیده بود، بدون آموزش اضافه تو Red Dead Redemption 2 سوارکاری کرد. Odyssey-3 میتونه برای تمرین ایجنتهای هوش مصنوعی هم محیط بسازه.
نویسندهها میگن world modelها هنوز حدود دو مرتبهی بزرگی (یعنی حدود ۱۰۰ برابر) از مدلهای زبانی کوچیکترن و برای همین هنوز به توان کاملشون نرسیدن. همهی نتیجههای بالا از آزمایشهای خود شرکته و مدل قراره چند هفتهی دیگه عمومی منتشر بشه.
نکات کلیدی:
- Odyssey-3 یه autoregressive diffusion transformer هست و انتشار عمومیش برای چند هفتهی آینده اعلام شده.
- رانندگی خودکار تو خیابونهای هند فقط با ۲۰ ساعت دادهی شبیهسازیشده انجام شد.
- policy شبیهسازیشده بین دخالتهای راننده حدود ۷۷٪ مسافتِ policy آموزشدیده با فیلم واقعی رو رفت.
- Flexion روی Odyssey-3 کنترل ربات انساننما ساخته و Poke & Wiggle تو ارزیابی رباتها همکاری میکنه.
- policy آموزشدیده با حدود دو ساعت فیلم GTA V بدون آموزش اضافه تو Red Dead Redemption 2 کار کرد.




