Dyna-2؛ یک میلیون ساعت ویدیو برای آموزش ربات
خلاصهٔ کاملتر
تیم Dyna Robotics تو گزارش فنی تازهش Dyna-2 رو معرفی کرده؛ یه مدل جهان-کنش (world-action model) که روی بیش از یک میلیون ساعت ویدیوی اولشخص انسانی — تقریباً معادل ۱۷۰ سال تجربهٔ بیداری — پیشآموزش دیده. به گفتهٔ نویسندهها منبع درست داده برای آموزش ربات، ضبط تصویری خود آدمهاست موقع انجام کارهای روزمره، چون این داده عملاً بینهایت در دسترسه و دقیقاً همون چیزی رو نشون میده که یه سیاست دستکاری لازم داره.
معماری Dyna-2 روی یه بکبون ویدیو-دیفیوژن سواره و ترکیبی از ترنسفورمرهاست: ویدیو و اکشن هرکدوم جدا توکنایز میشن و لایههای DiT مخصوص خودشون رو دارن. توکنهای ویدیو ماسک علّی دارن و توکنهای اکشن با self-attention دوطرفه به کانتکست ویدیو نگاه میکنن. آموزش با flow matching انجام میشه و ترنسفورمر اکشن عمداً کمعمقتر طراحی شده تا تأخیر استنتاج بلادرنگ پایین بمونه.
برای بررسی مقیاسپذیری، مدلها روی زیرمجموعههای تودرتوی ۱۰۰۰، ۱۰ هزار، ۱۰۰ هزار و یک میلیون ساعت آموزش دیدن تا تنها متغیر، ساعتِ تجربه باشه. نتیجه اینه که خطای پیشبینی روی دادهٔ انسانیِ کنارگذاشتهشده یکنواخت بهتر میشه. جالبتر اینکه همین روند روی ۳۹ تسک رباتیِ کاملاً دیدهنشده هم تکرار میشه — چیزی که نویسندهها میگن اولین قانون مقیاسپذیری عبورکننده از شکاف بدنمندی (embodiment gap) هست.
این روند تا عملکرد واقعی روی ربات هم ادامه پیدا میکنه. با پسآموزش روی ۱۴ تسک و فقط چند ساعت دادهٔ رباتی، میانگین امتیاز نرمالشده از ۲۰٪ به ۲۸٪، ۴۵٪ و ۵۳٪ رسیده. بعضی تسکها انگار یه آستانه لازم دارن: چرخوندن کلید قفلجعبه تا ۱۰۰ هزار ساعت اصلاً جواب نمیداد، ولی با یک میلیون ساعت ۹۰٪ موفق شده. باز کردن درِ بطری با دو دست پنجانگشتی هم فقط با حدود ۱۰ دقیقه دادهٔ teleoperation به ۵۰٪ رسیده.
به گفتهٔ نویسندهها چیزی که این انتقال رو ممکن میکنه خود مدلسازی جهانه، نه فقط حجم داده. تو آزمایش کنترلشده، حالت فقط-اکشن تو هر ۳۹ تسک از حالت مشترک (پیشبینی همزمان ویدیو و اکشن) عقب میمونه و با بزرگتر شدن داده دچار اورفیت میشه. وقتی مقدار دادهٔ اکشن ثابت بمونه و فقط ویدیوی بدون برچسب زیاد بشه، تعمیم روی دادهٔ رباتی باز هم بهتر میشه؛ تیم اسم این نتیجه رو گذاشته محور جدید مقیاسپذیری.
نکات کلیدی:
- پیشآموزش روی بیش از یک میلیون ساعت ویدیوی اولشخص انسانی
- قانون مقیاسپذیری هم روی دادهٔ انسانی و هم روی دادهٔ رباتیِ دیدهنشده برقراره
- میانگین عملکرد روی ۱۴ تسک واقعی با رشد مقیاس از ۲۰٪ به ۵۳٪ رسیده
- همآموزش ویدیو عامل اصلی انتقال بین بدنمندیهای مختلفه
- در مقایسهٔ مستقیم، WAM حدود ۱.۵۵ برابر نرخ موفقیت VLA رو داشته




