Dyna-2؛ رباتی که از ویدیوی آدمها یاد گرفت
خلاصهٔ کاملتر
به گزارش Humanoids Daily، شرکت Dyna Robotics از Dyna-2 رونمایی کرده؛ یه «مدل جهان-کنش» یا world-action model که روی بیشتر از یک میلیون ساعت ویدیوی انسانی پیشآموزش دیده. حرف اصلی این معرفی چیزیه که شرکت اسمشو قانون مقیاسپذیری انتقال انسان به ربات گذاشته: هرچی ویدیوی انسانی بیشتری به مدل بدی، تواناییش برای کنترل رباتی که تا حالا ندیده بهشکل قابلپیشبینی بهتر میشه.
گلوگاه همیشگی یادگیری رباتها دادهست: دادهٔ تلهاپریشن کیفیت بالا و برچسبخوردهٔ کنش داره ولی کند و گرون جمع میشه، و در مقابل ویدیوی انسانی توی اینترنت بینهایته اما تبدیل حرکت دست آدم به کنش گیرهٔ ربات — همون «شکاف جسمانیت» — خیلی سخته. Dyna با ساختن زیرمجموعههای تودرتو از ۱۰۰۰ تا یک میلیون ساعت ویدیوی خودمحور و تست روی ۳۹ کار مختلف و دو پلتفرم دوبازویی، دیده عملکرد zero-shot بهطور یکنواخت بهتر میشه و یه نقطهٔ عطف جایی بین ۱۰ تا ۱۰۰ هزار ساعت ظاهر میشه.
بخش جنجالیتر ماجرا ادعای معماریه. نویسنده میگه فقط پیشبینی کنش بعدی برای پر کردن این شکاف کافی نیست و Dyna-2 بهشدت به «همآموزی ویدیویی» تکیه میکنه، یعنی مدل همزمان مجبوره هم کنشهای آینده و هم فریمهای آیندهٔ ویدیو رو پیشبینی کنه. این دقیقاً برخلاف جریان غالب مدلهای VLA (بینایی-زبان-کنش) ـه و به شرطبندی کسایی مثل یان لکون روی مدلهای جهانی نزدیکه. آزمایشهای کنترلشدهٔ شرکت هم میگه این حالت مشترک تو هر ۳۹ کار و در همهٔ مقیاسها از آموزش فقط-کنش بهتر جواب میده.
تو مقایسهٔ مستقیم با Dyna-1 که یه مدل VLA بوده، نسخهٔ اولیهٔ Dyna-2 نرخ موفقیتی ۱٫۵۵ برابر گرفته — اون هم با دیتاست و هایپرپارامترهایی که برای خود VLA تنظیم شده بودن. تو استقرار zero-shot در سایتهای تازهٔ مشتریها هم نرخ قبولی تولیدی ۸۷ درصد بوده در برابر ۴۶ درصد Dyna-1، و تو تستهای کیفی مدل زیر نور چشمکزن، تاریکی کامل و حتی وقتی یه آدم کار ربات رو خراب میکرده هم کارشو تموم کرده. پیروی از دستور زبانی هم با همآموزی ویدیویی از ۳۵ به ۶۷ درصد و با بزرگتر شدن پیکره تا ۹۶ درصد رفته.
ایراد شناختهشدهٔ مدلهای جهانی مولد «شکاف واکنشپذیری» ـه: محاسبات سنگین پیشبینی آینده باعث میشه ربات دیر عمل کنه. Dyna-2 برای این یه خط لولهٔ تقطیر تولید ویدیو در یک گام معرفی کرده که بهجای هدف ثابت، مدل دانشآموز رو با یه توزیع هدف در حال تغییر تطبیق میده و تأخیر تولید ویدیو رو روی یک GPU از نوع H100 از ۱۰۲۰۳ میلیثانیه به ۱۱۰ میلیثانیه رسونده. به گفتهٔ شرکت، یک میلیون ساعت «فقط شروع یه عصر تازه از مقیاسپذیری برای رباتیکه».
نکات کلیدی:
- Dyna-2 یه مدل جهان-کنش پیشآموزشدیده روی بیش از یک میلیون ساعت ویدیوی انسانیه
- ادعای اصلی: قانون مقیاسپذیری انتقال از انسان به ربات، در چهار مرتبهٔ بزرگی داده
- همآموزی ویدیویی تو هر ۳۹ کار از آموزش فقط-کنش بهتر بوده
- نرخ قبولی ۸۷ درصد در استقرار zero-shot، در برابر ۴۶ درصد Dyna-1
- تقطیر یکگامی، تأخیر تولید ویدیو رو از حدود ۱۰ ثانیه به ۱۱۰ میلیثانیه رسونده




