تیم Rhoda AI با ربات واقعی تست کرد: پیشآموزش ویدیویی واقعاً جواب میده؟
خلاصهٔ کاملتر
سوال اصلی این تحقیق تیم Rhoda AI اینه: آیا pretraining (یعنی آموزش اولیه یه مدل رو حجم زیاد داده عمومی، قبل از آموزش تخصصی) رو ویدیوهای معمولی اینترنتی، واقعاً باعث میشه رباتها کارهای واقعی رو بهتر انجام بدن؟ خیلیا این فرض رو قبول دارن ولی کسی جدی تستش نکرده بود. تیم Rhoda با مدل خودشون به اسم DVA (Direct Video-Action) که یه مدل ویدیوییه و خروجیش رو یه مدل جدا تبدیل به حرکت ربات میکنه، اندازه مدل و مقدار محاسبات پیشآموزش رو تغییر دادن و هر بار نتیجه رو رو یه ربات واقعی امتحان کردن.
کار انتخابشده، باز کردن جعبههای بلبرینگ و جدا کردن زبالههاست؛ یه کار صنعتی واقعی که هر روز بیش از هزار بار تو یکی از سایتهای مشتریهاشون بهصورت دستی انجام میشه. این کار ۱۴ مرحله داره، از گرفتن تسمه جعبه تا باز کردن کیسه پلاستیکی شفاف و جدا کردن کاغذ از بلبرینگها، و چون طولانیه یه اشتباه تو مراحل اول کل بقیه کارو خراب میکنه. برای سنجش موفقیت هم از معیار at-speed completion rate استفاده کردن، یعنی درصد دفعاتی که ربات کل کارو درست و زیر ۱۰۰ ثانیه انجام داده، نه فقط بخشی از اون.
نتیجه اول اینه که هرچی مدل ویدیویی پیشآموزشدیده بزرگتر باشه، ربات بهتر کار میکنه: نرخ موفقیت از ۴٪ رو کوچیکترین مدل تا ۸۵٪ رو بزرگترینشون رسیده، و حتی تو بزرگترین مدلی که تست کردن هنوز این روند متوقف نشده. جالب اینه که علت اصلی بهتر شدن، دقت بیشتر نیست بلکه سرعت بیشتره: مدلهای بزرگتر کمتر نیاز به تلاش دوباره دارن و حرکاتشون سریعتره. تنها نقطه منفی اینه که دستهبندی زباله یکم با افزایش سایز مدل بدتر شده، چون سرعت بالا گاهی باعث میشه ربات زودتر از موقع تصمیم اشتباه بگیره.
نتیجه دوم مربوط به زمان و محاسباتیه که صرف پیشآموزش میشه، نه اندازه مدل. با ثابت نگهداشتن اندازه مدل و فقط زیاد کردن زمان آموزشش، نرخ موفقیت از ۵۸٪ به ۷۵٪ رسیده، ولی بیشتر این پیشرفت تو مراحل اولیه اتفاق افتاده و بعدش رشد کند شده. نکته مهمتر اینه که وقتی دادههای آموزشی اختصاصی ربات کم باشه، تاثیر این پیشآموزش بیشتر خودشو نشون میده؛ با ۲۵٪ داده، فاصله بین مدلهای با کمترین و بیشترین پیشآموزش به ۳۱ درصد رسیده، در حالی که با داده کامل فقط ۸ درصد بود.
نتیجه سوم اینه که یه معیار به اسم DINO FD (یعنی چقدر مدل خوب میتونه ادامه یه ویدیوی دیدهنشده رو حدس بزنه) میتونه از قبل، حتی قبل از آموزش تخصصی رو کار ربات، پیشبینی کنه که اون مدل رو ربات واقعی چقدر خوب کار میکنه؛ فرقی هم نداره این کیفیت از بزرگتر بودن مدل اومده باشه یا از بیشتر آموزش دیدنش. تیم Rhoda AI پیشنهاد میده تیمهای رباتیک از همین معیار برای رتبهبندی مدلهاشون قبل از هزینه کردن رو آزمایشهای گرون ربات واقعی استفاده کنن.
نکات کلیدی:
- مدل استفادهشده Direct Video-Action (DVA) نام داره: یه مدل ویدیویی بههمراه یه مدل جدا برای تبدیل پیشبینیها به حرکت ربات
- بزرگتر کردن مدل نرخ موفقیت رو از ۴٪ تا ۸۵٪ بالا برده
- افزایش زمان پیشآموزش نرخ موفقیت رو از ۵۸٪ به ۷۵٪ رسونده، بیشترین تاثیرش وقتیه که داده اختصاصی کمه
- با ۲۵٪ داده آموزشی اختصاصی، فاصله بین بهترین و بدترین بودجه پیشآموزش به ۳۱ درصد رسیده
- کل آزمایشها بیش از ۲۰۰ ساعت رو یه ربات واقعی صنعتی طول کشیده




