چرا رباتها باید خیلی دقیقتر از چتباتها باشن
خلاصهٔ کاملتر
به گفتهٔ چلسی فین، بنیانگذار Physical Intelligence، سختترین بخش رباتیک این نیست که ربات یه بار کاری رو انجام بده؛ اینه که همون کار رو بارها و بدون ناظر، با نرخ موفقیت بالای ۹۰ درصد تکرار کنه. تو این مقاله اومده که بیشتر دموهای یادگیری رباتی هیچوقت مجبور نیستن از این سد رد بشن، چون فقط کافیه یه بار جلوی دوربین جواب بدن.
فین میگه فرق بنیادی هوش مصنوعی فیزیکی با محصولات قبلی اینه که وسط خروجی مدل و نتیجهٔ واقعی، آدم نشسته: پیشنهاد اشتباه یه سیستم توصیهگر یا کد غلط یه دستیار برنامهنویسی رو یکی میبینه و درستش میکنه. بازوی رباتی که داره شیر تو فنجون میریزه چنین حاشیهٔ امنی نداره، پس باید خطاش خیلی کمتر باشه. نمونهٔ موفقش هم Waymo هست با بیش از ۲۵۰ هزار سفر خودران در هفته.
الگوریتمهایی مثل PPO و GRPO مدلهای زبانی رو با میلیونها تلاش جلو بردن، ولی تو دیتاسنتر هر تلاش فقط یه مشت محاسبهست. تو رباتیک، هر تلاش یعنی کارکرد واقعی بازو؛ فین تخمین میزنه حتی یه کار یکدقیقهای چیزی حدود ۷۰۰ روز-ربات کار پیوسته لازم داره تا به اون تعداد مسیر برسه. برای همین سراغ دستوری رفتن که با تلاشهای فیزیکی خیلی کمتر یاد بگیره.
اصلاح اول جلوی هدررفت وقت واقعی رو میگیره: اگه ربات دوتا جعبهٔ چسبیدهبههم رو با هم برداره، تا ابد سعی میکنه تاشون کنه و دادهی بیفایده تولید میکنه؛ اینجا آدم وسط اپیزود کنترل رو دست میگیره، مسیر رو اصلاح میکنه و بعد ربات خودش ادامه میده. اصلاح دوم یه تابع ارزش عمومیه که بهجای دهها تلاش برای هر کار، مفهوم پیشرفت و پسرفت رو در کل کارها یاد میگیره و بین کارهای متفاوت منتقلش میکنه.
تست نهایی یه کار ترکیبی سخت بود: درستکردن لاته با همکاری آدم، جایی که ربات سمت اسپرسو رو برمیداره و آدم شیر رو بخار میکنه. سختترین قسمتش جابهجا کردن فنجون پر بدون ریختنه که تعادل پیوسته و مبتنی بر تصویر دوربین میخواد. تیم بهجای چند تلاش نمایشی، سیاست آموزشدیده رو ۱۳ ساعت پیوسته اجرا کرد و دووم آورد.
نکات کلیدی:
- هدف، اعتمادپذیری بالای ۹۰ درصد در کارهای واقعیه، نه موفقیت یکباره جلوی دوربین
- ربات برخلاف چتبات آدمی بین خروجی و نتیجه نداره، پس خطای خیلی کمتری براش قابل تحمله
- دستور PPO و GRPO برای رباتیک گرون درمیاد: یه کار یکدقیقهای حدود ۷۰۰ روز-ربات تلاش میخواد
- دخالت انسانی وسط اپیزود، مسیرهای بنبست رو از چرخهٔ جمعآوری داده حذف میکنه
- تابع ارزش عمومی، تخمین پیشرفت رو بین کارهای مختلف منتقل میکنه
- سیاست لاتهسازی ۱۳ ساعت پیوسته بدون افت کار کرد




