لحظهٔ ChatGPT رباتیک هنوز نرسیده
خلاصهٔ کاملتر
به گفتهٔ چلسی فین، بنیانگذار Physical Intelligence، «لحظهٔ ChatGPT» برای رباتیک یعنی جایی که یه مدل عمومی بتونه کلی کار فیزیکی متفاوت — از شستن ماهیتابه تا درست کردن لاته — رو با یه سیاست واحد و بدون نظارت آدم انجام بده. به گفتهٔ نویسنده رباتیک هنوز اونجا نیست، ولی قطعههاش دارن کنار هم میشینن: مدلهای پایهای که روی دادهٔ متنوع ربات آموزش دیدن، بهعلاوهٔ راههای تازه برای خودبهبودی.
فرق اصلی با موجهای قبلی یادگیری ماشین اینه که اونجا همیشه یه آدم بین خروجی مدل و اثر واقعیش وایساده بود. یه پیشنهاد تبلیغاتی بد یا یه جواب اشتباه چتبات خیلی هزینه نداره، چون کاربر خودش قضاوت میکنه. ولی بازوی رباتی که پرتافیلتر رو جا میندازه یا یه فنجون پر شیر رو جابهجا میکنه، لحظهبهلحظه داره دنیا رو تغییر میده و معمولاً کسی نیست خطاش رو قبل از ریختن نوشیدنی بگیره.
برای همین نویسنده اتکاپذیری رو مهمتر از تنوع قابلیتها میدونه. تیمش برای ربات اسپرسوساز یه هدف مشخص گذاشته: بالای ۹۰ درصد موفقیت، جوری که آدم مجبور نباشه بالا سرش بمونه. همین یه کار چند مسئلهٔ سخت رو یکجا جمع میکنه: جاگذاری دقیق و نیرومند پرتافیلتر، جابهجایی نرم فنجون پر مایع بدون ریختن، و زمانبندی درست دمآوری. روش سنتی جمعآوری داده و آموزش و وصلهکاری دستی تا یه جایی جواب میده، ولی حوصلهٔ آدم قبل از رسیدن به ۹۹ درصد ته میکشه.
راهحل پیشنهادی یادگیری تقویتیه، منتها نه با نسخهٔ مدلهای زبانی. الگوریتمهایی مثل PPO و GRPO با میلیونها تلاش ارزون توی دیتاسنتر کار میکنن؛ برای ربات همین یه میلیون تلاش روی یه کار یکدقیقهای تقریباً ۷۰۰ روز کار پیوستهٔ ربات میشه. یعنی ساختار هزینه کاملاً فرق داره و صرفاً بالا بردن تعداد رولاوتها جواب نمیده.
دو تغییر این حلقه رو کارآمدتر میکنه. اول، بریدن بنبستها وسط کار: اگه ربات دو تا کارتن چسبیده به هم رو مثل یکی بگیره، تماشای شکست کامل چیزی یاد نمیده، پس یه اپراتور انسانی وسط کار مداخله میکنه، راه جبران رو نشون میده و ربات از یه حالت قابلادامه کارش رو ادامه میده. دوم، آموزش یه تابع ارزش عمومی روی کلی کار و محیط مختلف، بهجای تخمین جدا برای هر کار؛ مدلی که یاد میگیره «پیشرفت» چه شکلیه، چه ربات پیرهن تا کنه چه از یخچال چیزی برداره.
خروجی این ترکیب یه سیاست بوده برای درست کردن لاته بهصورت مشترک با آدم: ربات سمت اسپرسو رو میگیره و آدم شیر رو بخار میکنه. مدل مستقیم از تصویر دوربین کار میکنه و مفاصل ربات رو کنترل میکنه، تا سختترین مرحله یعنی بردن یه فنجون کاملاً پر تا زیرلیوانی بدون ریختن. برای اینکه معلوم شه این یه دموی یکباره نیست، سیاست ۱۳ ساعت پیوسته اجرا شده — همون آستانهای که Waymo هم برای رسیدن به ربع میلیون سفر خودران در هفته باید ازش رد میشد.
نکات کلیدی:
- لحظهٔ ChatGPT رباتیک یعنی یه مدل عمومی که بدون ناظر انسانی کارهای فیزیکی متنوع رو انجام بده
- برخلاف چتبات و ایجنت کد، ربات حاشیهٔ خطا نداره چون کسی خروجی رو قبل از اجرا چک نمیکنه
- هدف مشخص تیم: بالای ۹۰ درصد اتکاپذیری روی کار اسپرسو، نه فقط قابلیت انجامش
- PPO و GRPO مستقیم به ربات منتقل نمیشن؛ یک میلیون تلاش یعنی حدود ۷۰۰ روز کار ربات
- دو راهکار: مداخلهٔ انسانی برای بریدن بنبستها و یه تابع ارزش مشترک بین کارها
- سیاست نهایی ۱۳ ساعت پیوسته لاته درست کرده تا نشون بده پایداری واقعیه، نه دموی تبلیغاتی




