جمینای رباتیکس ۲: یک مدل برای کل بدن ربات
خلاصهٔ کاملتر
به گفتهٔ گوگل، Gemini Robotics 2 بهجای اینکه ربات رو برای یه حرکت خاص برنامهریزی کنه، یه مدل جنرالیست رو آموزش میده که هدف رو میفهمه، مراحل فیزیکیشو میچینه و کل بدن ربات — از پا تا نوک انگشت — رو کنترل میکنه. تو دموها دو پلتفرم به اسم Apollo و Duo کارهایی مثل بستن ساک، باز کردن لامپ، گره زدن کیسهٔ زباله و مرتب کردن گاراژ رو انجام دادن.
سیستم از دو مدل بههموصل ساخته شده. اولی یه مدل استدلال embodied ـه که تصویر دوربینها و یه دستور زبانی مثل «گاراژ رو مرتب کن و ابزارا رو بذار سر جاشون» رو میگیره و تصمیم میگیره چی اول انجام بشه، چی به چی وابستهست و کِی کار واقعاً تموم شده. دومی مدل vision language action ـه که این زیرهدفها رو به فرمان موتوری تبدیل میکنه؛ یعنی همزمان دهها مفصل و محرک رو میچرخونه و حواسش به تعادل ربات هم هست.
نویسنده توضیح میده چرا کنترل کل بدن اینقدر سخته: آدم موقع برداشتن یه چیز، وزنشو جابهجا میکنه و تعادلشو تنظیم میکنه بدون اینکه بهش فکر کنه، ولی ربات این هماهنگی خودکار رو نداره و باید برای یه حرکت سادهٔ دستدرازکردن دهها تصمیم جدا بگیره. تیم گوگل میگه فرقش با رباتهای ویروسی که پشتک میزنن همینه: اونا برای چند حرکت خاص تیون شدن، این یکی قراره عمومی باشه.
سختترین بخش، دستکاری ظریفه. باز کردن یه لامپ کروی از سرپیچ، بستن کیسهٔ زیپدار دور غذا و گره زدن کیسهٔ زباله همه تماس دقیق نوک انگشت، درک فضای سهبعدی و حرکت چندمرحلهای میخوان، نه یه گرفتن و ول کردن ساده. یه دست رباتیک میتونه حدود ۲۲ مفصل داشته باشه که باید با هم هماهنگ شن؛ به گفتهٔ تیم، بعضی از اعضا گره زدن کیسه رو موقع توسعه تقریباً غیرممکن میدونستن.
تو محور سوم، دو ربات هرکدوم نسخهٔ مستقل خودشون از همون مدل رو اجرا میکنن و دربارهٔ وضعیت کار با هم حرف میزنن؛ یکی بخش خودشو تموم میکنه و باقی کارو به اون یکی میسپره، بهجای اینکه یه شبکهٔ واحد هر دو تا رو بچرخونه. تو دموها رفتار بازیابی هم دیده میشه: ربات میفهمه گرفتنش ناموفق بوده یا تعادلش بههم خورده و دوباره تلاش میکنه.
نویسنده یادآوری میکنه که کارهای انتخابشده عمداً روزمرهن — برای آدم بیاهمیت، برای ماشین واقعاً سخت — و همین اونا رو معیار خوبی برای تعمیمپذیری میکنه. ولی اینکه این سیستم به کار مفید و بدون نظارت تو خونه یا محیط کار برسه هنوز به سرعت، قابلاتکا بودن و هزینه بستگی داره که تو نمایشهای گوگل هیچکدوم شفاف نشدن.
نکات کلیدی:
- سه محور اصلی: کنترل کل بدن، دستکاری ظریف، همکاری چند ربات
- ترکیب یه مدل استدلال embodied با یه مدل vision language action
- کارهای دمو: بستن ساک، باز کردن لامپ، گره زدن کیسهٔ زباله، مرتب کردن گاراژ
- هر ربات نسخهٔ مستقل خودشو اجرا میکنه و کارو دستبهدست میکنه
- هماهنگی حدود ۲۲ مفصل تو یه دست رباتیک
- رفتار بازیابی بعد از گرفتن ناموفق تو دموها دیده شده
- سرعت، هزینه و قابلاتکا بودن هنوز مشخص نیست




