Gemini Robotics ER 2؛ مغز متفکر رباتها
خلاصهٔ کاملتر
گوگل دیپمایند مدل Gemini Robotics ER 2 رو معرفی کرد؛ به گفتهٔ تیم سازنده این توانمندترین مدل «استدلال تجسمیافته» (embodied reasoning) اوناست. کارش اینه که مثل مغز سطحبالای ربات عمل کنه: با آدم حرف بزنه، دنیای فیزیکی رو بفهمه و کار چندمرحلهای رو برنامهریزی کنه، بعد اجرای حرکت رو بسپاره به یه مدل vision-language-action (VLA). میتونه ابزارهایی مثل Google Search یا هر تابع دلخواه کاربر رو هم صدا بزنه.
تو این نسخه تمرکز روی سرعت تصمیمگیریه. مدل به Gemini Live API وصل میشه و از یه اندپوینت استریم دوطرفه استفاده میکنه تا مکثهای آزاردهندهٔ «وایسا و فکر کن» از بین بره؛ یعنی ربات همزمان که داره کار میکنه، میتونه به مرحلهٔ بعدی فکر کنه. دیپمایند برای نشون دادنش یه دموی تعاملی با ربات Spot از Boston Dynamics ساخته که با یه دستور زبان طبیعی میره و برات خوراکی میاره.
یکی از سختترین سؤالها تو رباتیک اینه که کار کِی تموم شده. ER 2 دو قابلیت رو جلو برده: طبقهبندی پیوستهٔ پیشرفت، که هر فریم ویدیو رو تو پنج بازهٔ درصدی جا میده و به ۵۷.۴ درصد دقت رسیده، و پیدا کردن لحظهٔ دقیق یه رویداد — مثلاً اینکه ریختن قهوه تو فنجون کِی باید قطع بشه — با ۹۱.۳ درصد دقت و میانگین خطای ۰.۹۶ ثانیه، اون هم با هزینهٔ محاسباتی کمتر و چهار برابر سرعت اجرای بیشتر.
همکاری چندرباتی هم اضافه شده: رباتهای متفاوت با یه درک معنایی مشترک کار رو بین خودشون دستبهدست میکنن، مثل نمونهٔ Apollo 2 از Apptronik و Franka F3 Duo. تشخیص موفقیت یا شکست حالا روی ویدیوی خام کار میکنه نه عکس ثابت، خوندن ابزارهای اندازهگیری به نمایشگر دیجیتال و خطکش و دماسنج هم گسترش پیدا کرده، و مدل موقع نزدیک شدن آدم ربات انساننما رو متوقف و بعد از خالی شدن محیط دوباره فعالش میکنه.
نکات کلیدی:
- مغز سطحبالا برای ربات: برنامهریزی و ابزارصدازدن، اجرای حرکت با مدلهای VLA
- درک ویدیوی پیوسته برای دنبال کردن پیشرفت کار و اصلاح مسیر وسط اجرا
- ۵۷.۴ درصد دقت تو طبقهبندی پیشرفت و ۹۱.۳ درصد تو پیدا کردن لحظهٔ رویداد
- همکاری چند ربات با درک معنایی مشترک، نمونهش Apollo 2 و Franka F3 Duo
- در دسترس از Gemini API و Google AI Studio، پیشنمایش خصوصی رو Gemini Enterprise




