MolmoAct 2: پایهای باز برای رباتهای دنیای واقعی
خلاصهٔ کاملتر
هوش مصنوعی توی دنیای دیجیتال خیلی خوب کار میکنه، ولی وقتی نوبت به دنیای فیزیکی میرسه داستان فرق میکنه. اینکه یه ربات بتونه برای چند ساعت پشت سر هم ظرفها رو توی ماشین ظرفشویی بذاره یا نمونههای آزمایشگاهی رو آماده کنه، هنوز یه چالش جدیه. اینجاست که مدلهای پایه رباتیک اهمیت پیدا میکنن.
تیم Ai2 حالا MolmoAct 2 رو معرفی کرده؛ نسخه ارتقاءیافتهای از اولین Action Reasoning Model (ARM) که پارسال معرفی شده بود. این مدل قبل از هر حرکتی درباره محیط اطرافش در سه بُعد استدلال میکنه و به همین خاطر خروجیهای قابلاطمینانتری داره.
یکی از مهمترین تغییرات، پایه استدلالی مدله. MolmoAct 2 از Molmo 2-ER استفاده میکنه؛ یه ورژن تخصصی که روی حدود ۳ میلیون نمونه استدلال فیزیکی شامل تشخیص اشیاء، استدلال مکانی چند تصویری و پرسشوپاسخ ویدیویی آموزش دیده. نتیجهاش اینه که Molmo 2-ER روی ۱۳ بنچمارک استدلال فیزیکی میانگین امتیاز ۶۳.۸ از ۱۰۰ رو کسب کرده و از مدلهایی مثل GPT-5، Gemini 2.5 Pro و Qwen3-VL-8B جلو زده.
از نظر معماری، MolmoAct 2 یه اکشن اکسپرت مجزا داره که اکشنهای ربات رو از طریق flow matching تولید میکنه و از طریق یه KV-cache bridge به مدل زبانی-دیداری متصله. علاوه بر این، تیم Ai2 یه پیادهسازی کاملاً متنباز از توکنایزر FAST به اسم MolmoAct 2-FAST Tokenizer ساخته که دادههای آموزشیش هم منتشر شده؛ برخلاف نسخه اصلی Physical Intelligence که دادههاش بسته بود.
سرعت هم یه جهش بزرگ داشته. هر فراخوانی اکشن در مدل پایه حدود ۱۸۰ میلیثانیه طول میکشه، در حالی که نسخه قبلی MolmoAct حدود ۶۷۰۰ میلیثانیه وقت میبرد. این یعنی تفاوت بین ربوتی که بین هر حرکت مکث محسوسی داره و ربوتی که تقریباً در لحظه به محیطش واکنش نشون میده.
برای وظایفی که نیاز به درک عمیقتر سهبُعدی دارن، MolmoAct 2-Think وارد عمل میشه. این نسخه از توکنهای ادراک عمق استفاده میکنه، ولی با یه مکانیزم هوشمند adaptive-depth فقط برای نواحیای از تصویر که تغییرات داینامیک دارن عمق محاسبه میشه. نتیجه اینه که پیشبینی عمق کامل حذف میشه و ۱۷ درصد سریعتر از روش پیشبینی کامل عمق اجرا میشه.
در کنار مدل، تیم Ai2 دیتاست MolmoAct 2-Bimanual YAM رو هم منتشر کرده؛ بزرگترین دیتاست متنباز رباتیک دو دستی تا امروز با بیش از ۷۲۰ ساعت دمو از دو بازوی ربات که با هم کار میکنن. این دیتاست شامل وظایف هماهنگ مثل تا کردن حوله، اسکن خواربار، شارژ گوشی و جمع کردن میزه و بیش از ۳۰ برابر دادهی رباتیک MolmoAct قبلی داره.
یه نکته مهم اینه که قابلیت دو دستی دیگه به fine-tuning اختصاصی نیاز نداره و مستقیم توی مدل پایه تعبیه شده. یعنی کاربر از همون اول این قابلیت رو داره.
نکات کلیدی:
- MolmoAct 2 تا ۳۷ برابر سریعتر از نسخه قبلیه (۱۸۰ms در برابر ۶۷۰۰ms)
- پایه استدلالی Molmo 2-ER روی ۳ میلیون نمونه استدلال فیزیکی آموزش دیده
- در ۱۳ بنچمارک استدلال فیزیکی از GPT-5 و Gemini 2.5 Pro جلو زده
- MolmoAct 2-Think با مکانیزم adaptive-depth، عمق رو فقط برای نواحی مهم تصویر محاسبه میکنه
- دیتاست MolmoAct 2-Bimanual YAM با ۷۲۰+ ساعت، بزرگترین دیتاست متنباز رباتیک دو دستی تاریخه
- وزنها، دادهها، معماری و توکنایزر FAST همه به صورت متنباز منتشر شدن




