Qwen-RobotWorld؛ مدل جهانِ ویدیویی برای هوش تجسمیافته
خلاصهٔ کاملتر
تیم Qwen تو یه گزارش فنی، مدلی به اسم Qwen-RobotWorld رو معرفی کرده؛ یه «مدل جهان» (world model) ویدیوییِ زبانمحور برای هوش تجسمیافته (embodied intelligence). ایدهٔ کلیدی اینه که زبان طبیعی رو بهعنوان یه رابط واحدِ کنش (action interface) به کار میگیره: مدل از روی مشاهدهٔ فعلی و یه دستور زبانی، مسیر تصویریِ آیندهٔ فیزیکی رو پیشبینی میکنه.
به گفتهٔ نویسندهها این فرمولبندی واحد چند حوزهٔ مختلف رو پوشش میده: دستکاری رباتیک، رانندگی خودران، ناوبری داخلی و انتقال مهارت از انسان به ربات. همین یکپارچگی سه کاربرد اصلی رو ممکن میکنه: تولید دادهٔ مصنوعی برای تقویت آموزش سیاست (policy)، ساخت محیطهای مجازیِ مقیاسپذیر برای ارزیابی سیاست، و تولید سیگنالهای برنامهریزیِ زبانمحور برای کنترل ربات.
معماری مدل سه بخش داره. اول یه Double-Stream MMDiT با کدگذاری کنش توسط MLLM: یه ترنسفورمر دیفیوژنِ دو-جریانه با ۶۰ لایه که معناشناسی مدلِ منجمدِ Qwen2.5-VL رو از طریق attention مشترک لایهبهلایه با نهفتههای video-VAE ترکیب میکنه. دوم یه پیکرهٔ دانش به اسم Embodied World Knowledge (EWK) با ۸.۶ میلیون جفت ویدیو-متن (بیش از ۲۰۰ میلیون فریم) که کنش رو به زبان نگاشت میکنه، روی بیش از ۲۰ نوع بدنمندی و بیش از ۵۰۰ دستهٔ کنش.
بخش سوم یه برنامهٔ درسیِ پیشروندهٔ عمومی+خبره ـه؛ یه آموزش دومرحلهای که اول پیشفرضهای بصریِ عمومی رو یاد میگیره و بعد تخصص تجسمیافته رو زیر یه رابط زبانیِ مشترک تزریق میکنه. طبق نتایج مقاله، مدل عملکرد رقابتیِ قویای داره: تو EWMBench و DreamGen Bench رتبهٔ اول کلی رو گرفته و تو WorldModelBench و PBench از همهٔ مدلهای متنباز جلو زده. تحلیلهای zero-shot روی بنچمارک RoboTwin-IF هم به تعمیمپذیری و سازگاری چندنمایی مدل اشاره دارن.
نکات کلیدی:
- Qwen-RobotWorld یه مدل جهانِ ویدیوییِ زبانمحوره که آیندهٔ تصویریِ فیزیکی رو از روی مشاهده و دستور زبانی پیشبینی میکنه.
- یه فرمول واحد چند حوزه (دستکاری رباتیک، رانندگی خودران، ناوبری) رو پوشش میده.
- معماریش شامل یه دیفیوژن ترنسفورمر ۶۰ لایهای، پیکرهٔ ۸.۶ میلیونیِ EWK و آموزش دومرحلهای عمومی+خبرهست.
- تو بنچمارکهای EWMBench و DreamGen Bench رتبهٔ اول شده و از مدلهای متنباز جلو زده.




