شیائومی MiMo-V2.6 رو اوپنسورس کرد
خلاصهٔ کاملتر
شیائومی سری MiMo-V2.6 رو منتشر و اوپنسورس کرده: دو تا مدل که ذاتاً omnimodal هستن، یعنی از اول با متن و تصویر و ویدیو با هم آموزش دیدن نه اینکه بعداً بهشون وصله شده باشه. هدفشون کدنویسی، کارهای تصویری و کار کردن با خود کامپیوتره. MiMo-V2.6-Pro مدل قویتره و Flash سراغ تعادل بین هوش و هزینه میره. یه نسخه Pro-UltraSpeed هم هست که با همون کیفیت تا ۲۰ برابر سریعتر جواب میده.
به گفته شیائومی، Pro تو شاخص Artificial Analysis Intelligence Index نسخه ۴.۳ عدد ۴۶.۳۲ گرفته و با این حساب از Kimi K3 و Qwen3.8 Max جلو زده و بالاترین امتیاز بین مدلهای اوپنسورس این مقایسه رو داره. قیمت API هم همون سطح V2.5 مونده: Flash هر میلیون توکن ورودی بدون کش ۰.۱۴ دلار و خروجی ۰.۲۸ دلار، Pro هم ۰.۴۳۵ و ۰.۸۷ دلار. UltraSpeed ده برابر گرونتره. هر دو مدل الان تو AI Studio، MiMo Code، MiMo Desktop، پلتفرم API خود شیائومی و OpenRouter در دسترسن.
این نسخه بیشتر از هر چیز روی بزرگ کردن مقیاس reinforcement learning سوار شده، یعنی آموزش با پاداش روی کارهایی که درستی جوابشون قابل بررسیه. تو کمتر از شش روز، Flash و Pro هر کدوم سی قدم RL روی حدود ۷۵۰ هزار trajectory برداشتن، با هزینهای حدود ۸۵۰ هزار دلار برای Flash و ۲.۶۲ میلیون دلار برای Pro. نمره DeepSWE v1.1 هم از ۴۸.۸ به ۶۵.۶۸ و از ۵۸.۴ به ۷۲.۵۷ رسیده.
آموزش روی کد، ایجنت عمومی، کارهای تصویری و امنیت سایبری انجام شده، با ۱۵۶۸ نمونه تو هر آپدیت و طول کانتکست تا یک میلیون توکن. شیائومی router رو فریز کرده تا مدل زیادی از مسیرش منحرف نشه، و برای جلوگیری از reward hacking (یعنی وقتی مدل یاد میگیره بهجای حل درست مسئله، سیستم امتیازدهی رو گول بزنه) از ارزیابی adversarial، تشخیص ناهنجاری و چک متقابل verifierها استفاده کرده.
شیائومی اسم کاربردهای فراتر از کد رو گذاشته Vibe World: از یه تصویر، ویدیو یا متن میتونه چند ایجنت رو هماهنگ کنه تا صحنه سهبعدی تعاملی بسازن و چشمی تستش کنن، asset های Blender بسازه، بازوی رباتیک Franka Panda رو از روی تصویر دوربین کنترل کنه، فرانتاند و ارائه بسازه و موسیقی رو بهشکل نت و MIDI بنویسه. گزارش فنی، محیطهای آموزش و کد RL هم کنار مدلها منتشر میشه.
نکات کلیدی:
- MiMo-V2.6-Pro تو Artificial Analysis Intelligence Index v4.3 نمره ۴۶.۳۲ گرفته
- قیمت Flash هر میلیون توکن ۰.۱۴ دلار ورودی و ۰.۲۸ دلار خروجی، Pro ۰.۴۳۵ و ۰.۸۷ دلار
- سی قدم RL روی ~۷۵۰ هزار trajectory تو کمتر از شش روز، با هزینه ۸۵۰ هزار و ۲.۶۲ میلیون دلار
- نمره DeepSWE v1.1 از ۴۸.۸ به ۶۵.۶۸ و از ۵۸.۴ به ۷۲.۵۷ رفته
- طول کانتکست تا یک میلیون توکن و ۱۵۶۸ نمونه در هر آپدیت
- گزارش فنی، محیطهای آموزش و کد RL هم منتشر میشن




