کیمی K3 با وزنهای باز منتشر شد
خلاصهٔ کاملتر
مونشات (Moonshot AI) اعلام کرد که وزنهای مدل Kimi K3 و گزارش فنیاش رو منتشر کرده. به گفتهٔ تیم، K3 توانمندترین مدلشونه: یه مدل Mixture-of-Experts با ۲.۸ تریلیون پارامتر، درک تصویری بومی و پنجرهٔ کانتکست یکمیلیون توکنی. وزنها روی Hugging Face و گزارش فنی توی مخزن گیتهاب پروژه در دسترسه.
نکتهٔ اصلی این اعلامیه معماریه، نه اندازه. تیم میگه K3 روی دو ایدهٔ تازه سواره: Kimi Delta Attention که توی کانتکستهای میلیونتوکنی تا ۶.۳ برابر دیکد سریعتر میده، و Attention Residuals که بهجای جمع ثابت و یکنواخت لایهها، یه اتنشن یادگرفتهشده روی لایههای قبلی میذاره و حدود ۲۵ درصد بازدهی آموزش رو با تنها ۲ درصد هزینهٔ اضافه بالا میبره.
اسپارسیتی MoE هم بالا رفته: از ۸۹۶ اکسپرت عملاً ۱۶ تا فعال میشن، اون هم توی چارچوبی که خودشون Stable LatentMoE صداش میکنن. مجموع این تغییرهای ساختاری، به ادعای مونشات، حدود ۲.۵ برابر بهبود در بازدهی مقیاسپذیری نسبت به K2 میده — یعنی تبدیل مؤثرتر محاسبه به هوش، نه فقط بزرگتر کردن مدل.
روی بنچمارکهای داخلی خودشون که از الگوهای تکرارشوندهٔ کار واقعی کاربر و ایجنت ساخته شده، Kimi K3 Max نمرهٔ ۷۵.۵ روی Online Exp Bench، ۷۳.۵ روی DECK-Bench و ۶۲.۶ روی Finance-Bench گرفته و به گفتهٔ تیم توی هر سه از Claude Opus 4.8 و GPT-5.5 جلو زده. اینها بنچمارک داخلی خود سازندهان، پس بهتره با احتیاط خونده بشن.
مونشات فقط وزنها رو باز نکرده؛ بخش بیشتری از استک پشت مدل هم آزاد شده: کرنلهای پرسرعت اتنشن، کتابخانهٔ ارتباطی MoE و زیرساخت اجرای محیطهای ایجنتی در مقیاس. برای تیمهایی که میخوان مدلهای بزرگ رو خودشون سرو کنن، همین بخش دوم شاید از خود وزنها هم مهمتر باشه.
نکات کلیدی:
- Kimi K3 یه مدل MoE با ۲.۸ تریلیون پارامتر، مالتیمودال بومی و کانتکست ۱ میلیون توکن
- وزنها روی Hugging Face و گزارش فنی روی گیتهاب منتشر شدن
- معماری تازه: Kimi Delta Attention برای دیکد سریعتر و Attention Residuals برای آموزش کارآمدتر
- از ۸۹۶ اکسپرت فقط ۱۶ تا فعال میشن، در چارچوب Stable LatentMoE
- کرنلهای اتنشن، لایبرری ارتباطی MoE و زیرساخت محیط ایجنتی هم باز شدن




