Kimi K3؛ مدل باز ۲.۸ تریلیون پارامتری
خلاصهٔ کاملتر
مونشات مدل Kimi K3 رو معرفی کرده: یه مدل ۲.۸ تریلیون پارامتری با قابلیت بینایی بومی و پنجرهٔ کانتکست یکمیلیون توکنی، که به گفتهٔ سازنده اولین مدل بازِ کلاس ۳ تریلیونه. تیم میگه عملکرد کلیاش هنوز از قدرتمندترین مدلهای اختصاصی یعنی Claude Fable 5 و GPT 5.6 Sol عقبتره، ولی توی مجموعه ارزیابیهای خودشون سطح مرزی نشون داده و از بقیهٔ مدلهای تستشده جلو زده.
از نظر معماری، K3 روی دو ایدهٔ Kimi Delta Attention و Attention Residuals ساخته شده که جریان اطلاعات رو در طول دنباله و عمق مدل بهبود میدن. اسپارسیتی MoE هم بالا رفته و عملاً ۱۶ متخصص از ۸۹۶ فعال میشن. مجموع این تغییرها به ادعای تیم حدود ۲.۵ برابر بهبود در کارایی مقیاسپذیری نسبت به Kimi K2 داده.
تمرکز اصلی روی کدنویسی طولانیمدته. توی یکی از آزمایشها هر مدل تا ۲۴ ساعت وقت داشت چهار کرنل GPU رو پروفایل، بازنویسی و بنچمارک کنه؛ K3 با Fable 5 رقابت کرده و از Opus 4.8 و GPT 5.6 Sol و GPT 5.5 جلو زده. تیم میگه توی مراحل پایانی توسعه، نسخهٔ اولیهٔ خودِ K3 بیشتر کارهای بهینهسازی کرنل تیم رو انجام داده.
یه نمونهٔ جاهطلبانهتر ساختن MiniTriton بوده: یه کامپایلر فشرده شبیه Triton با لایهٔ IR سطحتایل روی MLIR، پاسهای بهینهسازی و خط لولهٔ تولید کد PTX. به گزارش مونشات، MiniTriton روی بنچمارکهای پشتیبانیشده همتراز یا بهتر از Triton و torch.compile عمل کرده و آموزش سرتاسری nanoGPT رو با همگرایی پایدار پیش برده.
بهعنوان یه اثبات مفهوم، K3 توی یه اجرای خودمختار ۴۸ ساعته یه تراشه برای یه مدل کوچک مبتنی بر معماری خودش طراحی، بهینه و تأیید کرده — با ابزارهای EDA متنباز و کتابخانهٔ Nangate 45nm. تراشه توی ۴ میلیمتر مربع، تایمینگ رو در ۱۰۰ مگاهرتز میبنده و توی شبیهسازی بیش از ۸٬۷۰۰ توکن بر ثانیه دیکد میده.
توی کار دانشی هم نمونههایی مثل یه گزارش تعاملی از ۴۲ سال صنعت ASIC (با بیش از ۲۸۰۰ جستوجوی وب و ۱۱ هزار صفحه منبع) و تحلیل ۳۹۱ رویداد موج گرانشی با بیش از ۲۰ سابایجنت همزمان ارائه شده. توی Kimi Work هم دو قابلیت تازه اضافه شده: ویجتها که کامپوننت تعاملی داخل چت میسازن، و داشبورد که ویجتهای مهم رو توی یه نمای ماندگار جمع میکنه.
از نظر زیرساخت، K3 از مرحلهٔ SFT به بعد آموزش آگاه به کوانتیزاسیون داره و از وزنهای MXFP4 با فعالسازی MXFP8 استفاده میکنه. تیم توصیه میکنه مدل روی پیکربندیهای سوپرنود با ۶۴ شتابدهنده یا بیشتر مستقر بشه و میگه پیادهسازی کش پیشوندی سازگار با KDA رو به جامعهٔ vLLM اضافه کرده.
مدل از همون روز روی kimi.com، Kimi Work، Kimi Code و API در دسترسه و قرار بوده وزنهای کامل تا ۲۷ ژوئیهٔ ۲۰۲۶ منتشر بشن. قیمت API برای ورودیِ کشهیت ۰.۳ دلار، ورودی کشمیس ۳ دلار و خروجی ۱۵ دلار بهازای هر میلیون توکنه؛ تیم میگه با معماری استنتاج تفکیکشدهٔ Mooncake، نرخ کشهیت توی بارهای کدنویسی بالای ۹۰٪ میمونه.
نکات کلیدی:
- مدل باز ۲.۸ تریلیون پارامتری با بینایی بومی و کانتکست یکمیلیون توکنی
- معماری KDA و AttnRes با فعال شدن ۱۶ متخصص از ۸۹۶ و ادعای ۲.۵ برابر کارایی بهتر از K2
- تمرکز روی کدنویسی طولانیمدت: بهینهسازی کرنل GPU و ساخت کامپایلر MiniTriton
- طراحی خودمختار یه تراشه در ۴۸ ساعت با ابزارهای EDA متنباز
- قیمت API: ۰.۳ دلار کشهیت، ۳ دلار کشمیس و ۱۵ دلار خروجی بهازای هر میلیون توکن
- به گفتهٔ خود تیم، هنوز از Claude Fable 5 و GPT 5.6 Sol عقبتره




