کیمی K3؛ بزرگترین مدل open-weight فعلی
خلاصهٔ کاملتر
سباستین راشکا بعد از انتشار وزنهای کیمی K3 نمودار معماریش رو درآورده و چند تا مشاهده کنارش گذاشته. حرف اولش اینه که نمودار با اینکه شلوغ به نظر میاد، در عمل نسخهٔ محصولی و بزرگشدهٔ همون Kimi Linear سال پیشه — از ۴۸ میلیارد پارامتر رسیده به ۲.۸ تریلیون، که با فاصله بزرگترین مدل open-weight حال حاضره. K3 پشتیبانی مالتیمودال بومی هم داره.
تنها جزء واقعاً تازه نسبت به Kimi Linear، همون LatentMoE هست؛ چیزی که تو Nemotron 3 Ultra هم دیده میشه. ایدهش اینه که لایههای خطی بزرگ رو با یه down-projection فشرده کنه، شبیه کاری که multi-head latent attention با attention میکنه. به گفتهٔ راشکا جهت کلی K3 — مثل Nemotron 3 و DeepSeek V4 — سمت کارایی اینفرنسه: اجزای موجود یکییکی با نسخههای بهینهشدهشون عوض شدن، یعنی MoE با LatentMoE و attention معمولی با multi-head latent attention و Kimi Delta Attention.
یه تغییر هست که به گفتهٔ نویسنده ربطی به کارایی نداره: attention residuals. اون هم مثل کاری که DeepSeek V4 با mHC روی مسیر residual انجام داد سراغ بهبود همین مسیر رفته، ولی جور دیگهای؛ mHC مسیر residual رو پهنتر کرد، در حالی که attention residuals مسیرهای residual رو بین لایهها به هم وصل میکنه و برای وزن اهمیت هر اتصال از یه امتیاز attention استفاده میکنه. طبق گزارش فنی، این کار خطای اعتبارسنجی و عملکرد پاییندستی رو بهطور پیوسته و البته کم بهتر میکنه و حدود ۴٪ به هزینهٔ آموزش و ۲٪ به هزینهٔ اینفرنس اضافه میکنه.
نکتهٔ جالبتر برای راشکا کنار گذاشتن کامل RoPE بود: K3 هیچ لایهٔ RoPE نداره و همهجا از NoPE یعنی نبود embedding موقعیتی استفاده میکنه — این هم از Kimi Linear به ارث رسیده. روند اخیر تو بقیهٔ معماریها برعکس بود: RoPE تو لایههای attention محلی مثل sliding window attention و NoPE تو لایههای سراسری. چند معماری دیگه هم فقط NoPE داشتن، ولی به گفتهٔ نویسنده K3 تا جایی که خبر داره اولین مدل در سطح frontier هست که این کارو کرده.
نکات کلیدی:
- کیمی K3 با ۲.۸ تریلیون پارامتر بزرگترین مدل open-weight فعلیه
- معماریش نسخهٔ بزرگشدهٔ Kimi Linear سال پیشه، نه یه طراحی از صفر
- LatentMoE تنها جزء تازهست و لایههای خطی بزرگ رو فشرده میکنه
- بیشتر تغییرها برای کارایی اینفرنسه: latent attention و Kimi Delta Attention
- attention residuals لایهها رو با وزن attention به هم وصل میکنه؛ حدود ۴٪ هزینهٔ آموزش و ۲٪ اینفرنس
- RoPE کلاً حذف شده و همهجا NoPE نشسته؛ اولین مدل frontier با این انتخاب
- پشتیبانی مالتیمودال بومی هم اضافه شده




