Kimi K3 قویترین مدل اوپنویت شد، اما نه یه لحظهٔ DeepSeek
خلاصهٔ کاملتر
تحلیل Zvi از Kimi K3 با یه جمعبندی روشن شروع میشه: این یه مدل خیلی خوب با بنچمارکهای عالیه و اگه وزنهاش طبق برنامه آزاد بشه، از نظر توان خام قویترین مدل اوپنویت میشه. ولی نویسنده هشدار میده ذوقزده نشیم و مدل رو فقط با نقاط قوت نسبیاش قضاوت نکنیم: به نظر اون در مجموع دستکم چهار ماه و به حدس میانهش شش ماه عقبتر از مرز مدلهای بستهست، با پستترینینگ نزدیکتر و پریترینینگ دورتر.
حقایق پایهای که Moonshot اعلام کرده: ۲.۸ تریلیون پارامتر با فعال شدن ۱۶ اکسپرت از ۸۹۶ (حدود ۵۰ میلیارد پارامتر فعال)، کانتکست یک میلیون توکن، بینایی بومی، و دو تغییر معماری به نامهای Kimi Delta Attention و Attention Residuals. شرکت میگه این تغییرها همراه با دستور پخت داده، حدود ۲.۵ برابر بهبود در کارایی اسکیلینگ نسبت به K2 داده. قیمت API سه دلار ورودی و پونزده دلار خروجی، پلنهای اشتراک از ۱۹ تا ۱۹۹ دلار، و وعدهٔ آزادسازی وزنها ۲۷ جولای.
بخش زیادی از مقاله دربارهٔ نحوهٔ خواندن بنچمارکهاست. نویسنده تأکید میکنه همهٔ بنچمارکهای رسمی با تنظیم حداکثر تلاش گرفته شدن، معمولاً با توکن خیلی بیشتر از تستهای مشابه رقبا، و مدل تا حدی distill شده — به احتمال زیاد از Claude و مخصوصاً Fable. نتیجهگیریش اینه که بنچمارکها رو مثل کف عملکرد ببینیم: ثابت میکنن مدل جدیه، ولی توان نسبیاش رو کمی بزرگتر از واقع نشون میدن.
مهمترین شاهد این ادعا هم همینجاست: بر اساس نتیجهٔ مقدماتی و غیررسمی، Kimi K3 روی شاخص Epoch Capabilities Index دقیقاً روی خط روند مدلهای چینی میافته، بین Opus 4.6 و Opus 4.7 — یعنی حدود شش ماه عقبتر از OpenAI و Anthropic ولی جلوتر از گوگل، متا و SpaceX. Ethan Mollick هم نقل شده که این یه لحظهٔ DeepSeek نیست، چون جایی روی منحنی نشسته که انتظارش میرفت، نه یه جهش غیرمنتظره.
نویسنده کل بخش اول مقاله رو میذاره روی همین الگوی تکرارشوندهٔ رسانهای: مدل چینی منتشر میشه، یه بنچمارک تحسینآمیز نقل میشه، و نتیجه میگیرن برتری آمریکا تموم شد. به گفتهٔ اون Axios بر اساس رتبهٔ Arena همین کارو کرد. او یادآوری میکنه که همین سبک استدلال چند بار روی سیاستگذاری واشینگتن اثر گذاشته، پس بیاهمیت نیست. تیترش هم سادهست: عملکرد دندانهداره؛ Kimi تو بعضی چیزها عالیه و تو بعضی چیزها نه.
حساسترین بخش مقاله دربارهٔ ایمنیست. به نوشتهٔ Zvi، هیچ تدبیر فنی مشخصی برای جلوگیری از سوءاستفاده دیده نمیشه و در حوزهٔ زیستشناسی عملاً صفره؛ بلاگ فنی رسمی هم تقریباً هیچی دربارهٔ ریسک و کاهش ریسک نگفته. Moonshot مدل رو برای بازبینی سیروزه هم ارائه نکرده. نکتهٔ عجیبتر اینه که چند پژوهشگر امنیت گزارش دادن مدل روی بنچمارکهای سایبری بهطور غیرمنتظره ضعیفه؛ فرضیهٔ مطرحشده اینه که اگه آموزش زیادی از Fable دیستیل شده باشه و Fable خودش کارهای سایبری رو رد کنه، همین کمبود نسبی توضیح داده میشه.
جمعبندی عملی نویسنده متعادله: Kimi K3 ارزش این رو داره که ببینی تو گردش کار تو جا میشه یا نه، ولی با این قیمت جای مدلهای اوپن کوچکتر و ارزونتر رو نمیگیره و انتظار داره معمولاً تو رقابت با بهترین مدلهای بسته ببازه — هرچند جاهایی هست که انتخاب خوبیه. حاشیهٔ خبری هم اینکه Moonshot به سرمایهگذارها گفته تو شش ماه آینده برنامهٔ عرضهٔ اولیهٔ سهام در هنگکنگ داره.
نکات کلیدی:
- ۲.۸ تریلیون پارامتر، ۱۶ اکسپرت فعال از ۸۹۶ (~۵۰B فعال)، کانتکست ۱M، بینایی بومی
- معماری تازه: Kimi Delta Attention و Attention Residuals، با ادعای ۲.۵ برابر کارایی اسکیلینگ نسبت به K2
- به تحلیل نویسنده ۴ تا ۶ ماه عقبتر از مرز مدلهای بسته؛ روی خط روند مدلهای چینی
- همهٔ بنچمارکها با حداکثر تلاش گرفته شدن و مدل تا حدی distill شده، پس توان نسبی بزرگنمایی شده
- تدابیر ایمنی زیستی عملاً وجود ندارن و بلاگ رسمی دربارهٔ ریسک حرفی نزده
- قیمت ۳/۱۵ دلار، اشتراک ۱۹ تا ۱۹۹ دلار، وعدهٔ آزادسازی وزنها ۲۷ جولای
- Moonshot از برنامهٔ عرضهٔ اولیهٔ سهام در هنگکنگ تو شش ماه آینده خبر داده




