کیمی K3 توی تست واقعی کدنویسی
خلاصهٔ کاملتر
کیمی K3 یه مدل زبانی بزرگ با وزنهای باز (open weight) ـه که با نمرههای بنچمارکی چشمگیر منتشر شد؛ توی چند لیدربورد جلوتر از GPT 5.5 و Opus 4.8 و نزدیک به مدلهای بستهٔ ردهٔ بالا ظاهر شد. برای یه مدل open weight این نتیجه غیرعادیه و برای همین سریع توجه توسعهدهندههایی رو گرفت که دنبال جایگزین ارزونتر میگردن. ولی به گفتهٔ نویسنده، تست دستی و مستقل روایت پیچیدهتری داره.
تو مقاله اومده که یه کانال مهندسی هوش مصنوعی یه هارنس بنچمارک اختصاصی ساخته و Opus 4.8، کیمی K3 و کیمی K2.7 رو با ایشوهای یکسان از یه مخزن واقعی و فعال — نه پروژهٔ نمایشی — تست کرده. هر مدل همون گردشکار سهمرحلهای رو طی کرد: برنامهریزی، پیادهسازی، اعتبارسنجی. بعد هر پولریکوئست با یه روبریک هفتبعدی (کیفیت پیادهسازی، over-engineering، تست، مستندسازی و…) از ۷۰ نمره ارزیابی شد و هزینهٔ هر تسک هم کنارش ثبت شد.
روی ایشوهای ساده فاصله تقریباً صفر بود: Opus 4.8 میانگین ۶۴.۳ از ۷۰ گرفت و کیمی K3 حدود ۰.۲ نمره پایینتر، با هزینهٔ کمتر. روی کارهای پیچیده اما فاصله باز شد؛ Opus روی ۶۲.۲ موند و کیمی K3 کمی بالای ۶۰. جالب اینکه دقیقاً همینجا برتری هزینهای کیمی K3 بزرگتر شد، چون Opus برای رسیدن به یه PR کامل توکن خیلی بیشتری مصرف میکرد.
گویاترین بخش، «تلهتسک»هایی بود که عمداً برای بیرون کشیدن ضعفهای مدلهای open weight طراحی شده بودن: نرخ شکست Opus 4.8 حدود ۸ درصد و کیمی K3 حدود ۳۶ درصد. خود تستر تأکید میکنه این تلهها هدفمند ساخته شدن، پس فاصلهٔ واقعی توی کار روزمره کمتره؛ نکته اینه که این حالتهای شکست وجود دارن و قابل پیشبینیان. جمعبندی نویسنده ترکیب مدلهاست: یه مدل قوی مثل Opus برای برنامهریزی، و کیمی K3 یا GLM 5.2 بهعنوان اسببارکش پیادهسازی، بهعلاوهٔ یه لایهٔ اعتبارسنجی اضافه.
نکات کلیدی:
- روی کارهای سادهٔ کدنویسی، کیمی K3 عملاً همسطح Opus 4.8 ـه و ارزونتر تموم میشه.
- روی کارهای پیچیده کیفیتش کمی افت میکنه، ولی در عوض صرفهٔ هزینهش بیشتر میشه.
- توی تلهتسکهای طراحیشده، نرخ شکست ۳۶ درصد بود در برابر ۸ درصد Opus.
- قیمتش روی OpenRouter حدود ۳ دلار ورودی و ۱۵ دلار خروجی بهازای هر میلیون توکن ـه، تقریباً نصف Opus.
- کیمی K2.7 هنوز عقبتره و برای هدایت کل گردشکار توصیه نمیشه.




