Step 5 Preview: همسطح Kimi K3 با یکسوم هزینه
خلاصهٔ کاملتر
تیم Artificial Analysis میگه Step 5 Preview، پرچمدار جدید StepFun، تو شاخص هوش این تیم نمره ۴۴ گرفته؛ دقیقا همسطح Kimi K3 (max) و یه پله پایینتر از GLM-5.3 (max) و Qwen3.8 Max که ۴۵ گرفتن. این مدل جانشین Step 3.7 Flash ـه که ماه مه امسال اومده بود و ۶۰۰ میلیارد پارامتر کل با ۲۷ میلیارد پارامتر فعال داره (یعنی معماری MoE که برای هر توکن فقط بخشی از مدل روشن میشه).
حرف اصلی گزارش قیمته. اجرای کل شاخص با Step 5 Preview حدود ۰.۷۲ دلار به ازای هر تسک درمیاد، در برابر حدود ۲.۰۰ دلار برای Kimi K3 (max) با همون نمره و ۲.۰۱ دلار برای GLM-5.3 (max) با یه نمره بیشتر. به گفته این تیم دلیلش مصرف توکن نیست، چون Step حدود ۱۶۴ میلیون توکن خروجی مصرف کرده و Kimi حدود ۱۷۰ میلیون. دلیلش صرفا قیمتگذاریه: یک دلار ورودی و ۲.۷ دلار خروجی به ازای هر یک میلیون توکن، در برابر ۳ و ۱۵ دلار Kimi.
بزرگترین جهش نسبت به نسل قبلی تو استدلال سطح بالاست. Step 5 Preview تو Humanity's Last Exam نمره ۴۶ درصد گرفته، نزدیک Kimi K3 با ۴۷ درصد، و تو CritPt هم ۲۱ درصد که بین Kimi (۲۳) و GLM-5.3 (۱۹) میشینه. نسبت به Step 3.7 Flash این یعنی ۲۵ واحد رشد روی HLE و ۱۹ واحد روی CritPt.
تو بنچمارک AA-Omniscience که حافظه واقعی و میزان توهم مدل رو میسنجه، ۴۲ درصد دقت گرفته؛ بالاتر از GLM-5.3 با ۳۴ درصد و پایینتر از Kimi K3 با ۴۸ درصد. نکته اینجاست که مدل بیشتر از GLM سراغ جواب دادن میره (۶۸ درصد سوالات در برابر ۵۵ درصد) ولی وقتی جواب میده، ۴۳ درصد مواقع توهم میزنه در برابر ۳۰ درصد. یعنی محدودکنندهش دانشش نیست، رفتارشه: به جای اینکه بگه نمیدونم، حدس میزنه.
جایی که عقب میمونه کارهای عاملیتیه. تو GDPval-AA که معیار اصلی این تیم برای عاملیته، ۱۵۶۶ امتیاز Elo گرفته در برابر ۱۶۶۸ برای Qwen3.8 Max و ۱۶۴۶ برای GLM-5.3 (max). همین فاصله تو Terminal-Bench 4.0 (۳۳ درصد در برابر ۳۹ و ۴۲)، AA-Briefcase و AutomationBench-AA هم تکرار میشه. از بقیه مشخصات: پنجره کانتکست یک میلیون توکن، ورودی متن و تصویر و ویدیو، و فعلا وزن بسته که قراره ۱۵ اکتبر متنباز بشه.
نکات کلیدی:
- نمره ۴۴ در شاخص هوش Artificial Analysis، همسطح Kimi K3 (max)
- هزینه حدود ۰.۷۲ دلار به ازای هر تسک، حدود ۲.۸ برابر ارزانتر از رقبای همنمره
- قیمتگذاری ۱ دلار ورودی و ۲.۷ دلار خروجی به ازای هر یک میلیون توکن، کش ورودی ۰.۰۵ دلار
- ۶۰۰ میلیارد پارامتر کل و ۲۷ میلیارد پارامتر فعال، کانتکست یک میلیون توکن
- ۴۶ درصد در Humanity's Last Exam و ۲۱ درصد در CritPt
- نرخ توهم ۴۳ درصد روی سوالات پاسخدادهشده در AA-Omniscience
- ۱۵۶۶ Elo در GDPval-AA، پایینتر از Qwen3.8 Max و GLM-5.3
- انتشار وزنها برنامهریزیشده برای ۱۵ اکتبر




