WAC: چطور هوش مصنوعی رو بنچمارک کنیم؟
خلاصهٔ کاملتر
چند سالیه که برای سنجش مدلهای زبانی یه روش رایج وجود داره: یه لیست بلند از سوالها درست میکنن — کدنویسی، ریاضی، حقوق، تحلیل داده — و میبینن مدل چند تاشو درست جواب میده. منطقش همون منطق آزمونهای آکادمیکه: تست دقیقاً همون شغل نیست، ولی نتیجهاش با عملکرد واقعی همبستگی داره.
نویسنده یه موازیسازی جالب میکشه: این دقیقاً همون کاریه که شرکتها سالها با آزمونهای استخدامی میکردن. گوگل از کاندیداها میخواست پازلهای منطقی حل کنن، ولی بعداً اعتراف کرد این تستها «کاملاً بیفایده» بودن. Linear الان کاندیداها رو ۲ تا ۵ روز روی یه پروژهی واقعی میآره تا ببینه چطور کار میکنن — چون «شغل رو نمیشه توی یه بعدازظهر ارزیابی کرد.»
مشکل اصلی اینجاست: AI دیگه یه چتبات ساده نیست. حالا یه ایجنت (agent) هست — سیستمی که به خودش ادامه میده، حافظه داره، و به ابزارها و منابع داخلی سازمان وصله. وقتی تیم dbt یه بنچمارک تحلیلی جدید ساخت، متوجه شد کسی به نمرههای مطلق اهمیت نمیده؛ همه میخواستن بدونن این محصول در مقایسه با همون سیستمی که خودشون با Claude و Slack و Databricks همبسته کردن چطوره.
این یه تنش بنیادی ایجاد میکنه: چطور میشه یه بنچمارک استاندارد ساخت وقتی مهمترین عامل عملکرد — یعنی context (متن و زمینهی اختصاصی هر سازمان) — ذاتاً غیرقابل استانداردسازیه؟ شاید جواب اینه که اصلاً نباید دنبال بنچمارک استاندارد بود؛ ما کارمندها و نرمافزارهای سنتی رو هم بنچمارک نمیکنیم.
معیار جدیدی که نویسنده پیشنهاد میده اینه: WAC یا «Wins above Claude and Co.» — اقتباسی از مفهوم WAR در بیسبال که نشون میده یه بازیکن چقدر از یه بازیکن معمولی بهتره. در دنیای AI، خط پایهی «معمولی» دیگه هیچچیز نیست؛ یه نمونهی C* هست — Claude Code یا Codex متصل به Linear، Slack، و هر ابزار داخلی دیگهای. سوال اصلی برای هر محصول و شاید هر کارمند اینه: چقدر از این خط پایه بهتری؟
در پایان، نویسنده به یه نکتهی ظریف اشاره میکنه درباره «هارنس» (harness) — یعنی لایهای که مدل AI رو برای یه کاربرد خاص بهینه میکنه. همه از هارنسهای پیچیده حرف میزنن، ولی گاهی سادهترین تغییر مهمترینه. گوگل برای اولین بار در ۲۵ سال کادر جستجوش رو بزرگتر کرد — چون با AI، آدمها سوالهای طولانیتری میپرسن. بعضی وقتها هارنس فقط یه textarea بلندتره.
نکات کلیدی:
- بنچمارکهای استاندارد AI مثل آزمونهای استخدامی قدیمی هستن: وقتی context مهمترین عامله، تستهای ثابت کافی نیستن
- AI ایجنتها به ابزارها و منابع داخلی سازمان وصلن، که ارزیابی استاندارد رو سختتر میکنه
- معیار تازهی عملکرد، «WAC» یا برتری نسبت به C* (Claude/Codex متصل به همهچیز) هست
- گوگل برای اولین بار در ۲۵ سال کادر جستجوش رو بزرگ کرد — نشانهای که حتی سادهترین تغییر UI میتونه مهمترین «هارنس» باشه




