بنچمارکهای AI دیگه نمیگن کدوم مدل بهتره
خلاصهٔ کاملتر
تو یک هفته چهار آزمایشگاه بزرگ مدل پرچمدار یا نزدیک به پرچمدار منتشر کردن: یه نسخهٔ جدید از خانوادهٔ Claude، یه Gemini سریع و ارزون، یه مدل از Meta و یه GPT که هنوز محدود عرضه شده. هرکدوم با یه عدد بنچمارک اومدن که بهتنهایی مثل برد قطعی به نظر میرسید. چون هر چهارتا با یه تسک تولید SVG و یه تسک کلونکردن بازی به شکل یکسان تست شدن، این هفته عملاً به آزمون خود بنچمارکها تبدیل شد.
تناقض اصلی سر Deep SWE بود، بنچمارکی که شهرتش به همخوانی با حس واقعی کار با مدله. مدل Meta بالاتر از همه امتیاز گرفت، ولی وقتی همون مدل قرار شد یه بازی ساده بسازه، خروجیاش ضعیفترینِ چهارتا بود: یه صحنهٔ تیراندازی با مکعب و استوانه، بدون طراحی کاراکتر و پرداخت بصری. مدل Gemini با تقریباً همون امتیاز و کسری از هزینه، نتیجهٔ کاملتری داد و GPT با امتیاز کمترِ Deep SWE، پرداختهترین خروجی رو ساخت.
نویسنده میگه شاخص ترکیبی Artificial Analysis هم این هفته زیر فشار رفت. این شاخص چند بنچمارک رو با وزن ترکیب میکنه تا نویز هر تست تکی گرفته بشه، ولی همون مدل Meta که تو تست دستی عقب بود، تو رتبهبندی کلی سوم شد، بالاتر از GPT و Geminiای که خروجی بهترشون رو دیده بودن. یعنی نمرهٔ کلی بالا تضمینی برای کیفیت روی تسک مشخصِ خودت نیست.
قیمت هم داستان خودشو داشت. یه مدل که بهعنوان حدود ۲۵ درصد ارزونتر از نسخهٔ قبلی معرفی شده بود، تو بنچمارک هزینهٔ هر تسک گرونترین مدل تستشده درومد، حتی گرونتر از همونی که قرار بود جایگزین ارزونش باشه. یه تسک تولید SVG با اون مدل چند دقیقه طول کشید و چند دلار خرج برداشت، در حالی که همون کار روی مدل ارزونتر زیر دو دقیقه و با کسری از یه دلار تموم شد.
تو بنچمارک تصویری معروف به Beauty Bench هم که با داوری AI کار میکنه نه با یه معیار درستی ثابت، همین ناهماهنگی دیده شد: همون مدل Meta که صدرنشین Deep SWE بود، خیلی پایینتر ایستاد. جمعبندی نویسنده اینه که بنچمارکها فیلتر اولیهن نه حکم نهایی. یه بنچمارک استدلالی که یه مدل نزدیک ۹۹ درصد ازش گرفته عملاً اشباع شده و دیگه مدلهای ردهبالا رو از هم جدا نمیکنه.
نکات کلیدی:
- مدل صدرنشین Deep SWE تو ساخت یه بازی ساده ضعیفترین خروجی چهار مدل رو داد
- همون مدل تو شاخص ترکیبی Artificial Analysis رتبهٔ سوم رو گرفت
- اختلاف هزینهٔ هر تسک بین دو مدل تقریباً همنمره تا شش برابر بود
- مدلی که با ادعای ۲۵ درصد ارزونتر اومده بود، گرونترین هزینهٔ هر تسک رو داشت
- یه بنچمارک استدلالی با نمرهٔ نزدیک ۹۹ درصد عملاً اشباع شده
- Beauty Bench با داوری AI رتبه میده و نتیجهاش با بنچمارک کد همجهت نیست




