بنچمارکهای محبوب برنامهنویسی، اشتباهای بزرگ دارن
خلاصهٔ کاملتر
دن لو تو این پست به سراغ کد یه ریپوی محبوب به اسم napkin-math میره که جدولی از تاخیر و توان عملیاتی چیزایی مثل خوندن حافظه، دیسک و شبکه رو برای تخمین سریع کارایی سیستم میده. یکی از دوستاش موقع آماده شدن برای مصاحبهٔ کارایی کامپیوتر، به عدد ۲۰ نانوثانیه برای تاخیر خوندن رندوم حافظه شک میکنه، چون این عدد باید حدود ۱۰۰ نانوثانیه باشه.
وقتی کد تست رو نگاه میکنن، میبینن مشکل از کجاست:
while test.i < test.vec.len() {
let random_index = test.order[test.i];
black_box(test.vec[random_index]);
test.i += 1;
}چون بین دفعات این حلقه هیچ وابستگی دیتایی نیست، پردازنده میتونه چندتا خوندن حافظه رو همزمان تو صف بندازه، پس عدد میانگین بهدستاومده اصلا تاخیر واقعی یه خوندن تنها رو نشون نمیده. تو کد بنچمارک دیسک هم باگای مشابه پیدا میشه، مثل آفستهای نامرتب که میتونن باعث خوندن اضافه از کش یا حتی خطای خارج از محدوده بشن.
بخش دوم پست به دو تا بنچمارک ارزیابی مدلهای هوش مصنوعی برای کدنویسی میپردازه: DeepSWE و Senior SWE-Bench. نتیجهٔ این بنچمارکا با تجربهٔ واقعی خیلیا از این مدلا جور درنمیاد؛ مثلا تو DeepSWE، مدل قدیمیتر GPT-5.5 بهتر از مدل جدید Opus 4.8 نشون داده میشه. دن لو میگه از ۱۱۳ تسک این بنچمارک، فقط چندتاش به زبون و نوع کاری که خودش باهاش کار میکنه ربط داره، پس نمرهٔ کلی براش تقریبا بیمعنیه.
دربارهٔ Senior SWE-Bench، دن لو به روش نمرهدهیش ایراد میگیره: یه راهحل باید هم از یه حد رتبهبندی بالاتر باشه و هم طولش بیشتر از دو برابر راهحل مرجع نشه تا «شیک» حساب بشه. همین آستانهٔ سخت باعث میشه یه خط کد بیشتر یا کمتر، نتیجهٔ پاس یا فیل رو کاملا عوض کنه، در حالی که هر تست فقط یه بار اجرا شده و طبق تجربهٔ خود نویسنده، نتیجهٔ اجرای مدلای زبونی بین دفعات مختلف نوسان زیادی داره.
نکات کلیدی:
- بنچمارک napkin-math (۵٫۴ هزار ستاره تو گیتهاب) برای تاخیر خوندن رندوم حافظه عدد ۲۰ نانوثانیه میده، در حالی که به خاطر باگ تو کد باید حدود ۱۰۰ نانوثانیه باشه
- تو DeepSWE با ۱۱۳ تسک، GPT-5.5 با ۶۷٪ در برابر ۵۴٪ Opus 4.8 برنده میشه، ولی اکثر تسکاش به کار واقعی برنامهنویسا ربطی نداره
- Senior SWE-Bench برای «شیک» بودن راهحل، آستانهٔ سخت روی طول کد میذاره و هر تست فقط یه بار اجرا میشه
- نتیجهٔ اجرای مدلای زبونی بین دفعات مختلف نوسان زیاد داره، پس یه اجرای تنها معیار قابلاعتمادی نیست




