ایجنتهای AI رو مثل محصول بسنجیم
خلاصهٔ کاملتر
اندرو ماربل تو این مقاله میگه بنچمارکهای کدنویسی — مثل شاخص ترکیبی AI Coding Agent Index که روی DeepSWE و Terminal-Bench V2 و SWE-Atlas-QnA بسته شده — دیگه با چیزی که واقعاً برای یه توسعهدهنده مهمه همراستا نیستن. به گفتهٔ اون سؤال امروز «میتونه انجامش بده؟» نیست، چون با یه آدم تو حلقه تقریباً هر ایجنتی از کار درش میآره؛ سؤال اینه که چقدر کارآمد انجامش میده و چه قضاوتی از خودش نشون میده.
نویسنده میگه تست کاملاً آزاد هم جواب نمیده — چیزی مثل یهضربه ساختن بازی، دموی قشنگی میشه ولی هیچ معیار موفقیتی نداره. برای همین سه تسک ساخته که هم شرط اجباری دارن هم فضای انتخاب آزاد: اینترفیس برچسبزنی برای ۱۵۰ جملهٔ ویکیپدیا (نصف از حباب داتکام، نصف از بحران مالی ۲۰۰۸)، اینترفیس رتبهبندی پنج طرح SVG برای هر کدوم از ۵۰ کاراکتر یونیکد، و اینترفیسی برای تصحیح ۱۰۰ قطعهکد پایتون که خطای سینتکسی داخلشون کار گذاشته شده.
پنج ایجنت تست شدن: GLM 5.2، Qwen 3.6 35B A3B، Laguna Poolside 2.1، Meta Muse Glimmer و Claude Opus 5 — سهتای وسطی محلی و کوانتایز شده. Claude با Claude Code و بقیه با هارنس Pi اجرا شدن. معیار کمّی، تعداد نوبت کاربر و مصرف توکن بود و بقیهٔ ارزیابی دستی و کیفی: چه انتخابهای ظاهری کرد، چقدر شهود داشت، و خروجی نهایی چقدر راحت استفاده میشه.
Claude تو هر سه تسک کمترین نوبت رو گرفت (۴، ۲ و ۳) و تقریباً یهضربه جواب داد، ولی نویسنده بدترین نکتهش رو «همکاری» میدونه: بیاجازه کلی تست و کار اضافه انجام میده و همین هر بار تکرار رو کند میکنه؛ کل مصرفش هم حدود ۵۰ دلار خرج برداشت. GLM برای این تسکها عملاً همسطح Claude بود ولی پرگو و دودل، و یه بار انقدر فکر کرد که تایماوت شد. Muse Glimmer کمترین توکن رو مصرف کرد و با سبک تفکر خیلی خلاصهش سریعترین تعامل رو داد.
Qwen و Laguna بهعنوان مدلهای کوچیک قابلقبول بودن ولی فاصلهشون با مدلهای نزدیکبهفرانتیر معلوم بود: استیرینگ بیشتری لازم داشتن و بعضی وقتها تو حلقهٔ فکر گیر میکردن — Laguna تو تسک ویرایش کد ۱۸ نوبت گرفت. خطاهای مشترک هم شنیدنیه: رندر مشکیرویمشکی SVGها، نبود سایدبار تو پاس اول، انتخاب رنگ قرمز/سبز برای دو کلاس. جمعبندی نویسنده اینه که برای ایجنتها به ارزیابی از جنس «نقد محصول» و منتقد قابلاعتماد نیاز داریم، نه فقط عدد بنچمارک.
نکات کلیدی:
- سه تسک پیشنهادی: برچسبزنی ۱۵۰ جملهٔ ویکیپدیا، رتبهبندی ۵ طرح SVG برای ۵۰ کاراکتر یونیکد، و تصحیح ۱۰۰ قطعهکد پایتون.
- Claude Opus 5 با Claude Code کمترین نوبت کاربر رو گرفت — ۴، ۲ و ۳ نوبت تو سه تسک — و هزینهش حدود ۵۰ دلار شد.
- Meta Muse Glimmer کمترین توکن رو مصرف کرد و بهخاطر سبک تفکر خیلی مستقیمش، تعامل سریعتری از Qwen و Laguna داشت.
- Laguna Poolside 2.1 تو تسک ویرایش کد ۱۸ نوبت کاربر لازم داشت، بیشترین بین همه.
- GLM 5.2 عملاً همسطح Claude ظاهر شد، ولی یه بار از بس فکر کرد تایماوت شد.
- Claude با هارنس Pi تست نشد، پس بخشی از رفتار تستکردن افراطیش میتونه از خود Claude Code باشه.




