Harness Arena: مقایسهٔ واقعی ابزارهای کدنویسی AI
خلاصهٔ کاملتر
تو این مقاله اومده که Harness Arena ابزارها رو نه از روی نمرهٔ یه بنچمارک بسته، بلکه از روی کاری که واقعاً تحویل میدن مقایسه میکنه. چیزی که اینجا سنجیده میشه هارنسه، یعنی همون لایهٔ نرمافزاری دور مدل: دستورالعملهاش، ابزارهایی که میتونه صدا بزنه و محیطی که توش اجرا میشه. چون مدل ثابت نگه داشته میشه، هر تفاوتی تو خروجی برمیگرده به کیفیت همین لایه، نه به خود مدل.
تو نمونهای که نشون داده شده، یه تسک به اسم «3D globe application, targeted overlay removal» روی شش هارنس اجرا شده: Codex، On Demand، Hermes، OpenCode، OpenClaw و Claude Code، همه با همون پیکربندی مدل Qwen 3.8. نمای مقایسه یه جدول میسازه که هر ستونش یه هارنسه و مدل مصرفی، نمرهٔ خودت، امتیاز جامعه و تعداد خروجیها رو کنار هم نشون میده.
داوری کوره: اول توضیح تسک و روبریکش رو میخونی، بعد خروجیهای بینام رو کنار هم بررسی میکنی و به هرکدوم از ۱ تا ۱۰ نمره میدی؛ اسم هارنسها فقط بعد از ثبت همهٔ نمرهها معلوم میشه. نویسنده پیشنهاد میکنه قبل از نمره دادن یه چکلیست کوتاه از روی روبریک بسازی، چون ابزاری که overlay رو درست حذف کرده ولی چرخش یا زوم رو خراب کرده نباید همنمرهٔ ابزاری بشه که هردو رو درست انجام داده.
لیدربورد بر اساس دستهبندی جدا میشه (کد، تحقیق، عملیات) و ریتینگ، نرخ برد، تعداد رأی، برد و باخت و میانهٔ زمان تکمیل رو نشون میده. نویسنده تأکید میکنه این عددها رو جدا از هم نخونی: هارنسی که سریع تموم میکنه ولی کد خراب تحویل میده عملاً سریعتر نیست. تو نماهای اولیهٔ دستهٔ کد، چند هارنس فقط با یه رأی، ریتینگ یکسان داشتن، پس فاصلهٔ کم بینشون هنوز معنی خاصی نمیده.
هرکسی میتونه بنچمارک خودش رو بفرسته: یا تسکها رو از مجموعههای موجود برمیداری، یا یه قالب اکسل دانلود میکنی و هر تسک رو تو یه ردیف مینویسی. حداقل دو هارنس برای اجرای مقایسه لازمه و مدلهایی مثل Kimi K2، GLM 4.5 Flash و Qwen 3.8 تو رابط کاربری بودن که چندتاشون اون موقع رایگان علامت خورده بودن. برای دیدن لیدربورد و battle log حساب لازم نیست، ولی برای داوری کردن و ساخت بنچمارک باید وارد بشی.
نکات کلیدی:
- مدل تو هر راند ثابت میمونه تا تفاوت خروجی فقط به هارنس برگرده
- راند نمونه شش هارنس شامل Codex، Claude Code و OpenCode رو با Qwen 3.8 سنجیده
- نمرهدهی از ۱ تا ۱۰ و کاملاً بینامه؛ اسم ابزارها بعد از ثبت نمره معلوم میشه
- ساخت بنچمارک سفارشی حداقل دو هارنس لازم داره و تسکها با قالب اکسل آپلود میشن
- بکاند پروژه روی گیتهاب با لایسنس MIT هست، ولی هزینهٔ مدل و هاست با خودته




