Terminal-Bench-Science؛ بنچمارکی که خود دانشمندا نوشتن
خلاصهٔ کاملتر
Terminal-Bench-Science یه بنچمارک تازهست که پژوهشگرای Stanford با تیم سازندهٔ Terminal-Bench و متخصصهایی از رشتههای مختلف علمی ساختنش. تو اعلامیهٔ پروژه اومده که هدفش سنجش ایجنتهای هوش مصنوعی (یعنی مدلهایی که خودشون تو ترمینال دستور میزنن و یه کار رو تا آخر پیش میبرن) روی کار واقعی پژوهشیه، نه سوالهای کتابی. نسخهٔ ۰.۱ با ۷۰ تسک منتشر شده.
به گفتهٔ نویسنده، سه تا کمبود باعث ساختش شده: بنچمارک باید از دل کار واقعی دانشمندا دربیاد، نتیجهش باید قابل راستیآزمایی باشه، و باید پابهپای مدلها بهروز بمونه. برای همین بهجای یه مقالهٔ یهبارمصرف، یه بنچمارک پیوستهست: مرتب نسخهٔ جدید میده، تسک اضافه میکنه و تسکهایی که مدلها اشباعشون کردن رو بازنشسته میکنه.
تسکها بهصورت باز روی GitHub پیشنهاد میشن و مسیر Propose → Build → Review رو طی میکنن؛ اول داور موضوعی اعتبار علمی رو بررسی میکنه، بعد داور فنی ساختار و تستهای راستیآزمایی رو، آخرش هم یه bar raiser تأیید نهایی میده. عددها نشون میده چقدر سختگیرانهست: از ۹۲۰ پیشنهاد، ۴۶۴ تا تأیید شد، ۳۸۶ تا پولریکوئست باز شد و آخرش فقط ۷۰ تسک به نسخهٔ ۰.۱ راه پیدا کرد.
تو نتایج، هر مدل سه بار روی هر ۷۰ تسک اجرا شده. Claude Opus 5 با Claude Code بالاترین نرخ حل رو با ۳۰ درصد گرفته، بعدش GPT-5.6 Sol با Codex روی ۲۲.۴ درصد و Claude Fable 5 روی ۲۱.۴ درصد. GLM 5.3 هم با ۸.۱ درصد قویترین مدل متنباز این دورهست. نویسنده میگه این سختی عمدیه و تسکها طوری کالیبره شدن که برای مدلهای روز هم چالش باشن.
هزینه هم بخشی از تصویره: ارزیابی کامل ۷۰ تسک با Claude Opus 5 حدود ۷ هزار دلار خرج برداشته، ولی GPT-5.6 Sol با ۴.۲ هزار دلار به همون سطحی رسیده که Claude Fable 5 با ۱۴.۲ هزار دلار بهش رسیده. کار روی نسخهٔ ۰.۲ هم شروع شده و مهلت ارسال پولریکوئست تا ۵ اکتبر ۲۰۲۶ه.
نکات کلیدی:
- نسخهٔ ۰.۱ شامل ۷۰ تسک از علوم زیستی، فیزیکی، زمین، ریاضی و مهندسیه.
- بالاترین نرخ حل مال Claude Opus 5 با Claude Code بود: ۳۰ درصد.
- GLM 5.3 با ۸.۱ درصد قویترین مدل متنباز ارزیابیشدهست.
- از ۹۲۰ پیشنهاد تسک، فقط ۷۰ تا به نسخهٔ ۰.۱ رسید.
- مهلت مشارکت برای نسخهٔ ۰.۲، پنجم اکتبر ۲۰۲۶ه.




