dig.bench؛ بنچمارکی که قانونهاش رو بهت نمیگه
خلاصهٔ کاملتر
یه تیم پژوهشی بنچمارک تازهای به اسم dig.bench منتشر کرده که سراغ چیزی میره که بنچمارکهای معمولی اندازه نمیگیرن: کشف علمی. تو هر بازی، قانونهای خودِ بازی به بازیکن گفته نمیشه و باید با آزمایش کردن پیدا بشه. به گفتهٔ سازندهها همهٔ بازیها متنیان، چون اینجوری هیچ مانع بصریای بین مدل و کشف نمیمونه و چیزی که سنجیده میشه فقط خود کشفه.
مجموعه ۷۰ بازی داره و تو ۷ سطح سختی دستهبندی شده؛ سطح ۱ سادهترینه و سطح ۷ سختترین. برای بردن هر بازی، عامل باید اول قانونهای ناشناخته رو کشف کنه و بعد باهاشون چالشها رو حل کنه. نمرهدهی هم سادهست: بازی باید توی تعداد محدودی قدم برده بشه. برد هر بازی روی اجراهاش میانگین گرفته میشه و بعد روی ده بازیِ همون سطح.
نکتهٔ اصلی مقایسه اینه که آدمها و مدلهای پیشرو دقیقاً یه شرایط دارن: همون رابط، همون وضعیت بازی، همون مجموعه اکشن و همون بودجهٔ قدم. تو مقاله اومده که هیچ بازیای آسون نیست و همهشون بازی کردنِ جدی میخوان، ولی تستکنندههای انسانی بیرونی تونستن همه رو تو تلاش اول ببرن. در مقابل، بهترین مدلها تو سطح آخر لنگ میزنن.
لیدربورد دو دستهٔ جدا داره: harness پایه (یعنی مدل خام و بدون ابزار جانبی) و harness عاملی که مدل رو با ابزارهای کدنویسی مثل Claude Code یا Codex ترکیب میکنه. ۲۱ بازی از اون ۷۰ تا عمومی شده و میشه هر مدلی رو از طریق SDK یا API روشون اجرا کرد. مقالهش هم روی arXiv با شناسهٔ 2608.12593 منتشر شده.
نکات کلیدی:
- ۷۰ بازی متنی تو ۷ سطح سختی، که ۲۱ تاش عمومی شده
- امتیاز هر سطح از میانگین ده بازیِ همون سطح درمیاد
- تستکنندههای انسانی همهٔ بازیها رو تو تلاش اول بردن
- بهترین مدلها تو سطح ۷ کم میارن
- لیدربورد دو حالت داره: harness پایه و harness عاملی
- مقاله روی arXiv با شناسهٔ 2608.12593 در دسترسه




