ARFBench: بنچمارک جدید Datadog برای سنجش هوش مصنوعی در تحلیل متریکها
خلاصهٔ کاملتر
هر سال بیش از یه تریلیون دلار به خاطر خرابی سیستمهای نرمافزاری از بین میره. وقتی یه سرویس دچار مشکل میشه، مهندسان باید سریع علت رو پیدا کنن — و یکی از مهمترین ابزارهاشون، تحلیل متریکهای observability یا همون دادههای سری زمانیه که وضعیت سلامت سیستم رو نشون میده. Datadog حالا یه بنچمارک جدید به اسم ARFBench (Anomaly Reasoning Framework Benchmark) معرفی کرده که مستقیماً از حوادث واقعی داخلی این شرکت گرفته شده.
ARFBench شامل ۷۵۰ جفت سوال-جواب از ۱۴۲ سری زمانی و ۶۳ حادثه واقعیه. سوالها در سه سطح دشواری طراحی شدن و هر سطح به استدلال درست از سطح قبلی وابستهست. این بنچمارک با دادههای مصنوعی فرق داره — هم دادههای واقعی داره، هم توضیحات متنی برای هر سری زمانی، و هم گروهبندی چندمتغیره که نشون میده چند متریک با هم چه معنایی دارن. مثلاً یه pod که ریاستارت میکنه شاید مهم نباشه، ولی اگه دهها pod همزمان این کار رو بکنن، یه ناهنجاری جدیه.
در آزمایشها، مدلهای مختلف از جمله LLMها (ورودی متنی)، VLMها (ورودی تصویری از نمودار) و مدلهای تخصصی سری زمانی با هم مقایسه شدن. GPT-5 با دقت ۶۲.۷٪ بهترین عملکرد رو داشت، ولی هنوز از متخصصان انسانی عقبتره. جالب اینه که مدلهای open-source بعضاً از مدلهای قدیمیتر proprietary یا مدلهای خانواده Claude بهتر عمل کردن.
Datadog برای رفع محدودیتهای VLMها — مثل تداخل رنگها در نمودارهای چندمتغیره — یه مدل ترکیبی هم آزمایش کرده. این مدل به اسم Toto-1.0-QA-Experimental از ترکیب Toto (مدل تخصصی سری زمانی خود Datadog) با Qwen3-VL-32B ساخته شده و با SFT و Reinforcement Learning آموزش دیده. این مدل در دستهبندی شناسایی ناهنجاریها حداقل ۸.۸ درصد از بهترین رقبا جلوتره — و تعداد پارامترهاش چند مرتبه از مدلهای frontier کمتره.
نکته جالب اینه که مدلها و انسانها در جاهای مختلفی اشتباه میکنن. GPT-5 روی ۴۸٪ از سوالهایی که هر دو متخصص اشتباه جواب دادن، درست جواب داده؛ در عوض، متخصصان ۷۹٪ از سوالهایی که GPT-5 غلط جواب داده رو درست حل کردن. این تفاوت نشون میده که ترکیب مدل و انسان میتونه یه «oracle» فوق بشری بسازه که دقت ۸۷.۲٪ داره — خیلی بالاتر از هر کدام بهتنهایی.
نکات کلیدی:
- ARFBench اولین بنچمارک TSQA مبتنی بر حوادث واقعی production با ۷۵۰ سوال در سه سطح دشواریه
- بهترین مدل موجود (GPT-5) فقط ۶۲.۷٪ دقت داره و هنوز از متخصصان انسانی عقبتره
- مدل ترکیبی Toto-1.0-QA-Experimental در شناسایی ناهنجاریها با حجم پارامتر کمتر، از همه مدلها بهتره
- مدلها و انسانها در جاهای مختلف اشتباه میکنن و ترکیبشون دقت ۸۷.۲٪ میده




