socbench؛ مدلهای زبانی چقدر تحلیلگر SOC خوبیان؟
خلاصهٔ کاملتر
مخزن socbench از تیم DeepTempo یه سؤال مشخص رو هدف گرفته: مدلهای استدلالی نسل جدید، وقتی نقش تحلیلگر مرکز عملیات امنیت رو بازی میکنن، واقعاً چقدر خوبن؟ ورودی هم چیزی نیست که از قبل تمیز شده باشه — NetFlow خام. هر مدل توی یه حلقهٔ ایجنتی چندمرحلهای و محدود کار میکنه و آخرش باید جوابش رو تو یه قالب JSON سفتوسخت بده.
چیزی که این بنچمارک رو از یه تست ساده جدا میکنه، کنترل متغیرهاست. مجموعهٔ داده از قبل ایندکس شده و قطعیه، ابزارها فقط-خواندنیان و برای هر پرسونا فهرست مجاز جدا دارن، و هر تحقیق سقف هزینهٔ دلاری داره. چهار پرسونا — SOC Analyst، Threat Analyst، Adversary Hunter و Detection Engineer — و سه ارائهدهنده روی همون واحدهای ارزیابی اجرا میشن.
همین اشتراک باعث میشه دلتاهای ablation هم معنیدار باشن: دو حالت tools_off و playbooks_off نشون میدن چقدر از نتیجه به ابزارها و چقدر به playbook ها وابستهست. امتیازدهی هم چند لنز داره: F1 در سطح هر flow، هر جفت و هر host. نمونهگیری هم طبقهبندیشدهست و در برابر ترکیب dataset hash و seed و mode قطعی میمونه.
ساخت ایندکس، خودِ کار اصلیه: parquet رو با config/schema.json نرمالسازی میکنه، سراسری بر اساس ts_start مرتب میکنه با تفکیک قطعی گرهها، به هر رکورد flow_id پایدار میده و واحدهای ارزیابی pair_timeline و host_egress رو میسازه. اجرای دوبارهٔ همون فرمان روی همون داده هیچ کاری نمیکنه مگه با --rebuild.
یه نکتهٔ مهم برای کسی که میخواد امتحانش کنه: پروژه local-first ـه. یه لپتاپ، سه تا API key و یه فایل parquet نمونه که تو خود مخزن کامیت شده کافیه تا با بودجهٔ زیر ۱۰ دلار یه اجرای آزمایشی (smoke) بگیری. حتی بدون هیچ کلیدی هم میشه با provider ساختگی کل مسیر رو اجرا کرد.
socbench build-index --config config/benchmark_config.yaml --dataset sample
socbench run --dataset-hash <hash> --providers mock --personas all
socbench run --dataset-hash <hash> --ablation tools_off --providers mock --personas allخروجی هر اجرا زیر runs// میشینه: خلاصهٔ امتیاز و هزینه، پیشبینیهای خام، فراخوانی ابزارها و حتی پرامپتهایی که واقعاً استفاده شدن. تو خود README تأکید شده که پروژه فعلاً آلفاست، ولی کل خط لوله سر تا ته اجرا میشه و هر نقطهٔ توسعه — ابزار، پرسونا، ارائهدهنده و لنز امتیازدهی — یا registry ـه یا یه کلید توی YAML.
نکات کلیدی:
- ارزیابی مدلهای استدلالی در نقش ایجنت SOC، روی NetFlow خام و از قبل ایندکسشده
- چهار پرسونا و سه ارائهدهنده روی واحدهای ارزیابی یکسان، پس اعداد قابل مقایسهان
- سقف هزینهٔ دلاری برای هر تحقیق و قالب JSON اجباری برای جواب نهایی
- دو ablation آمادهٔ tools_off و playbooks_off برای سنجش سهم ابزار و playbook
- اجرای کامل بدون API key از طریق provider ساختگی؛ پروژه فعلاً در وضعیت آلفاست




