EvidenceForge؛ ساخت لاگهای امنیتی جعلی واقعنما
خلاصهٔ کاملتر
تیم تحقیقاتی Cisco Talos ابزار متنبازی به اسم EvidenceForge منتشر کرده که کارش ساختن دیتاستهای لاگ امنیتی مصنوعیه؛ یعنی دادهای که واقعی نیست ولی برای تمرین شکار تهدید و تحقیقات امنیتی بهدرد میخوره. تو معرفی پروژه اومده که مشکل اصلی ابزارهای مشابه اینه که دادهشون اونقدر مصنوعی به نظر میرسه که یه تحلیلگر باتجربه تو چند ثانیه میفهمه جعلیه، و EvidenceForge دقیقاً سراغ همین مشکل رفته.
هستهٔ ایدهاش چیزیه که خودشون بهش میگن «انسجام از طریق ساخت». همهٔ فرمتهای لاگ از یه مدل واحد به اسم SecurityEvent تغذیه میشن، پس دو خروجی مختلف نمیتونن سر یه شماره پورت یا تایماستمپ یا LogonID با هم اختلاف داشته باشن؛ چون فقط یه مقدار وجود داره. نویسندهها میگن همین ناهماهنگی بین منابع مختلف، بزرگترین نشونهٔ دادهٔ ساختگیه که این ابزار حذفش میکنه.
بخش جالب دیگه ترتیب علّی رویدادهاست: کوئریهای DNS قبل از اتصالها، و رویدادهای Kerberos قبل از لاگین دامین میان، درست مثل دنیای واقعی. یه موتور قاعدهمحور پیشنیازها رو با فاصلهٔ زمانی واقعنما خودش میسازه. علاوه بر این، فعالیت کاربرها از یه فرایند Hawkes پیروی میکنه که رفتار انسانی رو شبیهسازی میکنه؛ یعنی رویدادها انفجاری شروع میشن و بعد آروم کم میشن، حتی تغییرات روزهای هفته مثل شلوغی لاگین دوشنبهها و خلوتی آخر هفته هم مدل شده.
این ابزار بیش از ۲۰ فرمت لاگ مرتبط رو پشتیبانی میکنه؛ از Windows Security با ۳۰ نوع Event ID و Sysmon گرفته تا ۱۳ نوع لاگ Zeek، تلهمتری eCAR برای EDR/XDR، syslog، تاریخچهٔ bash، هشدارهای Snort و لاگهای پراکسی و وب. میشه جای سنسورها (SPAN/TAP) و سگمنتهای شبکه رو هم تعریف کرد تا ابزار فقط لاگهایی رو بسازه که اون سنسور واقعاً میتونست ببینه.
نکتهٔ مهم اینه که موتور تولید کاملاً قطعیه و هیچ تماسی با مدل زبانی (LLM) نمیگیره؛ پس خروجی تکرارپذیره و هزینهٔ API نداره. فقط مرحلهٔ طراحی سناریو با کمک Claude Code Skills بهصورت تعاملی انجام میشه. سناریوها هم تو فایل YAML تعریف میشن که توش محیط، کاربرها، توپولوژی شبکه و خط داستانی حمله رو مشخص میکنی.
هر سناریو یه فایل GROUND_TRUTH.md هم تولید میکنه که دقیقاً مستند میکنه چی، کِی و کجا اتفاق افتاده. در نهایت یه چارچوب ارزیابی کیفیت با ۴ ستون و ۲۰ زیرمعیار هم داره که قابلتجزیه بودن، باورپذیری، علّیت و زمانبندی داده رو امتیاز میده، تا قبل از استفاده بدونی دادت چهقدر خوبه. پروژه با لایسنس MIT و با Python نوشته شده.
نکات کلیدی:
- ابزار متنباز سیسکو تالوس برای ساخت لاگ امنیتی مصنوعی واقعنما جهت تمرین شکار تهدید
- همهٔ فرمتها از یه مدل SecurityEvent واحد ساخته میشن تا تناقض بین منابع نباشه
- ترتیب علّی رویدادها و رفتار زمانی انسانی (فرایند Hawkes) شبیهسازی میشه
- پشتیبانی از بیش از ۲۰ فرمت لاگ مثل Windows Security، Sysmon، Zeek و syslog
- موتور تولید قطعی و بدون LLM، با خروجی تکرارپذیر و چارچوب ارزیابی کیفیت ۴ستونه




