CyberSecQwen-4B: مدل کوچک و متخصص برای امنیت سایبری
خلاصهٔ کاملتر
تیمهای امنیتی (SOC) هر روز با هزاران هشدار کماطمینان روبرو میشن. استفاده از مدلهای بزرگ ابری برای تحلیل این هشدارها سه مشکل اساسی داره: دادههای حساس مثل dump اعتبارنامهها یا نمونههای بدافزار نباید به API خارجی فرستاده بشن، هزینهی هر درخواست در مقیاس انبوه سنگین میشه، و خیلی از محیطهای زیرساخت حیاتی یا دولتی اصلاً به اینترنت وصل نیستن. CyberSecQwen-4B با هدف حل همین مشکلات ساخته شده.
ایدهی اصلی اینه که یه مدل ۴ میلیارد پارامتری که روی دادههای تخصصی امنیتی fine-tune شده، میتونه از یه مدل ۸ میلیارد پارامتری عمومیتر بهتر باشه — و روی یه GPU دوازده گیگابایتی مصرفی هم جا بشه. این مدل روی بنچمارک CTI-Bench با مدل Foundation-Sec-Instruct-8B شرکت Cisco مقایسه شده. نتیجه: در آزمون CTI-MCQ (طبقهبندی تهدیدات) با +8.7 امتیاز جلوتره، در حالی که نصف پارامتر داره.
آموزش مدل روی یه GPU تکی AMD Instinct MI300X با ۱۹۲ گیگابایت حافظه انجام شده. از تکنیک LoRA (یه روش fine-tuning سبک که فقط بخشی از وزنهای مدل رو تنظیم میکنه) با این تنظیمات استفاده شده:
LoRA r = 64
LoRA alpha = 64
LR = 5e-5 # cosine, warmup ratio 0.03
Epochs = 10
Precision = bf16
Max seq len = 4096
دادههای آموزشی شامل نگاشت CVE به CWE از سال ۲۰۲۱ (با حذف کامل همپوشانی با دادههای ارزیابی) و پرسشوپاسخهای مصنوعی تحلیل تهدید هستن — همه با لایسنس Apache 2.0. مدل پایه Qwen3-4B-Instruct است که fine-tune روی نسخهی instruction-tuned انجام شده نه مدل خام، چون این کار فرمت چندگزینهای رو بهتر حفظ میکنه.
برای اثبات اینکه نتیجه به معماری خاص وابسته نیست، همین دستور العمل روی مدل Gemma-4-E2B هم امتحان شده و مدل Gemma4Defense-2B با نتایج مشابه تولید شده. این نشون میده که رویکرد fine-tuning تخصصی روی پایههای مختلف هم جواب میده.
نکات کلیدی:
- مدل ۴B روی GPU دوازده گیگابایتی (مثل RTX 3080/4070) اجرا میشه
- در CTI-MCQ از Foundation-Sec-8B شرکت Cisco با 8.7 امتیاز جلوتره
- دادههای حساس محلی میمونن — نیاز به API ابری نیست
- لایسنس Apache 2.0 برای مدل، داده و کد
- همین recipe روی Gemma هم کار میکنه (Gemma4Defense-2B)




