SingGuard-NSFA: نگهبان تازهٔ ایجنتهای هوش مصنوعی
خلاصهٔ کاملتر
تو این مقاله اومده که با تبدیل شدن مدلهای زبانی از تولیدکنندهٔ متن به ایجنتهایی که ابزار صدا میزنن، کد اجرا میکنن و نقشهٔ چندمرحلهای میچینن، صورت تهدید هم عوض شده: مسئله دیگه «چیزی که مدل میگه» نیست، «کاری که ایجنت میکنه» هست. به گفتهٔ نویسندهها گاردریلهای موجود برای محتوای نامناسب طراحی شدن و تهدیدهای عملیاتی مثل تزریق پرامپت، بیرون کشیدن اطلاعات حساس، درخواست کد مخرب، سوءاستفاده از ابزار و مصرف بیرویهٔ منابع رو نمیبینن.
پاسخشون یه تاکسونومی به اسم NSFA هست که روی سهگانهٔ محرمانگی، صحت و دسترسپذیری بنا شده و 7 دامنهٔ سطحیک، 28 ریسک سطحدو و 185 نوع سطحسه داره و با سه راهنمای OWASP اعتبارسنجی شده. پنج دامنه سمت پرسش کاربره و دو دامنه سمت پاسخ مدل؛ منطقش هم اینه که تهدید تا جای ممکن سر پرسش گرفته بشه و گاردریل پاسخ فقط پشتیبان باشه. فقط ریسکهایی وارد دامنه شدن که از یه نوبت متن قابل تشخیصن، تا ماژول بدون حالت و کمتأخیر بمونه.
دادهٔ آموزش با یه خط لولهٔ چهارمرحلهای و 74 مدل زبانی متنباز ساخته شده: تولید بدون داده اولیه، تقویت بر پایهٔ نمونههای مرحلهٔ اول، ترجمه به 133 زبان و در آخر بازبرچسبزنی با یه مدل قویتر که موارد اختلافی حذف میشن. آموزش هم دو فاز داره؛ اول SFT زنجیرهٔ فکری روی بکبون Qwen3.5 با تگهای مرزی برای جلوگیری از تزریق دستور، بعد آموزش هدهای MLP سبک روی مدل فریزشده.
نتیجه دو حالت اجراست: حالت مولد یه تحلیل زنجیرهٔ فکری قابلتفسیر برای بازبینی انسانی و انطباق میده، و حالت طبقهبندی با یه گذر رو به جلو بین 45 تا 57 میلیثانیه جواب میده. زیاد کردن تعداد هدها از 5 به 50000 فقط 9 میلیثانیه به تأخیر اضافه میکنه. اضافه کردن یه ریسک جدید هم فقط یه هد سبک روی بکبون فریزشده میخواد؛ همین ترفند روی Llama Guard 3 هم 17.6 نمره F1 سمت پرسش بهبود داده.
نکات کلیدی:
- تاکسونومی NSFA: 7 دامنه، 28 ریسک و 185 نوع، همسو با سه راهنمای OWASP
- بنچمارک 133 زبانه با بیش از 93 هزار نمونهٔ ساختهشده و 3435 نمونهٔ چندمنبعی
- چهار مدل 0.8B، 2B، 4B و 9B، همه بالای 94 درصد F1 و 6 تا 12 نمره جلوتر از رقبا
- دو حالت اجرا: استدلال مولد برای بازبینی و طبقهبندی 45 تا 57 میلیثانیهای برای بلوکه کردن آنلاین
- ریسک جدید فقط یه هد سبک میخواد، بدون بازآموزی؛ روی Llama Guard 3 هم 17.6 نمره بهبود داده




