DeepTeam: تست نفوذ برای مدلهای زبانی
خلاصهٔ کاملتر
DeepTeam یه فریمورک متنباز از تیم Confident AI هست که red teaming (یعنی همون تست نفوذ، ولی برای سیستمهای مبتنی بر LLM) انجام میده. بهجای اینکه منتظر بمونی کاربر بدخواه ضعف رو پیدا کنه، خودش حمله شبیهسازی میکنه: جیلبریک، تزریق پرامپت و سوءاستفادهٔ چندمرحلهای. روی چتبات، پایپلاین RAG و ایجنت کار میکنه، کامل روی ماشین خودت اجرا میشه و روی DeepEval سواره.
طبق مستندات پروژه، بیشتر از ۵۰ آسیبپذیری آماده داره که با هر LLMی که خودت انتخاب کنی سنجیده میشن و خروجیشون نمرهٔ قبول/رد همراه با دلیله. دستهبندیشون اینه: حریم خصوصی داده (نشت PII و نشت پرامپت سیستم)، هوش مصنوعی مسئولانه (سوگیری، محتوای سمی، انصاف)، امنیت (BFLA، BOLA، RBAC، SSRF، تزریق SQL و شل)، ایمنی، کسبوکار، و یه دستهٔ کامل مخصوص ایجنتها مثل دزدیدن هدف و سوءاستفاده از هویت ایجنت.
بیشتر از ۲۰ روش حملهٔ برگرفته از مقالههای پژوهشی هم داره، هم تکمرحلهای هم گفتوگویی: از ROT13 و Base64 و لیتاسپیک برای رد شدن از فیلتر کلمه، تا Crescendo و Tree Jailbreaking که چندمرحلهای جلو میرن. اگه نخوای دستی آسیبپذیری انتخاب کنی، میتونی مستقیم روی چارچوبهای رسمی تست بگیری: OWASP Top 10 for LLMs 2025، OWASP Top 10 for Agents 2026، NIST AI RMF و MITRE ATLAS.
راهاندازیش کوتاهه. deepteam رو نصب میکنی و یه model_callback تعریف میکنی که ورودی رشتهای میگیره و جواب سیستم خودت رو برمیگردونه. لازم نیست تعریف کنی سیستمت دقیقاً چیه، چون مهاجم واقعی هم نمیدونه:
from deepteam import red_team
from deepteam.vulnerabilities import Bias
from deepteam.attacks.single_turn import PromptInjection
risk_assessment = red_team(
model_callback=model_callback,
vulnerabilities=[Bias(types=["race"])],
attacks=[PromptInjection()]
)بعد از پیداکردن ضعفها، هفت گارد آماده هم هست که تو پروداکشن ورودی و خروجی رو در لحظه چک میکنن: ToxicityGuard، PromptInjectionGuard، PrivacyGuard، IllegalGuard، HallucinationGuard، TopicalGuard و CybersecurityGuard. اجرا هم از CLI با فایل YAML ممکنه هم از پایتون، و ارزیابی ریسک رو میشه تو JSON ذخیره کرد. لایسنسش Apache 2.0 هست.
نکات کلیدی:
- بیشتر از ۵۰ آسیبپذیری آماده در شش دسته، از نشت PII تا ضعفهای مخصوص ایجنت مثل دزدیدن هدف
- بیشتر از ۲۰ روش حمله، تکمرحلهای و چندمرحلهای مثل Crescendo و Tree Jailbreaking
- تست آماده روی OWASP Top 10 for LLMs 2025، OWASP Top 10 for Agents 2026، NIST AI RMF و MITRE ATLAS
- هفت گارد پروداکشنی برای چک لحظهای ورودی و خروجی، از ToxicityGuard تا CybersecurityGuard
- نصب با pip install -U deepteam، اجرا از CLI با YAML یا از پایتون، لایسنس Apache 2.0




