AgentDojo؛ محک زدن ایجنتها در برابر تزریق پرامپت
خلاصهٔ کاملتر
به گفتهٔ سازندهها، AgentDojo یه محیط ارزیابی پویاست که تیمی از ETH زوریخ و Invariant Labs برای سنجش حملههای تزریق پرامپت (prompt injection) و دفاع در برابرشون روی ایجنتهای مبتنی بر مدلهای زبانی ساختن. برخلاف بنچمارکهای ثابت، اینجا ایجنت واقعاً باید تو یه محیط با ابزار و داده کار انجام بده، برای همین میشه دید مدل تو شرایط نزدیک به واقعیت چطور رفتار میکنه.
تزریق پرامپت یعنی مهاجم یه دستور مخفی رو لای دادههایی که ایجنت میخونه (مثلاً متن یه ایمیل یا یه صفحهٔ وب) جا میده تا ایجنت بهجای کار کاربر، خواستهٔ مهاجم رو انجام بده. AgentDojo همین سناریو رو شبیهسازی میکنه: مجموعهای از وظایف کاربر و وظایف مهاجم رو کنار هم میذاره و اندازه میگیره که ایجنت کار درست رو انجام میده یا گول میخوره.
این پکیج با pip نصب میشه و یه اسکریپت بنچمارک داره که میشه روی مدلهای مختلف، مجموعهوظیفههای گوناگون و ترکیبهای حمله و دفاع اجراش کرد. مثلاً میشه یه مجموعه رو با یه مدل مشخص و یه مکانیزم دفاعی مثل tool filter و یه حمله باهم تست کرد:
python -m agentdojo.scripts.benchmark --model gpt-4o-2024-05-13 --defense tool_filter --attack tool_knowledgeنتایج روی یه صفحهٔ اختصاصی و تو رجیستری بنچمارک Invariant منتشر شده و مقالهٔ مربوط بهش هم تو کنفرانس NeurIPS 2024 پذیرفته شده. ارزشش اینه که بهجای ادعاهای کلی دربارهٔ امنیت ایجنتها، یه معیار قابل تکرار و مشترک میده تا هم آسیبپذیریها و هم اثربخشی دفاعها رو بشه عددی مقایسه کرد. سازندهها یادآوری میکنن که API این پکیج هنوز در حال توسعهست و ممکنه تغییر کنه.
نکات کلیدی:
- AgentDojo یه محیط پویا برای سنجش تزریق پرامپت روی ایجنتهای LLM ـه
- ساختهٔ پژوهشگرای ETH زوریخ و Invariant Labs، منتشرشده تو NeurIPS 2024
- هم حملهها و هم دفاعها رو روی یه بنچمارک مشترک اندازه میگیره
- با pip نصب میشه و روی مدلها و دفاعهای مختلف قابل اجراست




