هوش مصنوعی CTF رو تسخیر کرد
خلاصهٔ کاملتر
رقابتهای Capture the Flag (CTF) همیشه یه محک جدی برای مهارتهای امنیت تهاجمی بودن — اما در سال ۲۰۲۶ همه چیز عوض شده. تیم Include Security در رقابت BSidesSF 2026 شرکت کرد و از نزدیک دید که LLMها چطور داره این فضا رو زیر و رو میکنه.
در نسخه ۲۰۲۵ همین رقابت، حدود نیمی از شرکتکنندهها ChatGPT 4 باز داشتن که فقط چالشهای ساده رو حل میکرد. اما در ۲۰۲۶ قضیه کاملاً فرق داشت: ۱۶ تیم تمام چالشها رو کامل حل کردن، هیچ چالشی کمتر از ۲۵ بار حل نشد، و اکثر چالشها چند دقیقه بعد از انتشار حل شدن. نویسنده مقاله که سال قبل با بازی solo جای پنجم رو گرفته بود، تخمین میزنه امسال بدون کمک هوش مصنوعی جای ۷۵ام میموند.
تیمهای برتر یه پایپلاین کاملاً اتوماتیک داشتن: رصد مداوم پلتفرم CTF برای چالشهای جدید، اجرای همزمان چند agent روی هر چالش، و ارسال خودکار فلگ به محض پیدا کردنش. وقتی امتیازها مساوی باشن، سرعت حل کردن برنده رو مشخص میکنه — پس داشتن agent بیشتر، مدل بهتر و CPU قویتر یعنی پول بیشتر.
تیم برنده که سورس کدشون رو هم منتشر کردن، از چند مدل مختلف بهصورت موازی استفاده میکردن. GPT-5.4-mini چالشهای ساده رو سریع له میکرد، Claude Opus 4.6 با max effort روی مشکلات عمیقتر کار میکرد، و یه LLM هماهنگکننده بینشان رو به اشتراک میذاشت. اگه یه agent گیر میکرد، کوردیناتور با اطلاعات agentهای دیگه دوباره راهش میانداخت.
نویسنده خودش از Claude Code با پلن Max 5x و مدل Opus 4.6 با یه پرامپت ساده استفاده کرد:
solve this CTF challenge keeping track of progress
Claude Code با فلگ --dangerously-skip-permissions داخل یه Debian VM ایزوله اجرا میشد و به ابزارهایی مثل Ghidra، Playwright و یه محیط Conda کامل دسترسی داشت.
اما این جادو در CTFهای سختتر مثل hxp و DEF CON هنوز کامل نیست. LLMها اکثر چالشهای این رقابتها رو نمیتونن بهصورت کاملاً مستقل حل کنن. طراحان چالش هم دارن یاد میگیرن: چالشهایی که داده آموزشی کمی دارن، مستندات گمراهکننده یا متناقض با سورسکد دارن، یا نیاز به غواصی عمیق در internals نرمافزارهای کمتر شناختهشده دارن، هنوز برای LLMها سخته.
مهمترین بخش مقاله اینه که موفقیت در CTF لزوماً به پنتست واقعی ترجمه نمیشه. CTF یه هدف مشخص داره (فلگ)، سیستمهای کوچیک و محدود، و مسیر حل از پیش طراحیشده. در مقابل، پنتست واقعی شامل سیستمهای عظیم با میلیونها خط کد، تشخیص false positive از true positive، درک context کسبوکار، گزارشنویسی تخصصی، و تصمیمگیریهای حساس در مورد محدوده کاره — چیزهایی که هنوز به تجربه و قضاوت انسانی نیاز دارن.
نکات کلیدی:
- در BSidesSF 2026، ۱۶ تیم تمام چالشها رو کامل حل کردن — سال قبل فقط یه تیم به این نزدیک شده بود
- Claude Code و Codex حتی چالشهای سخت binary exploitation رو خودکار حل کردن
- تیمهای برتر از پایپلاین چند-agent با مدلهای موازی و یه LLM هماهنگکننده استفاده کردن
- CTFهای سختتر مثل DEF CON هنوز مقاومت میکنن؛ طراحان چالش دارن رویکردشون رو تغییر میدن
- موفقیت LLM در CTF به پنتست واقعی ترجمه نمیشه چون ساختار هدف، مدیریت context و گزارشنویسی کاملاً متفاوته
- برای پنتست حرفهای، هنوز راهنمایی متخصص انسانی ضروریه




