GPT-5.5 و Claude Mythos: مدلهای جدید هوش مصنوعی که هکرهای حرفهای رو پشت سر میذارن
خلاصهٔ کاملتر
در ارزیابیهای اخیر، دو مدل پیشرفته هوش مصنوعی — GPT-5.5 از OpenAI و Claude Mythos Preview از Anthropic — در تستهای تخصصی امنیت سایبری نتایج چشمگیری نشون دادن. این ارزیابیها روی یه مجموعه ۹۵ تایی از تستهای تخصصی در چهار سطح دشواری انجام شده که مهارتهایی مثل reverse engineering، web exploitation و cryptography رو میسنجه.
تستهای سطح Expert که توسط شرکتهای امنیتی Crystal Peak Security و Irregular طراحی شدن، روی آسیبپذیریهای واقعی و تکنیکهای پیشرفتهای مثل heap overflow، use-after-free، padding-oracle attack و باز کردن بدافزارهای مبهمسازیشده تمرکز دارن. GPT-5.5 در این سطح به نرخ موفقیت ۷۱.۴٪ رسیده، در حالی که Claude Mythos با ۶۸.۶٪، GPT-5.4 با ۵۲.۴٪ و Opus 4.7 با ۴۸.۶٪ پشت سرشه.
یکی از جالبترین نمونهها، چالش rust_vm بود. توی این چالش یه باینری Rust بدون سیمبول وجود داشت که یه ماشین مجازی سفارشی پیادهسازی کرده بود. یه متخصص از Crystal Peak با ابزارهایی مثل Binary Ninja، gdb، Python و Z3 این چالش رو در حدود ۱۲ ساعت حل کرد. GPT-5.5 همین مسئله رو در ۱۰ دقیقه و ۲۲ ثانیه با هزینهای معادل ۱.۷۳ دلار و بدون هیچ کمک انسانی حل کرد.
فرآیند حل GPT-5.5 در پنج مرحله انجام شد: شناسایی اولیه باینری و معماری VM، بازسازی ISA (مجموعه دستورالعملها)، ساخت disassembler، reverse کردن منطق احراز هویت، و در نهایت استخراج رمز عبور معتبر. این مدل از یه scaffold ساده ReAct با ابزارهای Bash و Python داخل یه کانتینر Kali Linux استفاده کرد.
نکته مهم اینه که موفقیت Claude Mythos در آوریل — که اولین مدلی بود که شبیهسازی حمله به شبکه شرکتی رو بهصورت end-to-end تکمیل کرد — ممکن بود یه پیشرفت منحصربهفرد به نظر برسه. اما نتایج GPT-5.5 نشون میده که این دیگه یه استثنا نیست و یه روند کلی در پیشرفت مدلهای مختلف داره شکل میگیره.
نکات کلیدی:
- GPT-5.5 و Claude Mythos هر دو در تستهای سایبری سطح Expert نتایج مشابه و بالایی دارن
- GPT-5.5 با نرخ ۷۱.۴٪ در سطح Expert احتمالاً قویترین مدل تستشده تا الانه
- چالش rust_vm که ۱۲ ساعت وقت یه متخصص انسانی برد، توسط GPT-5.5 در ۱۰ دقیقه حل شد
- مدلها از scaffold ساده ReAct با ابزارهای Bash و Python روی Kali Linux استفاده میکنن
- این پیشرفتها یه روند گستردهتر رو نشون میده، نه موفقیت تصادفی یه مدل خاص




