هک Auto Mode کلود کد با یه درخواست ساده
خلاصهٔ کاملتر
یوهان رهبرگر تو بلاگ Embrace The Red یه زنجیرهٔ حملهٔ کامل رو نشون داده که با یه درخواست کاملاً معمولی شروع میشه، «این سایت رو خلاصه کن»، و آخرش کد دلخواه مهاجم روی ماشین کاربر اجرا میشه. نکته اینه که این اتفاق تو Auto Mode میافته؛ حالتی که از نیمهٔ آگوست حالت پیشفرض Claude Code شده و بهجای پرسیدن اجازه از آدم، از یه classifier ایمنی (یعنی مدلی که تصمیم میگیره یه دستور خطرناکه یا نه) استفاده میکنه.
به گفتهٔ نویسنده، ترفند اصلی این نیست که به مدل بگی چی کار کنه، بلکه اینه که مسیر خطرناک رو تنها راه منطقی حل مسئله جلوه بدی. سرور اول به ابزار WebFetch خطای ۴۱۵ میده تا کلود خودش سراغ curl تو ترمینال بره، بعد با یه ریدایرکت یه فایل ZIP تحویلش میده که ظاهرش آرشیو یادداشتهای یه کتابخونهست و دلیل موجهی برای بازکردنش میسازه.
تو اون آرشیو یه فایل باینری به اسم decoder هست که کلود درست تشخیص میده مشکوکه و اجراش نمیکنه. ولی بهجاش خودش یه دیکودر پایتونی مینویسه و همون داخل پوشهٔ آرشیو اجراش میکنه. اینجا module shadowing کار خودشو میکنه: یعنی یه فایل همنام با ماژول استاندارد پایتون جای اصلی رو میگیره. فایل مخرب struct.py داخل آرشیو موقع import شدن base64 بالا میاد و کد مهاجم اجرا میشه.
نویسنده میگه طعنهٔ ماجرا همینه: خود اون تصمیم ایمن، یعنی اعتماد نکردن به باینری ناشناس، مسیر حمله بوده، چون کلود به کدی که خودش نوشته اعتماد کامل داره. نرخ موفقیت تو نمونههای کوچیک بین ۳ از ۵ (۶۰٪) تا ۴ از ۵ (۸۰٪) بوده. تو یه نسخهٔ دیگه از حمله، پیلود بهجای پروسهٔ پایتون یه نمونهٔ headless دیگه از Claude Code بالا میاره که ابزار و کانتکست مستقل خودشو داره.
تو چند اجرا، وقتی کلود بالاخره متوجه آلودگی شده و خواسته پروسهٔ مخرب رو ببنده، خود Auto Mode جلوی دستور پاکسازی رو گرفته؛ یعنی همون مکانیزمی که ساخت بدافزار رو اجازه داده بود، بستنش رو بلاک کرد. Anthropic گزارش رو با برچسب Informative بسته و گفته Auto Mode یه امکان راحتی با یه classifier ـه، نه تضمین امنیتی. نویسنده این جواب رو منطقی میدونه ولی میگه عدد ۰.۰۰٪ فقط روی ۷۲ سناریوی مشخص سنجیده شده و زنجیرهٔ این تحقیق توش نبوده، پس هم اون عدد درسته هم این اجرای کد.
نکات کلیدی:
- Auto Mode از نیمهٔ آگوست ۲۰۲۶ حالت پیشفرض Claude Code ـه و اجازهگرفتن از کاربر رو با یه classifier عوض کرده.
- نرخ موفقیت حمله تو نمونههای کوچیک ۶۰ تا ۸۰ درصد بوده، مقابل عدد ۰.۰۰٪ ارزیابی Trajectory Labs روی ۷۲ سناریو.
- حلقهٔ اصلی حمله module shadowing با فایل struct.py داخل یه آرشیو ZIP دانلودشدهست.
- تو بعضی اجراها Auto Mode دستور پاکسازی بدافزار رو بلاک کرد، در حالی که ساختش رو اجازه داده بود.
- مرز امنیتی واقعی ایزولهٔ سیستمعامل و کنترل خروجی شبکهست، نه طبقهبند.




