Gemini 3.5 Flash Cyber؛ مدل سبک گوگل برای شکار آسیبپذیری
خلاصهٔ کاملتر
به گفتهٔ نویسندههای پست دیپمایند، مسئله اینه که ایجنتهای هوش مصنوعی دارن سریعتر از توان وصلهکردن مدافعها آسیبپذیری پیدا میکنن، پس جواب باید هم توانمند باشه هم ارزون و مقیاسپذیر. Gemini 3.5 Flash Cyber روی همون پایهٔ Flash ساخته شده و به گفتهٔ گوگل تو کارهای امنیتی از مدلهای Flash معمولی مؤثرتره.
منطق فنیاش «فضای جستوجو»ست. پیدا کردن باگهای عمیق یعنی گشتن تو یه فضای اجرای عظیم، و اتکا به یه فراخوانی گرون از یه مدل بزرگ خودش گلوگاه میشه. CodeMender این مدل رو چند بار صدا میزنه تا زیرایجنتها مسیرهای کد خیلی بیشتری رو تحلیل کنن و آخرش یه گزارش واحد و باکیفیت بدن. همین ارزونی و سرعت باعث میشه بشه مدل رو تو اسکنهای مکرر یا پایپلاین بررسی کامیت جا داد.
روی بنچمارک CyberGym، وقتی CodeMender تا پنج بار مدل رو برای یه گزارش نهایی صدا زده، عملکرد کلی ایجنت با مدلهای بهمراتب بزرگتر رقابت کرده. تو ارزیابی مستقل تیم Big Sleep روی کدبیسهای پیچیدهای مثل Chrome و Safari هم بهطور محسوسی از Flash معمولی جلو زده. تو تست موتور جاوااسکریپت V8 هم با تعداد فراخوانی ثابت، ۵۵ مسئلهٔ یکتای تأییدشده پیدا کرده در برابر ۴۷ تای Flash معمولی و ۳۶ تای Opus 4.6 — از جمله ۱۰ مورد که هیچکدوم از اون دوتا نگرفته بودن.
نمونهٔ عملیاش هم جالبه: تیم تحقیقات آسیبپذیری کلود گوگل میگه مدل ظرف دو ساعت چند آسیبپذیری اجرای کد از راه دور تو APIهای عمومی و یه باگ خرابی حافظه تو یه سرویس حساس پروداکشن پیدا کرده و بعد اکسپلویتی ساخته که از مکانیزمهای استاندارد مثل ASLR و W^X عبور میکرده. گوگل بهخاطر همین ماهیت دومنظوره، انتشار رو محدود نگه داشته؛ هرچند قابلیتهای پایهٔ CodeMender از طریق Gemini Enterprise Agent Platform به مشتریهای عادی هم میرسه.
نکات کلیدی:
- مدل روی Gemini 3.5 Flash سواره و برای یافتن، تأیید و وصلهٔ آسیبپذیری فاینتیون شده
- ایدهٔ اصلی: فراخوانی مکرر یه مدل ارزون بهجای یه فراخوانی گرون از مدل بزرگ
- در V8: ۵۵ مسئلهٔ یکتا در برابر ۴۷ (Flash معمولی) و ۳۶ (Opus 4.6)
- روی CyberGym با پنج فراخوانی، رقابتی با مدلهای خیلی بزرگتر
- دسترسی فعلاً محدود به دولتها و شرکای منتخب از طریق CodeMender




