چرا تیمهای امنیتی باید مدل خودشون رو بالا بیارن
خلاصهٔ کاملتر
Jason Haddix تو خبرنامهٔ Executive Offense مینویسه پرتکرارترین سوالی که ازشون میپرسن اینه که هنوز باید اشتراک مدلهای بستهٔ frontier رو نگه داشت یا وقتشه سراغ مدلهای محلی رفت. به گفتهٔ او مشکل اجارهٔ مدل اینه که روش کارت دیگه مال خودت نیست؛ یه شبه رفتار مدل عوض میشه، یه فیلتر سفتتر میشه و agentی که سهشنبه درست کار میکرد چهارشنبه از بحث دربارهٔ یه تکنیک تست نفوذ سر باز میزنه.
استدلال دوم دربارهٔ کیفیته. Aikido Security با همکاری Philippe Dourassov بنچمارکی اجرا کرد که توش ۱۱٫۷ میلیارد توکن خرج شد تا ۱۰ مدل روی ۳۲ آسیبپذیری تازهمنتشرشده، هر کدوم سه بار، تست بشن. مدل DeepSeek V4 Pro که open-weight هست (یعنی وزنهاش رو دانلود میکنی و خودت اجراش میکنی) ۲۸ تا از ۳۲ مورد رو پیدا کرد و از Opus 5 و Grok 4.6 و Claude Sol جلو زد. Qwen و GLM-5.3 هم تو همون رده نشستن.
دو تیم دیگه هم به نتیجهٔ مشابه رسیدن. تو تحقیق self-hosted شرکت TrustedSec مدلهای محلی کارهای رایج تهاجمی مثل دور زدن احراز هویت با SQLi، دستکاری JWT و IDOR رو درست انجام دادن و بهترینهاشون مدلهای ۲۷ تا ۳۱ میلیارد پارامتری بودن که روی سختافزار زیر میز جا میشن. Dreadnode هم با DreadIndex، بنچمارک ۷۶ تسکی تو ده حوزه، همون اسمها رو بالا میبینه. هر دو تیم یه هشدار مشترک دادن: وزنهای باز بدون یه harness دقیق، جایگزین آمادهٔ مدلهای بسته نیستن.
به گفتهٔ نویسنده بهانهٔ سختافزار هم دیگه تموم شده. اپل Mac Studio با M5 Ultra رو معرفی کرده با تا ۵۱۲ گیگابایت حافظهٔ یکپارچه و ۴٫۳ برابر توان محاسبات AI نسل قبل. NVIDIA هم DGX Spark رو داره که با برق پریز معمولی کار میکنه، و بالاتر از اون خط DGX Station روی تراشهٔ GB300 با حدود ۷۸۴ گیگابایت حافظه که مدلهای ردهٔ تریلیون پارامتری رو محلی اجرا میکنه. خود DeepSeek V4 Pro با ۱٫۶ تریلیون پارامتر فعلاً به سروری با ۸ تا H100 نیاز داره.
بخش تندوتیز مقاله دربارهٔ اقتصاد ماجراست. پنج هایپراسکیلر بزرگ برای ۲۰۲۶ بیش از ۶۰۰ میلیارد دلار تعهد زیرساخت دادن، نزدیک دو برابر سال قبل. پیشبینی میشه دیتاسنترهای AI تا ۷۰ درصد تولید حافظهٔ دنیا رو ببلعن و قیمت DRAM از ابتدای ۲۰۲۴ تا آخر امسال بیش از ۴۰۰ درصد بالا بره. حتی DGX Spark وسط چرخه از ۳۹۹۹ به ۴۶۹۹ دلار رفت. نویسنده میگه هر دلاری که خرج API میکنی همین چرخه رو تأمین مالی میکنه.
جمعبندی نویسنده اینه که مدل داره کالا میشه و چیزی که یه شرکت امنیتی رو متمایز میکنه، همون harness دور مدله: متدولوژی، مهندسی کانتکست، دامنهٔ agentها و دانش انباشتهٔ داخلی. اون صادقانه میگه خودشون هم برای سختترین کارها هنوز سراغ مدلهای بسته میرن و اسب کاریشون Opus 4.8 و 4.6 هست، ولی مجموعهای از agentها رو روی GLM 5.2 ساختن که با کنترل دقیق پرامپت خیلی خوب جواب میده. توصیهش اینه که همین سهماهه یه نفر رو بذاری روی ساخت harness محلی.
نکات کلیدی:
- DeepSeek V4 Pro تو بنچمارک Aikido ۲۸ از ۳۲ آسیبپذیری رو پیدا کرد و کل تست ۱۱٫۷ میلیارد توکن خرج برداشت
- تو تست TrustedSec مدلهای ۲۷ تا ۳۱ میلیارد پارامتری برای کارهای رایج تهاجمی کافی بودن
- Mac Studio با M5 Ultra تا ۵۱۲ گیگابایت حافظهٔ یکپارچه و ۴٫۳ برابر توان AI نسل قبل داره
- DGX Station روی GB300 حدود ۷۸۴ گیگابایت حافظه داره؛ ساخت ردهٔ بالا حدود ۳۰۰ تا ۵۰۰ هزار دلار درمیاد
- قیمت DRAM از ابتدای ۲۰۲۴ تا آخر امسال بیش از ۴۰۰ درصد رشد پیشبینی شده




