ایجنتی که فایل ویرایش میکنه و از خطاها بیرون میخزه انگار یه راز پشتشه. نویسنده میگه رازی نیست؛ یه LLM، یه حلقه و کافی توکن.
تیم Cognition یه بنچمارک جدید ساخته که میپرسه آیا کد مدلها واقعاً merge میشه یا فقط جواب میده. حتی قویترین مدلها روی سختترین بخشش زیر ۱۴٪ گرفتن.
یه تحلیل میگه بعد از اینکه مدلهای AI دارن مثل تراشه به دارایی استراتژیک تبدیل میشن، Sovereign AI دیگه فقط «مدل ملی بسازیم» نیست؛ بحث سرِ کنترل کل زنجیرهی تأمینه.
یه محقق امنیتی با جمع کردن دهها هزار کلید API و فاز کردن خودکار با کمک Claude، تونست به APIهای داخلی و مخفی گوگل دست پیدا کنه.
OpenAI به شرایط خدماتش یه بخش جدید برای نرمافزاری که روی سیستم خود مشتری نصب میشه اضافه کرده؛ نشونهای که معمولاً قبل از خودِ محصول میرسه.
مایکروسافت میگه سختترین بخش ساخت سیستمهای هوش مصنوعی دیگه دسترسی به یه مدل قوی نیست، بلکه انتخاب و ادارهکردن مدل درست تو کل چرخهٔ عمر یه اپلیکیشن واقعیه.
Frontend Masters یه دورهٔ رایگان Claude Code منتشر کرده که لیدیا هالی از تیم Claude Code توی Anthropic درسش میده؛ از CLAUDE.md و skills و hooks تا مدیریت پرمیشن و سیستمهای چندایجنته.
گزارش Business Insider جزئیات تماسهای پرتنشی رو روایت میکنه که به تصمیم کاخ سفید برای اعمال کنترل صادراتی روی مدلهای Anthropic و کنارگذاشتنِ مدل Fable انجامید.
شرکت امنیتی Doyensec دو ابزار تست نفوذ هوش مصنوعی، Aikido و XBOW، رو روی اپلیکیشنهای وب واقعی کنار هم گذاشته و همهٔ یافتههاشون رو دستی بررسی کرده.
بنچمارک AgentPerf اولین معیار سنجش برای کارهای ایجنتیکه و تو دور اول نتایج، پلتفرم GB300 NVL72 انویدیا تونسته با هر مگاوات برق تا ۲۰ برابر بیشتر از نسل قبل ایجنت اجرا کنه.
گوگل کلاد یه استاندارد باز معرفی کرده که دانش داخلی سازمان رو توی فایلهای مارکداون ساده نگه میداره تا هم آدمها بخوننش و هم ایجنتهای هوش مصنوعی بدون مترجم ازش استفاده کنن.
عبارت «طراحی هوش مصنوعی» یه برچسبه ولی به چهار نوع کار کاملاً متفاوت تقسیم شده؛ این مقاله کمک میکنه بفهمی دقیقاً کدومش رو داری انجام میدی.
یه تحقیق جدید میگه اپهای رایگان روی تلویزیونهای سامسونگ و الجی، دستگاهت رو بیخبر به یه گرهٔ پراکسی برای جمعآوری دیتای هوش مصنوعی تبدیل میکنن.
گوگل یه فیچر جدید به اسم Wardrobe رو رونمایی کرده که لباسهای توی عکسهای قدیمی Google Photos رو تشخیص میده و یه کمد مجازی میسازه که میتونی توش ستهای مختلف رو امتحان کنی.
با بالا رفتن هزینهٔ توکن، فرض «هرچی مدل بزرگتر بهتر» داره ترک میخوره؛ یه پیشبینی میگه ۸۰٪ کارها تا یکسالونیم آینده رو مدلهای خیلی ارزونتر میره.
گزارش امنیتی ۲۰۲۶ بلککایت میگه مهاجمها الان بهطور میانگین هفت روز قبل از اینکه آسیبپذیری عمومی بشه ازش سوءاستفاده میکنن؛ یعنی پنجرهی وصله کردن عملاً برعکس شده.
تیم Mirantis نشون داده میشه GPUهای انویدیا تو کبک و AMD تو آتلانتا رو زیر یه کنترلپلین واحد تو فرانکفورت گذاشت و مدل آموزش داد.
مایکروسافت خط Surface for Business رو با پردازندههای Intel Core Ultra و قابلیتهای هوش مصنوعی آنبورد بهروز کرد، اما قیمتهای بالا ممکنه خریداران سازمانی رو نگران کنه.
ایجنتهای LLM میتونن روی یه تسک میلیونها توکن بسوزونن. این مقاله با مطالعهی موردی Kilo نشون میده روتینگ درخواستها به ارزونترین مدلِ کافی، چطور هزینه رو تا حدود نصف کم میکنه.
هوش مصنوعی agentic سرعت و مقیاس حمله رو عوض کرده؛ CrowdStrike و NVIDIA میخوان با کشیدن telemetry سطح سختافزار به داخل SIEM، رفتار agentها رو زیر نظر بگیرن.