خیلی از مدیرهای مهندسی میگن اعداد بنچمارکهای صنعتی به سازمانشون نمیخوره. برایان هاک میگه این حرف درسته، ولی نتیجهای که ازش میگیرن غلطه.
نولان لاوسون میگه با ایجنتهای کدنویسی پیدا کردن باگ تقریباً مجانی شده و تنها سؤال باقیمونده اینه که کجا دست نگه داریم و بگیم کار تمومه.
یه تیم پژوهشی مدل زبانی رو فقط با محتوای درسی کلاس اول تا پنجم آموزش داده تا ببینه مهارتهای تازه واقعاً یاد گرفته میشن یا فقط از داده بیرون کشیده میشن.
دیپسیک یه هارنس کدنویسی ایجنتیک بیرون داده که همهچیزش — از ابزار و مدل تا ایجنتهای دیگه — پلاگینه؛ ولی تست عملی نشون داده مصرف توکنش سنگینه.
دو برنامهنویس رفتن سراغ مقالهٔ اصلی اثبات دانش صفر و با رنگآمیزی گراف نشون دادن چطور میشه یه جواب رو ثابت کرد بدون اینکه ذرهای ازش لو بره.
مدل ۲۷ میلیاردی تازهی Qwen روی لپتاپ کد مینویسه و عکس میفهمه، ولی حالت استدلال پیشفرضش انقدر سنگینه که برای کشیدن یه دایره هم دقیقهها فکر میکنه.
ایجنتی که با Strands ساختی و روی سرور خودت یا GCP اجرا میشه، با یه پکیج و چند متغیر محیطی تلهمتریش رو به همون داشبورد AWS میفرسته.
یه مهندس میگه استانداردهایی که شرکتهای AI جا انداختن — چند سشن چت، انتخاب مدل، اتصال MCP — بار تصمیمگیری رو میندازن گردن کاربر و جلوی فراگیرشدن ایجنت تو سازمان رو میگیرن.
ZAI میگه GLM-5.3 بدون تغییر معماری یا تعداد پارامتر، فقط با آموزش تکمیلی از ۷۵ درصد به ۹۱٫۲۵ درصد رسیده؛ اون هم روی بنچمارکی که همه با یه پرامپت سنجیده میشن.
طبق یادداشت SemiAnalysis، گوگل برای یکی از TPUهای نسل دهمش با AMD کار میکنه؛ هدف احتمالی، چسبوندن هستهٔ CPU به خود پکیج شتابدهنده برای بارهای reinforcement learning ـه.
نسخهٔ جدید Model Context Protocol نشست پروتکلی رو برداشته و بهجاش سرور باید یه شناسه بده به مدل تا خودش بین فراخوانیها جابهجاش کنه.
Z.ai مدل GLM-5.3 رو معرفی کرد؛ با حدود ۷۵۰ میلیارد پارامتر به صدر بنچمارکهای کدنویسی ایجنتیک رسیده. نیتن لمبرت میگه راز کار پستترینینگ و سرعت انتشاره، نه کپیبرداری از مدلهای آمریکایی.
xAI مدل جدیدش رو با ۲ دلار ورودی و ۶ دلار خروجی بهازای هر میلیون توکن عرضه کرد؛ تو یه تست عملی، کاری که روی Claude Opus 5 حدود ۲ دلار خرج برداشت، اینجا حدود ۳۸ سنت تموم شد.
xAI مدل جدیدشو با یه دور آموزش تکمیلی روی همون پایهٔ ۴.۵ ساخته، ولی نتیجهش تو چند بنچمارک مهم چسبیده به GPT-5.6 و Claude Opus 5 — با هزینهٔ خیلی کمتر برای هر تسک.
از 16 آگوست 2026 دیپسیک صورتحساب API رو بر اساس ساعت حساب میکنه؛ نرخ ساعتهای غیراوج نصف اوجه و دو مدل V4 با کانتکست یک میلیون توکنی هم روی همین جدول نشستن.
سیسکو فصل چهارم مالی ۲۰۲۶ رو بالاتر از سقف پیشبینی خودش بست و میگه یه سوپرسیکل شبکه راه افتاده؛ سفارشهای هوش مصنوعی هم به ۹.۳ میلیارد دلار رسید.
نسخهٔ بتای عمومی Docker VMM با Docker Desktop 4.86 اومد؛ لایهای که خود داکر از صفر نوشته، رم بیکار رو پس میده و اشتراک فایل رو سریعتر کرده.
یه مقالهٔ arXiv میگه اگه حالت پنهان لایهٔ آخر رو به قدم بعدی برگردونی، مدل ۱ میلیاردی به کیفیتی میرسه که معمولاً ۱.۵ برابر داده میخواد.
هاگینگفیس دادههای هفت ماه اول ۲۰۲۶ رو منتشر کرده: سقف اندازهٔ مدلهای چینی از آمریکاییها بالاتر رفته، ولی دانلودها هنوز سراغ مدلهای کوچیک و قدیمی میره.
سرورت سالمه ولی کاربرا از کندی و خرابی شاکیان؟ مانیتورینگ تجربهٔ دیجیتال کارایی رو از دید خود کاربر میسنجه تا چیزایی رو ببینی که تلهمتری بکاند از قلم میندازه.