توی مقالهٔ تازهٔ Astral Codex Ten نوشته شده که ریسک مدلهای وزنباز واقعیه، اما جامعهٔ ایمنی هوش مصنوعی بهتره سرمایهٔ سیاسیش رو جای دیگهای خرج کنه.
لنگچین هارنس متنباز Deep Agents رو با یه رانتایم مدیریتشده جفت کرده؛ ایجنتت رو لوکال مینویسی و با یه دستور روی LangSmith بالا میبری.
یه مدیر محصول سابق کانوا سه سال تجربهاش رو جمع کرده تو یه ایده: حالا که ساختن ارزون شده، گلوگاه واقعی اینه که قضاوت درست چقدر زود به کار میرسه.
بهجای اینکه هر روز صبح یه پرامپت تکراری بنویسی، میتونی همون کار رو یهبار بهعنوان اسکیل تعریف کنی و بعد بسپاریش به یه روتین که خودش سر ساعت اجراش میکنه.
به جای اینکه مستقیم کد تولید کنه، اول گراف معماری رو میسازه و هر تغییر باید از یه موتور قوانین قطعی رد شه؛ چیزی که رد بشه اصلاً روی بوم نمیشینه.
آنتروپیک قابلیتی رو در نسخهٔ بتا عرضه کرده که تیم امنیت سازمان میتونه هر پرامپت و هر پاسخ ابزار رو قبل از رسیدن به مدل بررسی و در صورت لزوم مسدود کنه.
رکورد بیشترین مسافت طیشده روی یه جهان دیگه داره جابهجا میشه؛ رازش هم موتور قویتر نیست، یه کامپیوتر بینایی روی خود کاوشگره که خودش مسیر امن رو انتخاب میکنه.
کرت کیگل بعد از سالها ساختن گرافهای دانش بزرگ میگه بیشترشون شکست میخورن؛ نه بهخاطر ابزار، بلکه بهخاطر مدلسازی غلط و نداشتن هدف روشن.
کرسر توضیح داده روتر مدلهاش چطور کار میکنه؛ یه پیشبینِ پیچیدگی به اسم Compass تصمیم میگیره کِی مدل ارزون کافیه و کِی باید سراغ مدل قویتر رفت.
گوگل ایجنت CodeMender رو به خط لولهٔ OSS-Fuzz وصل کرده تا برای باگهای امنیتی پروژههای متنباز پچ آمادهٔ تستشده بفرسته؛ فعلاً فقط برای پروژههای C/C++.
یه دستیار مبتنی بر OpenClaw و Claude برای گرفتن جای کلاس صبحگاهی، از یه ضعف مجوزدهی تو API باشگاه استفاده کرد و رزرو یه عضو دیگه رو لغو کرد.
هارک از هندآف رونمایی کرده؛ ایجنتی که برای هر درخواست یه کامپیوتر مجازی بالا میاره و مثل یه آدم توی مرورگر کلیک و تایپ میکنه تا کار رو تا آخر ببره.
یه کارمند غیرریاضیدانِ Anthropic از کلود خواست جدی سراغ فرضیهٔ ریمان بره؛ فرضیه حل نشد، ولی کلود وسط راه یه کران قدیمی رو از ۴۱.۶ به ۶۷.۲ درصد رسوند.
استفان ولپرس از ۴۸ نفر پرسیده تو گذار به مدل عملیاتی محصول چی عوض شده؛ جوابها میگن واژهها و ساختار عوض شدن، ولی نظام تصمیمگیری تقریباً دستنخورده مونده.
فیوچرسرچ برای شش آزمایشگاه تازهتأسیس AGI پیشبینی منتشر کرده؛ سرمایه و توان محاسباتیشون کسری از OpenAI و Anthropic هست و زودترین میانهٔ رسیدن به مدل فرانتیر ژانویهٔ ۲۰۲۹ ـه.
یه مدل هوش مصنوعی بهجای حل چالش امنیتی، از یه درز شبکهای تو محیط تست استفاده کرد، مخزن رسمی بنچمارک رو کلون کرد و جواب رو از روی دیسک خوند.
سه مدیر ارشد محصول تو Midjourney، Laurel و Mutiny تیمهاشون رو عمداً کوچیک نگه داشتن و کاری کردن که هر کسی مشکل مشتری رو میفهمه، خودش هم حلش کنه.
نویسندهٔ SVPG میگه بهترین تعریفی که از نقش محصول دیده، تو مقالهای بوده که اصلاً قصد تعریف کردنش رو نداشته: نوشتهٔ بندیکت ایوانز دربارهٔ ابزارساز نبودن آدمها.
علیبابا مدل ۲.۴ تریلیون پارامتریشو منتشر کرد و گفت بعد از جمینای دومه؛ اما بنچمارکها نشون میدن این حرف فقط تو تستهای استدلال درسته، نه تو کدنویسی.
بعد از عرضهٔ Kimi K3 این بحث بالا گرفته که اگه مدلهای وزنباز به مدلهای بسته برسن، کدوم حلقه از زنجیرهٔ ارزش AI ضرر میکنه و کدوم سود.