یه مدل هوش مصنوعی تو ۶۰ ساعت تونست بهترین حملهٔ شناختهشده به یه طرح امضای پساکوانتومی رو بهتر کنه؛ طرحی که دو سال بررسی متخصصهای انسانی رو پشت سر گذاشته بود.
یه مهندس نرمافزار میگه مدلهای زبانی از یه آستونهٔ مهم رد شدن و از این به بعد بهتر شدنشون خیلی کمتر به بهرهوری اضافه میکنه؛ جهش بعدی از ابزارها میاد نه از خود مدل.
یه مهندس iOS با سوئیفت و متال رانتایمی نوشته که مدل ۲۶ میلیارد پارامتری گوگل رو با حدود ۲ گیگ رم روی مکبوک ایر ۸ گیگابایتی اجرا میکنه.
یک پست آخر هفتهای تو X شایعهٔ خرید یک استارتاپ رباتیک میلیارددلاری رو راه انداخت؛ تکذیب شد، ولی معلوم شد مذاکرهها واقعی بودن و پای OpenAI هم وسطه.
جاستین وایس میگه هرچی بیشتر کدنویسی رو به مدل بسپری، شهودت نسبت به کدبیس آب میره؛ و چند عادت مشخص برای حفظ اون شهود پیشنهاد میده.
مهندسی پرامپت فقط مال متن نیست. یه پژوهش تازه نشون میده اگه تصویرِ خودِ مسئله رو واقعگرایانهتر کنی، مدلهای ویدیویی خیلی بهتر استدلال میکنن.
میگل فرناندز، معاون دیزاین محصول اسلک، میگه هوش مصنوعی فاصلهٔ «هیچ» تا «قابلقبول» رو صفر کرده، ولی فاصلهٔ «قابلقبول» تا «دوستداشتنی» سر جاشه.
آنتروپیک بعد از بازبینی ۱۴۱ هزار اجرای ارزیابی امنیتی، سه مورد پیدا کرد که مدلهاش از محیط تست به اینترنت واقعی رسیدن و به زیرساخت سه سازمان واقعی نفوذ کردن.
تو هر پیام جدید، کل گفتوگو دوباره برای مدل فرستاده میشه؛ همینه که باعث میشه بیشتر توکنی که خرج میکنی چیزی باشه که اصلاً تایپش نکردی.
یه عامل هوش مصنوعی موقع تست امنیتی از محیط ایزوله بیرون زد و به زیرساخت Hugging Face نفوذ کرد؛ نه از روی خصومت، فقط برای اینکه جواب بنچمارک رو پیدا کنه.
پنگرام از نسل چهارم آشکارسازش رونمایی کرده؛ مدلی شش برابر بزرگتر که میگه فقط تو هر ۲۴ هزار سند یه بار متن انسانی رو اشتباهی هوش مصنوعی تشخیص میده.
Hugging Face میگه یه ایجنت مبتنی بر مدلهای OpenAI از دل یه محیط تست بیرون زده و خودش یه نفوذ کامل رو اجرا کرده؛ ماجرایی که بحث سرعت پیشرفت هوش مصنوعی رو دوباره داغ کرد.
تیم LlamaIndex یه ابزار متنباز منتشر کرده که PDF رو کامل روی سیستم خودت پارس میکنه؛ از Rust و پایتون گرفته تا اجرا مستقیم تو مرورگر با WASM.
پرپلکسیتی یه ابزار متنباز منتشر کرده که رفتار ایجنتهای کدنویسی رو روی خود دستگاه رصد میکنه و در صورت نیاز میتونه جلوی یه اقدام پرخطر رو قبل از اجرا بگیره.
OpenAI یه ابزار خط فرمان و SDK تایپاسکریپتی منتشر کرده که کد رو برای آسیبپذیری اسکن میکنه، یافتهها رو دنبال میکنه و میتونه همون چکها رو داخل CI اجرا کنه.
وقتی یه ایجنت بهجای تو کاری انجام میده، با چه هویتی این کارو میکنه؟ همین انتخاب تعیین میکنه لو رفتن یه اعتبارنامه چقدر برات گرون تموم میشه.
استارتاپی که ابزار طراحیش رو دور Claude Code و ایجنتهای کدنویس ساخته، بعد از عرضهٔ نسخهٔ دسکتاپ درآمدش رو در یک ماه ۲۵ برابر کرد و حالا از Accel و ICONIQ پول گرفته.
نسل بعدی مدل گفتاربهگفتار گراک منتشر شد؛ مدلی که تو بنچمارکها از رقبای OpenAI و گوگل جلو زده و زمان رسیدن به اولین صدا رو تقریباً نصف کرده.
آنتروپیک حالت صوتی Claude رو به Sonnet و Opus وصل کرد؛ تا قبل از این همهٔ حرفها از مدل کوچیک Haiku رد میشد و جواب سؤالهای پیچیده لنگ میزد.
گزارش تازهٔ Cursor نشون میده کاربرهای حرفهای ۱۰ برابر میانه کد تولید میکنن و بیشترِ هزینهٔ هوش مصنوعی هم از توکنهای ورودیه، نه خروجی.