ابزار متنباز سایدبرنچ میذاره دو برنچ گیت رو کنار هم تو مرورگر مقایسه کنی، بدون اینکه ورکینگتری خودتو دست بزنی یا برنچ عوض کنی.
گوگل یه ابزار متنباز به اسم آرتمیس منتشر کرده که با کمک هوش مصنوعی، گوشی اندرویدی واقعی رو دقیقا مثل یه آدم لمس میکنه و تستهای پیچیده رو خودش انجام میده.
تیم Entelligence یه مدل ارزونقیمت هوش مصنوعی رو با یه مدل گرون مقایسه کرده تا ببینه برای ریویو کد چقدر خوبه، و نتیجه تو کدهای امنیتی جالب از آب دراومده.
یه محقق با پسزمینهی فیزیک دو معیار عددی برای سنجش شلختگی کدهای تولیدشده با هوش مصنوعی معرفی میکنه و نشون میده چرا خود ایجنتها هم نمیتونن این شلختگی رو جمع کنن.
نویسنده بهجای نوشتن تستهای مثالمحور، برای کلاینت HTTP خودش (ffetch) قانون کلی نوشت و گذاشت ابزار فازینگ ورودیهای عجیب رو پیدا کنه؛ نتیجهش یازده باگ پنهون بود.
دو PR تازه یه ماژول تجربی به اسم node:bench رو به هستهی Node.js اضافه میکنن، دقیقاً با همون الگوی node:test ولی برای بنچمارک زدن.
نسخه جدید Claude Fable تو بنچمارک ریلزی Agents on Rails به امتیاز Opus 5 رسید، اما با هزینه و زمان اجرای کمتر؛ مدل مخفی دور قبلی هم حالا معرفی شد.
توسعهدهندهای که داره یه بازی متنی با هوش مصنوعی میسازه، تعریف میکنه چطور از تست ساده پرامپت به یه سیستم eval کامل رسید که کل بازی، حافظه و حتی صفحهٔ نمایش رو چک میکنه.
دراپباکس بیش از ۲۰۰ وبسایت داره و برای اینکه بفهمه بنر کوکی همهجا درست کار میکنه، یه ربات ساخته که مثل یه کاربر واقعی رفتار میکنه و هر هفته گزارش میده.
تیم Vitest نسخه ۵ رو با تمرکز روی سرعت منتشر کرده؛ توی بنچمارکهای خودشون زمان اجرای تستها توی پروژههای بزرگ تا نیمی کم شده.
Vitest حالا یه قابلیت تجربی به اسم traceView داره که هر تعامل مرورگر رو مرحله به مرحله ضبط میکنه تا بعد از تموم شدن تست هم بشه قدمبهقدم بررسیش کرد.
یه توسعهدهنده مدلهای کوچیک و بزرگ رو گذاشت جلوی باگهای واقعی جنگو، بدون هیچ سرنخی. نتیجه نشون داد بنچمارکهای معروف دارن چیز دیگهای رو اندازه میگیرن.
با اینکه ایجنتهای هوش مصنوعی حالا بیشتر کدها رو مینویسن، تیمهای مختلف روشهای خیلی متفاوتی برای ریویو کردن این حجم تغییرات پیدا کردن؛ از حذف تقریبی ریویوی انسانی تا ریویو کردن فقط پلن و اسکیما.
یه مقالهٔ فنی میگه وقتی دو مدل هر دو رو MMLU تست میشن ولی روش امتیازگیریشون فرق داره، مقایسهٔ عددهاشون بیمعنیه، حتی اگه اسم بنچمارک و واحد امتیاز یکی باشه.
دن لو ۲۶ حالت مختلف از TDD و QuickCheck تا Lean 4 و TLA+ رو روی یک تسک واحد سنجید. حالت بدون هیچ دستور اضافه بالای میانگین موند و TDD ته جدول نشست.
نسخهی پنجم Vitest، فریمورک تست جاوااسکریپت، با تمرکز روی سرعت اومده؛ تو بعضی پروژههای بزرگ زمان اجرای تستها تا ۵۳ درصد کم شده، و ابزارهایی مثل Trace View هم برای دیباگ تستهای مرورگری اضافه شده.
به جای اینکه قدمبهقدم بنویسی چی کلیک شه، هدف رو به یه ایجنت میدی تا خودش راه رو پیدا کنه. متا، اوبر و Airbnb امتحانش کردن و عددهاشون میگه کجا جواب میده و کجا نه.
تیم Checkly سرویس اصلی پردازش نتایجش رو از Node.js به Go برد و کدنویسیش رو به یه ایجنت سپرد. چیزی که کار رو جواب داد، هارنس تستی بود که قبل از نوشتن کد ساختن.
Nathan Curtis میگه راه فهمیدن اینکه spec یه کامپوننت چقدر از نیت طراحی رو واقعاً حمل میکنه اینه که ازش بخوای کامپوننت رو پس بده و بعد دو تا نسخه رو با هم diff کنی.
آسانا رفتن از یه فریمورک تست قدیمی رو سالها عقب انداخته بود و آخرش با ایجنتهای AI دو هفتهای تمومش کرد؛ مقاله میگه مهاجرت فریمورک شاید بهترین کاربرد فعلی AI باشه.