متریکهای فعالیت مهندسی دیگه چیزی رو نشون نمیدن
خلاصهٔ کاملتر
تز اصلی این مقاله اینه که هوش مصنوعی متریکهای مهندسی رو منسوخ نکرده، ولی یه دستهٔ خاصشون رو فعالانه گمراهکننده کرده: همون شاخصهای فعالیت که تو گزارش هیئتمدیره نشون داده میشن. نویسنده به عنوان شاهد، نظرسنجی ۲۰۲۶ هالکویندز روی ۷۵۸ سازمان مهندسی رو میاره: ۷۶ درصد حداقل یه دستیار کدنویسی رو سازمانی راه انداختن (در ۲۰۲۴ فقط ۴۱ درصد)، ولی فقط ۳۴ درصد میتونن یه تغییر قابل اندازهگیری تو متریکهای تحویل نشون بدن.
به گفتهٔ نویسنده اگه دنبال یه ضریب ثابت برای بهرهوری هوش مصنوعی بگردی پیداش نمیکنی. کارآزمایی تصادفی METR روی ۱۶ توسعهدهندهٔ باتجربه و ۲۴۶ تسک نشون داد اینها با ابزار هوش مصنوعی ۱۹ درصد کندتر شدن، در حالی که خودشون قبلش فکر میکردن سریعتر میشن. ولی آزمایشهای میدانی مایکروسافت و اکسنچر روی مجموعاً ۴۸۶۷ توسعهدهنده حدود ۲۶ درصد تسک بیشتر ثبت کردن. فرق این دوتا تو نوع کاره و تو اینکه کدبیس چقدر تو ذهن آدمها جا افتاده، نه تو درست و غلط بودن مطالعه.
استدلال بعدی اینه که کار حذف نشده، فقط رفته پاییندست: از نوشتن به فهمیدن و بازبینی. تحلیل بلندمدت GitClear روی ۲۱۱ میلیون خط کد نشون داد برای اولین بار حجم کد کپیشده از کد ریفکتورشده جلو زده. گزارش امنیتی Veracode هم میگه ۴۵ درصد نمونههای تولیدشده تستهای امنیتی رو رد کردن. تلهمتری Apiiro روی ریپوهای سازمانی هم مسیرهای privilege escalation، یعنی راههایی که مهاجم باهاشون دسترسی بالاتر میگیره، رو ۳۲۲ درصد بیشتر دیده.
پیشنهاد نویسنده حذف متریک نیست، عوض کردن اولویته: خروجیهای سبک DORA، یعنی همون شاخصهای استاندارد سرعت و پایداری تحویل، سر جاشون بمونن، شاخصهای فعالیت پایین بیان و چندتا شاخص تشخیصی اضافه بشه. مهمترینهاش وقت انتظار تا اولین ریویوی واقعی، دوبارهکاری کوتاهمدت (خطهایی که تو ۱۴ روز عوض یا برگردونده میشن تقسیم بر خطهای اضافهشده) و نرخ شکست تو گیتهای تست و امنیته. همهشون هم باید نسبت به یه خط پایهٔ قبل از هوش مصنوعی روند گرفته بشن، نه به صورت عدد مطلق.
دو تا هشدار هم داره. اول اینکه به گفتهٔ نویسنده هیچکدوم از اینها نباید در سطح فرد گزارش بشه، چون طبق قانون گودهارت هر معیاری که هدف بشه از معیار بودن میافته و داشبورد خیلی زود تبدیل به جدول رتبهبندی میشه. دوم اینکه گزارش DORA ۲۰۲۵ هوش مصنوعی رو یه تقویتکننده میدونه: جایی که تست خودکار و پلتفرم داخلی قوی بوده خروجی بالا رفته، و جایی که ضعیف بوده ناپایداری و دوبارهکاری بیشتر شده.
نکات کلیدی:
- نظرسنجی ۲۰۲۶ هالکویندز: ۷۶ درصد سازمانها دستیار کدنویسی دارن، فقط ۳۴ درصد اثرش رو اندازه گرفتن.
- METR: ۱۹ درصد کندتر برای نگهدارندههای باتجربه؛ آزمایشهای میدانی سازمانی: حدود ۲۶ درصد تسک بیشتر.
- تحلیل حدود ۱۱۰ هزار PR متنباز: PRهای نوشتهشده با Claude Code حدود شش برابر PRهای انسانی حجم داشتن.
- Veracode: ۴۵ درصد کد تولیدشده تست امنیتی رو رد کرد. Apiiro: ۳۲۲ درصد رشد مسیرهای privilege escalation.
- جایگزین: وقت انتظار ریویو و دوبارهکاری ۱۴ روزه، فقط در سطح تیم.




