انسان در حلقه یا فقط تماشاچی حلقه؟
خلاصهٔ کاملتر
تو این مقاله اومده که «human in the loop» انقدر تکرار شده که به یه جواب رفلکسی برای هر نگرانی دربارهٔ AI تبدیل شده. داگ شپرد، مسئول امنیت تهاجمی Cloudflare، میگه خیلی از این گاردریلها در عمل چیزی جز مهر تأیید نیستن: اگه آدمِ توی حلقه فقط بتونه یه چیزی رو flag کنه ولی نتونه جلوشو بگیره، اون آدم کنار حلقهست نه توی حلقه. اسم این وضعیت رو میذاره حکمرانی نمایشی، چیزی که پروژه رو تصویب میکنه ولی ریسک رو کم نمیکنه.
دارن کیمورا، مدیرعامل AISquared، همین رو با یه جمله جمع میکنه: بیشتر شرکتها آدم ناظر بر حلقه دارن، نه آدم داخل حلقه. به گفتهٔ اون ناظر تصمیم رو میبینه و میتونه نگرانیشو بگه، ولی نمیتونه متوقفش کنه، تغییرش بده، ردش کنه یا ببرتش بالاتر. تستش هم سادهست: آیا بازبین میتونه قبل از اجرا جلوی کارو بگیره؟ آیا میتونه خروجی رو عوض کنه؟ آیا override اون ثبت و تو مراحل بعدی واقعاً اعمال میشه؟
مشکل دوم خستگی تصمیمه. اریک بیلینگزلی از TrustScale میگه اگه سیستم ۹۵ درصد مواقع درست باشه، شغل آدم میشه انتظار کشیدن برای اون مورد نادر اشتباه، و آدمها تو مراقبت مداوم از یه سیستم قابلاعتماد اصلاً خوب نیستن؛ بازبینی کمکم میشه تأیید. رابرت بلوموفی، CTO آکامای، هم میگه LLMها بهاندازهٔ کافی درست جواب میدن که خیال آدم رو راحت کنن و دقت اولیه آروم آروم بره.
بیلینگزلی پیشنهاد میده این کنترل هم مثل هر کنترل امنیتی دیگه مانیتور، تست و مستند بشه؛ یه لاگ که نشون بده یکی روی approve کلیک کرده کافی نیست، باید شواهدی باشه که اون آدم context لازم رو داشته، قضاوت مستقل کرده و اختیار override هم داشته. بلوموفی میگه بهتره بهجای نظارت انسانی شکننده، سیستمهای غیر AI نقش گاردریل رو بگیرن و بتونن خروجی مدل رو تست کنن، مشکل رو flag کنن و لازم شد کار رو pause کنن.
کیمورا اضافه میکنه که آدم توی حلقه همیشه هم جواب درست نیست. تو پاسخ به حادثهٔ امنیتی، اگه یه endpoint آلوده شده باید همون لحظه ایزوله بشه و ۲۰ تا ۳۰ دقیقه صبر برای تأیید یه نفر یعنی فرصت دادن به حمله برای پخش شدن. به گفتهٔ اون هدف این نیست که تو هر تصمیم AI یه آدم بذاریم، بلکه اینه که آدمِ درست، با context و اختیار درست، تو نقطهٔ درست workflow باشه.
نکات کلیدی:
- شپرد (Cloudflare): ناظری که نمیتونه جلوی اقدام رو بگیره، کنار حلقهست نه توی حلقه
- سه سوال کیمورا: توقف قبل از اجرا، تغییر خروجی، و اعمال شدن override تو مراحل بعدی
- بیلینگزلی: با دقت ۹۵ درصدی مدل، بازبینی به تأیید تشریفاتی تبدیل میشه
- لاگ کلیک روی approve بهعنوان شواهد کارکرد کنترل کافی نیست
- تو مهار حادثهٔ امنیتی، صبر ۲۰ تا ۳۰ دقیقهای برای تأیید انسانی میتونه باعث پخش شدن حمله بشه




