بهترین آدمهای تیمت بدترین داورهای AI هستن
خلاصهٔ کاملتر
یه مقاله از ۲۰۲۳ به اسم The LLMentalist Effect دوباره سر زبونها افتاده. ادعاش صریحه: حس هوشمندیای که موقع چت با یه مدل زبانی داری، همون کلک رماله، یعنی cold reading (گفتن جملههای کلی که هر کسی خودشو توشون پیدا میکنه). مدل جملههای آماری محتمل میریزه بیرون، تو معنیشو میسازی و با این حس بلند میشی که یکی درکت کرده.
نویسنده میگه نسخه تند این حرف توی ۲۰۲۶ دیگه جواب نمیده. رمالها کد کار نمینویسن و تیکت واقعی نمیبندن، ولی این مدلها به اندازه کافی این کارو میکنن. به گفته او، توی یه پست مهمان روی وبلاگ ترنس تائو هم یه ریاضیدان شاغل از استفاده روزمره از این ابزارها روی کار واقعی گفته. با این حال یه تیکه از حرف اون مقاله درسته و دقیقاً همون تیکهست که داره پایلوتهای AI شرکتهای جدی رو خراب میکنه.
نکته آزاردهنده اینه که باهوش بودن ازت محافظت نمیکنه، بلکه به نفع رماله. چیزی که روانشناسها بهش میگن subjective validation، یعنی خودت پل بین یه حرف کلی و زندگی خودت رو میسازی و بعد اعتبارشو میدی به گوینده. نویسنده میگه دموی AI هم همینه: قویترین مهندس تیم پرامپت دقیق مینویسه، انحراف خروجی رو میبینه و با یه خط درستش میکنه، بدون اینکه اصلاً حواسش باشه داره این کارو میکنه. ده دقیقه بعد کل اتاق فکر میکنه ابزار فوقالعادهست.
پس به گفته نویسنده سوال درست این نیست که «مدل میتونه این کارو بکنه؟»، سوال اینه که «بدون اینکه یه متخصص هر قدم هدایتش کنه میتونه؟» چون وقت همون متخصص دقیقاً همون هزینهای بود که میخواستی حذفش کنی. اینجاست که human in the loop از یه جمله آرامشبخش تبدیل میشه به یه بحث قیمت: اگه توی اون حلقه یه مهندس ارشد نشسته و خطاهای مدل رو میگیره، تو نیروی کار جایگزین نخریدی، یه ابزار قدرتمند برای متخصصها خریدی.
سه تا عادت هم پیشنهاد میکنه. اول کف رو تست کن نه سقف: یه آدم بلد ولی غیرمتخصص رو بذار پای پایلوت، چون اگه ابزار فقط دست کسی کار کنه که خودش هم میتونست کارو انجام بده، تو کارمندت رو سنجیدی نه نرمافزار رو. دوم نمره دادن رو ببر روی داده خودت: یه تستست کوچیک از تیکتهای بستهشده و PR های مرجشده خودت بساز که جوابش رو از قبل میدونی. سوم بعد هر تسک بپرس این کارو مدل حل کرد یا پرامپت و اصلاح آدم.
نویسنده میگه هیچکدوم اینها ضد AI نیست. ابزار معمولاً جایی میارزه که چک کردن جواب ارزون باشه، نه جایی که خروجی چشمگیرتر به نظر میاد. به گفته او شرکتهایی که جلو میزنن مدل باهوشتری ندارن، چون مدل دست همه هست؛ فرقشون اینه که یاد گرفتن توانایی واقعی رو از یه اجرای خوب تشخیص بدن.
نکات کلیدی:
- The LLMentalist Effect مدلهای زبانی رو به cold reading رمالها تشبیه میکنه
- سوگیری اصلی subjective validation ـه: خود مخاطب معنی رو میسازه و اعتبارشو میده به ابزار
- دموی وندور یه اجرای کنترلشدهست: تسک، اپراتور و قاب رو خود فروشنده انتخاب میکنه
- معیار درست اینه که هر واحد خروجی چقدر قضاوت انسانی مصرف میکنه، نه اینکه خروجی چقدر خوب به نظر میاد
- پایلوت رو با یه غیرمتخصص اجرا کن و روی تیکتها و PR های بستهشده خودت نمره بده، نه بنچمارک عمومی




