RLCD؛ رقیب تازهٔ RLHF برای مدلهای تصمیمگیر
خلاصهٔ کاملتر
Diogo Almeida که میگه روی تکنیک پشت ChatGPT کار کرده، حالا از طریق شرکتش Typesafe روشی به اسم RLCD (مخفف reinforcement learning for calibrated decisions) رو به عنوان جایگزین RLHF مطرح کرده. تو RLHF آدمها جوابهای مدل رو رتبهبندی میکنن و مدل طوری تنظیم میشه که بیشتر جوابهای پسندیدهشده بده. به گفتهٔ Almeida، RLHF مدل رو برای «درست به نظر رسیدن» بهینه میکنه، ولی RLCD برای «واقعاً درست بودن».
انتقاد اصلی Almeida اینه که ارزیاب انسانی فقط میبینه جواب همون لحظه چقدر قانعکنندهست، نه اینکه بعداً وقتی بر اساسش کاری انجام بشه درست از آب درمیاد یا نه. اون میگه نتیجهش چند مشکل مشخصه: mode dropping (یعنی مدل جوابهای درست ولی کمرایج رو کنار میذاره)، اطمینانی که به دقت واقعی ربطی نداره، و رفتار ناهمگون روی ورودیهای مشابه.
تو یه چتبات که آدم جواب رو میخونه و خودش قضاوت میکنه، این مشکلات فاجعه نیستن. ولی وقتی خروجی مدل بدون نظارت انسانی مستقیم یه کار تو نرمافزار رو اجرا میکنه، همینها تبدیل به ریسک جدی میشن.
مدل Typesafe که اسمش Jeff هست، به جای متن محاورهای یه تصمیم typed (یعنی خروجی ساختاریافته با نوع مشخص) همراه با یه عدد اطمینان برمیگردونه. این عدد calibrated هست، یعنی اگه مدل بگه ۹۰٪ مطمئنه، باید حدوداً ۹۰٪ وقتها درست باشه. اپلیکیشن هم میتونه یه آستانه تعیین کنه: بالای اون، کار خودکار انجام میشه و پایینش، تصمیم برای بررسی به یه آدم میرسه. پس Jeff برای صدا زده شدن توسط نرمافزار ساخته شده، نه برای گپ زدن.
Typesafe ادعا میکنه Jeff برای این جور کارها خیلی سریعتر و ارزونتره: حدود یکدهم ثانیه و کسری از یه سنت برای هر درخواست، در برابر چند ثانیه و هزینهٔ بیشتر برای یه LLM معمولی. از نرخ خطای ۰٪ تو خروجی ساختاریافته، در برابر خطای چند درصدی مدلهای GPT و Claude، هم حرف زده. ولی همهٔ این عددها رو خود Typesafe گزارش کرده، هیچ تست مستقلی انجام نشده و مدل فعلاً فقط waitlist داره.
نویسندهٔ مقاله معتقده بحث اصلی سر کاربرده، نه اینکه کدوم روش در کل بهتره. جوابهای روشن و مطمئن RLHF تو دستیارهای گفتوگومحور یه نقطهٔ قوته. اما تو ایجنتها و pipelineهای خودکار، مدلی که با اطمینان اشتباه میکنه از مدلی که میگه «مطمئن نیستم» خطرناکتره. پس به گفتهٔ نویسنده، RLHF برای رابطهایی که آدمها باهاشون حرف میزنن مناسبه و RLCD، اگه ادعاهاش ثابت بشه، برای لایههای تصمیمگیری پشت صحنه.
نکات کلیدی:
- RLCD مخفف reinforcement learning for calibrated decisions و ساختهٔ شرکت Typesafe هست.
- RLHF بر اساس پسند ارزیاب انسانی آموزش میبینه، RLCD بر اساس درستی واقعی نتیجه.
- مدل Jeff یه تصمیم typed به همراه عدد اطمینان calibrated برمیگردونه.
- ادعای Typesafe: حدود ۰.۱ ثانیه و کسری از یه سنت برای هر درخواست، با ۰٪ خطای خروجی ساختاریافته.
- هیچکدوم از بنچمارکها مستقل تأیید نشده و Jeff هنوز فقط waitlist داره.




