SFT، RL و On-Policy Distillation: نگاهی توزیعی به پستترینینگ
خلاصهٔ کاملتر
یه مدل زبانی رو میشه به عنوان یه توزیع احتمالی روی دنبالههای متنی در نظر گرفت. وقتی پستترینینگ میکنیم، داریم شکل این توزیع رو عوض میکنیم. سه روش اصلی — SFT، RL و On-Policy Distillation — این کار رو به شیوههای کاملاً متفاوتی انجام میدن.
SFT (Supervised Fine-Tuning) سادهترین حالته: یه دیتاست آماده داریم (از انسان یا مدل قویتر) و مدل رو با cross-entropy به سمت توزیع اون دیتاست میکشیم. مشکل اینجاست که چون توزیع شروع مدل در این فرآیند اهمیتی نداره، اگه دیتاست خیلی دور از توزیع اولیه مدل باشه، مدل راحت چیزهایی که قبلاً بلد بوده رو فراموش میکنه — پدیدهای که بهش Catastrophic Forgetting میگن. با این حال SFT برای وقتی که باید فرمت خروجی رو کلاً عوض کرد، عالیه.
RL (Reinforcement Learning) کاملاً فرق داره. مدل از خودش نمونه میگیره، یه تابع پاداش امتیازشون میده، و بعد با Policy Gradient مدل آپدیت میشه. اینجا توزیع هدف ثابتی وجود نداره. در RLVR (RL with Verifiable Rewards) که پاداش قابل تأیید و کمبایاسه، این روش خوب کار میکنه. در RLHF که مدل پاداش ناقصه، کار پیچیدهتر میشه و باید از جریمههای KL و محدودیتهای trust-region استفاده کرد.
On-Policy Distillation (OPD) بین این دو قرار میگیره: نمونهها از خود مدل (دانشآموز) گرفته میشن ولی گرادیان مدل رو به سمت توزیع یه معلم هدایت میکنه. یه نسخه جدید به اسم OPSD (On-Policy Self Distillation) معلم و دانشآموز رو یکی میگیره، با این تفاوت که معلم به جواب درست دسترسی داره. تحلیل per-token KL نشون داده توکنهای سبکی مثل "wait" یا "alright" KL بالاتری از توکنهای ریاضی دارن، پس برای جلوگیری از کولپس باید یه مکانیزم clipping توکنبهتوکن اضافه کرد.
آزمایشها روی یه تسک ویرایش کد نشون داد که دانشآموزی که از معلم SFT یا معلم RL تقطیر شده بود، به نتایج بسیار مشابهی رسید — حتی هر دو از معلم RL پیشی گرفتن. جالبتر اینکه دانشآموز OPD که از معلم SFT (که خودش دچار فراموشی شده بود) تقطیر شده بود، فراموشی کمتری از معلمش نشون داد. این نتیجه نشون میده که نحوه نمونهگیری آنلاین خیلی مهمتر از کیفیت توزیع معلمه. یعنی میشه یه مدل تخصصی رو حتی با SFT آموزش داد و بعد با OPD این قابلیت رو به مدل اصلی منتقل کرد بدون اینکه قابلیتهای دیگهاش خراب بشه.
نکات کلیدی:
- SFT مدل رو به سمت یه توزیع خارجی ثابت میکشه و مستعد Catastrophic Forgetting است
- RL با نمونهگیری آنلاین و سیگنال پاداش کار میکنه و توزیع هدف ثابتی نداره
- On-Policy Distillation ترکیب هر دو روشه و نمونهها از خود مدل دانشآموز گرفته میشن
- کیفیت معلم در OPD کمتر از انتظار اهمیت داره؛ آنچه بیشتر مهمه منبع آنلاین دادههاست
- OPSD با مکانیزم clipping توکنبهتوکن از آپدیتهای اضافه روی توکنهای کماهمیت جلوگیری میکنه




