Edit-R1: ویرایش تصویر با یادگیری تقویتی هوشمند
خلاصهٔ کاملتر
یادگیری تقویتی از بازخورد انسانی (RLHF) در تولید تصویر از متن خیلی موفق بوده، ولی وقتی نوبت به ویرایش تصویر میرسه، هنوز دستنخورده مونده. مشکل اصلی اینه که هیچ مدل پاداش جامع و قویای برای همه انواع وظایف ویرایش وجود نداره.
مدلهای پاداش فعلی معمولاً فقط یه امتیاز کلی میدن؛ بدون اینکه بررسی دقیقی انجام بدن. این یعنی تفاوتهای ظریف دستورالعملها نادیده گرفته میشه و پاداشهای مغرضانهای تولید میشه که آموزش مدل رو خراب میکنه.
پژوهشگران برای حل این مشکل Edit-R1 رو معرفی کردن. ایده اصلی اینه که به جای یه «نمرهدهنده» ساده، از یه «تأییدکننده استدلالی» استفاده بشه. این تأییدکننده که Edit-RRM نام داره، دستورالعمل ویرایش رو به اصول مجزا تجزیه میکنه، تصویر ویرایششده رو در برابر هر اصل ارزیابی میکنه، و بعد همه این بررسیها رو به یه پاداش دقیق و قابل تفسیر تبدیل میکنه.
برای ساختن Edit-RRM دو مرحله طی شده: اول، با استفاده از fine-tuning نظارتشده (SFT) به عنوان «شروع سرد»، مسیرهای پاداش زنجیرهوار (CoT) تولید شده. دوم، یه الگوریتم یادگیری تقویتی جدید به اسم GCPO (Group Contrastive Preference Optimization) معرفی شده که از دادههای ترجیح جفتی انسانی استفاده میکنه تا مدل پاداش رو تقویت کنه.
بعد از ساخته شدن Edit-RRM، از الگوریتم GRPO برای آموزش مدلهای ویرایش با این مدل پاداش غیرمشتقپذیر ولی قدرتمند استفاده میشه. این معماری دو مرحلهای (ساخت RRM و بعد آموزش مدل ویرایش) یه نقطه قوت اساسی داره: مدل پاداش میتونه مستقل از مدل ویرایش توسعه و بهبود پیدا کنه.
نتایج آزمایشها نشون میده که Edit-RRM از مدلهای زبان-بینایی قدرتمندی مثل Seed-1.5-VL و Seed-1.6-VL به عنوان مدل پاداش اختصاصی ویرایش بهتر عمل میکنه. یه روند مقیاسپذیری هم مشاهده شده؛ با رشد پارامترها از ۳ میلیارد به ۷ میلیارد، کیفیت خروجی مداوم بهتر میشه.
Edit-R1 روی مدلهای ویرایش تصویر واقعی مثل FLUX.1-kontext هم آزمایش شده و بهبودهای ملموسی داشته. این نشون میده که رویکرد تأییدکننده مبتنی بر استدلال زنجیروار میتونه به عنوان یه لایه بهبود عمومی روی مدلهای ویرایش تصویر موجود اعمال بشه.
در مجموع، Edit-R1 نشون میده که گذار از «نمرهدهنده کلی» به «تأییدکننده استدلالی» در حوزه ویرایش تصویر، یه قدم بزرگ به سمت سیستمهای هوش مصنوعی دقیقتر و قابل اعتمادتره.
نکات کلیدی:
- Edit-R1 اولین فریمورک RLHF اختصاصی برای ویرایش تصویره
- Edit-RRM دستورالعملها رو به اصول جزئی تقسیم میکنه و هر کدوم رو جداگانه ارزیابی میکنه
- GCPO الگوریتم جدیدیه که از دادههای ترجیح جفتی انسانی برای تقویت مدل پاداش استفاده میکنه
- این سیستم از مدلهای قوی مثل Seed-1.5-VL و Seed-1.6-VL در ارزیابی ویرایش تصویر پیشی میگیره
- با افزایش اندازه مدل از ۳B به ۷B، عملکرد به طور مداوم بهتر میشه
- روی FLUX.1-kontext آزمایش شده و نتایج مثبتی داشته




