VIPE: تصویر ورودی رو مهندسی کن
خلاصهٔ کاملتر
توی عصر مدلهای پایه، کیفیت خروجی یه مدل تا حد زیادی به پرامپتش بستگی داره. نویسندههای این مقاله میگن حالا که مدلهای ویدیویی دارن به مدل پایهی کارهای بصری تبدیل میشن، همون منطق باید روی ورودی تصویری هم جواب بده: بهجای بهینهکردن متن، خودِ تصویرِ مسئله رو خودکار ویرایش کنیم. اسم این ایده رو گذاشتن VIPE یا مهندسی پرامپت تصویری.
مثال سادهش یه تسک استدلال فیزیکیه: «توپ بعد از عبور از موانع توی کدوم سطل میافته؟» صحنهی اصلی یه طرح انتزاعی و تخته و مدل معمولاً اشتباه جواب میده. با یه فراخوانی ساده به یه مدل ویرایش تصویر، همون صحنه به یه نسخهی واقعگرایانه — مثلاً ناودانیهای فلزی یه کارخانه — تبدیل میشه و همون مدل درست جواب میده.
آزمایشها روی شش تسک انجام شده: فیزیک VPCT، جستوجوی ترکیبی، وصلکردن نقطههای همرنگ، مرتبکردن سه عدد، حل ماز توی اندازههای مختلف و پازل RushHour. دو جور ویرایش هم امتحان شده: ویرایش آزاد (freeform) که کل حالوهوای صحنه رو عوض میکنه، و ویرایش مفهومی اتمی یا ACE که فقط یه ویژگی مشخص مثل جنس، رنگ، اندازه یا ضخامت خط اجزا رو دستکاری میکنه.
به گفتهی نویسندهها، VIPE توی همهی این تسکها استدلال ویدیویی رو بهتر کرده و جالبتر اینکه برای مدلهای ویدیویی حتی از مهندسی پرامپت متنی کلاسیک یا تستتایم اسکیلینگ هم مؤثرتر بوده؛ یعنی با محاسبات کمتر، جواب بهتر. یه نکتهی عملی هم از نتایج درمیاد: بهترین ویرایش برای هر تسک فرق داره و چیزی که ماز رو حل میکنه لزوماً برای RushHour بهترین گزینه نیست.
نکات کلیدی:
- VIPE یعنی بهجای متن پرامپت، خودِ تصویر ورودی رو خودکار ویرایش کنیم
- تبدیل صحنههای انتزاعی به تصویر واقعگرایانه، دقت استدلال مدلهای ویدیویی رو بالا میبره
- دو سبک ویرایش: آزاد (تغییر کل صحنه) و ACE (تغییر یه ویژگی مشخص)
- روی شش تسک از فیزیک و ماز تا RushHour جواب داده
- به گفتهی نویسندهها از پرامپتمهندسی متنی و تستتایم اسکیلینگ هم کمهزینهتر و مؤثرتره




