PDD انویدیا: ویدیو با ۴ تا ۸ ارزیابی
خلاصهٔ کاملتر
تولید ویدیو با مدلهای دیفیوژن و فلو-مچینگ گرون تموم میشه، چون فرایند نمونهبرداریشون کند و تکراریه و گاهی صدها بار ارزیابی شبکه لازم داره. تو این مقاله اومده که روشهای شتابدهی امروزی بیشتر به تقطیر امتیاز واریاسیونی (VSD) و لاسهای خصمانه تکیه میکنن؛ کیفیت خوبی میدن ولی بهینهسازیشون بدقلقه و به فروپاشی حالت میخورن، یعنی خروجیها کمتنوع و کمحرکت میشن.
ایدهی Parallel Decoding Distillation یا PDD سادهست: بهجای اینکه چند گام کوچیک معلم توی یه گام بزرگ ادغام بشه، چند گام معلم با یه بار ارزیابی شبکه همزمان پیشبینی میشن. بازهی زمانی به N بازه تقسیم میشه و بازهها توی بلاکهایی به اندازهی L دستهبندی میشن؛ موقع تولید، هر ارزیابی مدل دانشآموز L بازه جلو میره.
معماریِ دانشآموز هم دستکاری سنگینی نمیخواد: فقط لایهی خطی آخرِ معلم N بار تکرار میشه، یکی برای هر بازه. چون جمعِ وزندارِ چند تبدیل خطی خودش یه تبدیل خطیه، موقع تولید میشه لایههای مربوط به هر بلاک رو توی یه لایهی واحد فیوز کرد. همین باعث میشه وزنهای دانشآموز مستقیم از معلم مقداردهی اولیه بشن و تعداد ارزیابیها (NFE) هم موقع اجرا قابل تنظیم بمونه.
آموزش بهصورت on-policy انجام میشه: از یه حالت نویزی شروع میکنن، دانشآموز رو روی یه بلاک جلو میبرن، بعد فقط یکی از حالتهای همون مسیر رو نمونه میگیرن و خروجی متناظرش رو با گام حلکنندهی ODE معلم تطبیق میدن. نکتهی ظریفش اینه که بهینهسازی روی همون یه زیربازه، سیگنال لازم برای یادگیری کل بازه رو میده و دیگه نیازی به JVP یا تقریب تفاضل محدود نیست.
به گفتهی تیم انویدیا، PDD با ۴ تا ۸ ارزیابی شبکه روی LTX-2.3 (متن به ویدیو و صدا)، Wan2.1 14B و Qwen-Image به نتایجی در حد بهترین روشها میرسه. برای مقایسه، مدل معلم روی Wan2.1 به خاطر CFG هر گام دو بار ارزیابی لازم داره و روی هم ۲×۵۰ ارزیابی میبره. مقایسههای کنار هم با DMD2 و AnyFlow هم منتشر شده و ادعای اصلیشون اینه که تنوع ویدیوهای تولیدی بهطور محسوسی بهتر شده.
نکات کلیدی:
- PDD چند گام نویززدایی معلم رو با یه بار ارزیابی شبکه پیشبینی میکنه
- تکرار لایهی خطی آخر و فیوزکردنش موقع تولید، تعداد گامها رو منعطف میکنه
- آموزش on-policy روی یه زیربازه، سیگنال یادگیری کل بازه رو میده
- کیفیت در حد بهترین روشها با ۴ تا ۸ NFE روی LTX-2.3، Wan2.1 14B و Qwen-Image
- برخلاف روشهای مبتنی بر VSD و لاس خصمانه، تنوع و حرکت خروجی حفظ میشه




