فیلتر کردن دیتا؛ بزرگترین اهرم مدلهای ویدیویی
خلاصهٔ کاملتر
تو این پست فنی، دو برادری که پشت Linum هستن و از صفر مدل متنبهویدیو آموزش میدن، میگن معماری مدلهای تصویر و ویدیو از زمان Stable Diffusion 3 تقریباً دستنخورده مونده و هنوز همون flow matching (یعنی روشی که مدل یاد میگیره نویز رو قدمبهقدم به تصویر تبدیل کنه) با بکبون ترنسفورمره. به نظرشون بیشتر پیشرفتها از سه جای دیگه اومده: فیلتر و متعادلسازی دیتا، آنوتیشن بهتر، و تولید دیتای مصنوعی.
نسخهی ۲۰۲۴ پایپلاینشون کاملاً روی CPU میچرخید. برای بریدن ویدیوها سر کاتها از PySceneDetect استفاده میکردن، برای پیدا کردن کلیپهای پر از متن از مدل قدیمی EAST، و برای سنجیدن میزان حرکت هم سراغ motion vectorهای داخل فایلهای H.264 میرفتن، یعنی همون دادهای که کدک برای فشردهسازی ذخیره میکنه. روی اینها یه درخت تصمیم دستی نشسته بود؛ مثلاً کلیپی که میانگین انرژی حرکتش زیر ۰.۱ بود عملاً ثابت حساب میشد و دور ریخته میشد.
نویسندهها میگن این مسیر از پایه اشتباه بود. اجرای EAST روی دهها میلیارد فریم هفتهها طول میکشید و چون مجبور بودن فریمها رو کوچیک کنن، متنهای ریز از فیلتر رد میشدن. مهمتر از اون، درخت تصمیم اونقدر درهمتنیده شده بود که هر فیلتر جدید شاخههای قبلی رو به هم میریخت. جمعبندی خودشون اینه که دنبال ارزونترین فیلتر نباید رفت، بلکه باید بهترین فیلتری رو ساخت که بودجه اجازه میده.
تو ۲۰۲۵ همه چیز رفت روی GPU. جای PySceneDetect رو AutoShot و TransNetV2 گرفت، جای EAST رو PaddleOCR روی هزاران کارت A10G و L4، و جای الگوریتمهای کلاسیک بینایی ماشین رو مدلهای زبانی فاینتیونشده. کل دهها میلیارد نمونه تو حدود ۳۶ ساعت و با کمتر از ۱۰ هزار دلار پردازش شد. نتیجهش ملموس بود: مدلی که با دیتاست ۲۰۲۴ چند هفته طول کشیده بود تا حرکتی مثل زدن گیتار رو یاد بگیره، با دیتای فیلترشدهی جدید زیر ۲۴ ساعت یادش گرفت.
بخش سخت ماجرا خود برچسبزدنه. میگن با ۲ تا ۳ هزار نمونه میشه یه فیلتر خوب آموزش داد، ولی یکدست نگه داشتن معیارها واقعاً سخته؛ به مطالعهای از CMU اشاره میکنن که توش حتی متخصصهای فیلمبرداری حدود ۲۴ درصد مواقع با برچسب مرجع اختلاف داشتن. برای دستهبندی تصویر و ویدیو Qwen-2-VL-2B رو با SFT فاینتیون کردن، و برای نمرهی زیباییشناختی ۱ تا ۴ سراغ RLVR با الگوریتم GSPO روی Qwen-2.5-VL-3B رفتن که خیلی بهتر از SFT جواب داد.
نکات کلیدی:
- پردازش دهها میلیارد نمونه روی GPU حدود ۳۶ ساعت و کمتر از ۱۰ هزار دلار خرج برداشت.
- مدل با دیتای فیلترشدهی ۲۰۲۵ زیر ۲۴ ساعت حرکتی رو یاد گرفت که قبلاً چند هفته طول میکشید.
- برای آموزش یه فیلتر خوب، ۲ تا ۳ هزار نمونهی برچسبخورده کافی بوده.
- نمرهی زیباییشناختی با RLVR و الگوریتم GSPO روی Qwen-2.5-VL-3B از نسخهی SFT بهتر جواب داد.
- فقط نمونههای با نمرهی ۳ و ۴ از فیلتر زیباییشناختی رد میشن.
- تلاش برای اضافه کردن reasoning به مدل نمرهدهنده جواب نداد.




