LiteFrame: انکودر ویدیویی سبک برای مدلهای زبانی بزرگ
خلاصهٔ کاملتر
وقتی میخوای یه مدل زبانی بزرگ (LLM) رو برای فهمیدن ویدیوهای طولانی بهکار بگیری، بزرگترین چالش اینه که تعداد توکنهای بصری (visual tokens) بهشدت زیاد میشه. هر فریم ویدیو باید جداگانه از یه مدل بینایی (Vision Transformer یا ViT) رد بشه و خروجیش به LLM تحویل داده بشه. هرچه ویدیو طولانیتر، فریمهای بیشتر، توکنهای بیشتر، و محاسبات سنگینتر.
روشهای رایج سعی میکنن بعد از استخراج ویژگی، تعداد توکنها رو کم کنن تا LLM راحتتر کار کنه. اما محققان LiteFrame متوجه شدن که با این کار فقط مشکل رو جابهجا میکنن: گلوگاه از LLM به انکودر بصری منتقل میشه، که هنوز مجبوره همه فریمها رو با هزینه بالا پردازش کنه.
LiteFrame یه انکودر ویدیویی سبکوزن و کارآمده که مستقیماً این مشکل رو هدف میگیره. برای آموزشش از روشی به اسم Compressed Token Distillation یا CTD استفاده میشه. ایده اصلی اینه که یه انکودر کوچکتر (دانشآموز) یاد میگیره مستقیماً همون خروجیهای فشرده و اطلاعاتمحوری رو تولید کنه که یه مدل بینایی بزرگتر (استاد) بعد از یه مرحله pooling فضایی-زمانی تولید میکرد. یعنی محاسبات اضافی دور زده میشن، نه اینکه بعداً حذف بشن.
در کنار CTD، یه مرحله تنظیم سبک به اسم Language Model Adaptation یا LMA اضافه شده که فضای نمایش فشردهشده رو با LLM هماهنگ میکنه. این هماهنگی به مدل اجازه میده تا با ۵۱۲ فریم بهصورت همزمان کار کنه — چیزی که قبلاً با بودجه محاسباتی ثابت ممکن نبود. معماری انکودر هم از کانولوشنهای عمقی ۱D برای مدلسازی زمانی و کانولوشنهای strided برای کاهش ابعاد استفاده میکنه تا FLOPs کمتری مصرف بشه.
نتایج قابل توجهه: LiteFrame با تنها ۸۷ میلیون پارامتر (در مقایسه با ۳۰۴ میلیون مدل استاد) کار میکنه، تا ۳۵٪ تأخیر کل رو کاهش میده، و با همان بودجه محاسباتی میتونه ۸ برابر بیشتر فریم پردازش کنه. روی بنچمارکهایی مثل Video-MME، MLVU و LongVideoBench هم دقت بهتری داره. جالبتر اینکه بدون هیچ آموزش اضافهای روی رزولوشن بالا، روی بنچمارک HLVid هم به نتیجه state-of-the-art رسیده.
نکات کلیدی:
- گلوگاه اصلی Video LLMها انکودر بصریه، نه فقط LLM
- LiteFrame با روش CTD انکودر رو از ابتدا برای خروجی فشرده آموزش میده
- مرحله LMA انکودر سبک رو با LLM هماهنگ میکنه
- ۸۷M پارامتر در مقابل ۳۰۴M پارامتر مدل استاد
- ۳۵٪ کاهش تأخیر و پشتیبانی از ۸ برابر فریم بیشتر در همان بودجه
- بدون آموزش روی رزولوشن بالا، نتیجه برتر روی HLVid




