WeMM-Embedding؛ امبدینگ چندرسانهای تنسنت
خلاصهٔ کاملتر
تیم Vision ویچت (زیرمجموعهٔ تنسنت) خانوادهای از مدلهای embedding چندرسانهای به اسم WeMM-Embedding رو منتشر کرده. embedding یعنی تبدیل ورودی به یه بردار عددی که شباهتش با بقیه قابل اندازهگیری باشه، و نکتهٔ این خانواده اینه که متن، عکس، ویدیو، سند تصویری و ورودی درهمتنیده همه به یه فضای مشترک میرن. یعنی میتونی با یه جملهٔ متنی دنبال یه فریم ویدیو بگردی. ورودی صوتی فعلاً پشتیبانی نداره.
سه اندازه روی Hugging Face منتشر شده: ۲، ۴ و ۹ میلیارد پارامتر، همه با لایسنس Apache 2.0. بردار خروجی از آخرین لایه و از محل یه توکن مخصوص برداشته میشه و بعد L2 نرمال میشه. طبق جدولهای گزارش فنی، مدل ۹ میلیاردی روی MMEB-v2 میانگین ۸۰.۶ گرفته در برابر ۷۷.۸ برای Qwen3-VL-Embedding هشتمیلیاردی، و روی MMEB-v3 عدد ۵۹.۵ در برابر ۵۳.۵.
جالبتر اینکه مدل ۲ میلیاردی هم با میانگین ۷۷.۹ روی MMEB-v2 عملاً همسطح رقیب هشتمیلیاردیه. تو MMEB-v3 که ۱۹۰ تسک داره و تسکهای متنی، ایجنتی و صوتی هم توش هست، نسخهٔ ۲ میلیاردی ۵۶.۰ و نسخهٔ ۴ میلیاردی ۵۸.۲ گرفتن. تسکهای صوتی برای هر سه مدل صفر شده، چون مدل اصلاً صدا نمیگیره و تسک پشتیبانینشده امتیاز صفر میگیره.
همهٔ مدلها Matryoshka هستن، یعنی میتونی بردار رو از ته ببُری و کوتاهش کنی بدون اینکه کیفیت فرو بریزه. کافیه بردار رو تا بُعد دلخواه برش بدی و دوباره نرمال کنی:
embedding = torch.nn.functional.normalize(embedding[..., :d], dim=-1)به گفتهٔ تیم، مدل ۲ میلیاردی روی ۲۵۶ بُعد هنوز ۹۸.۷ درصد کارایی تصویر و ویدیوی حالت کاملش رو نگه میداره، که برای هزینهٔ ذخیرهسازی و سرعت جستوجو عدد مهمیه.
از نظر عملی، برای بازتولید نتایج نسخهٔ transformers دقیقاً ۵.۲.۰ توصیه شده چون نسخههای جدیدتر پیشپردازش متفاوتی دارن. سروینگ هم روی vLLM نسخهٔ ۰.۲۷.۰ و SGLang نسخهٔ ۰.۵.۹ تست شده و اسکریپت آماده براش گذاشتن. کد ارزیابی MMEB-v3 هم تو ریپو هست و روی پایپلاین رسمی VLM2Vec با کمترین تغییر ساخته شده.
نکات کلیدی:
- سه اندازه: ۲، ۴ و ۹ میلیارد پارامتر، همه روی Hugging Face با لایسنس Apache 2.0
- MMEB-v2: میانگین ۸۰.۶ برای مدل ۹ میلیاردی و ۷۷.۹ برای ۲ میلیاردی
- MMEB-v3 با ۱۹۰ تسک: ۵۹.۵ برای ۹ میلیاردی در برابر ۵۳.۵ برای Qwen3-VL-Embedding
- با Matryoshka، مدل ۲ میلیاردی روی ۲۵۶ بُعد ۹۸.۷ درصد کارایی تصویر و ویدیو رو حفظ میکنه
- ورودی صوتی پشتیبانی نمیشه؛ تستشده روی vLLM ۰.۲۷.۰ و SGLang ۰.۵.۹




