FLAT: یک فضای توکن مشترک برای عکس و متن
خلاصهٔ کاملتر
مدلهای چندحالته معمولاً برای فهمیدن و برای ساختن، دو نمایش جدا نگه میدارن. تو مقالهی FLAT اومده که میشه این دو تا رو یکی کرد: یک انکودر VLM هم عکس و هم متن رو به حداکثر ۲۵۶ توکن پیوستهی ۶۴بعدی تبدیل میکنه، و همین یه رشته هم برای بازیابی کار میکنه، هم برای تولید تصویر و کپشننویسی.
کلید ماجرا nested dropout هست، یعنی موقع آموزش عمداً توکنهای آخر رو حذف میکنن تا اطلاعات از کلی به جزئی مرتب بشه. نتیجهش اینه که موقع استفاده فقط چند توکن اول رو برمیداری: توکن اول معنای کلی صحنه رو داره و هرچی جلوتر بری، ترکیببندی و جزئیات ریزتر برمیگرده. یعنی بدون عوض کردن مدل یا نمایش، خودت بین هزینهی محاسبات و دقت یکی رو انتخاب میکنی.
عددهاش هم بد نیستن: ۸۳.۱ روی GenEval، و برای کپشننویسی ۴۰.۵ BLEU-4 با ۱۳۸.۶ CIDEr روی COCO. تو بازیابی، R@5 روی COCO ۸۶.۸ (عکس به متن) و ۷۵.۸ (متن به عکس)، و روی Flickr ۹۸.۳ و ۹۳.۶. عجیبترین بخش همینجاست: پهنتر کردن نمایش به اندازهی ۲۵۶ برابر، نتیجهی COCO رو کمتر از یک نمره تکون میده.
یه classifier خطی روی ویژگیهای فریزشدهی FLAT، با یک توکن ۶۴بعدی به ۷۳.۳ درصد top-1 روی ImageNet-1K میرسه، با ۱۶ توکن به ۸۱.۲ و با ۶۴ توکن به ۸۱.۸ درصد. چون عکس و متن یه فضای مشترک و قابل دیکود دارن، جمع و تفریق سادهی بردارها هم گذارهای معنایی قابل فهم میده. نویسندهها میگن ورودی چندزبانه و فشرده کردن چهار فریم ویدیو تو یک رشته هم کار میکنه، درحالیکه هیچوقت مستقیم آموزشش ندادن.
نکات کلیدی:
- یک انکودر VLM هم عکس و هم متن رو به حداکثر ۲۵۶ توکن پیوستهی ۶۴بعدی میبره.
- با nested dropout توکنها از کلی به جزئی مرتب میشن، پس بریدن پیشوند، هزینه رو کم میکنه.
- تو بازیابی COCO، فرق یک توکن با ۲۵۶ توکن کمتر از یک نمرهست.
- کپشننویسی روی COCO به ۴۰.۵ BLEU-4 و ۱۳۸.۶ CIDEr میرسه و امتیاز GenEval ۸۳.۱.
- پروب خطی روی ImageNet-1K با یک توکن ۷۳.۳ درصد و با ۶۴ توکن ۸۱.۸ درصد میده.




