EVE، مدل Tencent برای جستجوی اسناد بدون OCR
خلاصهٔ کاملتر
اکثر سیستمهای جستجوی اسناد اول با OCR صفحه رو به متن تبدیل میکنن، بعد رو اون متن جستجو میکنن. مشکل اینجاست که تو همین تبدیل، ساختار جدولها بههم میریزه، نمودارها یا حذف میشن یا به یه رشتهی بیمعنی تبدیل میشن، و چیدمان دیداری صفحه هم از بین میره. Tencent با EVE Preview 4.5B، یه مدل ۴.۵ میلیارد پارامتری، این مرحله رو کلاً حذف کرده و مستقیم پیکسلهای صفحه رو با متن سوال مقایسه میکنه.
EVE از یه معماری به اسم ColBERT-Paligemma (یا ColPali) استفاده میکنه: یه بکبون مشترک، هم متن سوال و هم عکس صفحه رو از خودش رد میکنه و بهجای یه بردار خلاصه برای کل صفحه، برای هر کلمهی سوال و هر تیکهی تصویری صفحه یه بردار جدا میسازه. موقع جستجو، این بردارها با هم مقایسه میشن (بهاش میگن MaxSim) و بهترین تطبیقها جمع میشن؛ یعنی حتی اگه فقط یه خط از یه جدول شلوغ به سوال جواب بده، همون کافیه که امتیاز صفحه بالا بره.
نکتهی مهم اینه که EVE خودش جواب سوال رو نمیده، فقط میگه کدوم صفحه به احتمال زیاد جواب رو داره. تو یه تست رو عکس یه فاکتور، برای دو تا سوال دربارهی مبلغ کل و قیمت یه قلم، امتیازای ۱۵.۱۹ و ۱۴.۱۲ گرفته که هر دو بالان چون فاکتور واقعاً جواب هر دو سوال رو داشته؛ اما استخراج خودِ عدد به عهدهی یه مدل reader جداست که تو یه پایپلاین RAG تصویری بعد از EVE میاد.
بردارهای EVE فشردهشده به ۱۲۸ بعدـن، برای همین اندیس یه میلیون صفحه زیر ۱۸۰ گیگ جا میشه. مدل رو میشه روی یه GPU تک، مثلاً یه RTX A6000، با دقت bfloat16 و حدود ۱۰ گیگ VRAM اجرا کرد؛ یعنی برای تست کردنش نیازی به سرور چند-GPU نیست.
نکات کلیدی:
- EVE Preview 4.5B یه مدل ۴.۵ میلیارد پارامتری از Tencent برای جستجوی OCR-free اسنادـه
- از معماری ColBERT-Paligemma (ColPali) با بردارهای ۱۲۸ بعدی در سطح هر تیکهی تصویر استفاده میکنه
- اندیس یه میلیون صفحه حدود ۱۸۰ گیگابایت جا میگیره
- روی یه RTX A6000 با bfloat16 حدود ۱۰ گیگ VRAM لازم داره
- فقط صفحهی مرتبط رو پیدا میکنه؛ استخراج جواب دقیق به عهدهی یه مدل reader جداست




