ایندکسکردن تصویرها برای RAG بدون هزینهٔ سنگین
خلاصهٔ کاملتر
تیم Kapa که دستیار هوش مصنوعی برای مستندات فنی میسازه، تو این مطلب توضیح میده چطور میلیونها تصویر مثل اسکرینشات، دیاگرام و جدول رو تو خط لولهٔ RAG خودش مفید کرده. ایدهٔ اصلی سادهست: تصویرها رو موقع کوئری به مدل نمیفرستن.
به جاش، هر تصویر یکبار موقع ایندکسکردن با یه مدل بینایی ارزون توصیف میشه، اون توصیف بهصورت متن ذخیره میشه و کنار تکههای متنی معمولی بازیابی میشه. به این ترتیب کار سنگینِ «نگاهکردن به تصویر» فقط یهبار موقع ورود داده انجام میشه، نه روی هر کوئری.
نویسنده میگه روش متداول یعنی فرستادن تصویر به مدل بینایی موقع کوئری، در عمل سهتا مشکل ساختاری داره: هزینه (تصویرهای خام ۲۷٪ روی GPT و ۵۱٪ روی Claude به هزینهٔ هر کوئری اضافه کردن)، محدودیت حجم پیلود (یه کوئری معمولی به ۲۰ تا ۳۰ تصویر ارجاع میده و زود به سقف میرسه)، و ضعف بازیابی چندوجهی روی جزئیات ریز جدولها و نمودارها.
نکتهٔ مهم اینه که تصویرها دو نوعن: بعضیها فقط «توضیحی»ان و چیزی که متن گفته رو روشنتر نشون میدن، ولی بعضیها «حامل اطلاعات»ان؛ مثل یه جدول مشخصات یا دیاگرام سیمکشی که خود اون عدد فقط تو تصویر وجود داره. برای نوع دوم، توصیف در واقع رونویسی دقیق محتوای تصویره.
به گفتهٔ نویسنده، چندتا نکته تو عمل مهمه: بیشتر تصویرها آشغالن (لوگو، بنر) و باید فیلتر بشن؛ کیفیت توصیف بیشتر به متنِ اطرافِ تصویر وابستهست تا به بزرگی مدل، طوری که یه مدل کوچیک تقریباً بهخوبی مدل گرون عمل کرده؛ و ذخیرهکردن هر توصیف بهصورت یه تکهٔ جدا بهتر از چسبوندنش داخل متنه، چون فقط وقتی لازمه وارد کانتکست میشه.
نتیجهش این بوده که سربار هر کوئری فقط ۱ تا ۶ درصد بیشتر از حالت فقطمتنی شده، ولی کیفیت جوابها از نظر آماری معنادار بهتر بوده. تیم Kapa میگه همین رویکرد «یکبار بخون، بهصورت متن ذخیره کن» با نتیجهٔ تیم تحقیقاتی مایکروسافت هم همخوانی داره.
نکات کلیدی:
- تصویرها موقع ایندکس یکبار توصیف میشن، نه موقع هر کوئری
- فرستادن تصویر موقع کوئری گرونه و به سقف حجم پیلود میخوره
- متنِ اطرافِ تصویر بیشتر از بزرگی مدل روی کیفیت توصیف اثر داره
- ذخیرهٔ توصیف بهصورت تکهٔ جدا، هزینه رو پایین نگه میداره




