هزینهٔ JEV در برابر ریرنک با LLM
خلاصهٔ کاملتر
این مقاله سراغ قیمتگذاری JEV میره؛ مدلی که برای تصمیمهای ساختاریافته مثل classification دودویی، انتخاب بین گزینهها و نمرهدهی ساخته شده، نه تولید متن آزاد. حسابهای جدید ۵ دلار اعتبار رایگان میگیرن و بقیهش بر پایهٔ ارزون بودن هر فراخوانیه.
چرا هزینهٔ هر فراخوانی اینقدر مهمه؟ چون reranking (یعنی مرتبکردن دوبارهٔ نتایج جستوجو قبل از رسیدن به LLM) معمولاً روی تکتک chunkهای برگشتی اجرا میشه، نه یه بار برای هر query. هزینهٔ اون عملاً میشه «تعداد توکن هر مقایسه × تعداد مقایسهها». اگه ۲۰ کاندید رو برای یه query با LLM مرتب کنی، کل متن هر ۲۰ تا رو پول میدی.
به گفتهٔ مقاله، تو تستهایی که JEV رو با Gemini Flash-Lite و Gemini Flash روی promptهای یکسان مقایسه کردن، برای chunkهای کوتاه تفاوت کم بوده؛ چون اونجا سربار خود فراخوانی غالبه. ولی با بلندتر شدن chunk فاصله زیاد شده. نویسنده میگه اگه chunkهات چند جملهان، شاید عوضکردن ابزار نیرزه. ولی برای مستندات فنی، متن حقوقی یا سیاستهای داخلی که chunkها صدها کلمهان، انتخاب reranker مستقیم روی قبض ماهانه اثر میذاره.
همزمانی هم رو هزینهٔ واقعی اثر داره. یه batch از تصمیمها بهصورت ترتیبی حدود ۴۰ ثانیه طول کشیده، ولی با ۶۴ درخواست همزمان حدود ۷.۶ ثانیه. یعنی میشه کل کاندیدها رو rerank کرد بدون اینکه زمان پاسخ به کاربر خیلی بره بالا. مقاله یادآوری میکنه که ارزش reranking هم کم نیست: روی یه baseline از نوع BM25 (جستوجوی کلیدواژهای کلاسیک) دقت top-1 از ۲۱٪ به ۵۴٪ رسیده.
به نظر نویسنده ۵ دلار رایگان برای نمونهسازی و فهمیدن اینکه ابزار به کارت میاد یا نه کافیه، ولی برای load test جدی یا benchmark روی هزاران query نه.
نکات کلیدی:
- ۵ دلار اعتبار رایگان برای حسابهای جدید
- تو chunkهای کوچیک هزینه و تأخیر نزدیک Gemini Flash-Lite هست
- با بزرگتر شدن chunk، اختلاف هزینه به نفع JEV بیشتر میشه
- batch ترتیبی حدود ۴۰ ثانیه، با ۶۴ درخواست همزمان حدود ۷.۶ ثانیه
- reranking روی BM25 دقت top-1 رو از ۲۱٪ به ۵۴٪ رسونده




