الگولیا لیدربرد اختصاصی مدلهای زبانی رو منتشر کرد
خلاصهٔ کاملتر
الگولیا یه لیدربرد اختصاصی به اسم LLM Leaderboard راه انداخته که ۲۴ مدل از OpenAI، Anthropic، گوگل، xAI و مدلهای متنباز مثل MiniMax و Qwen رو از طریق پلتفرم Agent Studio خودش تست میکنه. برخلاف بنچمارکهای عمومی مثل MMLU یا HumanEval که فقط توانایی خام مدل رو میسنجن، این تستها مدلها رو تو نقش واقعیشون قرار میدن: تفسیر کوئری، صدازدن API جستوجو و ساختن جواب از دادههای واقعی محصولات.
سه معیار اصلی سنجیده میشه: ربط پیشنهادها (Relevance)، توهمزایی یعنی وقتی مدل چیزی رو که تو نتایج جستوجو نبوده از خودش میسازه (Hallucinations)، و سازگاری زبونی رو ۱۲ زبون. به گفتهٔ الگولیا، هر امتیاز با یه بازهٔ اطمینان آماری همراهه؛ یعنی اگه بازهٔ دو مدل با هم همپوشانی داشته باشه، تفاوتشون صرفاً نویزه نه برتری واقعی.
دادهها نشون میدن مدل اول جدول همیشه بهترین انتخاب نیست. مثلاً Gemini 3.1 Flash Lite با ۹۲٪ کیفیت هر کوئریش ۰.۰۰۲ دلار میشه، در حالی که GPT-5.4 با ۹۱٪ کیفیت ۳۵ برابر گرونتره و Claude Opus 4.6 با ۸۸٪ کیفیت، ۳۷۵ برابر گرونتر از مدل اوله. تو تأخیر هم داستان مشابهه: همون GPT-5.4 با حالت extended thinking تا ۴۸ ثانیه طول میکشه واسه ۸۹٪ کیفیت، ولی بدون اون حالت فقط ۹ ثانیه میگیره و کیفیتش هم ۹۱٪ میشه؛ یعنی فکرکردن بیشتر همیشه نتیجهٔ بهتر نمیده.
الگولیا تأکید میکنه این لیدربرد یه نقطهٔ شروعه، نه حرف آخر؛ چون تستها روی کاتالوگ محصولات فروشگاهی انجام شده و اگه ایجنت شما کار دیگهای مثل تیکت پشتیبانی یا تولید کد انجام بده، ترتیب مدلها ممکنه فرق کنه. چیزی که قابل استفاده تو هر دامنهایه، خود روش تسته: بازهٔ اطمینان، سطحبندی سختی تستها و اندازهگیری تأخیر جدا از هم.
نکات کلیدی:
- الگولیا ۲۴ مدل زبانی از OpenAI، Anthropic، گوگل، xAI و متنباز رو با Agent Studio تست کرده.
- سه معیار سنجش: ربط نتایج (Relevance)، توهمزایی (Hallucinations)، سازگاری با ۱۲ زبون.
- Gemini 3.1 Flash Lite با ۹۲٪ کیفیت و ۰.۰۰۲ دلار هر کوئری، ارزونترین و بالاترین امتیاز رو داره.
- Claude Opus 4.6 با ۸۸٪ کیفیت، ۳۷۵ برابر گرونتر از مدل اوله.
- هزینهٔ هر کوئری تو کل مدلها بین کمتر از ۰.۰۱ تا بیش از ۰.۸۰ دلار متغیره.




