وقتی چند تا LLM قاضی همنظر میشن، باید باورشون کرد؟
خلاصهٔ کاملتر
فرض کن از ۱۰ تا مدل زبانی میخوای که تشخیص بدن یه متن بازیابیشده به سوال کاربر ربط داره یا نه. ۸ تاشون میگن «ربط داره» و ۲ تاشون میگن «نه». عدد ۸ از ۱۰ خیلی قانعکننده به نظر میاد، ولی سوال مهمتر اینه که این ۸ تا قاضی چقدر مستقل از هم به این نتیجه رسیدن. اگه پرامپت مشترک، خانوادهی مدل مشترک یا یه نقطهکور مشترک داشته باشن، ممکنه فقط دارن یه اشتباه رو با هم تکرار میکنن، نه اینکه شاهد مستقل باشن.
کریشنا بالاسوبرامانیان و ساشا پادکوپایف، محققای آمازون، تو مقالهشون که تو ICML 2026 ارائه شده، پیشنهاد میدن بهجای رای اکثریت ساده یا وزندار، پنل قاضیها رو مثل یه شبکه ببینیم؛ هر قاضی یه سطح قابلیت اعتماد داره، ولی هر جفت قاضی هم میتونه رابطهی خاص خودشو داشته باشه. اونا از یه مدل آماری به اسم Ising استفاده کردن که همبستگی بین متغیرهای دوتایی (مثل رای بله یا خیر) رو مدل میکنه، و این کارو بدون نیاز به لیبل انسانی و بهصورت خودکار انجام میدن.
این روش رو میشه دو جور اجرا کرد: یه نسخهی سادهتر که الگوی وابستگی قاضیها رو برای همهی برچسبها یکسان فرض میکنه، و یه نسخهی پیچیدهتر که اجازه میده این الگو بین برچسبهای مثبت و منفی فرق کنه. محققا این روش رو رو سه تا کار باینری تست کردن: تشخیص ربط، تشخیص محتوای مسموم، و ارزیابی خلاصهسازی، با پنل ۱۰ تایی از قاضیهای مختلف.
نتیجه: روش وابستگیمحور تو هر سه کار، ۹ تا ۱۴ درصد از بهترین baseline (رای اکثریت وزندار) بهتر عمل کرد. برای مثال تو تشخیص ربط، دقت به ۰.۹۱۲ رسید در برابر ۰.۸۲۰ برای رای وزندار؛ تو تشخیص محتوای مسموم ۰.۷۹۲ در برابر ۰.۶۹۴؛ و تو ارزیابی خلاصهسازی ۰.۸۰۶ در برابر ۰.۷۳۷. نویسندهها توصیه میکنن تیمهایی که از پنل قاضی استفاده میکنن، کل پنل رو از نظر تنوع آماری بررسی کنن و ساختار توافق بین قاضیها رو هم چک کنن.
نکات کلیدی:
- مقاله «Dependence-aware label aggregation for LLM-as-a-judge via Ising models» تو ICML 2026 ارائه شده.
- روش پیشنهادی بدون نیاز به لیبل انسانی (unsupervised) کار میکنه و هم قابلیت اعتماد هر قاضی و هم وابستگی بین قاضیها رو یاد میگیره.
- رو تشخیص ربط دقت ۰.۹۱۲ در برابر ۰.۸۲۰ (رای وزندار) به دست اومد؛ رو خلاصهسازی ۰.۸۰۶ در برابر ۰.۷۳۷.
- پنل تست شامل ۱۰ مدل قاضی با دمای صفر (یعنی خروجی کاملا قطعی و بدون تصادف) بوده.




