LLM رو کلسیفایر نبین، فیچر ببین
خلاصهٔ کاملتر
نویسنده این پست میگه کار کردن با LLM بهعنوان classifier (یعنی یه پرامپت که یه متن میگیره و یه برچسب برمیگردونه) آزاردهندهست، و بدتر اینکه نتیجهش معمولاً بد هم نیست، برای همین بهراحتی ولش نمیکنی. ایراد اولش اینه که مدل برچسب قطعی میده؛ log probability توکنها رو هم بگیری، هیچ دلیلی نداری باور کنی اون عددها کالیبرهان. یعنی نمیتونی مثل یه مدل معمولی آستانه بذاری و precision رو با recall معامله کنی.
دو ایراد دیگه هم هست. اول اینکه دادهٔ ساختاریافته رو فقط میتونی بچسبونی تو پرامپت و هیچ تضمینی نیست مدل ازش استفاده کنه؛ ضمن اینکه LLM نمیدونه تو جمعیتی که داری تست میکنی کلاس مثبت نادره یا فراوون. دوم تفسیرپذیری: پرامپت چون به نثر نوشته شده ظاهراً خواناست، ولی معلوم نیست داخل مدل کدوم بخشش واقعاً رعایت شده.
قابی که نویسنده پیشنهاد میده سادهست: رأی مدل رو خروجی نهایی حساب نکن، یه فیچر حسابش کن و بدش به یه رگرسیون لجستیک. حالا خروجیت احتمال واقعیه و بهطور میانگین کالیبرهست، هر متغیر دیگهای هم داشتی میتونی کنارش بذاری، و مدل خودش رو با نرخ پایهٔ دادهٔ آموزش تطبیق میده. تفسیر خود رأی LLM هنوز مبهم میمونه، ولی حداقل میدونی اون رأی چقدر تو تصمیم نهایی وزن داره.
به گفتهٔ نویسنده مزیت بزرگتر اینه که راه بهتر کردن مدل دیگه ور رفتن با کلمات پرامپت نیست. میتونی داده جمع کنی (که انقدرها هم دردسر نیست، چون برای سنجش عملکرد به هر حال به تستست نیاز داشتی)، از خود مدل فیچرهای فرعی بگیری، از residualها بفهمی کجا لنگ میزنی، و آخرش هم مدل نهایی رو از رگرسیون لجستیک به xgboost یا یه شبکهٔ عصبی عوض کنی. هر کدوم اینا یه اهرم واقعیه، برخلاف حدس زدن سر جملهٔ پرامپت.
مثال عملی مقاله تشخیص کنایهست روی دیتاست SemEval 2018 Task 3 با ۴۶۱۸ توییت (۳۸۳۴ تا آموزش، ۷۸۴ تا تست) و مدل gemini-3.1-flash-lite. پرامپت خام به TPR ۰.۹۶۵ و F1 ۰.۷۴۷ میرسه، ولی نمرهٔ Brier برابر ۰.۲۵۹ درمیاد؛ یعنی عملاً همردهٔ حدس تصادفی که ۰.۲۵ میده. با رگرسیون لجستیک، Brier میره روی ۰.۱۷۵ و F1 دستنخورده میمونه، چون ترتیب نمونهها عوض نشده. قدم بعدی نویسنده اینه که به جای یه رأی، نوزده سؤال فرعی از مدل بپرسه و همه رو فیچر کنه.
نکات کلیدی:
- رأی مستقیم LLM کالیبره نیست: Brier برابر ۰.۲۵۹، در حالی که حدس تصادفی ۰.۲۵ میده.
- بردن همون رأی داخل رگرسیون لجستیک، Brier رو به ۰.۱۷۵ رسوند بدون اینکه F1 (۰.۷۴۷) تکون بخوره.
- مدل برازششده به رأی Ironic احتمال ۰.۶۸۷ و به رأی Not احتمال ۰.۱۸۸ میده.
- دیتاست: SemEval 2018 Task 3، ۴۶۱۸ توییت، با مدل gemini-3.1-flash-lite.
- با این قاب، بهبود مدل از پرامپتنویسی به دادهٔ بیشتر، فیچر بیشتر و معماری بهتر منتقل میشه.




