TaoLive یه ایجنت آموزش داده که با تغییر Harness هم دقتش رو حفظ میکنه
خلاصهٔ کاملتر
تیم TaoLive یه گزارش فنی منتشر کرده دربارهٔ ایجنتهای آواتار دیجیتالی که تو پخش زنده فروش (لایو کامرس) استفاده میشن؛ همونهایی که باید سوالای محصول رو جواب بدن، با بیننده تعامل کنن و کمپینها و قوانین رو هم سریع رعایت کنن. برای این کار از یه ساختار به اسم Harness استفاده میکنن که مهارتها، ابزارها و پرامپتهای سیستمی رو از وزنهای خود مدل جدا نگه میداره، یعنی رفتار مدل رو میشه بدون آموزش دوباره عوض کرد.
مشکل اینجاست که وقتی Harness عوض میشه، مدلهای کوچیکی که فقط رو یه نسخهٔ خاص فاینتیون شدن، بهجای دنبال کردن دستور جدید، اسمها و قالبهای قبلی رو حفظ میکنن و اشتباه جواب میدن؛ مدلهای بزرگتر این مشکلو ندارن ولی برای پاسخ لحظهای خیلی کندن.
راهحل تیم روشیه به اسم HAT (Harness-Aware Training)؛ توش وضعیتهای مختلف Harness عمداً وارد دادهی آموزشی میشه، تو سه مرحله: فاینتیون نظارتشده با این دادههای متنوع، تقطیر برای برگردوندن تواناییهای عمومی مدل، و یادگیری تقویتی تو یه شبیهساز اتاق پخش زنده که شبیه محیط واقعیه.
نتایج رو با بیش از ۴۵۰۰ نمونه تو چهار مجموعهٔ ارزیابی سنجیدن. مدل ۳۵ میلیارد پارامتریشون تو تست پرسشوپاسخ لایو واقعی امتیاز ۹۴.۸ گرفته، در حالی که مدل پایه فقط ۸۰.۳ و قویترین مدل عمومی که امتحان کردن ۹۳.۰ گرفته. رو تست Harness-Variant QA هم امتیاز ۹۴.۶ ثبت شده و رو IFEval (سنجش توانایی دنبالکردن دستورالعمل عمومی) امتیاز ۸۳.۵ نگه داشته شده؛ در مقابل، فاینتیون معمولی بدون تنوع Harness باعث میشه امتیاز IFEval هفت و هفت دهم واحد افت کنه.
از نظر سرعت هم، رو یه GPU از نوع NVIDIA H20 و با فعال بودن MTP (یه تکنیک برای سریعتر پیشبینی کردن توکنها)، سیستم تو ۵۰ درصد موارد ۳.۴۰۷ ثانیه و تو ۹۵ درصد موارد ۸.۱۱۴ ثانیه طول میکشه تا جواب کامل بده؛ یعنی برای مصرف لحظهای تو یه پخش زنده قابلقبوله. به گفتهٔ نویسندهها، این نشون میده HAT میتونه یه ایجنت جمعوجور و سریع بسازه که حتی وقتی Harness عوض میشه بازم درست کار میکنه، بدون اینکه توانایی دنبالکردن دستورهای عمومیشو از دست بده.
نکات کلیدی:
- مدل ۳۵ میلیارد پارامتری با HAT رو Live-Stream QA امتیاز ۹۴.۸ گرفته؛ مدل پایه ۸۰.۳ و بهترین مدل عمومی رقیب ۹۳.۰
- رو Harness-Variant QA امتیاز ۹۴.۶ و رو IFEval امتیاز ۸۳.۵؛ فاینتیون بدون HAT، IFEval رو ۷.۷ واحد پایین میآره
- تست شده رو بیش از ۴۵۰۰ نمونه تو چهار مجموعهٔ ارزیابی
- رو یه GPU از نوع NVIDIA H20 با MTP: تاخیر ۳.۴۰۷ ثانیه (P50) و ۸.۱۱۴ ثانیه (P95)




