AutoTTS: وقتی هوش مصنوعی استراتژی استنتاج خودش رو میسازه
خلاصهٔ کاملتر
AutoTTS یه پروژه پژوهشیه از دانشگاههای UMD، UVA، WUSTL و سازمانهایی مثل Google و Meta که میخواد مشکل طراحی دستی استراتژیهای استنتاج در مدلهای زبانی بزرگ (LLM) رو حل کنه. ایده اصلیش اینه: بهجای اینکه انسانها با آزمونوخطا یه سیاست خوب برای تخصیص محاسبات در زمان تست طراحی کنن، یه عامل کدنویسی (coding agent) این کار رو انجام میده — و همه چیز از طریق ویرایش کد پیش میره، نه آپدیت وزنهای مدل.
فرآیند به این شکله: ابتدا یه محیط ریپلی آفلاین ساخته میشه. یعنی برای هر سوال از بنچمارک، چند مسیر استدلال موازی از مدل اجرا میشه، توکنها به بازههای ثابت تقسیم میشن، و همهچیز کَش میشه. از این به بعد دیگه هیچ فراخوانی جدیدی به مدل لازم نیست؛ عامل جستجوگر فقط با این دادههای ذخیرهشده کار میکنه. هزینه کل یه اجرای کامل جستجو حدود ۳۹.۹ دلار و ۱۶۰ دقیقه زمانه.
مدل سیستم روی یه چارچوب تصمیمگیری مارکوف (MDP) بناشده. در هر گام، سیستم میتونه شاخه جدید باز کنه (BRANCH)، یه شاخه رو ادامه بده (CONTINUE)، از اون اطلاعات بگیره (PROBE)، شاخه ضعیف رو حذف کنه (PRUNE)، یا جواب بده (ANSWER). هزینه کلی هم با این فرمول محاسبه میشه:
Cost(s_t) = Σ_i ℓ_{t,i} + κ_probe · |Ω_t|
عامل کدنویسی در هر دور یه کنترلر (policy) به شکل کد پیشنهاد میده، اون رو روی محیط ریپلی ارزیابی میکنه، نتایج دقت و هزینه رو میبینه، و در دور بعدی کد رو بهبود میده. این حلقه تکراری بدون هیچ گرادیانی پیش میره و خروجیش یه برنامه کنترلر بهینهشدهست.
بهترین کنترلر کشفشده CMC یا Confidence Momentum Controller نام گرفته. CMC از میانگین متحرک نمایی (EMA) اطمینان پاسخها استفاده میکنه و فقط وقتی سطح اطمینان بالا و روندش مثبت باشه متوقف میشه — نه روی پیکهای گذرا. همچنین شاخههایی که جوابشون با اجماع کلی همراستاست، محاسبات بیشتری دریافت میکنن و شاخههای ضعیف فقط پس از چند دور پشتسرهم انحراف حذف میشن.
نتایج روی بنچمارکهای سخت ریاضی AIME24 و AIME25 با مدلهای Qwen3 در چهار اندازه مختلف نشون میده که AutoTTS در نقطه عملیاتی β=0.5 حدود ۶۹.۵٪ توکن کمتر نسبت به SC@64 مصرف میکنه درحالیکه دقت معادل حفظ میشه. در نقطه β=1.0 هم دقت اوج از تمام روشهای دستساز بیشتره. پارامتر β بهصورت یکپارچه همه تنظیمات داخلی کنترلر رو کنترل میکنه.
نکات کلیدی:
- AutoTTS طراحی استراتژی استنتاج رو از کار دستی به جستجوی خودکار تبدیل میکنه
- محیط ریپلی آفلاین باعث میشه هزینه کشف فوقالعاده پایین بمونه (صفر فراخوانی LLM در ارزیابی)
- کنترلر CMC با مکانیزمهایی مثل توقف مبتنی بر روند و کنترل جفتشده عرض-عمق، کارایی بالایی داره
- ۶۹.۵٪ صرفهجویی در توکن نسبت به SC@64 با حفظ دقت برابر
- بهینهسازی از طریق تکامل برنامه، نه بکپروپاگیشن یا فاینتیونینگ مدل پایه




