دو ترفند برای برنامهنویسی با مدلهای System One
خلاصهٔ کاملتر
شان گودکه تو این پست دربارهی مدلهای System One مینویسه، یعنی مدلهایی که به جای متن آزاد فقط جواب سوالهای چندگزینهای رو بیرون میدن. معروفترین نمونهشون Jev هست. ولی نویسنده میگه برای ساختن همچین چیزی اصلاً لازم نیست مدل رو عوض کنی: کافیه به logits دسترسی داشته باشی (یعنی همون امتیاز خامی که مدل به هر توکن میده) و خروجی ساختاریافتهی تکتوکنی بگیری. خودش با حدود ۱۵۰ خط پایتون یه نسخهی ساده ساخته.
تو دموی Doom با Qwen3-8B، نسخهی System One هر ۱۹۰ میلیثانیه ششهفت تصمیم دستهای میگیره، در حالی که همون مدل با tool call معمولی هر ۶۰۰ میلیثانیه یه تصمیم میگیره. ولی نویسنده میگه اگه فقط دکمههای بازی رو بهعنوان گزینه بدی، جواب نمیده: مدلش صد درصد وقتها دکمهی شلیک رو نگه میداشت و بیهدف تو مرحله میچرخید. یه forward pass وقت داره واکنش نشون بده، ولی نه اینکه هدف کوتاهمدت رو خودش دربیاره.
راهحلش هدفگذاری لایهایه: هر چند وقت یه بار از مدل بپرسی بین چندتا هدف کوتاهمدت ثابت (مثل زره جمع کردن یا کشتن دشمن) کدوم رو میخواد، بعد همون هدف رو بذاری توی پرامپت هر ۲۰۰ میلیثانیه. به گفتهی نویسنده این کار معادل reasoning تو مدلهای معمولیه، چون راهی میده محاسبات بیشتری خرج یه مسئله بشه. میشه چند لایه چید: از یه حلقهی استراتژیک هر ده ثانیه تا حلقهی داخلی هر ۱۰۰ میلیثانیه که خود دکمهها رو میزنه.
مشکل دموی دوم، یعنی Wikiracing، چیز دیگهایه: مقیاس. صفحهی ویکیپدیای baseball بیش از هزار لینک داخلی داره، ولی Jev فقط ۲۵۵ گزینه برای هر سوال قبول میکنه و نسخهی دستساز نویسنده هم بعد از حدود صد گزینه خوب کار نمیکرد. روش امتیازدهی مستقل هم براش جواب نداد، چون Qwen3-8B به چند صد لینک امتیاز یکسان میداد و انتخاب سخت میشد.
چیزی که گرفت tournament sampling بود: صد لینک رو یه دور غربال کن، بعد بین برندهها دوباره انتخاب کن. نویسنده میگه LLMها تو قضاوت نسبی خیلی بهتر از نمرهدادن مطلقان، و با همین روش مسیر ایدهآل سهلینکی پیدا شد. به نظرش System One در واقع یه classifier همهمنظورهست: از یه مدل اختصاصی بزرگتر و کندتره، ولی به جای آموزش دوباره فقط با عوض کردن پرامپت تنظیم میشه.
نکات کلیدی:
- مدل System One فقط جواب سوال چندگزینهای میده، پس زمان استنتاجش ثابت و قابل پیشبینیه
- Qwen3-8B تو حالت System One هر ۱۹۰ میلیثانیه شش تا هفت تصمیم میگیره، با tool call هر ۶۰۰ میلیثانیه یکی
- بدون لایهی هدف کوتاهمدت، مدل تو Doom صد درصد وقتها فقط شلیک میکرد
- Jev سقف ۲۵۵ گزینه برای هر سوال داره و کیفیت بعد از حدود صد گزینه افت میکنه
- tournament sampling یعنی غربال صدتا صدتا و بعد انتخاب بین برندهها
- پیادهسازی نویسنده حدود ۱۵۰ خط پایتونه و هیچ تغییری تو خود مدل نمیده




