چرا LLMها تو ریاضی و کدنویسی اینقدر خوبن؟
خلاصهٔ کاملتر
استیون بایرنز تو این پست LessWrong با یه توضیح رایج مخالفت میکنه: اینکه LLMها تو ریاضی خوبن چون ریاضی «راحت بررسی میشه». به گفتهی نویسنده، برای ریاضی پیشرفته خود بررسیکننده هم معمولاً یه LLM هست. پس این جمله در اصل یعنی «LLMها تو قضاوت استدلال ریاضی خوبن» و هنوز جواب نمیده چرا تو ریاضی بهترن تا مثلاً نقد داستان.
نظریهی خودش اینه که همهچی به کیفیت دادهی pretraining (یعنی مرحلهی اول آموزش که مدل از متنهای اینترنت یاد میگیره) برمیگرده. نویسنده میگه اگه یه جملهی تصادفی از یه مقالهی ریاضی برداری، بیش از ۹۹ درصد مطمئنی که درسته. پس مدلی که با imitative learning (یعنی یادگیری از راه تقلید متنهای انسانی) آموزش دیده، تقریباً همیشه استنتاج درست میکنه. بعدش فقط یه کم دادهی دستچینشده یا RL لازمه تا استراتژیهاش صیقل بخوره.
برای کد هم همین منطق رو میاره: بیشتر کدهای اینترنت کامپایل میشن و کاری که انتظار داری رو انجام میدن، ولی اغلب زشت، باگدار یا کندن. برای همین شرکتها چند سال زحمت کشیدن تا با دادهی دستچینشده و RL این مشکل رو کم کنن. اما به نظر نویسنده، ادبیات تحقیقاتی خیلی از حوزههای دیگه پر از ایدههای غلط و گیجکنندهست. مدلی که از اونا تقلید کنه، حرف بیپایه و بینش درست رو بدون برچسب قاطی تحویل میده، دقیقاً مثل آدمها.
نویسنده بعد از انتشار چند اصلاح هم انجام داده. قبول کرده که RLVR (یعنی RL با پاداش قابل بررسی، مثل سؤالهایی که جواب درست مشخص دارن) روی ریاضی رایجه. یکی از کاربرها به اسم beren هم تو کامنتها گفته شرکتها از ابزاری مثل Lean و Sympy تو حلقهی RL استفاده میکنن. جواب بایرنز اینه که LLMها قبل از ممکن شدن این روشها هم تو اثبات ریاضی قوی بودن، و ساختن یه autoformalizer بدون یه مدل از قبل خوب تو اثبات، مثل مرغ و تخممرغه.
تو آخر نویسنده این نظریه رو به بحث recursive self-improvement وصل میکنه (یعنی AI که خودش AI بهتر بسازه). سؤالش اینه که ادبیات ایدههای ML بیشتر شبیه مقالههای ریاضیه، شبیه کدهای GitHub، یا شبیه حوزههای شلوغ و پر از خطا. جوابش رو هم به خواننده واگذار میکنه.
نکات کلیدی:
- ادعای اصلی: قدرت LLM تو ریاضی از کیفیت دادهی pretraining میاد، نه از قابلیت بررسی.
- به گفتهی نویسنده بیش از ۹۹ درصد جملههای مقالههای ریاضی درستن.
- کد اینترنت بیشترش کار میکنه ولی باگدار و ناکارآمده، پس به RL و دادهی دستچینشدهی بیشتری نیاز داره.
- برای ریاضی پیشرفته، RL بیشتر از نوع RLAIF هست که داورش یه LLM هست.
- منتقدها میگن شرکتها از Lean و Sympy تو حلقهی RL ریاضی استفاده میکنن.




