LLMها تو کدوم بخش ریاضی خوبن؟
خلاصهٔ کاملتر
گاورز این یادداشت رو چند روز بعد از اعلام OpenAI نوشته که گفته بود ده مسئلهٔ مهم ریاضی و علوم کامپیوتر نظری رو حل کرده؛ از جمله اولین ساخت یه گروه غیرسوفیک و اثبات اینکه یه عدد رمزی چندرنگی سریعتر از نمایی رشد میکنه. به گفتهٔ خودش اولی یکی از مهمترین مسائل باز نظریهٔ گروهها بوده و دومی رو انتظار نداشته تو طول عمرش حل شده ببینه. تأکید میکنه که داره وضعیت اوایل آگوست ۲۰۲۶ رو ثبت میکنه، چون این تواناییها سریع عوض میشن.
نقطهٔ شروع بحثش یه مشاهدهست: با اینکه مدلها اثبات قضیههای سخت رو هم پیدا میکنن، تقریباً همهٔ نتایج پرسروصداشون از جنس مثال نقض بوده. ولی میگه اول باید روشن کرد اصلاً «پیدا کردن مثال نقض» یعنی چی، چون خیلی از قضیهها رو میشه به شکل یه گزارهٔ وجودی نوشت و برعکس.
برای نشون دادن این مشکل قضیهٔ وینوگرادوف رو کنار نتیجهٔ گلوسکین میذاره: از نظر ساختار منطقی تقریباً شبیه همان، ولی اولی بیچونوچرا یه قضیهست و دومی یه مثال. تفاوت به نظر او اینه که تو قضیهٔ وینوگرادوف کل چالش سر همون متغیر کمّیشدهٔ اوله، در حالی که تو کار گلوسکین رسیدن به بُعد درست هیچ سختیای نداره و چالش جای دیگهایه.
یه تمایز دیگه هم میذاره: بین «مثال» و «مثال نقض». به گفتهٔ او چیزی رو مثال نقض مینامیم که گزارهای رو رد کنه که دلیل خوبی برای باور کردنش داشتیم. از این زاویه، ساخت گروه غیرسوفیک بیشتر یه مثاله تا مثال نقض، چون کارشناسهای زیادی جدی باور نداشتن همهٔ گروهها سوفیکان.
فرضیهٔ نهایی گاورز اینه: دوتا چیز رو مطمئنیم مدلها توش خوبن — دونستن حجم عظیمی از ریاضیات، و سرعتی که اجازه میده قبل از رسیدن به جواب کلی تلاش ناموفق بکنن. پس سبکشون به مسئلههایی میخوره که بهترین روش حلشون امتحان کردن ایدههای زیاد و نهچندان بدیعه تا وقتی شانس بیاری. واکنش کارشناسها هم همین رو تأیید میکنه: اول شگفتزده میشن، بعد میبینن رویکرد اونقدرها هم تازه نبوده.
چیزی که به نظرش هنوز کم دارن «شامه»ست؛ همون حس تشخیص اینکه یه مسیر ارزش دنبال کردن داره یا نه و باید درخت جستوجو رو هرس کرد. میگه تو گفتوگو با مدلها زیاد پیش میاد که رویکردی امیدوارکننده به نظر برسه و بعد از دقت کردن خیلی کمرنگ بشه. دلیل احتمالیاش هم اینه که دادهٔ آموزشی پر از اثباتهای مرتبشدهست و مسیرهای بنبست حذف شدن. البته تأکید میکنه ادعا نمیکنه مدلها هیچوقت به اینجا نمیرسن.
نکات کلیدی:
- زمینه: OpenAI اعلام کرده ده مسئلهٔ باز ریاضی و علوم کامپیوتر نظری رو حل کرده
- بیشتر نتایج پرسروصدای مدلها از جنس ساختن مثال یا مثال نقضن، نه اثبات قضیه
- مرز بین «قضیه» و «مثال نقض» به بافت ریاضی وابستهست، نه فقط به شکل منطقی گزاره
- گاورز دو نقطهٔ قوت اصلی مدلها رو دانش وسیع و سرعت امتحان کردن ایدهها میدونه
- ضعف فعلی به نظر او نداشتن «شامّه» برای تشخیص مسیرهای امیدبخش و هرس کردن درخت جستوجوست




