LittleLearner: مدلی که فقط تا کلاس پنجم درس خونده
خلاصهٔ کاملتر
مدلهای زبانی امروزی همهچیز رو یکجا میبینن، برای همین سخته بفهمی یه مهارت جدید واقعاً یاد گرفته شده یا فقط از چیزی که از قبل تو دادهٔ آموزشی بوده بیرون کشیده شده. نویسندهها میگن راهحلشون اینه که خود توزیع دادهٔ آموزشی رو محدود کنن، تا مرز دانش مدل از اول معلوم باشه و هر تغییری رو بشه دقیق بهش نسبت داد.
پیکرهشون LittleCurriculum اسم داره: ۸۸ میلیارد توکن که با یه خط لولهٔ فیلتر پنجمرحلهای از FineWeb-Edu بیرون کشیده شده و با استانداردهای Common Core کلاس اول تا پنجم همراستاست. هر مفهوم، واقعیت یا واژهای که بالاتر از کلاس پنجم تدریس میشه عمداً حذف شده. روی همین پیکره سه مدل از صفر آموزش دیدن — ۰.۶، ۱.۳ و ۵ میلیارد پارامتر — و هر کدوم یه مدل کنترل Unfiltered هم داره با همون معماری، همون تعداد توکن و همون دستور پخت، ولی بدون فیلتر.
یافتهٔ اصلی اینه که مداخلههای استاندارد از این مرز رد نمیشن. بزرگتر کردن مدل، توانایی داخل محدوده رو بهتر میکنه و کمی هم به مسئلههای هممسیر سرایت میکنه، ولی روی مسئلههای بالاتر از کلاس پنجم تقریباً چیزی اضافه نمیکنه. post-training با GRPO — یعنی تنظیم مدل با پاداش، اینجا روی مجموعهٔ MathCAMPS — تواناییهای داخل محدوده رو حسابی بالا میبره ولی شکاف بیرون از محدوده رو پر نمیکنه، حتی وقتی با دادهٔ بیرونمحدوده آموزش ببینه.
in-context learning هم با promptهایی که تست کردن، برای مدل ۵ میلیاردی هیچ توانایی استدلالی تازهای بیرون از کلاس پنجم باز نکرد. جمعبندی نویسندهها اینه که اینها همه elicitation هستن نه acquisition — یعنی فقط چیزی رو که فیلتر pretraining گذاشته تقویت میکنن، و همون فیلتر سقف واقعی توانایی مدل رو تعیین میکنه.
چون مرز دانش مدل دقیقاً مشخصه، نویسندهها سه مسیر پژوهشی رو جالب میدونن: اینکه آیا RL خودش میتونه توانایی جدید بسازه (چون prior محدوده، هر چیزی که بعدش پیدا شه به خود RL برمیگرده)، یادگیری پیوسته — مثلاً اضافه کردن اعداد منفی و اندازهگیری اینکه مدل نزدیک مرز جواب میده، امتناع میکنه یا توهم میزنه — و مقایسهٔ کنترلشدهٔ مدل با بچهها. چکپوینتها تو سه نسخهٔ Base، GRPO و Chatty منتشر شدن و یه دموی چت مدل ۵ میلیاردی هم روی وب هست.
نکات کلیدی:
- LittleCurriculum یه پیکرهٔ ۸۸ میلیارد توکنیه که با پنج مرحله فیلتر از FineWeb-Edu و بر اساس Common Core کلاس K–5 ساخته شده.
- سه اندازهٔ ۰.۶، ۱.۳ و ۵ میلیارد پارامتر، هر کدوم با یه مدل کنترل Unfiltered با معماری و تعداد توکن یکسان.
- GRPO روی MathCAMPS توانایی داخل محدوده رو بالا میبره ولی شکاف بیرون از K–5 رو پر نمیکنه.
- in-context learning تو آزمایشهای این تیم هیچ توانایی تازهای بیرون از محدوده باز نکرد.
- چکپوینتها تو سه نسخهٔ Base، GRPO و Chatty در دسترسن و مقاله با شناسهٔ arXiv 2608.13545 منتشر شده.




