ردپای تاریخ آموزش مدلها با چند سؤال ساده
خلاصهٔ کاملتر
به گفتهٔ Shrivu Shankar، با «پروبکردن» مدلها — یعنی پرسیدن سؤالهای حسابشده از روی API رسمی — میشه حدس زد هر مدل کِی و روی چه دادهای آموزش دیده. تو این پست اومده که روشهای مشابه قبلاً برای تخمین تعداد پارامترها و ترکیب دیتاست به کار رفتن و این بار نوبت خط زمانی آموزشه. نویسنده تأکید میکنه همهٔ اینها تخمینه، چون دادهٔ قطعی عمومی برای راستیآزمایی وجود نداره.
اول یه یادآوری از نحوهٔ آموزش مدلهای بزرگ: یه ران چندماهه روی دادهٔ عمومی اینترنت که چکپوینت پایه رو میسازه، بعد دادهٔ تخصصی و باکیفیت برای تقویت قابلیتها، و آخرش post-training که مدل پایه رو به یه دستیار تبدیل میکنه. نویسنده میگه نسخههای major معمولاً یعنی چکپوینت pre-training جدید و نسخههای minor یعنی پیشرفت تو post-training.
برای تخمین تاریخ چکپوینت، یه دیتاست از رویدادهای روزانهٔ ویکیپدیا ساخته و از هر مدل کوییز هشتگزینهای گرفته؛ جایی که نرخ خطا میپره، همونجاست که سیگنال دادهٔ آموزشی تموم میشه. نتیجه اینه که مدلهای Opus 4.7 به بعد کاتاف مؤثر مشترکی حدود اواخر دسامبر ۲۰۲۵ دارن، یعنی احتمالاً از یه ران میان؛ و خانوادهٔ GPT-5.6 چکپوینت جدایی داره که حدود اواخر فوریهٔ ۲۰۲۶ تموم شده.
یه مورد عجیب هم Opus 5 هست: کاتافش رسماً مه ۲۰۲۶ اعلام شده، ولی در عمل چیزی بیشتر از مدلهای با کاتاف ژانویهٔ ۲۰۲۶ بلد نیست، و به گفتهٔ نویسنده این حتی روی یادآوری نسخهٔ پکیجهای برنامهنویسی هم صدق میکنه. وقتی هم مستقیم از مدلها میپرسه امروز چندمه، جوابها تقریباً با همون تخمینهای مبتنی بر واقعیت همخوانی داره.
بخش جالبتر، هویت خودگزارشیه: مدلها وقتی هیچ زمینهای ندارن، اسمی رو میگن که تو دادهٔ آموزشی بیشتر دیدنش، و الگوها با آموزش روی چتهای کاربرهای ChatGPT و Claude جور درمیاد. نویسنده این رو کمی جنجالی میدونه که مدلهای OpenAI تقریباً هیچوقت خودشون رو مدل یه آزمایشگاه دیگه معرفی نمیکنن، ولی Sonnet 5 مرتب خودش رو GPT-4 معرفی میکنه؛ به نظرش احتمال تقطیر عمدی کمه و بیشتر ردپای چتهای قدیمیه.
نکات کلیدی:
- پروبکردن مدلها از روی API میتونه سرنخهایی از تاریخ و دادهٔ آموزششون بده
- کوییز رویدادهای روزانهٔ ویکیپدیا، کاتاف مؤثر رو از روی جهش نرخ خطا پیدا میکنه
- Opus 4.7 به بعد کاتاف مؤثر مشترک حدود اواخر دسامبر ۲۰۲۵ دارن
- GPT-5.6 از چکپوینتی جدا با پایان حدود اواخر فوریهٔ ۲۰۲۶ میاد
- کاتاف Opus 5 رسماً مه ۲۰۲۶ اعلام شده ولی در عمل چیزی تازهتر نشون نمیده
- هویت خودگزارشی مدلها ردپای آموزش روی چتهای کاربرها رو نشون میده
- همهٔ نتیجهها تخمینیه و دادهٔ عمومی برای راستیآزمایی وجود نداره




