مدلهای متنباز چقدر از فرونتیر بسته عقبان؟
خلاصهٔ کاملتر
مدلهای متنباز (که میشه وزنهاشون رو دانلود کرد) معمولاً بهاندازهی بهترین مدلهای بسته (که فقط از طریق API در دسترسن) توانمند نیستن، اما این فاصله چقدره و چطور تغییر میکنه؟ نویسنده با دادهی ۱۷ بنچمارک منتخب (۸ خصوصی و ۹ عمومی، حدود ۱۱۰ نقطهداده) به این سؤال جواب میده.
یافته: امروز روی بنچمارکهای خصوصی (که دادهشون عمومی نیست) مدلهای باز حدود ۸ تا ۱۰ ماه عقبان، و روی بنچمارکهای عمومی حدود ۴ تا ۶ ماه. این فاصله حوالی زمان DeepSeek R1 (ژانویه ۲۰۲۵) کمترین بود و از آن زمان در حال رشده. این عددها رو به عقب نگاه میکنن: بهترین مدلهای باز امروز تقریباً همسطح بهترین مدلهای بستهی ۸ تا ۱۰ ماه پیشان.
نکتهی جالب اینه که همین روند در هر دو مجموعهی کاملاً مجزای خصوصی و عمومی دیده میشه، که نشون میده روند واقعیه. این یعنی بنچمارکهای عمومی فاصله رو تقریباً نصف دستکم میگیرن (احتمالاً چون سازندگان مدلهای باز تا حدی روی دادهی تست آموزش میدن یا کاملاً فیلترش نمیکنن)، اما همچنان اطلاعات مفیدی میدن.
نویسنده چند هشدار هم میده: گاهی ارائهدهندگان ثالثی که مدلهای باز رو سرو میکنن عملکرد را بهطور نامحسوس افت میدن که فاصله رو بزرگتر نشون میده؛ و آلودگی داده در بعضی بنچمارکهای خصوصی (مثل FrontierMath و ARC) به نفع سمت بسته عمل میکنه و ممکنه فاصله رو بیش از واقع نشون بده. به گمان او فاصله روی کارهای دنیای واقعی احتمالاً حتی بزرگتر از بنچمارکهای خصوصیه.
نکات کلیدی:
- مدلهای باز روی بنچمارکهای خصوصی ۸ تا ۱۰ ماه و عمومی ۴ تا ۶ ماه عقبان
- فاصله حوالی DeepSeek R1 کمترین بود و از آن زمان رشد کرده
- بنچمارکهای عمومی فاصله رو تقریباً نصف دستکم میگیرن اما همچنان مفیدن
- آلودگی داده و افت ارائهدهنده ممکنه فاصله رو بیش از واقع نشون بده




