قیمت فکر کردن ماشینها داره سقوط میکنه
خلاصهٔ کاملتر
تیم Epoch AI تو گزارش تازهاش میگه نکتهٔ کمدیدهشدهٔ رونق هوش مصنوعی اینه که خروجی دیتاسنترها داره به سرعت ارزون میشه، حتی وقتی ورودیهاش مثل چیپ و برق گرونتر میشن. مثال خودشون گویاست: ژانویهٔ ۲۰۲۵ مدل o3 اوپنایآی با میانگین ۳۰ سنت برای هر سؤال روی بنچمارک GPQA Diamond (آزمون چندگزینهای در حد دکترای فیزیک و شیمی و زیست) نمرهٔ ۷۵٪ میگرفت. کمتر از ۱۸ ماه بعد، GPT-5.6 Luna همون نمره رو با ۰٫۰۰۰۴ دلار گرفت؛ یعنی ۷۲۵ برابر ارزونتر.
برای اندازهگیری این روند، پنج بنچمارک ریاضی، علوم سخت و بازیهای فکری طی سه سال گذشته بررسی شده. نتیجه اینه که قیمت یه سطح مشخص از عملکرد هر فصل حدود ۴۷٪ میافته، یعنی سالی ۱۳ برابر. به نوشتهٔ گزارش، این افت چهار برابر سریعتر از توالییابی DNA، شش برابر سریعتر از قدرت پردازش، ۱۸ برابر سریعتر از باتری لیتیومی و ۵۴ برابر سریعتر از برق (در قرن منتهی به ۱۹۷۳) بوده. سرعتش هم بسته به حوزه فرق میکنه: معما و بازی فصلی ۳۹ تا ۴۳ درصد، ریاضی فصلی ۵۰ تا ۵۲ درصد.
یه الگوی جالب هم پیدا کردن: ارزونشدن درست بعد از اینکه یه سطح عملکرد برای اولین بار فتح میشه از همیشه تندتره. میانگین هر پنج بنچمارک نشون میده هزینه اول فصلی ۶۶٪ (سالی ۷۵ برابر) میافته، ولی دو سال بعد این نرخ نصف میشه و میرسه به فصلی ۳۲٪. توضیح احتمالی خود نویسنده اینه که شرکتها یه مدت کوتاه میتونن بابت تازگی پول بیشتری بگیرن، تا وقتی رقابت قیمت رو پایین بکشه.
روش کار هم قابل توجهه. بهجای اجرای گرون و مکرر مدلها با بودجههای مختلف، از روشی که مرکز CAISI توسعه داده استفاده کردن: از روی لاگ یه اجرای بدون محدودیت بودجه حساب میکنن مدل با بودجهٔ کمتر چند سؤال رو درست جواب میداد. اینجوری کل منحنی هزینه-عملکرد هر مدل درمیاد، نه فقط سقف توانش.
نویسنده خودش چند هشدار جدی میده. ممکنه شرکتها مدلهاشون رو مخصوص بنچمارکها تربیت کنن، پس بهبود بنچمارک لزوماً بهبود کار واقعی نیست. ضمناً این عددها فرض میگیرن کاربر همیشه دنبال ارزونترین مدل ممکن برای هر کار میگرده، در حالی که آدمهای واقعی اینقدر مدل عوض نمیکنن. خودشون هم نوشتن بهخاطر نوسان و کمبود داده، از استاندارد خطا و آزمون فرض صرفنظر کردن و عددها باید «تقریبی ولی منطقی» خونده بشن.
نکات کلیدی:
- هزینهٔ یه سطح ثابت از عملکرد از ۲۰۲۳ فصلی ۴۷٪ (سالی ۱۳ برابر) افت کرده
- نمرهٔ ۷۵٪ روی GPQA Diamond در ۱۸ ماه از ۳۰ سنت به ۰٫۰۰۰۴ دلار رسید؛ ۷۲۵ برابر ارزونتر
- افت قیمت برای عملکرد تازهفتحشده فصلی ۶۶٪ هست و دو سال بعد به ۳۲٪ میرسه
- بازیهای فکری فصلی ۳۹ تا ۴۳ درصد، ریاضی فصلی ۵۰ تا ۵۲ درصد ارزون میشن
- منحنی هزینه-عملکرد با روش CAISI و از روی لاگ اجراها تخمین زده شده، نه با اجرای مجدد
- داده و کد روی گیتهاب منتشر شده و تحلیل عمداً بدون استاندارد خطا گزارش شده




