اوپنایآی قیمت GPT-5.6 Luna رو ۸۰٪ کم کرد
خلاصهٔ کاملتر
اوپنایآی قیمت GPT-5.6 Luna، کوچیکترین مدل خانوادهٔ ۵.۶، رو ۸۰٪ کم کرده: هر میلیون توکن ورودی ۲۰ سنت و هر میلیون توکن خروجی ۱.۲ دلار. Terra، مدل میانرده، ۲۰٪ ارزونتر شده و رسیده به ۲ دلار ورودی و ۱۲ دلار خروجی. Soul، مدل پرچمدار، قیمت لیستش تغییری نکرده ولی حالت اینفرنس سریعش حالا ۲.۵ برابر سرعت میده بهجای ۱.۵ برابر قبلی، با همون ضریب ۲ برابری هزینه — که عملاً برای کسی که throughput براش مهمه یه کاهش قیمت بیسروصداست.
به گفتهٔ نویسنده، بخش جذابتر ماجرا اینه که این فضا برای کاهش قیمت از کجا اومد. طبق گزارش خود اوپنایآی، شرکت مدل Soul رو داخل ایجنت کدنویسی Codex به جون زیرساخت پروداکشن خودش انداخته: مدل ترافیک واقعی رو تحلیل کرده، ناکارآمدیهای توزیع بار رو پیدا کرده، هیوریستیکهای مسیریابی درخواستها بین GPUها رو تنظیم کرده و کرنلهای GPU رو بازنویسی کرده. نتیجهش ۲۰٪ کاهش هزینهٔ سرو و ۱۵٪ بهبود بازدهی تولید توکن از مسیر speculative decoding بوده.
speculative decoding یعنی یه مدل کوچیک پیشنویس توکنها رو پیشنهاد میده و مدل بزرگ فقط تأییدشون میکنه، تا تولید سریعتر بشه بدون افت کیفیت. اوپنایآی میگه Soul با اجرای صدها آزمایش روی معماری همون مدل پیشنویس، خودش رو هم بهتر کرده. نویسنده تأکید میکنه این هنوز همون کار همیشگی یه مدل کدنویسی خوبه روی یه مسئلهٔ بهینهسازی مشخص، منتها بهصورت پیوسته و روی دادهٔ زندهٔ میلیونها پرامپت روزانه.
نویسنده یادآوری میکنه که مقایسهٔ قیمت هر توکن گمراهکنندهست و چیزی که واقعاً مهمه هزینهٔ هر کار تمامشدهست. مثلاً Kimi K3 حدود نصف قیمت Soul روی هر توکنه ولی برای همون کار تقریباً دو برابر توکن مصرف میکنه، پس در عمل سر به سر میشه. روی شاخص artificial analysis هم GPT-5.6 Luna Max حدود ۶ سنت بهازای هر کار درمیاد، در برابر حدود ۲۶ سنت GLM 5.2 Max و حدود ۴۰ سنت Claude Opus 5 در تنظیمات پایین، با سطح هوشمندی مشابه.
دربارهٔ اینکه این خودبهبودی بازگشتیه یا نه، نویسنده جواب محتاطانهای میده: چیزی که اینجا اتفاق افتاده بهینهسازی زیرساخت سرویسدهیه، نه بازطراحی هوش خود مدل، و آدمها هنوز تغییرات رو بازبینی و منتشر میکنن. با این حال یه حلقهٔ واقعیه که مدل ناکارآمدی رو پیدا میکنه، وصله پیشنهاد میده، تستش میکنه و تکرار میکنه — چیزی شبیه آزمایشهای auto-research آندری کارپثی، منتها در مقیاس پروداکشن یه آزمایشگاه بزرگ.
به نظر نویسنده، الگوی در حال شکلگیری اینه: بزرگترین و گرونترین مدل ممکن رو آموزش بده، ازش برای فشردهکردن مدلهای ارزونتر و تقریباً همسطح استفاده کن، درآمد رو از همون مدلهای کارگری دربیار و دوباره خرج آموزش نسل بعد کن. ثابتموندن قیمت Soul هم با همین میخونه: صرفهجوییهای احتمالی اونجا به حاشیهٔ سود تبدیل میشه نه تخفیف، و فشار رقابتی مدلهای متنباز چینی احتمالاً همون چیزیه که اوپنایآی رو برای ارزونکردن Luna و Terra عجول کرده.
نکات کلیدی:
- قیمت GPT-5.6 Luna ۸۰٪ کم شد: ۲۰ سنت ورودی و ۱.۲ دلار خروجی بهازای هر میلیون توکن.
- صرفهجویی از خود مدل دراومد: Soul داخل Codex کرنلهای GPU و speculative decoding رو بهتر کرد.
- ۲۰٪ کاهش هزینهٔ سرو و ۱۵٪ بهبود بازدهی تولید توکن، عددهاییه که اوپنایآی اعلام کرده.
- هزینهٔ هر کار مهمتر از قیمت هر توکنه؛ Luna Max حدود ۶ سنت بهازای هر کار درمیاد.
- قیمت Soul ثابت موند، چون صرفهجوییهاش احتمالاً به حاشیهٔ سود رفته.




