OpenAI هزینهٔ کاربرهای مهمون رو نصف کرد
خلاصهٔ کاملتر
بر اساس گزارشی که The Information منتشر کرده و یه منبع آگاه تأییدش کرده، مهندسهای OpenAI اوایل همین ماه به همکارهاشون گفتن که تونستن هزینهٔ inference رو بیش از نصف کم کنن. منظور از inference همون هزینهٔ اجرای مدلهای هوش مصنوعی موجوده — یعنی هزینهای که بابت پاسخ دادن به کاربرها پرداخت میشه، نه هزینهٔ آموزش مدل.
تو مقاله اومده که OpenAI این بهینهسازی جدید رو روی ChatGPT اعمال کرده، اون هم مشخصاً برای بازدیدکنندههایی که حساب کاربری ندارن. با این کار، تعداد GPUهای انویدیا که برای سرویسدهی به این کاربرها لازمه به فقط چند صد تا افت کرده. البته معلوم نیست قبلاً چند تا لازم بوده یا OpenAI دقیقاً از چه تکنیکهایی استفاده کرده.
نکتهٔ مهم اینه که کاربرهای مهمون فقط به مجموعهٔ خیلی محدودی از امکانات ChatGPT دسترسی دارن، برای همین این سؤال باز میمونه که آیا این صرفهجویی به کل محصول هم منتقل میشه یا نه. نویسنده اشاره میکنه که این نامعلومیه بخش مهم ماجراست.
تو مقاله همچنین اومده که Deepseek هم تازه یه روش متنباز جدید منتشر کرده که میتونه سرعت درخواستهای inference رو بین ۶۰ تا ۸۵ درصد بالا ببره. به گفتهٔ نویسنده، منابعی که با این بهینهسازیها آزاد میشن میتونن صرف مقیاسپذیری بیشتر، مدلهای بهتر، پاسخهای سریعتر یا حاشیهٔ سود بیشتر بشن. ولی چون ساخت دیتاسنترها کند پیش میره، این جور دستاوردها احتمالاً بیشتر به آزمایشگاهها فضای نفس میدن تا اینکه از تقاضای تراشه کم کنن.
نکات کلیدی:
- OpenAI میگه هزینهٔ inference رو برای کاربرهای بدون حساب ChatGPT بیش از نصف کم کرده
- تعداد GPUهای انویدیای لازم برای این کاربرها به چند صد تا رسیده
- تکنیک دقیق و اینکه به کل محصول میرسه یا نه هنوز مشخص نیست
- Deepseek هم یه روش متنباز برای ۶۰ تا ۸۵ درصد تسریع inference منتشر کرده
- این صرفهجوییها احتمالاً به آزمایشگاهها فضا میدن، نه اینکه تقاضای تراشه رو کم کنن




