سود مهلت: چرا سرعت استنتاج AI اهرم بعدی مقیاسه
خلاصهٔ کاملتر
نویسنده اول یه استعارهٔ تاریخی میسازه: از دههٔ ۴۰ که ENIAC یه ژیمنازیوم رو پر میکرد تا امروز که همون توان روی نوک انگشت جا میشه، مهندسها فشردگی رو دو جور خرج کردن؛ یا همون کار رو تو یه دستگاه کوچیکتر انجام دادن، یا کار بیشتر رو تو همون فضا جا دادن. تو استنتاج مدلهای AI هم همین انتخاب هست: یا زودتر تموم کنی، یا تا وقتی مهلت پر میشه کار بیشتری بکنی. اسم این وقت اضافه رو گذاشته «سود مهلت» (deadline dividend).
سنجش Artificial Analysis برای gpt-oss-120b نشون میده Cerebras با 1790.3 توکن در ثانیه دیکود میکنه، SambaNova دوم با 701.3، Groq با 476.1 و میانهٔ 16 ارائهدهنده 170.7. یعنی Cerebras 2.55 برابر رقیب دوم و 10.49 برابر میانهست. سمت OpenAI هم روز 13 آگوست پیشنمایش Ultrafast برای GPT-5.6 Sol باز شد که تا 750 توکن در ثانیه خروجی میده و تو یه تست ششتسکی GDP-Val همون کار رو 83 ثانیه در برابر 464 ثانیهٔ حالت Standard جواب میده.
نویسنده میگه اون بودجهٔ اضافه سه جا خرج میشه: مدلهای امروزی میتونن روی همون سؤال بیشتر فکر کنن، مدلهای آینده میتونن یاد بگیرن از بودجههای بزرگتر بهتر استفاده کنن (مثل چیزی که OpenAI با o1 و o3 نشون داد)، و agentهای سریال میتونن سرعت استنتاج رو تبدیل به سرعت اجرا کنن. Cerebras خودش الگویی به اسم CePO داره که با 10 تا 20 برابر بودجهٔ یکشات، روی Llama 3.3-70B از Llama 3.1-405B رد میشه.
وقتی مدل تصمیم میگیره یه اپلیکیشن زنده الان چه کاری بکنه، تأخیر استنتاج به تأخیر اجرا تبدیل میشه. مثال Codex-Spark هم همینه: OpenAI این مدل کوچیک real-time کد رو روی Cerebras با بالای 1000 توکن در ثانیه اجرا میکنه و میگه لوپهای agent تا 40٪ سریعتر شدن. تو یه لوپ فرضی هشتمرحلهای، با نرخ 170.7 tok/s کل کار 64.9 ثانیه طول میکشه ولی با 1790.3 tok/s فقط 22.5 ثانیه.
سمت تجاری، OpenAI متعهد شده تا 2028 حدود 750 مگاوات از Cerebras بخره و برای 1.25 گیگاوات دیگه هم اختیار خرید داره. آمازون هم برای ترکیب Trainium و CS-3 مذاکره کرده. تعهدات عملکرد باقیموندهٔ Cerebras رسیده به 25.4 میلیارد دلار. قیمت هر میلیون توکن خروجی روی gpt-oss-120b برابر 0.75 دلار، یعنی 25٪ بالاتر از میانهست. صرفهٔ این پرمیوم وقتیه که کار اضافه هزینهٔ نهایی هر جواب درست و بهموقع رو پایین بیاره.
نکات کلیدی:
- Cerebras روی gpt-oss-120b: 1790.3 tok/s، 10.49 برابر میانهٔ ارائهدهندهها
- Ultrafast برای GPT-5.6 Sol تا 750 tok/s و 14 برابر حالت Standard
- CePO با Best-of-N خرج 10-20 برابری بودجهٔ یکشات
- OpenAI تعهد 750MW تا 2028 + اختیار 1.25GW
- تعهدات باقیماندهٔ Cerebras: 25.4 میلیارد دلار




