انقلاب inference: چرا سختافزار هوش مصنوعی داره عوض میشه
خلاصهٔ کاملتر
به گفتهٔ Matthew S. Smith تو IEEE Spectrum، از حدود 2020 همهٔ توجه روی train کردن مدلهای بزرگتر بود، ولی تو 2026 inference (یعنی استفاده از مدل آموزشدیده برای تولید جواب) اومده وسط صحنه. دلیلش سادهست: LLMها کاربردی شدن و مردم ازشون استفاده میکنن. مدلهای reasoning با chain of thought چند بار پشت سر هم inference اجرا میکنن و تا 20 برابر متن بیشتر میسازن. ایجنتها هم شبانهروز کار میکنن.
مقاله توضیح میده که inference دو فاز داره. تو prefill مدل کل پرامپت رو یکجا میخونه و بردارهای key و value رو تو KV cache (یه حافظهٔ موقت که تا دهها گیگابایت بزرگ میشه) میریزه. این فاز موازیپذیره و GPUها توش عالیان. تو decode مدل توکنبهتوکن جواب میده و برای هر توکن باید کل وزنها و KV cache رو از حافظه بخونه. اینجا گلوگاه memory bandwidth هست، یعنی سرعت رسیدن داده از حافظه به پردازنده. به همین خاطر GPUهای H100 موقع اجرای LLMهای متنباز 50 تا 80 درصد وقت بیکارن.
استارتاپها دو راه متفاوت رفتن. تراشهٔ Raptor از d-Matrix شتابدهنده رو مستقیم روی DRAM استک میکنه تا فاصلهٔ داده میکرومتری بشه نه میلیمتری. Majestic Labs برعکس، رابط حافظهای ساخته که داده رو تا حدود یک متر جابهجا میکنه و تا 128 ترابایت DRAM رو به یه رک وصل میکنه؛ رک GB300 NVL72 شرکت Nvidia حدود 20 ترابایت HBM3E داره. هر دو از DRAM معمولی استفاده میکنن، چون HBM دو تا سه برابر گرونتره. در مقابل، SK Hynix میگه HBM4 حداکثر bandwidth رو دو برابر میکنه.
غولها سراغ ترکیب تراشهها رفتن. Nvidia بعد از قرارداد 20 میلیارد دلاری با Groq، واحد Groq 3 LPU رو معرفی کرد. این تراشه قدرت محاسبهٔ کمتری از GPU داره، ولی 500 مگابایت SRAM روی خود تراشه داره. به گفتهٔ Ian Buck، memory bandwidth این تراشه هفت برابر GPU هست. قراره prefill روی GPUهای Vera Rubin اجرا بشه و decode روی LPUها؛ هر رک Groq 3 LPX هم 256 تا LPU داره.
آمازون هم تراشهٔ Trainium رو برای prefill و Wafer-Scale Engine 3 شرکت Cerebras رو برای decode گذاشته. WSE-3 یه ویفر کامل سیلیکونیه با بیش از 4 تریلیون ترانزیستور و 44 گیگابایت SRAM. همین تراشه GPT-5.3-Codex-Spark رو با بیش از 1000 توکن در ثانیه اجرا میکنه، در حالی که GPT-5.4 معمولی 50 تا 125 توکن در ثانیهست. جمعبندی Buck اینه که برای inference امروز «همهٔ تراشهها» لازمن.
نرمافزار هم داره کمحجمتر میشه. با quantization (یعنی ذخیرهٔ اعداد مدل با بیت کمتر) Nvidia فرمت 4 بیتی NVFP4 رو ساخته و AMD، Intel و Qualcomm پشت MXFP4 هستن. به گفتهٔ Nvidia تبدیل DeepSeek-R1 از FP8 به NVFP4 کمتر از یک درصد افت و سه برابر سرعت داشت. Tensordyne با اعداد لگاریتمی ضرب رو به جمع تبدیل میکنه و ادعای 1300 توکن در ثانیه برای هر کاربر با کمتر از یکدهم برق سختافزار مشابه Nvidia رو داره. Etched هم transformer رو مستقیم تو تراشهٔ Sohu پیاده کرده.
نکات کلیدی:
- GPUهای Nvidia H100 موقع inference روی LLMهای متنباز 50 تا 80 درصد وقت بیکارن
- Majestic Labs تا 128 ترابایت DRAM رو به یه رک وصل میکنه، در مقابل حدود 20 ترابایت HBM3E تو GB300 NVL72
- Nvidia Groq 3 LPU با 500 مگابایت SRAM هفت برابر GPU memory bandwidth داره
- WSE-3 شرکت Cerebras با 44 گیگابایت SRAM مدل GPT-5.3-Codex-Spark رو با بیش از 1000 توکن در ثانیه اجرا میکنه
- تبدیل DeepSeek-R1 از FP8 به NVFP4 کمتر از یک درصد افت کیفیت و سه برابر سرعت داشت
- Etched ادعا میکنه تراشهٔ Sohu مدل Llama 70B رو با 500 هزار توکن در ثانیه اجرا میکنه، ولی فقط برای معماری transformer




