همدستی AMD و Cerebras برای اینفرنس بیتأخیر
خلاصهٔ کاملتر
AMD و Cerebras از یه همکاری فنی خبر دادن تا چیزی بسازن که بهش میگن اینفرنس تفکیکشده (disaggregated inference). ایدهش سادهست: کار اینفرنس دو مرحله داره با نیازهای کاملاً متفاوت، پس چرا هر دو رو روی یه جور سختافزار بندازیم؟ تو این طرح، راهکار رکاسکیل AMD Helios پردازش پرامپت و کانتکستهای بزرگ رو برمیداره و موتور ویفراسکیل سربراس مرحله دیکد و تولید توکن رو.
تفکیک دقیقاً به همین خاطر جواب میده که مرحله اول به توان عبوری بالا احتیاج داره و مرحله دوم به پهنای باند حافظه و تأخیر خیلی کم. طبق مدلسازی آزمایشگاههای AMD و سربراس در جولای ۲۰۲۶ روی مدل یکتریلیونپارامتری Kimi 2.6، ترکیب این دو تا ۵ برابر توکن بر ثانیه بهازای هر وات میده. جای تأکید داره که این عدد از مقایسه با پیکربندی فقطسربراس درمیاد و یه بنچمارک مستقل نیست.
لیزا سو، مدیرعامل AMD، میگه اینفرنس داره به یکی از بزرگترین فرصتهای زیرساختی هوش مصنوعی تبدیل میشه و تنوعش یه رویکرد منعطفتر میخواد. اندرو فلدمن، مدیرعامل و همبنیانگذار سربراس، هم این شراکت رو فرصتی برای رسوندن اینفرنس فوقسریع به مشتریهای بیشتر میدونه. سربراس قراره سیستمهای Helios رو تو دیتاسنترهای خودش مستقر کنه.
تو اطلاعیه اومده که این جهتگیری بیشتر به درد کارهایی مثل کدنویسی، کوپایلتهای بیدرنگ، ایجنتهای زنده و ورکفلوهای ایجنتیک میخوره؛ جاهایی که سرعت جواب مستقیم روی تجربه کاربر اثر میذاره. راهکار مشترک قراره نیمه دوم ۲۰۲۶ اول از همه از طریق Cerebras Cloud در دسترس قرار بگیره.
نکات کلیدی:
- AMD Helios مسئول توان عبوری بالا و پردازش پرامپتهای بزرگ
- موتور ویفراسکیل سربراس مسئول تولید توکن با کمترین تأخیر
- ادعای تا ۵ برابر توکن بر ثانیه بهازای هر وات، بر پایه مدلسازی داخلی دو شرکت
- سربراس Helios رو تو دیتاسنترهای خودش مستقر میکنه
- عرضه اولیه: نیمه دوم ۲۰۲۶ روی Cerebras Cloud




