مدل رو توی سیلیکون حک کنیم یا نه؟
خلاصهٔ کاملتر
نویسنده میگه اولین بار فوریه دربارهٔ تالاس (Taalas) خوند: یه شرکت تورنتویی که Llama 3.1 8B رو نه بارگذاری، بلکه روی سیلیکون حک کرده — وزنها بهشکل ترانزیستور فیزیکی سر خط تولید. گروک (Groq) سالها روی همین مسئله کار کرده بود ولی یه قدم عقبتر ایستاد و وزنها رو روی چیپ اما قابل بازنویسی نگه داشت. تو هشت ماه، انویدیا یکیشون رو برداشت و AMD اون یکی رو.
مسئلهٔ مشترک «دیوار حافظه»ست: موقع استنتاج، بیشترین انرژی GPU صرف ریاضی نمیشه، صرف جابهجا کردن وزنها از HBM به واحدهای محاسباتیه، و برای هر توکن این رفتوبرگشت به تعداد لایهها تکرار میشه. چیپی که وزنها رو روی خود دای نگه میداره اصلاً HBM نمیخواد و با SRAM کار میکنه — یعنی بار تولید میره روی ظرفیتی که مثل کارخونههای حافظه تا ۲۰۲۷ پیشفروش نشده.
اعداد تالاس (همهشون خودِ شرکت گزارش کرده و مستقل تأیید نشدن): حدود ۱۶۹۶۰ توکن بر ثانیه برای هر کاربر روی Llama 3.1 8B در برابر تقریباً ۲۳۰ روی H200، مصرف ۰٫۰۱۵ ژول بر توکن و هزینهٔ ۰٫۰۰۷۵ دلار به ازای هر میلیون توکن. کل مدل ۸ میلیاردی روی یه دای ۸۱۵ میلیمتر مربعی با ۵۳ میلیارد ترانزیستور جا میشه. کنارش یه بخش SRAM قابل بازنویسی هست برای KV cache و آداپترهای LoRA — لهجهٔ مدل رو عوض میکنه، ذهنش رو نه.
گروک از سمت دیگه حمله کرده: LPU هم HBM نداره ولی وزنها تو SRAM روی چیپ لود میشن، پس هر مدلی باهاش کار میکنه و عوضکردن مدل فقط یه کامپایل و لود دوبارهست. هزینهش ظرفیته: نسل اول ۲۳۰ مگابایت SRAM روی هر چیپ داره و یه مدل ۷۰ میلیاردی روی ۵۷۶ چیپ پخش میشه. خلاصهش اینه که تالاس شرط بسته وزنها ثابت میمونن و گروک شرط بسته فقط معماری ثابت میمونه.
نویسنده میگه شرط لازم برای ریختن یه بار کاری تو سیلیکون هیچوقت «محبوب بودن» نبوده، «تمومشده بودن» بوده؛ SHA-256 و کدکهای ویدیویی استاندارد شده بودن، ولی LLMها هنوز هر چند ماه نسخهٔ جدید میدن و همون عددهاست که تو فلز ریخته شده. اسب سیاه هم مدلهای دیفیوژنیان: به گفتهٔ گوگل، Gemini Diffusion بهجای یه توکن، بلوکی از توکنها رو با هم تولید و اصلاح میکنه و ۱۴۷۹ توکن بر ثانیه گزارش داده — یعنی همون گلوگاه ترتیبی رو کوچیک میکنه که این دو چیپ برای حذفش ساخته شدن.
نکات کلیدی:
- گلوگاه اصلی استنتاج، آوردن وزنها از HBM ـه، نه خود محاسبات
- تالاس وزنها رو تو mask-ROM حک میکنه؛ عوضکردن مدل یعنی ماسک و کارت جدید
- گروک وزنها رو تو SRAM لود میکنه؛ انعطاف داره ولی ظرفیت هر چیپ خیلی کمه
- انویدیا معماری گروک رو ۲۰ میلیارد دلار لایسنس گرفت، AMD تالاس رو خرید
- هر دو خریدار یه تقسیم کار مشترک تعریف کردن: GPU برای خوندن ورودی، چیپ تخصصی برای تولید خروجی
- نویسنده میگه حککردن مدل جایی جواب میده که کار «تمومشده» باشه: OCR، ترجمه، تشخیص گفتار، امبدینگ




