معماریهای جدید LLM: کاهش هزینهی متنهای بلند
خلاصهٔ کاملتر
یکی از اصلیترین دغدغههای طراحی مدلهای زبانی بزرگ در سالهای اخیر اینه که با بلندتر شدن کانتکست (بهویژه در مدلهای reasoning و agent)، کَش KV (همون جایی که key و value های attention ذخیره میشن) به یه گلوگاه جدی تبدیل میشه؛ هم از نظر حافظه، هم از نظر محاسبات. چند مدل جدید open-weight هر کدوم با زاویهای متفاوت این مشکل رو هدف گرفتن.
Gemma 4 E2B/E4B از دو تکنیک همزمان استفاده میکنه. اولی KV Sharing یا Cross-Layer Attentionه: لایههای انتهایی شبکه به جای محاسبهی مستقل key و value، مقادیر KV لایههای قبلی رو مستقیماً به اشتراک میذارن. مثلاً در E2B با ۳۵ لایه، فقط ۱۵ لایهی اول KV جداگانه دارن و ۲۰ لایهی آخر از همونها استفاده میکنن. این کار در کانتکست ۱۲۸K تقریباً ۲.۷ گیگابایت حافظه صرفهجویی میکنه.
تکنیک دوم Gemma 4، Per-Layer Embeddings (PLE) ه که هدفش متفاوته. به جای اینکه کل مدل رو بزرگتر کنیم، برای هر لایه یه بردار embedding کوچیک و توکن-محور آماده میشه و بعد از مرحلهی feed-forward به residual اضافه میشه. همین باعث میشه مدل E2B با پارامتر «مؤثر» ۲.۳ میلیارد کار کنه، اما کل پارامترهایش ۵.۱ میلیارد باشه، چون embedding tableها ارزونتر از افزودن لایههای attention یا FFN بیشترن.
Laguna XS.2 ساختهی Poolside، یه ایدهی ظریف دیگه داره: تخصیص بودجهی attention به ازای هر لایه. در این مدل لایههای sliding-window (که فقط روی یه پنجرهی محلی ۵۱۲ توکنی کار میکنن) تعداد query head بیشتری دارن، ولی لایههای global attention که گرانترن تعداد query head کمتری. تعداد KV head در همهی لایهها ثابت ۸ تاست. این یعنی بودجهی محاسباتی دقیقاً اونجایی خرج میشه که بیشترین فایده رو داره.
ZAYA1-8B ساختهی Zyphra، مکانیزم جدیدی به اسم Compressed Convolutional Attention (CCA) معرفی میکنه. برخلاف MLA در DeepSeek که فقط کَش KV رو فشرده میکنه، CCA عملیات attention رو مستقیماً در فضای فشردهی latent انجام میده؛ یعنی هم KV cache کوچیکتره، هم FLOPهای prefill و training کمتر میشه. برای جبران کاهش expressiveness ناشی از فشردهسازی، از convolution روی Q و K فشرده استفاده میشه تا هر بردار کمی از کانتکست محلی اطرافش آگاه بشه.
DeepSeek V4 دو تغییر اساسی داره. اولی mHC (Manifold-Constrained Hyper-Connections) ه که به جای یه residual stream تکی، چند stream موازی نگه میداره و با محدودیتهای ریاضی (ماتریسهای doubly stochastic) پایداری رو تضمین میکنه. این کار ظرفیت مدل رو بدون گرانترکردن لایههای attention یا MoE بالا میبره و طبق گزارش تیم DeepSeek، فقط ۶.۷٪ زمان آموزش بیشتر میخواد. دومی ترکیبی از CSA (فشردهسازی ملایم با انتخاب sparse) و HCA (فشردهسازی شدید، هر ۱۲۸ توکن در یه entry) هست که روی بُعد طول دنباله کار میکنن، نه بُعد نمایش توکن. نتیجه اینه که در کانتکست ۱M توکن، DeepSeek V4-Pro فقط ۲۷٪ از KV cache یه مدل استاندارد رو مصرف میکنه.
نکات کلیدی:
- KV Sharing در Gemma 4 باعث میشه لایههای انتهایی KV لایههای قبلی رو به اشتراک بذارن و حافظه رو تا ~۵۰٪ کاهش بده
- Per-Layer Embeddings (PLE) روشی برای افزایش ظرفیت مدلهای کوچیکه بدون گرانکردن لایههای اصلی
- Laguna XS.2 تعداد query head رو به ازای هر لایه تنظیم میکنه تا بودجهی attention بهینه بشه
- CCA در ZAYA1-8B attention رو مستقیماً در فضای فشرده انجام میده و با convolution کیفیت رو حفظ میکنه
- mHC در DeepSeek V4 residual stream رو به چند مسیر موازی تبدیل میکنه با overhead کم
- CSA و HCA در DeepSeek V4 طول دنبالهی KV cache رو فشرده میکنن نه نمایش هر توکن رو




