دیپسیک V4.1 Flash: فشردهسازی KVCache تا ته خط
خلاصهٔ کاملتر
نویسندهی این تحلیل میگه اولش فکر کرده V4.1 Flash فقط یه نسخهی پستترینینگه، ولی با دیدن سرعت حدود ۴۲۰ توکن در ثانیه و خبر جمع شدن مدلهای V4 Pro نظرش عوض شده و میگه بهتر بود اسمش V5 Flash باشه. عنوان گزارش فنی هم همینه: فشار آوردن به مرزهای فشردهسازی KVCache. انگیزهاش روشنه، کانتکست ایجنتها مدام بلندتر میشه و فراخوانی پشتسرهم ابزارها بار سنگینی روی prefill میذاره؛ یعنی همون مرحلهای که مدل کل ورودی رو یکبار میخونه.
KVCache همون حافظهایه که مدل برای توکنهای قبلی نگه میداره تا دوباره حسابشون نکنه، و تو کانتکست بلند همین حافظه HBM و SSD رو پر میکنه. کاری که CSA2 میکنه فشردهسازی این کش از سه جهته: در بُعد کانال همهی هدها یه بردار مشترک ۵۱۲ بعدی (latent) رو استفاده میکنن، در بُعد دنباله انکودر هر دو موقعیت مجاور رو تو یک خانه ادغام میکنه، و در بُعد لایه چند لایه یه KV مشترک دارن.
کل شبکه در نهایت فقط ۳ نسخه کش انکودر و ۱ نسخه کش دیکودر نگه میداره و با کوانتیزیشن FP4، رشد ذخیرهسازی به حدود ۸۹۰ بایت برای هر توکن میرسه. سرجمع کش رانتایم حدود یکچهارم و کش ماندگار (همونی که برای استفادهی دوباره روی دیسک میمونه) حدود یکهشتم DeepSeek-V4-Flash میشه، و به گفتهی گزارش کیفیت کلی مدل هم بهتره.
بخش جالبتر، معماری CED یا همون Causal Encoder-Decoder هست. مدل ۴۰ لایه داره: ۲۰ لایهی اول نقش انکودر رو بازی میکنن و KV جهانی رو میسازن، ۲۰ لایهی بعدی همون KV رو میخونن جای اینکه هر کدوم KV خودشون رو بسازن. ایدهاش از مقالهی YoCo میآد. نتیجه این میشه که بیشتر موقعیتهای یه پرامپت بلند فقط از نصف شبکه رد میشن، پس پارامتر فعال prefill ۸ میلیارد میمونه و decode ۱۶ میلیارد.
این میونبر یه عارضه هم داره: موقعیتهای قدیمی از لایههای دیکودر رد نشدن، پس کش محلی SWA اون لایهها ساخته نشده. جواب دیپسیک چیزیه به اسم Decoder SWA Bounded Replay: فقط چند صد موقعیت آخر پرامپت از دیکودر رد میشن و بینهایت به عقب برنمیگرده. بازسازی تقریبی میشه، ولی حافظهی جهانی دستنخورده میمونه و هزینهی هر نوبت گفتگو ثابت میمونه. نویسنده میگه سر جمع، محاسبهی prefill عملاً نصف میشه.
نکات کلیدی:
- ۵۵۲ میلیارد پارامتر، کانتکست تا ۱ میلیون توکن، ورودی مولتیمودال
- ۸ میلیارد پارامتر فعال در prefill و ۱۶ میلیارد در decode
- کش رانتایم حدود ۱/۴ و کش ماندگار حدود ۱/۸ نسل V4-Flash
- ۴۰ لایه: ۲۰ لایه انکودر و ۲۰ لایه دیکودر، با پنجرهی SWA برابر ۱۲۸
- MoE با ۳۸۴ اکسپرت و انتخاب ۶ تا؛ کش FP4 و حدود ۸۹۰ بایت به ازای هر توکن




