دیپسیک V4 Pro رو خودت لوکال سرو کن
خلاصهٔ کاملتر
دیپسیک نسخهٔ نهایی DeepSeek-V4-Pro-0813 رو منتشر کرده؛ همون مدل استدلالی و کدنویسی agentic که تا حالا فقط نسخهٔ preview داشت. تو این مقاله اومده که وزنها با لایسنس MIT بیرون اومدن، یعنی هرکی سختافزارش رو داشته باشه میتونه بهجای زدن به API دیپسیک خودش مدل رو بالا بیاره. فقط حواست باشه این یه مدل بزرگ mixture-of-experts ـه — یعنی مدل به چندتا «متخصص» تقسیم شده و هر بار فقط بخشیشون فعال میشن — پس لپتاپ جوابگو نیست.
برای سرو کردنش دو مسیر رسمی مستند شده: vLLM و SGLang. نمونهٔ اصلی دیپسیک روی یه نود با چهار GPU مدل GB300 بالا میاد؛ تو vLLM با --kv-cache-dtype fp8 و --block-size 256 مصرف حافظه رو پایین نگه میدارن و با --data-parallel-size 4 و --enable-expert-parallel متخصصها رو بین کارتها پخش میکنن. دستور SGLang خلاصهتره:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Pro-0813 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARKاینجا --tp 4 یعنی tensor parallelism روی چهار کارت و --speculative-algorithm DSPARK همون speculative decoding رو روشن میکنه. تو vLLM همین قابلیت با یه بلوک JSON به اسم --speculative-config فعال میشه؛ کارشون یکیه، فقط اسم فلگ فرق داره.
speculative decoding معمولاً یه مدل کوچیک draft لازم داره که چند توکن جلوتر رو حدس بزنه تا مدل اصلی همهشون رو یهجا تأیید کنه و تعداد passهای سنگین کم بشه. فرق DSpark اینه که مدل draft جدا نمیخواد و همون checkpoint خود V4 Pro نقش draft رو هم بازی میکنه. یعنی نه فایل اضافه دانلود میکنی، نه درگیر هماهنگ نگهداشتن توکنایزر دو تا مدل میشی.
به گفتهٔ نویسنده، نسخهٔ نهایی نسبت به preview تو تسکهای agentic جهش داشته: Terminal Bench 2.1 از ۷۲٫۱ به ۸۷٫۹ و DeepSWE از ۱۲٫۸ به ۶۲٫۷. در عوض قیمت API خود دیپسیک با این نسخه دو تا چهار برابر شده، برای همین نویسنده میگه اگه بار کاریت سنگین و مداومه لوکالکردن بهصرفهتره — وگرنه برای استفادهٔ سبک، API دردسر مدیریت کلاستر GPU و کرنلهای MoE رو از دوشت برمیداره.
نکات کلیدی:
- وزنهای DeepSeek-V4-Pro-0813 با لایسنس MIT منتشر شدن، پس self-host و استفادهٔ تجاری آزاده.
- نمونهٔ رسمی اجرا یه نود با چهار GPU مدل GB300 ـه، با kv-cache روی fp8 و block-size برابر ۲۵۶.
- DSpark به checkpoint جداگانه برای draft نیاز نداره؛ تو نمونهٔ vLLM با هفت توکن حدسی تنظیم شده.
- سطح reasoning effort سه حالت low، high و max داره و برای max خروجی تا ۳۸۴K توکن پیشنهاد شده.
- فریمورک DeepSeek Harness میتونه نسخهٔ لوکال رو بهعنوان provider سفارشی بهجای API ابری صدا بزنه.




