دیپسیک V4 Flash رو محلی اجرا کنیم؟
خلاصهٔ کاملتر
تو این مقاله اومده که دیپسیک V4 Flash، یه مدل متنباز ۲۸۴ میلیارد پارامتری، بیشترین جهشش رو از پسآموزش گرفته نه از معماری جدید: نمرهٔ بنچمارک DeepSweep از حدود ۷ درصد به ۵۴ درصد رسیده. روی شاخص هوشبههزینه هم کنار Gemini 2.5 Flash میشینه و GLM 5.2 رو که تقریباً سه برابرشه، تو تقریباً همهٔ بنچمارکها میزنه.
نویسنده هشدار میده این اعداد کاملاً قابلمقایسه نیستن، چون دیپسیک مدل خودش رو با هارنس بهینهٔ خودش تست کرده — یعنی همون داربست ابزار و پرامپت و ارکستراسیونی که دور مدل پیچیده میشه. یه مطالعهٔ اوپنایآی روی Arc-AGI نشون داده عوض کردن هارنس میتونه نمره رو از حدود ۱۳ به ۴۰ درصد ببره، پس هارنس هم به اندازهٔ خود مدل باید بررسی بشه.
برای اجرای محلی، مصرف حافظه مستقیم به سطح کوانتیزیشن بستگی داره: حدود ۱۶۸ گیگابایت VRAM برای ۴ بیت و حدود ۱۱۰ گیگابایت برای ۳ بیت، اون هم فقط برای بارگذاری مدل و بدون حساب کردن کانتکست. عملاً یعنی چیزی شبیه کلاستر دو تا NVIDIA DGX Spark لازمه؛ روی همین کلاستر و با هارنس Open Code سرعت حدود ۲۵ تا ۳۰ توکن بر ثانیه بوده و زنجیرهٔ استدلال مدل منظمتر و کمحرفتر از نسخههای قبلی دیپسیک بوده.
راه دوم، موتور اجرای سفارشیای به اسم Dwarf Star هست که بهجای کوانتیزه کردن یکنواخت، دقتها رو ترکیب میکنه — بخشی از وزنها بالاتر میمونن و بخشی به ۲ بیت میرسن — و با آفلود روی SSD و دستکاری KV cache یه سیستم ۱۲۸ گیگابایتی رو هم کافی میکنه. در عوض نویسنده یادآوری میکنه مدل فقط متنیه و برای تصویر و صدا باید مدل جدا کنارش بذاری، ضمن اینکه قیمت API — حدود ۲ سنت برای هر میلیون توکن ورودی و نزدیک ۳۰ سنت برای خروجی — رقابت با میزبانی محلی رو سخت میکنه.
نکات کلیدی:
- جهش DeepSweep از حدود ۷ به ۵۴ درصد، عمدتاً از پسآموزش نه معماری جدید
- بنچمارکها با هارنس خود دیپسیک گرفته شدن؛ هارنس میتونه نمره رو چند برابر کنه
- ۱۶۸ گیگابایت VRAM برای ۴ بیت و ۱۱۰ گیگابایت برای ۳ بیت، بدون حساب کانتکست
- موتور Dwarf Star با دقت ترکیبی و آفلود SSD، اجرا روی سیستم ۱۲۸ گیگابایتی رو ممکن میکنه
- مدل فقط متنیه؛ برای کار چندوجهی به یه مدل مکمل نیاز داری




