دیپسیک اولین مدل تصویری خانوادهٔ V4 رو داد
خلاصهٔ کاملتر
دیپسیک اولین مدل مالتیمودال خانوادهٔ V4 رو با اسم DeepSeek-V4-Flash-Vision-Exp منتشر کرده. به گفتهٔ مدلکارت، این مدل از صفر ساخته نشده؛ روی همون معماری DeepSeek-V4-Flash ماژولهای بینایی اضافه کردن و آموزش رو ادامه دادن تا درک تصویر هم بهش اضافه شه. وزنها بازه و تا الان نزدیک ۱۸ هزار بار از Hugging Face دانلود شده. ادعای دیپسیک سادهست: مالتیمودال بهتر، بدون عقبگرد روی کارهای متنی.
تو بخش مالتیمودال، بزرگترین جهش مال ApexBench هست که از ۲۶.۲ به ۳۶.۵ (Pass@1) رسیده، و Agents' Last Exam از ۲۵.۲ به ۲۷.۳. ولی یه پانویس تو جدول خود دیپسیک این مقایسه رو نسبی میکنه: نسخهٔ قبلی یعنی V4-Flash-0731 اصلاً بخش تصویری ورودی رو نادیده میگرفته و فقط از متن جواب میداده. پس این جهش بیشتر از اینکه بهتر شدن یه مهارت باشه، اضافه شدن مهارتیه که قبلاً وجود نداشت.
روی کارهای متنی فاصلهها کوچیکن و بعضیجاها حتی بهتر شده: Terminal Bench 2.1 از ۸۲.۷ به ۸۳.۹، DeepSWE از ۵۴.۴ به ۵۹.۳ و Toolathlon-Verified از ۷۰.۳ به ۷۵.۹؛ فقط Cybergym یهکم افت کرده، از ۷۶.۷ به ۷۵.۳. یعنی اضافه کردن بینایی چیزی از توان متنی مدل کم نکرده. مقابل Opus 4.8 ولی اوپوس معمولاً جلوئه: ۶۹.۷ به ۵۷.۷ روی NL2Repo و ۷۱.۷ به ۶۳.۶ روی DSBench-Hard.
تو مالتیمودال ورق تا حدی برمیگرده: دیپسیک روی ZeroBench (Pass@5) با ۳۵.۰ به ۳۴.۰ و روی Agents' Last Exam با ۲۷.۳ به ۲۵.۷ جلو میزنه، ولی ApexBench هنوز مال اوپوسه، ۳۹.۴ به ۳۶.۵. نویسنده میگه جدول خیلی هم گلچینشده نیست، چون بخش متنی که اوپوس بیشترش رو میبره حذف نشده. مدل با لایسنس MIT اومده و vLLM و SGLang رو پشتیبانی میکنه، همراه با روش speculative decoding به اسم DSpark.
نکات کلیدی:
- روی معماری DeepSeek-V4-Flash ساخته شده، با ماژول بینایی و ادامهٔ آموزش
- ApexBench: از ۲۶.۲ به ۳۶.۵ (Pass@1)، ولی Opus 4.8 با ۳۹.۴ هنوز جلوتره
- ZeroBench (Pass@5): ۳۵.۰ در برابر ۳۴.۰ اوپوس؛ Agents' Last Exam: ۲۷.۳ در برابر ۲۵.۷
- Opus 4.8 تو NL2Repo و DSBench-Hard با اختلاف دورقمی جلوئه
- پانویس مهم: نسخهٔ ۰۷۳۱ ورودی تصویری رو کلاً نادیده میگرفته
- وزن باز با لایسنس MIT، پشتیبانی از vLLM و SGLang و speculative decoding با نام DSpark




