تست نسخهی فشردهی MiniCPM5-2B: بعد از GGUF شدن چقدر باهوش میمونه؟
خلاصهٔ کاملتر
MiniCPM5-2B یه مدل زبانی ۲ میلیارد پارامتریه از OpenBMB که برای اجرا رو دستگاههای محدود ساخته شده. نسخهی اصلیش BF16ـه، ولی چیزی که بیشتر آدمها برای اجرای محلی لازم دارن نسخهی GGUFـه، چون این فرمتیه که با llama.cpp، Ollama و LM Studio کار میکنه. OpenBMB این نسخه رو تو سه سطح فشردهسازی F16، Q8_0 و Q4_K_M منتشر کرده.
تستی که انجام شده رو نسخهی Q8_0 بوده که کمترین افت کیفیت رو نسبت به مدل اصلی داره؛ یعنی اگه مشکلی همینجا دیده بشه، تو Q4_K_M که فشردهتره، احتمالاً بدتر هم میشه. مصرف حافظه خیلی کم بود: حدود ۵.۳ گیگابایت VRAM با کش فعال، و حتی میتونه با غیرفعال کردن کش به حدود ۲ گیگابایت برسه؛ یعنی رو یه گرافیک متوسط یا حتی فقط با CPU هم قابل اجراست.
برای مقایسه، همون تستهایی که رو نسخهی کامل مدل اجرا شده بود، دوباره رو نسخهی فشرده هم تکرار شد. تو یه باگ سخت SQL روی Oracle که باید یه ستون واقعی تو دیتابیس رو تشخیص میداد، مدل فشرده یه ستون ساختگی به اسم «تاریخ شروع پارتیشن» رو از خودش درآورد و یه فیلد متادیتا رو اشتباهی بهجای عدد درآمد در نظر گرفت؛ جوابش خیلی روون و مطمئن بود ولی کاملاً غلط.
تو ترجمهی چندزبانه هم داستان مشابهی بود؛ حتی با یه جملهی سادهتر، مدل فشرده تو زبانهایی مثل کرهای ترجمهی بیمعنی و درهم داد. ولی همهچیز بد نبود: تو یه مسئلهی فیزیک و ریاضی که یه جواب مشخص و قابلبررسی داشت، مدل فشرده سریع و درست جواب داد. تو یه تست کدنویسی هم که باید انیمیشن HTML از چرخیدن یه کباب رو آتیش میساخت، خروجی ساده ولی درست و کارکردنی تحویل داد.
نتیجه اینه که فشردهسازی یکنواخت عمل نمیکنه؛ رو کارهایی که منطق خودشون کامله (مثل حل معادله یا نوشتن کد ساده) مدل خوب میمونه، ولی رو کارهایی که به دونستن یه واقعیت دقیق و خاص نیاز داره (مثل جزئیات یه دیتابیس یا ترجمهی محاورهای) با اعتمادبهنفس بالا جواب غلط میده، که این از یه جواب مردد خطرناکتره چون کاربر متوجه اشتباه نمیشه.
نکات کلیدی:
- نسخهی GGUF مدل MiniCPM5-2B تو فرمتهای F16، Q8_0 و Q4_K_M عرضه شده و با llama.cpp، Ollama و LM Studio کار میکنه
- نسخهی Q8_0 فقط حدود ۵.۳ گیگابایت VRAM لازم داره (یا ۲ گیگ بدون کش) و رو سختافزار معمولی اجرا میشه
- تو کدنویسی خودکفا و مسائل ریاضی با جواب مشخص، افت کیفیت زیادی نداشت
- تو کارهایی که نیاز به دونستن جزئیات دقیق دارن، مثل اسکیمای دیتابیس یا ترجمهی چندزبانه، جوابهای غلط ولی با ظاهر مطمئن داد




