MiniCPM5-2B: مدل کوچیک هوش مصنوعی برای اجرای لوکال
خلاصهٔ کاملتر
OpenBMB مدل MiniCPM5-2B رو منتشر کرده؛ یه مدل زبانی دنس با ۲٫۵ میلیارد پارامتر (حدود ۱٫۹۸ میلیارد بدون احتساب embedding) که رو ۴۲ لایه transformer با grouped-query attention کار میکنه. برخلاف مدلهای بزرگ که برای سرور ساخته میشن، این یکی از اول برای اجرای لوکال رو لپتاپ، گوشی یا جیپییوهای ضعیفتر طراحی شده.
نکتهی جالب، context length (یعنی حجم متنی که مدل میتونه همزمان تو حافظهش نگه داره) اونه: ۱۳۱٬۰۷۲ توکن بهصورت native، درحالیکه اکثر مدلهای زیر ۳ میلیارد پارامتر معمولاً بین ۴ تا ۳۲ هزار توکن محدودن. این برای کارهایی مثل نگهداشتن تاریخچهی طولانی یک ایجنت یا سند بزرگ تو حافظه بهدرد میخوره.
OpenBMB مدعیه تو مقایسه با مدلهای بزرگتر مثل Qwen3.5-4B، این مدل میانگین امتیاز ۵۳٫۹ گرفته در مقابل ۵۱٫۱ اون یکی، و بیشترین فاصله رو تو استدلال کد، ریاضی، کار با ابزار و تسکهای ایجنتی داره. البته این بنچمارک رو خود سازنده منتشر کرده، پس باید با احتیاط بهش نگاه کرد؛ تو دانش عمومی و مکالمهی آزاد فاصلهش با مدلهای بزرگتر خیلی کمتره.
مدل تو فرمتهای مختلفی عرضه شده: GGUF برای llama.cpp و Ollama و LM Studio، نسخهی MLX چهاربیتی برای مکهای اپل سیلیکون، GPTQ برای جیپییو، و یه مدل کوچیکتر به اسم DSpark هم برای سرعتبخشیدن به تولید متن (speculative decoding) کنارش اومده. چکپوینتهای آموزشی مختلف (Base تا نسخهی نهایی بعد از RL) هم عمومی شدن.
دیتاستهای آموزشی زیر نام UltraData هم منتشر شدن که شامل دیتای وب، کد و نمونههای آموزش ایجنته؛ این سطح از شفافیت تو مدلهای اپنسورس زیاد دیده نمیشه. لایسنس مدل هم Apache 2.0 هست و معماریش استاندارد Llamaـه، پس تو ابزارهای موجود بدون دردسر جا میشه.
نکات کلیدی:
- ۲٬۵۱۶٬۷۵۶٬۴۸۰ پارامتر کل، رو ۴۲ لایه با grouped-query attention
- context length حدود ۱۳۱ هزار توکن، غیرمعمول برای این سایز
- میانگین بنچمارک ۵۳٫۹ در مقابل ۵۱٫۱ برای Qwen3.5-4B طبق ادعای OpenBMB
- فرمتهای GGUF، MLX چهاربیتی، GPTQ و LiteRT برای اجرا رو دستگاههای مختلف
- لایسنس Apache 2.0 و دیتاستهای آموزشی UltraData عمومی هستن




