MiniCPM5-2B؛ مدل ۲ بیای که دیتاستش هم کاملا بازه
خلاصهٔ کاملتر
MiniCPM5-2B دومین مدل از سری MiniCPM5 هستش که OpenBMB بعد از MiniCPM5-1B منتشر کرده؛ یه مدل ۲.۵۲ میلیارد پارامتری (۱.۹۸ میلیارد بدون امبدینگ) با معماری استاندارد LlamaForCausalLM و ۴۲ لایه، که مخصوص اجرا رو دستگاههای محدود مثل موبایل و لپتاپ ساخته شده. تو attention هم از روش grouped-query (۱۶ هد برای query و فقط ۲ هد برای key/value) استفاده کرده که حافظهی مصرفی رو موقع اجرا کم میکنه.
طبق بنچمارک خود OpenBMB، این مدل رو ۹ محور مختلف (از استدلال کد و ریاضی گرفته تا کارهای عاملی) میانگین ۵۳.۹ گرفته؛ عددی که از Qwen3.5-4B (با ۵۱.۱ و حدود ۶۰ درصد پارامتر بیشتر) و granite-4.2-3B (۴۲.۷) بالاتره. چون این نتایج رو خود سازنده منتشر کرده، بهتره کاربرها رو دادهی خودشون هم تستش کنن، ولی روش شفاف و با اسم رقیبهای مشخص گزارش شده.
یکی از ویژگیهای غیرمعمول این مدل، پشتیبانی از کانتکست تا ۱۳۱٬۰۷۲ توکنه؛ عددی که معمولا مخصوص مدلهای خیلی بزرگتره، نه یه مدل ۲ بی. این یعنی میشه یه پروژهی کامل یا یه سند طولانی رو بدون بریدن بهش داد، که برای کارهای عامل کدنویسی یا جستجو خیلی بهدردبخوره. البته اینکه دقت مدل تا انتهای همین ۱۳۱ هزار توکن حفظ میشه یا نه، تو گزارش OpenBMB مشخص نشده و بهتره هرکسی رو دادهی خودش امتحان کنه.
OpenBMB این مدل رو تو فرمتهای مختلفی مثل GGUF (برای llama.cpp، Ollama و LM Studio)، MLX (برای سیلیکون اپل)، GPTQ کوانتایز شده و یه نسخهی LiteRT برای موبایل منتشر کرده؛ یه مدل کوچیکتر به اسم DSpark هم برای سرعت گرفتن با روش speculative decoding (یعنی یه مدل کوچیک اول جمله رو حدس میزنه و مدل اصلی فقط تاییدش میکنه) کنارش اومده.
جالب اینه که دیتاستهای آموزشی زیر پرچم UltraData (شامل دادهی وب، دادهی کد و نمونههای آموزش عامل) هم کامل متنباز شدن، که کار رو برای تکرار یا توسعهی این مدل توسط تیمهای دیگه راحتتر میکنه. لایسنس مدل هم Apache 2.0 هست که استفادهی تجاری بدون محدودیتهای رایج مدلهای باز دیگه رو اجازه میده.
نکات کلیدی:
- MiniCPM5-2B حدود ۲.۵۲ میلیارد پارامتر داره و مخصوص اجرا رو موبایل و دستگاههای محدوده
- رو بنچمارک ۹ محوری OpenBMB میانگین ۵۳.۹ گرفته، بالاتر از Qwen3.5-4B با ۵۱.۱
- تا ۱۳۱٬۰۷۲ توکن کانتکست پشتیبانی میکنه
- تو فرمتهای GGUF، MLX، GPTQ و LiteRT منتشر شده و یه نسخهی DSpark برای speculative decoding هم داره
- دیتاستهای آموزشی (UltraData) و لایسنس Apache 2.0 مدل کاملا بازن




