MiniCPM 5 2B؛ مدل کوچیکی که فقط بلده ابزار صدا بزنه
خلاصهٔ کاملتر
OpenBMB مدل MiniCPM 5 2B رو بهعنوان ادامهی مدل ۱ بی قبلیش منتشر کرده؛ یه مدل حدود ۲.۵ میلیارد پارامتری که هدفش چت کردن یا کدنویسی نیست، فقط برای صدا زدن ابزارها (tool calling) و کارهای عاملی (agentic، یعنی وقتی مدل باید چند مرحله تصمیم بگیره و از ابزارهای مختلف استفاده کنه) آموزش دیده.
تو آموزش این نسخه، بهجای ترکیب دادههای مختلف مثل قبل، از ۴۰۰ میلیارد توکن دادهی «تفکر عمیق» استفاده شده. یه مرحلهی جدید یادگیری تقویتی به اسم RL2 هم اضافه شده که به گفتهی OpenBMB از روشهای معمول مثل GRPO پایدارتره؛ مدل برای هر حوزه (استدلال، کارهای عمومی، کارهای عاملی) جدا آموزش میبینه و در آخر خروجی خودش رو با مدلهای بزرگتر مقایسه و اصلاح میکنه.
نتیجهی این روش اینه که MiniCPM 5 2B رو بنچمارکهای ابزار زدن حتی از بعضی مدلهای ۴ میلیاردی مثل Qwen هم جلو میزنه. اما رو بنچمارکهای سختتر عاملی مثل SweetBench Pro و Terminal Bench، مدلهای بزرگتر Qwen تقریبا دو برابر امتیاز میگیرن؛ طبیعیه، چون Qwen بودجهی آموزشی خیلی بزرگتری داشته.
این مدل تو نوشتن متن بلند، خلاقیت و تولید کد ضعیفه؛ مثلا وقتی ازش یه مقالهی ۵۰۰۰ کلمهای خواستن، خروجی خیلی کوتاهتر از این بود. اما تو تستهای سخت عاملی مثل برنامهریزی چندمرحلهای، برگشتن از خطا وسط کار، مقاومت در برابر تزریق دستور (prompt injection، یعنی قایم کردن یه دستور مخرب تو خروجی یه ابزار برای گول زدن مدل) و پیدا کردن ابزار درست از بین گزینههای اشتباه، خوب عمل کرده؛ تو تکرار تستها هم حدود ۸۰ درصد پایدار بوده.
نسخهی ۴ بیتی GGUF این مدل رو llama.cpp روی یه کارت گرافیک RTX Pro 6000 بیش از ۴۰۰ توکن در ثانیه اجرا میشه و تو سناریوهای چند ابزاره با کانتکست بزرگ به بیش از ۵۰۰ توکن در ثانیه هم میرسه. یه مشکل تنظیمات هم پیدا شده: سرور SGLang برای نسخههای BFloat16 و DeepSpark خروجی ابزار رو خراب برمیگردوند، در حالی که همون مدل رو llama.cpp درست کار میکرد؛ یعنی مشکل از تنظیم سرور بوده نه خود مدل.
نکات کلیدی:
- MiniCPM 5 2B حدود ۲.۵ میلیارد پارامتر داره و مخصوص صدا زدن ابزار و کارهای عاملیه، نه چت یا کدنویسی
- با روش جدید RL2 و آموزش تخصصی برای هر حوزه، رو بنچمارکهای ابزار زدن از بعضی مدلهای ۴ میلیاردی جلو زده
- رو تستهای سختتر مثل SweetBench Pro و Terminal Bench، حدود نصف امتیاز Qwen رو میگیره
- نسخهی GGUF ۴ بیتی این مدل رو RTX Pro 6000 بیش از ۴۰۰ توکن در ثانیه اجرا میشه
- تو نوشتن متن بلند و تولید کد ضعیفه، ولی تو منطق، ریاضی و ابزار زدن قویه




