مدل استدلالی Maple-Preview با وزنهای سهمقداری
خلاصهٔ کاملتر
دیپگرو مدل استدلالی متنبازی به اسم Maple-Preview منتشر کرده که با لایسنس MIT، همراه وزنها و کانفیگ و کد مدل، روی Hugging Face در دسترسه. تو این مقاله اومده که مدل با برچسب 20B-A1B عرضه شده: حدود ۲۰ میلیارد پارامتر کل، ولی فقط حدود ۱ میلیارد پارامتر به ازای هر توکن فعال میشن.
نکته اصلی معماری، وزنهای سهمقداریه. بیشتر مدلها وزنها رو اعشاری ۱۶ یا ۳۲ بیتی نگه میدارن یا بعداً به ۸ و ۴ بیت کوانتایز میکنن؛ اینجا هر وزن فقط یکی از سه مقدار منفییک، صفر یا مثبتیک رو میگیره و نتیجهش یه چکپوینت ۵.۳۱ گیگابایتیه. نویسنده توضیح میده سود واقعی این کار پهنایباند حافظهست: داده کمتری بین حافظه و واحد پردازش جابهجا میشه و همین معمولاً گلوگاه اصلی اجرای مدله، مخصوصاً روی سختافزار خانگی.
از نظر ساختار، مدل ۲۴ لایه و ۲۵۶ متخصص داره که برای هر توکن فقط ۸ تاشون فعال میشن. برای توجه هم از نسبت ۳ به ۱ بین اتنشن پنجرهای (با پنجره ۵۱۲ توکنی) و اتنشن سراسری استفاده میکنه؛ اتنشن پنجرهای هر توکن رو به یه بازه محلی محدود میکنه و لایههای سراسری وابستگیهای دوردست رو میگیرن. همین ترکیب اجازه میده پنجره متن ۱۳۱٬۰۷۲ توکنی پشتیبانی بشه بدون اینکه هزینه درجهدوم اتنشن تو همه لایهها پرداخت بشه.
عدد سرعت، یعنی ۲۱۸ توکن در ثانیه روی مک مینی M4، با یه رانتایم جداگانه مخصوص اپل سیلیکون به دست اومده، نه با پیادهسازی استاندارد Transformers که به Triton و FlashAttention و GPUهای CUDA وابستهست. نویسنده تأکید میکنه این تفاوت مهمه: مسیر اجرایی که این عدد رو میده لزوماً همونی نیست که یه توسعهدهنده بهصورت پیشفرض از Hugging Face اجرا میکنه. دیپگرو بر اساس اندازهگیریهای خودش مدعیه این مدل ۵ تا ۱۶ برابر مدلهای کممصرفی مثل Gemma 4، Qwen3.5 و gpt-oss سریعتره.
ارزیابی روی چهار بنچمارک LiveCodeBench v6، AIME 2026، HMMT 2026 و GPQA-Diamond انجام شده و به گفته کارت مدل، Maple-Preview مرز پارتوی حافظه-به-کارایی و سرعت-به-کارایی رو جابهجا کرده. نویسنده تأکید میکنه «بهترین در وزن خودش» یعنی جلوتر از مدلهای هماندازه و همهزینه، نه بهتر از بزرگترین مدلهای مرزی. خود دیپگرو هم صریح گفته این یه نسخه پیشنمایشه که پستترینینگ خیلی کمی برای کارهای ایجنتیک دیده، پس ابزارزنی و اجرای چندمرحلهای کار هنوز جای کار داره.
نکات کلیدی:
- مدل MoE با ۲۰ میلیارد پارامتر کل و حدود ۱ میلیارد پارامتر فعال به ازای هر توکن
- وزنهای سهمقداری حجم چکپوینت رو به ۵.۳۱ گیگابایت رسونده
- ۲۴ لایه، ۲۵۶ متخصص با ۸ متخصص فعال، و پنجره متن ۱۳۱٬۰۷۲ توکنی
- ۲۱۸ توکن در ثانیه روی مک مینی M4، ولی با رانتایم اختصاصی اپل سیلیکون
- منتشرشده با لایسنس MIT؛ برای استدلال قویه، برای کارهای ایجنتیک هنوز نه




