Qwen 3.8 27B عالیه، ولی وسواس فکری داره
خلاصهٔ کاملتر
جمعهی گذشته Qwen 3.8 27B منتشر شد: یه مدل ۲۷ میلیارد پارامتری با لایسنس Apache 2 از آزمایشگاه Qwen علیبابا که قابلیت بینایی هم داره. سایمون ویلیسون میگه ۲۷ میلیارد اندازهی خوبی برای اجرا روی یه لپتاپ نسبتاً قویه، و مدل رو با بیلد کوانتایزشدهی ۱۷ گیگابایتی Q4_K_M توی LM Studio هم روی مکبوک پرو M5 Max با ۱۲۸ گیگ رم و هم روی NVIDIA DGX Spark تست کرده. بنچمارکهای خود Qwen حتی از مدل بستهوزن Qwen 3.7-Plus هم جلو زدن.
بزرگترین ایراد به گفتهی او پیشفرضشه: پارامتر reasoning_effort — یعنی اینکه مدل قبل از جواب دادن چقدر فکر کنه — روی xhigh تنظیم شده. نتیجه اینکه سقف پیشفرض ۸۱۹۲ توکنی کانتکست فوراً پر میشد و مجبور شد کانتکست رو روی حداکثر ۲۶۲۱۴۴ بذاره. اولین تست، کشیدن SVG یه پلیکان سوار دوچرخه، ۲۱ دقیقه طول کشید و ۲۲٬۲۷۶ توکن استدلال مصرف کرد تا ۳٬۲۲۳ توکن خروجی بده؛ همون پرامپت با استدلال خاموش دو دقیقه بیشتر طول نکشید. توصیهی صریحش اینه که این پیشفرض رو نادیده بگیرید و از low شروع کنید.
از اون طرف مدل توی کارهای دیداری خوب عمل میکنه: وقتی ازش خواسته شده جعبههای محصورکنندهی پلیکانهای یه عکس رو به شکل JSON و در مقیاس ۰ تا ۱۰۰۰ برگردونه، مختصاتها دقیق درومدن. توی نقش موتور یه عامل کدنویسی هم جواب داده؛ ویلیسون با Pi و مدلی که روی Spark بالا اومده بود سؤال «auth چطور کار میکنه؟» رو توی مخزن datasette پرسیده و جواب محکمی گرفته، و بعد هم ازش خواسته یه اسکریپت پایتون برای تبدیل ترنسکریپتهای JSONL به Markdown بنویسه که نوشت و تست کرد.
تنها گیر جدی سرعته: حدود ۱۵ تا ۳۰ توکن در ثانیه، در حالی که مدلهای میزبانیشده خیلی جلوترن (مثلاً ۷۴ و ۱۸۴ توکن در ثانیه طبق Artificial Analysis). یه راهحل توی خود مدل هست: Multi-Token Prediction یا MTP، یعنی یه مکانیزم ارزونتر چند توکن جلوتر رو حدس میزنه و مدل اصلی فقط سریع درستی حدسها رو تأیید میکنه. ویلیسون به پیشنهاد Georgi Gerganov، سازندهی llama.cpp، اینطوری اجراش کرده:
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--reasoning-preserveطبق بنچمارکی که گرفته، همین حالت حدود ۷۲ درصد از GGUF پیشفرض LM Studio جلو زده. جمعبندی نویسنده اینه که یه فایل ۱۷ گیگابایتی حالا کانتکست بلند، tool calling قابلاتکا، بینایی و تولید کد رو با هم داره و روی سختافزار خونگی اجرا میشه — تنها چیزی که نمیذاره بشه ابزار هر روز، کندیشه. علتش هم اینه که مدلهای dense (غیر MoE) به پهنای باند حافظهی زیادی نیاز دارن و هیچکدوم از این دو دستگاه توی اون قوی نیستن.
نکات کلیدی:
- Qwen 3.8 27B یه مدل ۲۷ میلیارد پارامتری با لایسنس Apache 2 و قابلیت بیناییه که بیلد کوانتایزشدهی Q4_K_M ـش فقط ۱۷ گیگابایته.
- پیشفرض reasoning_effort روی xhigh ـه؛ یه SVG پلیکان ۲۱ دقیقه و ۲۲٬۲۷۶ توکن استدلال برد، در حالی که با استدلال خاموش حدود ۱۳۷ ثانیه طول کشید.
- کانتکست پیشفرض ۸۱۹۲ توکن برای این مدل کم میآد؛ حداکثر کانتکست ۲۶۲۱۴۴ توکنه.
- سرعت روی مکبوک M5 Max و DGX Spark حدود ۱۵ تا ۳۰ توکن در ثانیهست.
- اجرا با --spec-type draft-mtp روی llama.cpp حدود ۷۲ درصد سریعتر از GGUF پیشفرض LM Studio بود.




