Qwen 3.6 27B؛ نقطهٔ شیرین توسعهٔ لوکال
خلاصهٔ کاملتر
نویسنده میگه تا حالا از مدلهای لوکال ناامید بوده، ولی Qwen 3.6 نظرش رو عوض کرده: به گفتهٔ خودش اولین مدل محلیه که واقعاً بهعنوان یه هوش عمومی معنا میده. این مدل دو نسخه داره؛ یه نسخهٔ mixture-of-experts به اسم Qwen 3.6 35B A3B و یه نسخهٔ چگال Qwen 3.6 27B که کندتره ولی قویتر — و همون ۲۷Bه که نویسنده توصیهاش میکنه.
برای تست، ازش خواسته یه شعر ۸ خطی دربارهٔ رقص زوک و فیزیک کوانتوم بنویسه و میگه روند فکر کردن مدل هم از نظر مفاهیم کوانتومی و هم قافیهها منطقی بوده. تست جدیتر تو OpenCode بوده: ساختن یه مینروب ششضلعی با pnpm. کار از همون اولین پرامپت جواب داده، اونم با یه پکیج درستوحسابی Node. جالب اینکه نسخهٔ ۳۵B A3B سریعتر بوده ولی دستور ساخت پکیج رو نادیده گرفته و همهچیز رو تو یه index.html ریخته.
برای اجرا، نویسنده llama.cpp رو پیشنهاد میکنه و صریحاً میگه به Ollama نیازی نیست (و به دلایل اخلاقی توصیهاش هم نمیکنه). اول باید از Hugging Face یه کوانتیزیشن مناسب برداری — مثلاً نسخههای unsloth یا bartowski. مدلهای پیشفرض معمولاً با دقت BF16 میان و کوانتیزیشن ۸ بیتی نصف فضا رو آزاد میکنه بدون اینکه عملاً کیفیت افت کنه.
راهاندازیش هم همینقدر کوتاهه:
llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
--spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080اینجا -ngl 999 همهٔ لایهها رو میده به GPU، -fa on فلشاتنشن رو روشن میکنه، -c 65536 کانتکست رو روی ۶۴ هزار توکن میذاره (با اینکه کانتکست بومی مدل ۲۵۶ هزار توکنه) و draft-mtp از پیشبینی چندتوکنی برای سرعت بیشتر استفاده میکنه. بعدش میتونی هم مستقیم تو مرورگر باهاش چت کنی، هم دقیقاً همین سرور رو بهعنوان provider به OpenCode وصل کنی و باهاش کد بزنی.
سراغ اعداد که بریم: روی مکبوک Max M5 با ۱۲۸ گیگ رم، نسخهٔ ۲۷B با llama.cpp حدود ۱۸ توکن بر ثانیه میده و با فعال کردن MTP به ۳۲ توکن بر ثانیه میرسه. نسخهٔ ۳۵B A3B تا ۱۰۵ توکن بر ثانیه هم میره (یعنی حدود سه برابر سریعتر)، ولی نویسنده میگه ترجیح میده یکسوم کد تولید کنه اما با کیفیت بالاتر. نکتهٔ فنی جالب اینکه llama.cpp از MLX — که مخصوص Apple Siliconه — سریعتر درومده و ۹۵ درصد GPU رو مشغول نگه داشته.
از نظر حافظه، هر دو نسخه زیر ۴۸ گیگ رم مشترک اپل جا میشن و کوانتیزیشن ۴ بیتی زیر ۱۸ گیگ میره، یعنی روی دستگاه ۳۲ گیگی هم اجرا میشه. روی کارتهای Nvidia باید تهاجمیتر کوانتیزه کنی ولی سرعت بالاتره؛ یه کاربر Hacker News گزارش داده روی ۵۰۹۰ با Q6_K به ۵۰ توکن بر ثانیه تو کانتکست ۱۲۳ هزارتایی رسیده.
تو بنچمارک Artificial Analysis، امتیاز Qwen 3.6 27B برابر ۳۷ه — تقریباً همترازِ مدلهای مرزیِ اواسط ۲۰۲۵ مثل GPT-5 و Claude Sonnet 4.5 — در حالی که Gemma 4 31B روی ۲۹ و نسخهٔ ۳۵B A3B روی ۳۲ وایمیسن. DeepSeek V4 Flash با ۴۰ بالاتره، ولی نویسنده یادآوری میکنه که اون با کوانتیزیشن خیلی تهاجمیتر (۲ تا ۴ بیت) و ۱۰۳ گیگ رم اجرا شده.
جمعبندی نویسنده اینه که داریم وارد دورهای میشیم که اجرای مدل شخصی عملی شده. استدلالش هم فقط سرعت نیست: مدل لوکال رو میشه فاینتیون کرد، ازت گرفته نمیشه (به تعطیل شدن Claude Fable 5 اشاره میکنه)، برای دادهٔ حساس و پروژهٔ آفلاین مناسبه، و مدلهای مرزی فعلی هم با سوبسید سنگین دارن سرویس میدن. به باور اون، مدلهای آینده احتمالاً دانش رو از هوش خام جدا میکنن و بخش زیادی از دانش رو به فراخوانی ابزار میسپرن.
نکات کلیدی:
- Qwen 3.6 دو نسخه داره: MoE با ۳۵B (سریعتر) و چگال ۲۷B (کندتر ولی باکیفیتتر).
- با llama.cpp و کوانتیزیشن Q8 + MTP، نسخهٔ ۲۷B روی مکبوک M5 به ۳۲ توکن بر ثانیه میرسه.
- llama.cpp از MLX سریعتر بوده و ۹۵ درصد GPU رو استفاده کرده.
- امتیاز ۳۷ تو Artificial Analysis؛ تقریباً همترازِ مدلهای مرزیِ اواسط ۲۰۲۵.
- هر دو نسخه زیر ۴۸ گیگ رم جا میشن؛ با کوانتیزیشن ۴ بیتی حتی روی دستگاه ۳۲ گیگی.
- مزیت اصلی مدل لوکال از نگاه نویسنده: کنترل، حریم خصوصی و اینکه یهشب بیدار نمیشی ببینی مدل رو برداشتن.




