Qwen3.8-27B: بهترین انتخاب پیشفرض برای RTX 4090
خلاصهٔ کاملتر
تو این مقاله، سایت Kingy.ai سه مدل همرده رو روی یه RTX 4090 با ۲۴ گیگ VRAM تست کرده: Qwen3.8-27B، Qwen3.6-27B و Gemma 4 31B-it. همه با فایل Q4_K_M و رانتایم llama.cpp اجرا شدن. جمعبندی نویسنده اینه که برای بیشتر آدمهایی که یه کارت ۲۴ گیگی رو برای کار جدی لوکال میخرن، Qwen3.8-27B انتخاب پیشفرض بهتریه، چون توی سرعت با Qwen3.6 مساویه ولی توی کیفیت خیلی جلو زده.
روی ۱۲ تسک کدنویسی تو محیط پایتون، Qwen3.8 هر ۱۲ تا رو با اولین seed پاس کرد و درمجموع ۳۵ از ۳۶ ران seed رو برد. Qwen3.6 و Gemma هرکدوم فقط ۱۶ از ۳۶ رو تحویل دادن. توی ۴۰ کیس استدلال با سه seed، Qwen3.8 عدد ۱۱۷ از ۱۲۰ رو زد، Gemma ۱۰۴ از ۱۲۰، ولی Qwen3.6 فقط ۲۸ از ۱۲۰، چون بیشتر مواقع بودجهٔ ۷۶۸ توکن رو تموم میکرد بدون اینکه جواب نهایی رو تحویل بده.
توی دیکود سریال، Qwen3.8 و Qwen3.6 روی حدود ۴۹ توکن در ثانیه گره خوردن و Gemma حدود ۸.۳٪ کندتر بود. تو ۳۲K کانتکست هر دو Qwen حدود ۶.۲۳ گیگ VRAM آزاد داشتن ولی Gemma فقط ۲.۶۰ گیگ. تو ۶۴K هم Gemma با کش F16 دچار CUDA OOM شد و فقط وقتی کش K/V رو به Q8_0 تغییر دادن، سه دور موفق رو با ۲.۵۵ گیگ آزاد رد کرد.
Gemma دو جا برندهست: فراخوان ابزار ساختاریافته (۹۰ از ۹۰ تکمرحلهای و ۳۰ از ۳۰ چندمرحلهای) و بینایی روی مجموعهٔ کوچیک تست (۱۹ از ۲۰ در برابر ۱۸ و ۱۷). ولی همین Gemma تو لوپ agent کدنویسی نتیجهٔ ضعیفتری داشت و ۱۰ فراخوان نامعتبر تولید کرد. نویسنده میگه اگه یه راوتر ابزار میخواین Gemma بهتره، ولی برای عامل کدنویسی همچنان Qwen3.8 انتخاب امنتره.
از Qwen3.6 به Qwen3.8 مهاجرت کنین یا نه؟ به گفتهٔ نویسنده برای عامل کد، استدلال و پرسش روی سند بله ارزش داره، چون Qwen3.8 نه سرعت رو قربانی میکنه نه حافظه، و اندازهٔ فایلش فقط ۰.۲۷ گیگ بزرگتره. برای یه سرویس کپیادیت پایدار شاید نیاز به تعویض نباشه. باید هم حواستون باشه قالب چتها فرق داره و باید تست رگرسیون خودتون رو دوباره بزنین.
نکات کلیدی:
- Qwen3.8-27B: 12/12 پاس کد، 39/40 استدلال، 23/24 پرسش روی سند
- سرعت دیکود Qwen3.8 و Qwen3.6 مساوی: حدود 49 tok/s
- Gemma 4 31B-it: 90/90 فراخوان ابزار تکمرحلهای، 19/20 بینایی
- Gemma تو 64K فقط با کش Q8_0 K/V جا میشه
- بالاترین کانتکست پایدار تستشده 64K بود، نه 262K اعلامشده




