Qwen 3.8 Flash Next روی چهار تا RTX 3090
خلاصهٔ کاملتر
نویسنده تجربهٔ اجرای Qwen 3.8 Flash Next رو روی سختافزار خانگی تعریف میکنه. این مدل تو Hugging Face با شناسهٔ Qwen/Qwen3.8-Flash-Next و پایپلاین image-text-to-text منتشر شده و وزنهای safetensorsش تو ۱۳۱ فایل پخش شده، یعنی نسخهٔ full-precisionش سنگینه. چیزی که کاربردیش میکنه کوانت INT4 با فرمت W4A16 از Vinnie AIه که برخلاف بعضی کوانتهای قبلی، پشتیبانی از ورودی تصویر رو هم نگه داشته.
به گفتهٔ نویسنده، صاحبهای 3090 مدتها بین سرعت و کیفیت گیر بودن: مدلهای dense کلاس 27B سریعان ولی روی کیفیت به سقف میخورن، و مدلهای بزرگتر معمولاً برای حلقههای ایجنتی (جایی که مدل باید ابزار صدا بزنه، منتظر بمونه، کانتکست رو دوباره بخونه و باز تولید کنه) خیلی کندن. این مدل وسط این دوتا میشینه و چون ویژن داره، ایجنت میتونه اسکرینشات و UI رندرشده رو هم ببینه، نه فقط متن.
حداقلهای سختافزاری کاملاً مشخصه: چهار تا RTX 3090 که روی هم ۹۶ گیگابایت VRAM میشن، و ۱۲۸ گیگابایت رم سیستم، چون موقع لود شدن مدل مصرف رم تا حدود ۱۰۰ گیگ بالا میره و اگه نزدیک سقف باشی کار خراب میشه. کنارش CUDA و NVCC نسخهٔ ۱۳.۰ به بالا (ترجیحاً ۱۳.۳+) لازمه. بیلد هم برای SM86 یعنی معماری Ampere کامپایل شده، کارتهای SM89 احتمالاً با تغییراتی کار میکنن ولی مسیر تستشده نیستن.
فلگهای vLLM اینجا بیشتر از همیشه مهمان، چون بعضیهاشون مرز بین یه ایجنت سالم و یه سرور کرشکنندهان. --max-model-len 131072 کانتکست کامل رو باز میکنه، --max-num-seqs 2 و --max-num-batched-tokens 2048 برای بار تکایجنتی تنظیم شدن نه سرویسدهی چندکاربره، --gpu-memory-utilization 0.96 مصرف VRAM رو تا نزدیک سقف میبره، و --cuda-graph-mode full با --enable-prefix-caching سرعت اجرای تکراری رو بالا میبرن. برای tool calling هم --enable-auto-tool-choice با پارسر qwen3xml لازمه.
یه نکتهٔ مهم اینه که async scheduling عمداً خاموش میمونه: روشن کردنش حدود ۱۰ توکن بر ثانیه اضافه میکنه ولی بدون یه سری پچ اضافه، سرور رو ناپایدار و آخرش کرش میکنه. در عمل پردازش پرامپت از حدود ۳۹۹ توکن به بالای ۵۰۰ میرسه و تولید حول ۵۹ توکن بر ثانیه میمونه. نویسنده میگه این کانفیگ یه پایهٔ پایدار و قابلتکراره، نه سقف تئوری، چون یه نفر با کوانتکردن بیشتر KV cache تا نزدیک ۲۰۰ توکن بر ثانیه هم رفته ولی پیچیدگی و بیثباتیش خیلی بیشتره.
نکات کلیدی:
- کوانت INT4 با فرمت W4A16 از Vinnie AI پشتیبانی از تصویر رو حفظ میکنه.
- چهار تا RTX 3090 یعنی ۹۶ گیگ VRAM، بهعلاوهٔ حداقل ۱۲۸ گیگ رم سیستم.
- کانتکست کامل ۱۳۱٬۰۷۲ توکن با vLLM سرو میشه.
- خروجی واقعی حدود ۵۵ تا ۶۱ توکن بر ثانیهست، تقریباً دو برابر llama.cpp روی همون سختافزار.
- async scheduling حدود ۱۰ توکن بر ثانیه اضافه میکنه ولی بدون پچ باعث کرش میشه.




