اجرای محلی Qwen3.8 روی سختافزار خودت؟ عملاً نه
خلاصهٔ کاملتر
نویسنده جواب کوتاه رو همون اول میده: اجرای Qwen3.8-2.4T-A95B روی سختافزار خودت از نظر فنی ممکنه، ولی عملاً نه — مگه اینکه منظورت از «سختافزار خودت» یه کلاستر چندنودی GPU باشه. این مدل یه mixture-of-experts با ۲.۴ تریلیون پارامتر کله که برای هر توکن ۹۵ میلیارد پارامترش فعال میشه، و برای سرو شدن با vLLM یا SGLang ساخته شده، نه برای لپتاپ یا یه کارت RTX.
ریشهٔ ماجرا معماریشه: ۵۱۲ متخصص که برای هر توکن ۱۰ متخصص مسیریابیشده بهعلاوهٔ ۱ متخصص مشترک فعال میشن، و ۹۲ لایه که توش Gated DeltaNet (توجه خطی) با لایههای Gated Attention کامل ترکیب شده. نتیجه یه شخصیت دوگانهست: هزینهٔ محاسبات هر توکن دنبال پارامترهای فعال میره و روی شتابدهندههای امروزی قابلمدیریته، ولی رد پای حافظه دنبال کل پارامترهاست، چون هر متخصص باید آمادهٔ مسیریابی یه جایی نشسته باشه.
حساب حافظه سادهست. با FP16/BF16 یعنی ۲ بایت برای هر پارامتر، فقط وزنها حدود ۴.۸ ترابایت حافظه میخوان، قبل از اینکه KV cache و فعالسازیها رو حساب کنی. حتی با کوانتیزاسیون تهاجمی INT4 هم عدد جایی بین ۶۰۰ گیگابایت تا حدود یک ترابایت میشینه. هیچ GPU تکی تو بازار اینقدر حافظه نداره و حتی یه سرور ۸ کارتی با کارتهای ۸۰ گیگابایتی (مجموعاً ۶۴۰ گیگ) بسته به کوانتیزاسیون و طول کانتکست یا خیلی تنگه یا اصلاً کافی نیست.
طول کانتکست هم مسئله رو بدتر میکنه. مدل بهصورت بومی ۲۶۲٬۱۴۴ توکن رو پشتیبانی میکنه و تا کمی بیشتر از یک میلیون توکن گسترش پیدا میکنه، ولی حافظهٔ KV cache با طول کانتکست و اندازهٔ بچ بالا میره. نسبت ۶۴ هد پرسوجو به ۴ هد کلید/مقدار با بعد هد ۲۵۶ یه ساختار grouped-query هست که کش رو نسبت به توجه چندهدی کامل کوچیکتر میکنه، ولی تو کانتکستهای میلیونی بازم سهم قابلتوجهی از بودجهٔ حافظه رو میگیره.
به نوشتهٔ مقاله، مسیر درست سرو کردن همون vLLM و SGLang هست (کارت مدل TokenSpeed رو هم اضافه میکنه)، چون هر دو موازیسازی تانسوری، خطلولهای و مخصوصاً موازیسازی متخصصها رو پشتیبانی میکنن؛ یعنی ۵۱۲ متخصص بین GPUها پخش میشن و هر دستگاه فقط بخشی از وزنها رو نگه میداره. اجرای مدل با Transformers خام روی یه ماشین مسیر واقعبینانهای نیست.
جمعبندی نویسنده اینه که برای بیشتر توسعهدهندهها خودمیزبانی نمیارزه و مسیر پیشفرض همون API ابری Qwen3.8-Max هست که ورودی تصویری، حالت بدون فکر، کانتکست پیشفرض یک میلیونی و ابزارهای داخلی هم داره. خودمیزبانی فقط برای سازمانهایی منطقیه که از قبل کلاستر چندنودی دارن، الزام اقامت داده یا حریم خصوصی سختگیرانه دارن، یا میخوان فاینتیون و مسیریابی سفارشی انجام بدن.
نکات کلیدی:
- ۲.۴ تریلیون پارامتر کل، ۹۵ میلیارد فعال برای هر توکن با ۵۱۲ متخصص
- وزنها با BF16 حدود ۴.۸ ترابایت و با INT4 حدود ۶۰۰ گیگ تا ۱ ترابایت حافظه میخوان
- کوانتیزاسیون مرتبهٔ بزرگی مسئله رو عوض نمیکنه، فقط کمی کوچیکش میکنه
- کانتکست بومی ۲۶۲٬۱۴۴ توکن و KV cache بار حافظهای مستقلی روی وزنها اضافه میکنه
- vLLM و SGLang مسیر رسمی سرو کردن هستن چون موازیسازی متخصص رو مدیریت میکنن
- برای بیشتر تیمها Qwen Cloud منطقیتره؛ خودمیزبانی فقط با کلاستر و الزام دادهای توجیه داره




