Xing4.0-29B-A4B؛ مدل MoE چینی که لوکال جواب میده
خلاصهٔ کاملتر
China Telecom مدل Xing4.0-29B-A4B رو با وزن باز منتشر کرده، ادامهٔ همون سری که قبلاً اسمش TeleChat بود. این یه مدل MoE ـه، یعنی بهجای اینکه کل شبکه برای هر توکن روشن بشه، فقط چندتا زیرشبکهٔ تخصصی صدا زده میشه. اینجا ۶۴ اکسپرت مسیریابیشده بهعلاوهٔ یک اکسپرت مشترک داریم و برای هر توکن ۴ تاشون فعال میشه. پس ۲۹ میلیارد پارامتر داری، ولی هزینهٔ محاسباتی هر توکن نزدیک یه مدل ۴ میلیاردیه.
تو این مقاله اومده که عددی که موقع انتخاب سختافزار باید نگاه کنی همون ۴ میلیارد فعاله، نه ۲۹ میلیارد کل. ولی یه قید مهم هم داره: هنوز باید کل ۲۹ میلیارد پارامتر یا نسخهٔ کوانتایزشدهاش یه جایی تو حافظه جا بشه، چه VRAM کارت گرافیک، چه حافظهٔ یکپارچه، چه رم سیستم. یعنی سرعت تولید توکن بالا میره و تأخیر کم میشه، ولی از بار حافظه کم نمیشه.
وزنها فرمت Hugging Face Transformers دارن، برای همین هر سه بکاند رسمی بدون تبدیل وزن باهاشون کار میکنن. vLLM نقطهٔ شروع معمولیه چون یه سرور سازگار با API اوپنایآی بالا میاره. SGLang بیشتر به درد کارهای ایجنتی و خروجی ساختاریافته و tool call میخوره. KTransformers هم مال وقتیه که VRAM کافی نداری: بخشی از اکسپرتها میره رو رم CPU و فقط مسیرهای پرترافیک رو GPU میمونه، با این هزینه که throughput پایینتر میاد.
به گفتهٔ جدول بنچمارک خود مدل، Xing4.0 تو Terminal-Bench 2.1 با ۵۷.۵ جلوتر از Gemma4-26B-A4B با ۳۰ و Qwen3.6-35B-A3B با ۵۱.۵ وایستاده و تو Claw-Eval به ۷۶.۵۵ و تو DeepresearchBII به ۶۰.۸ رسیده. در عوض تو SWE-bench Verified مدل Qwen با ۷۶ در برابر ۷۵ جلو میزنه و تو IFBench و AA.LCR هم Xing کمی عقبه. یعنی جای اصلیش کارهای ایجنتی و ترمینالیه، نه دستورپذیری خشک و خالی.
تنظیمات پیشنهادی خود مدل بسته به کار فرق میکنه: temperature ۱.۰ برای استدلال عمومی و ۰.۸ برای کدنویسی و کار ایجنتی، هر دو با top_p ۰.۹۵ و repetition_penalty ۱.۰۵. یه فلگ enable_thinking هم تو چتتمپلیت هست که رد استدلال مدل رو نشون میده؛ برای دیباگ رفتار ایجنت خوبه ولی توکن اضافه خرج میکنه. آموزش مدل هم کامل روی NPUهای Ascend 910C هواوی با MindSpore انجام شده، ولی برای اجرا اصلاً لازم نیست سختافزار هواوی داشته باشی.
نکات کلیدی:
- ۲۹ میلیارد پارامتر کل، حدود ۴ میلیارد فعال بهازای هر توکن، با ۶۴ اکسپرت مسیریابیشده و ۱ اکسپرت مشترک
- کانتکست بومی ۲۵۶ هزار توکن، با مسیر گسترش تا ۵۱۲ هزار
- سه بکاند رسمی: vLLM، SGLang و KTransformers، همه روی همون وزنهای Hugging Face
- Terminal-Bench 2.1: ۵۷.۵ در برابر ۵۱.۵ برای Qwen و ۳۰ برای Gemma؛ ولی SWE-bench Verified: ۷۵ در برابر ۷۶ برای Qwen
- تمریندیده روی Ascend 910C با MindSpore، ولی inference سختافزار هواوی نمیخواد
- فاینتیون با LLaMA-Factory و MindFormers پشتیبانی میشه




