Hy4 preview تنسنت: ۷۷۰ میلیارد پارامتر روی سرور خودت
خلاصهٔ کاملتر
تنسنت مدل پرچمدار جدیدش، Hy4 preview، رو با لایسنس Apache 2.0 منتشر کرده: یه معماری MoE (یعنی مدلی که بهجای فعال کردن همهٔ وزنها، برای هر توکن فقط چندتا «متخصص» رو صدا میزنه) با ۷۷۰ میلیارد پارامتر کل و ۴۹ میلیارد پارامتر فعال به ازای هر توکن. از ۷۸ لایهش لایهٔ اول dense هست و ۷۷ لایهٔ بعدی MoE با ۲۵۶ متخصص مسیریابیشده بهعلاوهٔ یک متخصص مشترک.
سمت معماری، مدل از Gated DeepSeek Sparse Attention (Gated DSA) همراه با IndexCache برای استفادهٔ دوباره از ایندکسها بین لایهها استفاده میکنه، بهعلاوهٔ identity Hyper-Connections روی مسیر residual. یه لایهٔ MTP (پیشبینی چندتوکنی) هم داخلش هست، حدود ۱۰ میلیارد پارامتر با ۰٫۷ میلیارد فعال، که speculative decoding رو ممکن میکنه و تأخیر تولیدهای بلند رو پایین میاره. طول context هم روی ۱ میلیون توکن اعلام شده.
این مدل برای دسکتاپ نیست. هر دو دستور رسمی تنسنت با tensor parallelism هشتتایی نوشته شدن، یعنی یه نود ۸ کارتی خط پایهست، حتی با چکپوینت FP8. تنسنت دو ایمیج داکر آماده داده، vllm/vllm-openai:hy4-preview و lmsysorg/sglang:hy4-preview، که نسخهٔ SGLang هم x86 و هم Arm رو پوشش میده. اجرای vLLM این شکلیه:
docker run --gpus all -p 8000:8000 --ipc=host \
vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
--attention-backend FLASHMLA_SPARSE \
--tool-call-parser hy_v4چندتا از این فلگها اختیاری نیستن. --attention-backend FLASHMLA_SPARSE لازمه چون مدل بهجای attention متراکم از Gated DSA استفاده میکنه و کانفیگ عمومی vLLM الگوی sparse رو درست درنمیاره. پارسرهای hy_v4 هم فرمت خاص tool-calling و ردپای reasoning این مدل رو میفهمن که با قالبهای رایج مثل ChatML فرق داره. تو SGLang همین پارسرها رو میشه روی auto گذاشت و speculative decoding با الگوریتم NEXTN تنظیم میشه. خروجی هر دو مسیر یکیه: یه اندپوینت سازگار با OpenAI روی پورت 8000.
پیشنهاد خود تنسنت برای پارامترها temperature=0.9 و top_p=1.0 هست و مدل بهصورت پیشفرض تو حالت reasoning «high» کار میکنه، یعنی قبل از جواب کلی زنجیرهٔ فکری تولید میکنه. برای جوابهای سریعتر میشه با reasoning_effort: no_think این مرحله رو رد کرد.
تو ارزیابی کور داخلی تنسنت که ۱۶۳ متخصص روی ۲۰۳ تسک واقعی مهندسی نمره دادن، Hy4 preview با میانگین ۲٫۹۹ کمی جلوتر از GLM 5.3 با ۲٫۹۲ و Kimi K3 با ۲٫۹۴ ایستاده. خود تنسنت هم شفاف میگه این هنوز یه preview با ایرادهای شناختهشدهست: مدل روی تسکهای ساده بیش از اندازه فکر میکنه و کار خودش رو زیادی بازبینی میکنه، همون ایرادی که تو Hy3 preview هم دیده شده بود.
نکات کلیدی:
- ۷۷۰ میلیارد پارامتر کل، ۴۹ میلیارد فعال به ازای هر توکن، ۷۸ لایه و ۲۵۶ متخصص مسیریابیشده در هر لایهٔ MoE.
- لایسنس Apache 2.0، با دو نسخهٔ full-precision و FP8 روی Hugging Face، ModelScope، GitCode و CNB.
- خط پایهٔ سختافزار: نود ۸ کارتی، چون هر دو دستور رسمی روی tensor parallelism هشتتایی تنظیم شدن.
- لایهٔ MTP داخلی (حدود ۱۰ میلیارد پارامتر، ۰٫۷ میلیارد فعال) speculative decoding رو بدون کار اضافه فعال میکنه.
- طول context یک میلیون توکن، با Gated DSA و IndexCache برای مدیریت context طولانی.
- نمرهٔ ۲٫۹۹ در برابر ۲٫۹۲ برای GLM 5.3 و ۲٫۹۴ برای Kimi K3 در ارزیابی داخلی تنسنت با ۱۶۳ داور.




