Hy4 preview؛ غول ۷۷۰ میلیاردی تنسنت
خلاصهٔ کاملتر
تیم Hunyuan تنسنت مدل Hy4 preview رو به شکل open-weight و با لایسنس Apache 2.0 روی Hugging Face، ModelScope، GitCode و CNB منتشر کرده. این یه مدل Mixture-of-Experts هست، یعنی به جای اینکه کل شبکه برای هر توکن روشن بشه فقط بخش کوچیکی ازش فعال میشه: از ۷۷۰ میلیارد پارامتر کل، برای هر توکن فقط ۴۹ میلیارد پارامتر کار میکنه. پنجرهٔ context تا ۱ میلیون توکن میره، vocab مدل ۱۲۰٬۸۳۲ توکنه و یه نسخهٔ کوانتیزهٔ FP8 هم کنارش اومده.
بکبون ۷۸ لایه داره: لایهٔ اول dense معمولیه و ۷۷ لایهٔ بعدی MoE با ۲۵۶ اکسپرت مسیریابیشده و ۱ اکسپرت مشترک؛ هر توکن ۸ تای برتر و اکسپرت مشترک رو روشن میکنه. مکانیزم attention ش روی Gated DSA سواره، نسخهای گیتدار از sparse attention کار DeepSeek که با IndexCache ایندکسها رو بین لایهها دوباره استفاده میکنه. iHC هم مسیر residual رو به ۴ جریان موازی پهن کرده. یه لایهٔ MTP بومی (۱۰ میلیارد پارامتر که ۰.۷ میلیاردش فعاله) هم برای speculative decoding داخلشه.
برای مقایسه، تنسنت به جای بنچمارک خودکار یه ارزیابی کور انسانی گذاشته: ۱۶۳ متخصص داخلی روی ۲۰۳ تسک مهندسی خروجیها رو نمره دادن، بدون اینکه بدونن کدوم جواب مال کدوم مدله. Hy4 preview میانگین ۲.۹۹ گرفته در برابر ۲.۹۲ برای GLM 5.3 (نرخ برد ۴۶.۸٪) و ۲.۹۴ برای Kimi K3 (نرخ برد ۵۱.۲٪). یعنی یه برتری واقعی ولی باریک، نه اختلاف فاحش. مقاله میگه اعداد تفکیکی بنچمارکهای استاندارد هنوز منتشر نشده.
به گفتهٔ تنسنت دادهٔ آموزش با کمک تیمهای داخلی خودش ساخته شده و مدل روی چهار حوزه تنظیم شده: مهندسی نرمافزار، کار اداری و تولید سند، ساخت پروتوتایپ بازی و تحقیقات علمی. خود شرکت هم میگه این نسخه ناقصه: زنجیرههای استدلال بیش از حد طولانی و وارسی بیش از اندازهٔ جوابهای خودش، دو مشکلی که هم latency و هم هزینهٔ inference رو بالا میبرن. در عوض از نظر اجرا آمادهست: ایمیج رسمی داکر برای vLLM و SGLang، API سازگار با OpenAI، tool calling، پایپلاین finetune و ابزار AngelSlim برای کوانتیزهسازی.
نکات کلیدی:
- ۷۷۰ میلیارد پارامتر کل و ۴۹ میلیارد فعال به ازای هر توکن، با لایسنس Apache 2.0 و نسخهٔ FP8.
- ۷۸ لایه: یکی dense و ۷۷ تا MoE با ۲۵۶ اکسپرت مسیریابیشده و ۱ اکسپرت مشترک، top-8 برای هر توکن.
- context تا ۱ میلیون توکن، vocab ۱۲۰٬۸۳۲ توکنی و لایهٔ MTP ۱۰ میلیاردی برای speculative decoding.
- ارزیابی کور با ۱۶۳ متخصص روی ۲۰۳ تسک: میانگین ۲.۹۹ در برابر ۲.۹۲ (GLM 5.3) و ۲.۹۴ (Kimi K3).
- دو مشکل اعلامشدهٔ خود تنسنت: استدلال بیش از حد طولانی و وارسی بیش از اندازهٔ جوابها.




