Hy4 preview؛ غول متنباز جدید تنسنت
خلاصهٔ کاملتر
تنسنت تازهترین مدل متنباز خانوادهٔ Hunyuan رو با اسم Hy4 preview بیرون داده، اون هم با لایسنس Apache 2.0 و وزنهای کامل روی Hugging Face، ModelScope، GitCode و CNB. ساختارش MoE هست، یعنی بهجای یه شبکهٔ یکپارچه دهها «متخصص» کوچیک داره و برای هر توکن فقط چندتاشون روشن میشن. نتیجهش اینه که مدل روی کاغذ ۷۷۰ میلیارد پارامتر داره، ولی هر توکن فقط ۴۹ میلیارد پارامترش رو درگیر میکنه.
تو مقاله اومده که بدنهٔ مدل ۷۸ لایهست: لایهٔ اول یه شبکهٔ معمولیه و ۷۷ لایهٔ بعدی هرکدوم ۲۵۶ متخصص مسیریابیشده بهعلاوهٔ ۱ متخصص مشترک دارن که برای هر توکن ۸ تاشون انتخاب میشن. مکانیزم توجهش Gated DSA هست، یه نسخهٔ sparse از attention که بهجای نگاه کردن به کل متن فقط ۲۰۴۸ توکن مهم رو میبینه، و با IndexCache همون ایندکسها بین لایهها دوباره استفاده میشن تا سربار کم بشه.
یه لایهٔ MTP هم داره؛ یه ماژول جدای ۱۰ میلیارد پارامتری (۰.۷ میلیارد فعال) که چند توکن جلوتر رو حدس میزنه تا speculative decoding سرعت تولید متن رو بالا ببره. اندازهٔ hidden برابر ۶۱۴۴ و پنجرهٔ کانتکست ۱ میلیون توکنه، یعنی میشه کل یه codebase یا یه دسته سند بلند رو یهجا بهش داد.
مقایسهٔ اصلی تنسنت یه بنچمارک تستی معمولی نیست: ۱۶۳ کارشناس داخلی خروجی مدلها رو روی ۲۰۳ تسک واقعی مهندسی، بهصورت کور و بدون دونستن اسم مدل، نمره دادن. Hy4 preview میانگین ۲.۹۹ گرفته مقابل ۲.۹۲ برای GLM 5.3 و ۲.۹۴ برای Kimi K3، با نرخ برد ۴۶.۸ و ۵۱.۲ درصد. ولی تو هر دو مقایسه حدود ۴۰ درصد باخت هم داشته، پس جلو هست اما با فاصلهٔ کم.
برای اجرا حساب کار دستت باشه: دستورالعمل رسمی تنسنت برای vLLM از --tensor-parallel-size 8 استفاده میکنه، یعنی هشت GPU، اون هم با نسخهٔ کوانتایزشدهٔ FP8 نه نسخهٔ کامل. خود تنسنت هم شفاف گفته این یه preview زودهنگامه و دو ایراد داره: روی تسکهای سخت بیشتر از لازم فکر میکنه و جواب خودش رو زیادی بازبینی میکنه، که هر دو تأخیر و هزینه رو بالا میبره.
نکات کلیدی:
- ۷۷۰ میلیارد پارامتر کل و ۴۹ میلیارد پارامتر فعال به ازای هر توکن
- لایسنس Apache 2.0 با انتشار وزنها روی Hugging Face، ModelScope، GitCode و CNB
- پنجرهٔ کانتکست ۱ میلیون توکن بهعلاوهٔ لایهٔ MTP دهمیلیاردی برای speculative decoding
- میانگین ۲.۹۹ در برابر ۲.۹۲ (GLM 5.3) و ۲.۹۴ (Kimi K3) روی ۲۰۳ تسک مهندسی
- اجرای رسمی با vLLM یا SGLang روی هشت GPU و با چکپوینت FP8




