H3 Max: ویدیوی ۵ ثانیهای در ۳ ثانیه
خلاصهٔ کاملتر
fal مدل ویدیویی جدیدش به اسم H3 Max رو منتشر کرده. تو این پست اومده که H3 Max یه نسخهٔ post-trained (یعنی مدل متنباز رو گرفتن و با دادهٔ جدید دوباره آموزش دادن) از MiniMax H3 هست که تیم تحقیقاتی fal روش کار کرده و تیم inference همون شرکت هم برای حداکثر سرعت بهینهش کرده. ادعای اصلی اینه که این مدل همزمان بالاترین کیفیت و بیشترین سرعت رو داره.
عددها اینشکلیان: ساخت یه ویدیوی ۵ ثانیهای زیر ۳ ثانیه طول میکشه، یعنی تقریباً ۳۵ برابر throughput سرویس رسمی MiniMax H3 و بهطور میانگین ۱۵ برابر سریعتر از هر مدلی با کیفیت قابل مقایسه. نتیجهٔ عملیش اینه که تولید ویدیو از زمان واقعی هم جلو میزنه و میشه تو کارهای تعاملی و حجمبالا ازش استفاده کرد.
برای سنجش کیفیت، fal بهجای معیارهای خودکار سراغ مقایسهٔ انسانی رفته. H3 Max رو مقابل ۱۲ مدل مطرح مثل Gemini Omni Flash، Wan 3.0، Seedance 2.5، Kling 3 و Veo 3.1 گذاشتن و ارزیابها تو سه محور جدا قضاوت کردن: ترجیح کلی، درک پرامپت و زیباییشناسی. نتایج با Bayesian Elo و بازهٔ اطمینان ۹۵٪ جمعبندی شده و H3 Max تو هر سه محور اول شده. بنچمارکهای مستقل Artificial Analysis و Design Arena هم همین رتبه رو تأیید کردن.
به گفتهٔ نویسنده این نتیجه از همزمان پیشبردن دو کار به دست اومده: post-training برای کیفیت، و طراحی موتور inference دور خود مدل برای سرعت. کل آموزش و سرویسدهی روی سیستمهای NVIDIA GB200 NVL72 انجام شده که به ازای هر تراشه تا ۲ برابر نسل قبلی کارایی میده. قاعدهشون هم این بوده که هر بهینهسازی فقط وقتی میمونه که مدل جایگاهش رو تو ارزیابی کیفیت داخلی از دست نده.
H3 Max از همین حالا روی fal در دسترسه، هم تو Playground، هم با fal Agent و هم از طریق API، تو دو حالت text-to-video و image-to-video. برای هفتهٔ اول هم با ۵۰٪ تخفیف عرضه میشه.
نکات کلیدی:
- ساخت ویدیوی ۵ ثانیهای در کمتر از ۳ ثانیه، حدود ۳۵ برابر throughput سرویس رسمی MiniMax H3
- رتبهٔ ۱ در ارزیابی انسانی مقابل ۱۲ مدل، در هر سه محور کیفیت کلی، درک پرامپت و زیباییشناسی
- آموزش و سرویسدهی کامل روی NVIDIA GB200 NVL72 با تا ۲ برابر کارایی هر تراشه نسبت به نسل قبل
- تأیید رتبهٔ ۱ در بنچمارکهای مستقل Artificial Analysis و Design Arena
- عرضه روی fal با ۵۰٪ تخفیف در هفتهٔ اول




