h3؛ اجرای بومی MiniMax-H3 روی اپل سیلیکون
خلاصهٔ کاملتر
تو معرفی این پروژه اومده که هدفش اجرای بومی مدل ویدیوساز MiniMax-H3 روی اپل سیلیکونه؛ یعنی بهجای پشتهٔ پایتون، همهچیز مستقیم با C و Metal اجرا میشه. کار بهشکل برشهای عمودیِ قابلاجرا جلو رفته: اول متادیتای مدل و برابری بلوکهای Metal، بعد رمزگذاری پرامپت، بعد تولید ویدیو و صدا از متن، و آخر شرطیسازی با فریم اول و آخر. الان تولید ویدیو/صدا، لنگرهای فریم اول و آخر و مرجعهای ترتیبی Ref2VA سرتاسر کار میکنن.
چیزی که اجرای عملی رو ممکن کرده یه مشت گزینهٔ ریزه که هرکدوم رو جدا میشه تنظیم کرد: --steps تعداد پاسهای نویزبرداری، --reuse استفادهٔ دوباره از سرعت کل denoiser، --layers تعداد بلوکهای فعال ترنسفورمر، و --core-reuse که هستهٔ سنگین رو کمتر اجرا میکنه ولی پچ و هد وابسته به گام زمانی رو هر بار تازه نگه میداره. یه اجرای سریع چهارپاسه این شکلیه:
./h3 -d ./MiniMax-H3 -p "A red fox walks through fresh snow in a pine forest." \
--width 512 --height 512 --frames 22 \
--steps 4 --layers 50 --reuse 1 \
-o outputs/fox-four-step.mp4به گفتهٔ نویسنده همین اجرای چهارپاسه روی M5 Max حدود ۳.۵ ثانیه طول کشیده، در برابر ۲۶.۴ ثانیهٔ مرجع ۲۹ پاسی، با SSIM کل ویدیوی ۰.۵۵۶. گزینهٔ --token-reduction هم توکنهای افقی ویدیو رو بعد از بلوک سوم جفت میکنه و روی همون بنچمارک ۵۱۲ مربع، زمان نویزبرداری رو از ۳۹.۱۳ به ۲۸.۰۶ ثانیه آورده؛ چون ترکیببندی تصویر رو جابهجا میکنه، عمداً پیشفرض نیست.
برای مکهای کمحافظه --ssd-streaming جالبترین بخشه: بدون کوانتایز کردن و با همون چکپوینت BF16 اصلی، فقط دو بلوک DiT تو حافظه میمونه و بلوک بعدی همزمان با اجرای GPU از SSD خونده میشه. حجم تانسورهای DiT اینجوری از حدود ۳۶.۵ گیگ به ۲ گیگ رسیده و خروجی بایتبهبایت یکی درومده؛ در عوض یه فوروارد گرم ۵۰ بلوکی تو ۵۱۲ مربع ۸۴٪ کندتر میشه و تو ۸۶۴×۴۸۰ فقط ۲۶٪.
نکات کلیدی:
- اجرای بومی MiniMax-H3 با C و Metal روی اپل سیلیکون، بدون پشتهٔ پایتون
- تولید ویدیو و صدا از متن، لنگر فریم اول/آخر و مرجعهای ترتیبی Ref2VA
- چهار پاس نویزبرداری: حدود ۳.۵ ثانیه روی M5 Max در برابر ۲۶.۴ ثانیهٔ مرجع
- استریم از SSD حافظهٔ DiT رو از ۳۶.۵ گیگ به ۲ گیگ میرسونه، با خروجی یکسان
- عرض و ارتفاع باید مضرب ۳۲ باشن و خروجی ۲۴ فریم بر ثانیهست
- روی GPUهای M5 مسیر بومی BF16 با Metal 4 و TensorOps حدود ۲٪ سریعتره




