MiniMax Music 3؛ ساخت آهنگ کامل روی سیستم خودت
خلاصهٔ کاملتر
MiniMaxAI مدل متنبهموزیک MiniMax Music 3 رو منتشر کرده؛ مدلی که از روی یه برگهٔ ترانه و یه توضیح متنی از صدایی که میخوای، آهنگ کامل با وکال میسازه. تو مقاله اومده که فرقش با ابزارهای لوپساز اینه که کل ساختار آهنگ — اینترو، ورس، پیشکورس، کورس، بریج، بخش سازی و اوترو — رو در نظر میگیره، نه چندتا کلیپ کوتاه. خروجی تا پنج دقیقهست، به شکل WAV استریوی ۱۶ بیتی با نرخ ۳۲ کیلوهرتز.
نصب لوکالش مسیر معمول Hugging Face رو میره: اول diffusers و torchaudio رو نصب میکنی، بعد ریپوی MiniMaxAI/MiniMax-Music3 رو میکشی پایین — که مدل زبانی، توکنایزر Qwen3-8B برای شرطیسازی موسیقی، یه VAE مبتنی بر flow matching، دیکودر عمق RVQ، وکودر و چکپوینت ترنسفورمر توشه. اسکریپت آمادهٔ scripts/end_to_end/minimax_ttm_test.py وزنها رو بار اول دانلود میکنه و یه دموی Gradio بالا میاره؛ محیط مجازی معمولی پایتون کافیه و conda لازم نیست.
دموی Gradio دو حالت داره. تو حالت ساده فقط یه توضیح متنی از سبک، تمپو، کلید و حالوهوا میدی — مثلاً «acoustic pop, C major, warm and building» — و خود مدل ترانه رو هم مینویسه. تو حالت Studio ترانهٔ خودت رو میدی و رابط، متن رو به بخشهای آهنگ میشکنه؛ فیلدهایی هم برای جنسیت و جنس صدای خواننده، سازبندی، یادداشت چیدمان هر بخش و عنوان آهنگ داره. تولید هر ترک هم آنی نیست و بسته به سختافزار چند دقیقه طول میکشه.
معماریش سلسلهمراتبیه و از دو مدل زبانی درهمتنیده ساخته شده: یه LLM سراسری ۸ میلیاردی اولین codebook از RVQ — یعنی همون روش لایهلایه کوانتیزهکردن صدا — رو فریمبهفریم پیشبینی میکنه و مسئول انسجام بلندمدت آهنگه، و یه LLM محلی حدوداً ۰.۶ میلیاردی جزئیات آکوستیک هر فریم رو پر میکنه. سنتز نهایی بهجای رمزگشایی صرفاً از توکنهای گسسته، حالتهای پنهان پیوستهٔ هر دو مدل رو ترکیب میکنه تا بافت ساز و وکال بیشتر حفظ بشه؛ یه VAE مبتنی بر flow matching هم که از مدل گفتار MiniMax اقتباس شده، لتنت نهایی رو به موج استریو تبدیل میکنه.
از نظر سختافزار، روی یه RTX 6000 با ۴۸ گیگ VRAM موقع تولید کمی بیشتر از ۲۷ گیگ مصرف شده، اون هم بدون batching یا بهینهسازی — پس کارتهای ۳۲ گیگی هم احتمالاً جواب میدن، هرچند حداقل رسمی جایی اعلام نشده. نویسنده میگه خروجی پاپ انگلیسی منسجم و با وکال قابلقبول درمیاد، ولی پرامپت سبک بالیوودی و کومبیا نتیجهای داده که اصلاً حالوهوای اون سبکها رو نداشته و حتی وکال کومبیا انگلیسی از آب دراومده. مدلکارت هم چندزبانهبودن رو تأیید نکرده، پس پیشنهادش اینه که برای سبکهای غیرانگلیسی اول چندتا نمونه بسازی.
نکات کلیدی:
- خروجی: WAV استریوی ۱۶ بیتی با نرخ ۳۲ کیلوهرتز، تا پنج دقیقه با ساختار کامل آهنگ.
- مصرف VRAM حدود ۲۷ گیگ روی RTX 6000؛ کارت ۳۲ گیگ نقطهٔ شروع منطقیه.
- معماری: LLM سراسری ۸ میلیاردی + LLM محلی ۰.۶ میلیاردی روی توکنایزر RVQ هشتلایه.
- حالت Studio: ترانهٔ خودت، تفکیک بخشها، جنس صدای خواننده و سازبندی قابل تنظیمه.
- کیفیت بیرون از انگلیسی ناپایداره؛ بالیوودی و کومبیا تو تست ضعیف بودن.




