StepAudio 3 Gen؛ یه مدل واحد برای ساخت هر نوع صدا با هوش مصنوعی
خلاصهٔ کاملتر
یه تیم تحقیقاتی مقالهای دربارهٔ مدل هوش مصنوعی StepAudio 3 Gen منتشر کرده؛ یه مدل صوتی همهکاره که با یه معماری واحد میتونه صدای گفتار بسازه (TTS، یعنی تبدیل متن به گفتار بدون نیاز به نمونه صدای از قبل ضبطشده)، صدای دلخواه طراحی کنه، افکت صوتی و حتی موزیک بسازه. نکتهٔ متفاوتش اینه که برخلاف اکثر مدلهای صوتی جدید که بر پایهٔ دیفیوژن (یه روش تولید تدریجی و پیوستهٔ سیگنال) کار میکنن، این مدل صدا رو به شکل توکنهای گسسته تولید میکنه، شبیه به کاری که مدلهای زبانی با متن انجام میدن.
موتور اصلیش یه رمزگذار به اسم StepAudio Tokenizer هست که صدا رو با نرخ ۱۲.۵ هرتز به یه فضای کد ۱۶ در ۲۰۴۸ تبدیل میکنه (به روش RVQ یا کوانتیزاسیون برداری باقیمانده، یعنی صدا لایهبهلایه به کدهای عددی فشرده میشه). هر لایه از این کدها همزمان اطلاعات معنایی (چی گفته شده) و اطلاعات آکوستیکی (چطور گفته شده) رو نگه میداره. برای تولید صدا، بخش اصلی مدل اولین لایهٔ کد رو به روش اتورگرسیو پیشبینی میکنه و یه ترنسفورمر سبکتر بقیهٔ پونزده لایه رو کامل میکنه.
به گفتهٔ نویسندهها، سه اصل کلیدی تو طراحی این مدل رعایت شده: پیشآموزش تدریجی و آگاه از تداخل (که توانایی صوتی رو اضافه میکنه بدون اینکه مدل زبانی توانایی متنیش رو از دست بده)، یه ماژول adapter برای ترکیب کدهای چندلایه، و مدلسازی اتورگرسیو گسسته روی یه بازنمایی مشترک برای همهٔ انواع صدا. با این ترکیب و آموزش چندمرحلهای، مدل تو تستهای TTS و طراحی صدا به نتایج همردهٔ بهترین مدلهای موجود رسیده و در ساخت گفتار، صدای آوازی، افکت و موزیک هم توانایی خوبی از خودش نشون داده.
نکات کلیدی:
- StepAudio 3 Gen یه مدل واحد برای TTS، طراحی صدا، افکت و موزیکه
- برخلاف مدلهای دیفیوژنی، صدا رو به شکل توکن گسسته و اتورگرسیو تولید میکنه
- رمزگذارش صدا رو با نرخ ۱۲.۵ هرتز به فضای کد ۱۶ در ۲۰۴۸ تبدیل میکنه
- تو تستهای TTS و طراحی صدا به نتایج همردهٔ بهترین مدلهای موجود رسیده




