Breeze TTS 2؛ تبدیل متن به گفتار زیر ۴۰ میلیثانیه
خلاصهٔ کاملتر
BreezeBlue مدل تبدیل متن به گفتارش رو با اسم Breeze TTS 2 بیرون داده و برخلاف بیشتر سرویسهای این حوزه، هم کد inference (یعنی همون کدی که مدل رو اجرا میکنه) و هم وزنهای مدل رو عمومی گذاشته. تو این مقاله اومده که مدل بین گزینههای متنباز توی جدول Artificial Analysis اول شده و حتی از بعضی سیستمهای بستهٔ تجاری هم جلو زده. خروجیاش دوزبانهست: انگلیسی و چینی، هر دو از یه چکپوینت واحد.
جذابیت اصلیاش تأخیره. روی یه کارت H100 که مسیر سریع روش گرم شده باشه، TTFA (یعنی فاصلهٔ بین فرستادن متن و رسیدن اولین تکه صدا) زیر ۴۰ میلیثانیهست و ضریب بلادرنگ به ۰.۳۲ میرسه؛ یعنی صدا حدود ۳.۱ برابر سریعتر از پخش واقعی ساخته میشه. برای یه دستیار صوتی زنده این عدد یعنی هنوز جا برای تأخیر شبکه باقی میمونه.
کنترل صدا سه حالت جدا داره. voice clone یه نمونهٔ صوتی بههمراه متن دقیق همون نمونه میگیره و تن، ریتم و حس گوینده رو روی متن جدید سوار میکنه. voice design اصلاً نمونهٔ صوتی نمیخواد و صدا رو از روی یه توصیف متنی، مثلاً «یه زن جوان با صدای گرم و لحن آروم»، از صفر میسازه؛ به گفتهٔ نویسنده بهتره --cfg-scale 4 بذاری تا مدل بیشتر به توصیف بچسبه.
حالت سوم، voice direction، بین اون دوتاست: هویت گوینده از نمونهٔ صوتی میاد ولی لحن و سرعت رو با یه دستور متنی هدایت میکنی، پس یه شخصیت ثابت میتونه صحنه به صحنه حس متفاوتی بگیره بدون اینکه لازم باشه برای هر حس یه نمونهٔ جدید ضبط کنی. تو هر سه حالت هم میشه رویدادهای صوتی مثل (laugh) یا (sigh) رو مستقیم وسط متن نوشت تا بهجای خوندهشدن، صدای واقعیشون پخش بشه.
سختافزارش عجیبغریب نیست ولی مفت هم نیست. حالت پیشفرض (eager) حدود ۷.۷ گیگابایت حافظهٔ GPU میگیره و روی کارت ۱۲ گیگی جا میشه. فلگ --fast-all که CUDA Graph رو روی پنج مرحلهٔ اجرا روشن میکنه مصرف رو میبره حدود ۱۴.۴ گیگ و کارت ۲۴ گیگی لازم داره، بهعلاوهٔ یه زمان گرمشدن اولیه. برای سرویس همیشهروشن بهصرفهست، برای تولید تکوتوک نه. برای تیمهای محصولی هم یه هشدار هست: مجوز کد و وزنها یکی نیست و «وزن باز» اینجا به معنی «آزاد برای محصول» نیست.
نکات کلیدی:
- TTFA زیر ۴۰ میلیثانیه و ضریب بلادرنگ ۰.۳۲ روی H100 گرمشده
- کارت ۱۲ گیگی برای حالت eager (مصرف ۷.۷ گیگ) و کارت ۲۴ گیگی برای --fast-all (مصرف ۱۴.۴ گیگ)
- سه حالت کنترل صدا: voice clone، voice design و voice direction
- رویدادهای صوتی مثل (laugh) و (sigh) با پرانتز در انگلیسی و کروشه در چینی داخل متن نوشته میشن
- کد اجرا Apache 2.0 هست ولی وزنها غیرتجاریان و کار تجاری اجازهٔ کتبی از RESONIA, INC. میخواد
- اجرا روی لینوکس با Python 3.10 به بالا و یه GPU انویدیا با CUDA




