Breeze TTS 2 با وزنهای عمومی منتشر شد
خلاصهٔ کاملتر
توی حوزهٔ تبدیل متن به گفتار بلادرنگ، معمولاً مدلهای بسته و API-محور جلو بودن. حالا BreezeBlue میگه Breeze TTS 2 توی جدول Elo مربوط به Artificial Analysis بین مدلهای متنباز اول شده و از چند سیستم اختصاصی هم جلو زده، در حالی که وزنها و کد اجراش هر دو قابل دانلودن. مدل دوزبانهست و انگلیسی و چینی رو از یه مدل واحد تولید میکنه.
سرعتش از ترکیب معماری و یه سری بهینهسازی اختیاری سطح CUDA میاد. حالت پیشفرض همون اجرای معمولی PyTorch (اصطلاحاً eager) هست که امنتره و تقریباً هر جایی بالا میاد. برای سرعت واقعی، فلگ --fast-all روشن میشه و CUDA Graph رو روی همهٔ مراحل خط لوله (رمزگذار متن، prefill و decode بدنهٔ مدل، دیکودر عمق و کدک صوتی) فعال میکنه. با این مسیر و بعد از گرمشدن، عددهای اعلامشده به دست میان: زیر ۴۰ میلیثانیه تا اولین فریم صدا و ضریب بلادرنگ ۰.۳۲.
هزینهاش حافظه و زمان راهاندازیه. حالت eager حدود ۷.۷ گیگابایت VRAM میخواد که روی کارت ۱۲ گیگی راحت جا میشه، ولی مسیر سریع حدود ۱۴.۴ گیگ میبره و سازنده کارت ۲۴ گیگی رو پیشنهاد میده. چون گرمشدن اولیه هم وقت میبره، این مسیر برای سرویسهایی که مدام بالان منطقیه، نه برای اسکریپتهای تکباره.
از نظر کاربرد، مدل سه حالت جدا داره. کلون صدا با یه نمونهٔ صوتی تمیز بهعلاوهٔ متن دقیق همون نمونه کار میکنه و تن و ریتم گوینده رو بازتولید میکنه. طراحی صدا اصلاً نمونه نمیخواد و صدا رو از روی توصیف متنی میسازه (مقدار --cfg-scale بالاتر، مثلاً ۴، باعث میشه خروجی بیشتر به توصیف بچسبه). هدایت صدا هم هویت گوینده رو از نمونه میگیره ولی لحن و سرعت رو با دستور متنی عوض میکنه. رویدادهایی مثل (sigh) هم مستقیم داخل متن نوشته میشن.
نویسنده اشاره میکنه که BreezeBlue یه مجموعه بنچمارک اختصاصی هم برای طراحی صدا، هدایت صدا و سنجش تأخیر منتشر کرده، چون این قابلیتها برخلاف رونویسی یا ترجمه معیار عمومی جاافتاده ندارن. ولی چون انتشار زیر لایسنس پژوهشی و غیرتجاریه، مخاطب واقعیاش تیمهاییه که دنبال جایگزین متنبازن یا دارن نمونهٔ اولیه میسازن. کد Apache 2.0 هست، وزنها نه، و استفادهٔ تجاری اجازهٔ کتبی از Resonia (شرکت مادر) میخواد. شرایط استفادهٔ مسئولانه هم صریحه: رضایت صاحب صدا الزامیه و جعل هویت و کلون غیرمجاز ممنوعه.
نکات کلیدی:
- رتبهٔ اول بین مدلهای متنباز جدول Artificial Analysis، به ادعای BreezeBlue
- زیر ۴۰ میلیثانیه تا اولین صدا و ضریب بلادرنگ ۰.۳۲ روی H100 گرمشده با --fast-all
- مصرف حافظه: ۷.۷ گیگ در حالت eager (کارت ۱۲ گیگی) و ۱۴.۴ گیگ با مسیر سریع (کارت ۲۴ گیگی)
- سه حالت مجزا: کلون صدا، طراحی صدا از توصیف متنی، و هدایت لحن روی صدای کلونشده
- دوزبانه (انگلیسی و چینی) از یه مدل واحد؛ زبان دیگهای اعلام نشده
- کد Apache 2.0 ولی وزنها غیرتجاری؛ لایسنس تجاری از Resonia و کلون غیرمجاز صدا ممنوع




