Sopro V2 Turbo؛ TTS سریع روی همون لپتاپ خودت
خلاصهٔ کاملتر
تیم Halo NeuroAI خانوادهٔ جدیدی از مدلهای تبدیل متن به گفتار به اسم Sopro V2 رو معرفی کرده و سریعترین عضوش یعنی sopro-v2-turbo رو متنباز کرده. این یه مدل ۱۲۰ میلیون پارامتری با قابلیت voice cloning هست، یعنی از روی یه نمونهٔ کوتاه صدا، همون صدا رو بازتولید میکنه. خروجی رو استریم میده، روی CPU لپتاپ یا حتی داخل مرورگر بالا میاد و انگلیسی، آلمانی، فرانسوی و پرتغالی اروپایی رو پشتیبانی میکنه.
عددهاش هم جدیه. روی CPU یه Apple M3 تولید آفلاین با RTF ۰٫۲۴ انجام میشه (RTF یعنی زمان تولید تقسیم بر طول صدای خروجی، پس هرچی کمتر بهتر) و توی حالت استریم حدود ۳۰۰ میلیثانیه طول میکشه تا اولین تکه صدا برسه. روی یه H100 همین اعداد به RTF ۰٫۰۷ و حدود ۲۰۰ میلیثانیه میرسن. راهاندازیش هم یه دستوره: uvx --from sopro soprotts serve یه دموی محلی بالا میاره و یه دموی ONNX هم هست که کلاً داخل مرورگر و بدون سرور اجرا میشه.
چرا پرتغالی اروپایی؟ نویسنده میگه Halo NeuroAI روی سختافزار و نرمافزاری کار میکنه که به آدمهایی با ALS یا آفازی بعد از سکته کمک میکنه دوباره صدای خودشون رو داشته باشن. سرویسهای آماده مثل OpenAI و ElevenLabs و Cartesia پرتغالی اروپایی رو درست ادا نمیکردن، چون دادهٔ آموزششون به پرتغالی برزیلی متمایله. راهحلهای دور زدنش هم تأخیر رو بالا میبرد؛ روی باکیفیتترین گزینهشون تولید یه جمله ۴ تا ۶ ثانیه طول میکشید که برای این کاربرد اصلاً جواب نمیده.
نسخهٔ V2 عملاً همهٔ اجزای V1 رو عوض کرده. جای توکنایزر ۱۲۸ هزارتایی Llama یه توکنایزر SentencePiece با ۸۱۹۲ توکن نشسته، چون فقط جدول embedding قبلی حدود ۴۹ میلیون پارامتر میخورد. مدل کانولوشنی هم جاشو به یه ترنسفورمر decoder با RoPE و RMSNorm و grouped-query attention داده، و هد آکوستیک از کدبوکهای گسسته به flow matching روی mel spectrogram سوییچ کرده. توکنایزر گفتار هم از انکودر Whisper large-v3 با یه گلوگاه FSQ ساخته شده و بعد به یه مدل ۲۰ میلیونی تقطیر شده.
آموزش چهار مرحله داشته: اول یه مدل معلم ۰٫۵ میلیاردی، بعد DPO روی جفتهای ترجیحی (نویسنده میگه GRPO مدل رو ناپایدار میکرد)، بعد تقطیر به همون مدل ۱۲۰ میلیونی، و آخرش reflow که گامهای حلکنندهٔ هد آکوستیک رو از ۳۲ به ۲ رسونده؛ یعنی ۱۶ برابر سریعتر بدون افت محسوس کیفیت. توی بنچمارک Seed-TTS test-en هم WER پایینتری از خود دادهٔ اصلی گرفته، اونم در حالی که رقباش ۳ تا ۱۴ برابر بزرگترن.
نکات کلیدی:
- sopro-v2-turbo یه مدل TTS ۱۲۰ میلیون پارامتریِ متنبازه که انگلیسی، آلمانی، فرانسوی و پرتغالی اروپایی رو پشتیبانی میکنه
- روی CPU مک M3: تولید آفلاین با RTF ۰٫۲۴ و حدود ۳۰۰ میلیثانیه تا اولین صدا در حالت استریم
- مرحلهٔ reflow گامهای هد آکوستیک رو از ۳۲ به ۲ کم کرده، ۱۶ برابر سریعتر
- واترمارک نداره و تیم عمداً اضافهش نکرده، چون توی یه پایپلاین متنباز حذفش راحته
- فرانتاند متنش مینیماله: بهتره عددها و علامتها به حروف نوشته شن، و متن چندزبانه هنوز نقطهضعفه
- کد آموزش فعلاً منتشر نمیشه؛ محاسبات پروژه رو FCCN-FCT و مرکز ابرمحاسبات بارسلونا تأمین کردن




