Muse Voice Transcribe؛ گفتار به متن لحظهای متا
خلاصهٔ کاملتر
متا از Muse Voice Transcribe رونمایی کرده، اولین مدل درک صوت لحظهای که تیم Meta Superintelligence Labs ساخته. تو معرفی رسمیش اومده که این مدل سه کارو با هم انجام میده: streaming ASR (یعنی همونطور که داری حرف میزنی متن رو مینویسه)، diarization (یعنی مشخص میکنه هر تیکه از حرفها مال کدوم گویندهست) و endpointing (یعنی میفهمه کی حرف گوینده تموم شده). به گفتهٔ متا، تا اول سپتامبر ۲۰۲۶ تو رتبهبندی Artificial Analysis برای گفتار به متن استریمی و بنچمارکهای عمومی diarization اول شده.
مدل از خانوادهٔ Muse Spark هست و autoregressive کار میکنه. صدا به تکههای ۸۰ میلیثانیهای (۱۲.۵ هرتز) شکسته میشه و هر تکه به یک soft token تبدیل میشه. سر هر تکه مدل تصمیم میگیره یا به گوش دادن ادامه بده یا یه توکن متن بیرون بده. وقتی صدا قطع میشه، یه توکن بهش میگه دیگه ورودیای نمونده و مدل بقیهٔ متن رو یکجا مینویسه.
چون خود مدل تصمیم میگیره چقدر گوش بده، یه بدهبستون بین دقت و تأخیر پیش میآد: هرچی بیشتر صبر کنه متن دقیقتره ولی دیرتر میرسه. راهحلشون adaptive delay بوده، یعنی تأخیر برای هر کلمه جدا و بر اساس سختی همون کلمه تنظیم میشه. اینو با یادگیری تقویتی آموزش دادن و پاداش نرخ خطای کلمه (WER) رو در پاداش تأخیر ضرب کردن، نه جمع.
برای دو تا کار دیگه هم فقط توکن مخصوص اضافه کردن، نه معماری جدید. برای جدا کردن گویندهها یه توکن شروع نوبت و یه برچسب گوینده گذاشتن، و برای endpointing دو تا توکن شروع و پایان گفتار. نمونهٔ دنبالهٔ توکنها برای تشخیص گوینده این شکلیه:
<|start_of_turn|>Hello, how are you doing?<|speaker_A|><|start_of_turn|> Did anything fun over the weekend?<|speaker_A|><|start_of_turn|> Hey I'm good!<|speaker_B|>یعنی برچسب گوینده آخر هر تیکه میآد و اگه یه نفر چند تیکه پشت هم حرف بزنه، برچسب همهشون یکیه. از نظر پوشش زبان، مدل روی بیش از ۷۰ زبان آموزش دیده که ۲۵ تاش کامل تست شده و متا فعلاً همون ۲۵ تا رو پیشنهاد میده. صدای بیشتر از یک ساعت و بالای ۲۰ گوینده رو هم بدون هیچ پردازش بعدی میگیره. الان از راه Meta Model API، اپ Meta AI روی مک و Muse Code در دسترسه.
نکات کلیدی:
- صدا تو تکههای ۸۰ میلیثانیهای (۱۲.۵ هرتز) پردازش میشه و هر تکه یک توکن میشه
- adaptive delay با یادگیری تقویتی و ضرب پاداش WER در پاداش تأخیر به دست اومده
- آموزش روی بیش از ۷۰ زبان، که ۲۵ زبانش کامل اعتبارسنجی شده
- صدای بالای یک ساعت و بیش از ۲۰ گوینده، بدون پردازش بعدی
- در دسترس از راه Meta Model API، اپ Meta AI روی مک و Muse Code




