مایکروسافت مدل صوتی بلادرنگ خودش رو تست میکنه
خلاصهٔ کاملتر
طبق گزارشی که منتشر شده، مایکروسافت داره روی اولین مدل صوتی بلادرنگ بومی خودش کار میکنه؛ مدلی به اسم MAI Realtime که به شکل یه ورودی مخفی و early-access توی MAI Playground پیدا شده. تو این مقاله اومده که یه گروه کوچیک از شرکا همین حالا بهش دسترسی دارن و چیزی که پیداست به یه سیستم دوطرفه و full-duplex اشاره داره — یعنی همزمان گوش میده و حرف میزنه، بهجای اینکه نوبتی جواب بده.
فعلاً دوتا صدا در دسترسه، Victoria و Grant، که هر دو خیلی طبیعیتر از چیزی هستن که حالت صوتی Copilot الان میده. زبون رو میشه دستی ثابت کرد یا روی تشخیص خودکار گذاشت و مدل وسط مکالمه هم زبون عوض میکنه بدون اینکه رشتهٔ کلام از دستش در بره. نوبتگیری هم دو حالت داره: یه حالت Switchboard که روی یه endpointer به اسم MAI-Ears و توکنهای کنترلی درونخطی سواره، و یه حالت قطعی که تشخیص سکوت رو با یه endpointer معنایی مبتنی بر Whisper ترکیب میکنه.
تفاوت عملی این دو حالت تو استفادهٔ واقعی خیلی محسوس نیست، ولی وسط حرف پریدن تمیز مدیریت میشه و تأخیر پاسخ هم پایینه. این مدل آواز نمیخونه و صدای غیرگفتاری تولید نمیکنه، پس بیشتر یه سیستم مکالمهایه تا یه مولد صوت عمومی. یه پنل دیباگ هم هست که عدد تأخیر زنده، «فکرهای» مدل و مراحل پردازش رو نشون میده، و قراره با بازتر شدن دسترسی، اشتراکگذاری نمونه هم به کاربرهای playground اضافه بشه.
به گفتهٔ نویسنده این مدل یه خلأ آشکار رو پر میکنه؛ تا الان همهٔ مدلهای گفتاری MAI یکطرفه بودن — MAI-Voice-2 و نسخهٔ Flash برای تولید صدا و MAI-Transcribe-1.5 برای تشخیص گفتار — و لایهٔ speech-to-speech توی Voice Live API سرویس Azure Speech هنوز به GPT-Realtime تکیه میکنه.
یه مدل full-duplex داخلی این وابستگی رو برای تیم مصطفی سلیمان تموم میکنه؛ همون تیمی که تو Build 2026 هفت مدل داخلی عرضه کرد و کمکم داره اجزای OpenAI رو از Copilot و Teams و Bing بیرون میکشه. Microsoft Foundry مقصد احتمالی توسعهدهندههاست و بخش صوتی Copilot هم سطح مصرفکننده، هرچند هنوز برای هیچکدوم زمانبندیای اعلام نشده.
نکات کلیدی:
- MAI Realtime اولین مدل صوتی بلادرنگ و full-duplex بومی مایکروسافته
- دو صدای Victoria و Grant، با تثبیت دستی یا تشخیص خودکار زبون و تعویض زبون وسط مکالمه
- دو حالت نوبتگیری: Switchboard با MAI-Ears، و حالت قطعی با تشخیص سکوت و Whisper
- آواز و صدای غیرگفتاری تولید نمیکنه؛ فقط مکالمه
- با عرضهاش، وابستگی لایهٔ گفتار به گفتار Azure Speech به GPT-Realtime از بین میره




