SpeechAnalyzer اپل، Whisper رو هم شکست داد
خلاصهٔ کاملتر
به گفتهٔ نویسنده — که تیم سازندهٔ اپ Inscribeه — موتور جدید SpeechAnalyzer اپل دقیقترین موتور تشخیص گفتار رویدستگاهیه که تست کردن. تو بنچمارک LibriSpeech، این موتور روی گفتار تمیز نرخ خطای واژه (WER) حدود ۲.۱۲٪ و روی بخش نویزی ۴.۵۶٪ داشته، در حالی که Whisper Small به ۳.۷۴٪ و ۷.۹۵٪ رسیده و API قدیمی اپل یعنی SFSpeechRecognizer با ۹.۰۲٪ و ۱۶.۲۵٪ آخر شده — همه روی یه Mac با تراشهٔ M2 Pro و کاملاً رویدستگاه.
چرا این تست رو کردن؟ چون اپل با iOS 26 و macOS 26، موتور SFSpeechRecognizer رو با API جدید SpeechAnalyzer و SpeechTranscriber عوض کرد ولی هیچ عدد دقتی منتشر نکرد و توسعهدهندهها تو حدس مونده بودن. جواب نویسنده روشنه: آره، مهاجرت بکن. API جدید نرخ خطا رو روی همون صدا ۳.۵ تا ۴ برابر کم میکنه و برخلاف موتور قدیمی، خروجی نقطهگذاریشده و با حروف بزرگوکوچک درست میده.
نتیجهٔ غافلگیرکنندهتر اینه که موتور جدید اپل حتی از Whisper Small — بزرگترین مدلی که این تیم عرضه میکنه — روی هر دو بخش با اختلاف خوبی جلو زد، اون هم با حدود یکسوم زمان محاسبه. البته Whisper دو مزیت واقعی نگه میداره: زبونهای خیلی بیشتری رو پوشش میده (SpeechTranscriber حدود ۳۰ زبان) و همهجا اجرا میشه، نه فقط روی پلتفرمهای اپل با نسخهٔ ۲۶. همهٔ پنج موتور هم خیلی سریعتر از زمان واقعی بودن؛ یعنی یه ساعت صدا تو حدود ۱.۵ تا ۵ دقیقه رویدستگاه رونویسی میشه.
نویسنده تأکید میکنه که به یه بنچمارک از شرکتی که خودش یکی از موتورها رو میفروشه باید با شک نگاه کرد، برای همین دو تا تضمین گذاشته. اول، ستون Whisper با اعداد منتشرشدهٔ خود OpenAI قابلبازتولیده و هر شیش اندازهگیری با یه اختلاف کوچیک و ثابت روی اونها نشستن — همون چیزی که بازتولید صادقانه شبیهشه. دوم، رونوشت خام همهٔ عبارتها برای دانلود عمومیه تا هرکی خواست خودش دوباره نمره بده. هر دو موتور از یه نرمالساز متن رد شدن و WER هم روی کل پیکره حساب شده نه میانگین عبارتها.
جالب اینکه خود بنچمارک یه باگ تو محصول تیم پیدا کرد: موقع ورودی فایل، صدا به SpeechAnalyzer داده میشد ولی تابع finalizeAndFinishThroughEndOfInput() صدا زده نمیشد و برای همین موتور هیچوقت نتیجهٔ نهایی رو تحویل نمیداد و ایمپورت تا ابد گیر میکرد؛ رفعش همون روز منتشر شد. نویسنده محدودیتها رو هم شفاف میگه: تست فقط انگلیسیه، صدا از نوع کتاب صوتی خواندهشدهست نه جلسهٔ واقعی، و روی یه دستگاه انجام شده — دقت باید بین تراشههای اپل سیلیکون منتقل بشه ولی سرعت فرق میکنه.
نکات کلیدی:
- SpeechAnalyzer اپل تو iOS/macOS 26 دقیقترین موتور رویدستگاهِ تستشده بود: WER حدود ۲.۱۲٪ روی گفتار تمیز.
- این موتور از Whisper Small هم دقیقتر بود و هم حدود سه برابر سریعتر.
- مهاجرت از SFSpeechRecognizer قدیمی بهصرفهست؛ نرخ خطا ۳.۵ تا ۴ برابر کم میشه.
- Whisper هنوز برای پوشش زبانهای بیشتر و اجرا روی پلتفرمهای غیراپل مزیت داره.
- تست فقط برای انگلیسی و روی گفتار خواندهشدهست، نه صدای جلسههای واقعی.




