ارتقای بزرگ حالت صوتی ChatGPT با مدل Bidi 1
خلاصهٔ کاملتر
به گزارش TestingCatalog، اوپنایآی داره حالت صوتی ChatGPT رو برای بزرگترین ارتقای چند ماه اخیرش آماده میکنه. یه مدل صوتی نسلجدید به اسم Bidi 1 تو رابط وب ChatGPT پیدا شده که مخفف طراحی دوطرفه (bidirectional) هست؛ یعنی دستیار میتونه همزمان حرف بزنه، بشنوه و گوش بده. به گفتهٔ نویسنده، ارجاعها بهش قبل از یه انتشار احتمالی همین هفته ظاهر شده و به بخشی از کاربرها هم رسیده.
نویسنده میگه تو تستهای اولیه، فاصلهاش با حالت صوتی پیشرفتهٔ فعلی کاملاً مشخصه. Bidi 1 تو منوی انتخاب مدل کنار گزینههای استاندارد و پیشرفته قرار میگیره و وقتی انتخابش کنی حباب صوتی زرد میشه. وقتی مکث میکنی یا آرومتر حرف میزنی، تأییدهای کوتاه و طبیعی مثل یه «okay» میده، بدون اینکه بپره وسط حرفت.
یکی از قابلیتهاش اینه که وسط کار میتونه تسک عوض کنه؛ مثلاً ازش بخوای تا ده بشمره، وسطش بگی برعکس بشمر، سریع خودشو تطبیق میده. مهمتر از همه، به گفتهٔ نویسنده رشتهٔ کل مکالمه رو نگه میداره و مثل قبل زمینهٔ حرفهای قبلی رو گم نمیکنه — همون ضعفی که مدتها گریبان لایهٔ صوتی فعلی رو گرفته بود. دیگه وسط مکثهای طولانی هم نمیپره وسط.
رفتار خلاقانهٔ نسخهٔ قبلی هم حفظ شده؛ آواز خوندن و بیتباکس هم بلده، ولی برخوردش با کپیرایت سفتتر شده. آهنگهای معروف رو مستقیم رد میکنه، ولی هنوز حاضره یه قطعهٔ اورجینال به سبک یه هنرمند دلخواه بسازه.
نویسنده این حرکت رو تلاش اوپنایآی برای کمکردن فاصلهٔ بین مدلهای متنی قدرتمندش و لایهٔ صوتی قدیمیترش میدونه؛ انگار مکالمه رو یه مسیر اصلی ورود به ChatGPT میبینه. شرکت هنوز رسماً چیزی اعلام نکرده. احتمالاً انتشارش تدریجی و اختیاری روی وب و موبایل باشه و منطقهٔ اقتصادی اروپا شاید بیشتر منتظر بمونه. ظاهراً Codex هم چند هفته بعد ارتقای صوتی جدا خودشو میگیره و دسترسی API شاید دیرتر بیاد.
نکات کلیدی:
- Bidi 1 یه مدل صوتی دوطرفهست که همزمان حرف میزنه، میشنوه و گوش میده
- رشتهٔ کل مکالمه رو نگه میداره و وسط مکثهای طولانی نمیپره وسط حرف
- وسط کار میتونه تسک عوض کنه و تأییدهای کوتاه و طبیعی میده
- برخوردش با کپیرایت سفتتره: آهنگ معروف رو رد میکنه ولی قطعهٔ اورجینال میسازه
- هنوز رسماً اعلام نشده؛ انتشار تدریجی و اختیاری، احتمالاً با تأخیر تو اروپا




