مدلی که همزمان گوش میده و حرف میزنه
خلاصهٔ کاملتر
به گفتهٔ مقاله، Inclusion AI با همکاری دانشگاه Tsinghua یه مدل full-duplex (یعنی همزمان میتونه گوش بده و حرف بزنه، نه اینکه نوبتی) منتشر کرده. کل سیستم ۹ میلیارد پارامتره و از صفر آموزش ندیده؛ سه مدل باز رو به هم چسبوندن: MiniCPM 4.5 با ۱.۳۸ میلیارد پارامتر به عنوان ستون زبانی، SigLip 2 برای بینایی و Whisper medium برای صدا.
معماریش دو حلقه داره. حلقهٔ تعامل صدا و ویدیو و متن رو زنده میگیره و همون لحظه جواب میده، بدون اینکه لازم باشه اول میکروفون بسته بشه. حلقهٔ توانایی قراره کارهای طولانیتر مثل جستوجوی وب یا فراخوانی ابزار رو بفرسته پسزمینه و نتیجه رو بعداً وسط همون گفتوگو برگردونه. مشکل اینجاست که هارنس این حلقهٔ دوم تو مخزن عمومی نیست، پس جذابترین ادعای این انتشار اصلاً قابل تست نیست.
دو چکپوینت داده شده: یکی Omni که صدا و ویدیو رو با هم میگیره و یکی فقط صدا. نسخهٔ کامل موقع اجرا کمی بیشتر از ۲۶ گیگ VRAM میگیره. یعنی روی لپتاپ و کارتهای ۱۲ و ۱۶ گیگی بالا نمیاد و عملاً یه کارت حرفهای مثل ۴۰۹۰ یا A6000 میخواد.
تو تست زنده، مدل سلام و احوالپرسی و سؤال ساده رو جواب داد و برای درخواست آهنگ حتی یه سؤال روشنکننده پرسید. اما وقتی یه سؤال طولانی و عجیب دربارهٔ دعوای همسایه ازش پرسیدن، جوابش کلی بود و به جزئیات کاری نداشت. تو تست صوتی آفلاین هم اول چند کلمه چینی گفت و بعد با لهجه رفت سراغ انگلیسی. نویسنده میگه این رو مثل یه نمایش معماری ببینید، نه محصول آماده.
نکات کلیدی:
- سیستم ۹ میلیارد پارامتری از ترکیب MiniCPM 4.5، SigLip 2 و Whisper medium
- ستون زبانی فقط ۱.۳۸ میلیارد پارامتر داره
- اجرای نسخهٔ کامل کمی بیش از ۲۶ گیگ VRAM میخواد
- دو چکپوینت جدا: Omni برای صدا و ویدیو، و Audio-only برای فقط صدا
- هارنس حلقهٔ توانایی منتشر نشده، پس سپردن کار به پسزمینه تستشدنی نیست




