1

شرکت متا از نخستین مدل صوتی بلادرنگ خود با نام Muse Voice Transcribe رونمایی کرده که برای تبدیل گفتار به متن طراحی شده و به گفته متا، می‌تواند گفت‌وگوی هم‌زمان بیش از ۲۰ گوینده را پردازش کند و در یک مکالمه، چند زبان را به‌صورت هم‌زمان تشخیص دهد. این مدل علاوه بر تشخیص گویندگان مختلف، قادر است هنگام تغییر زبان در میانه یک جمله نیز عملکرد خود را حفظ کند. به این پدیده که در آن گوینده در جریان یک مکالمه بین زبان‌های مختلف جابه‌جا می‌شود، Code-switching گفته می‌شود.

Muse Voice Transcribe می‌تواند چنین جملاتی را نیز به‌صورت متنی ثبت کند. به گفته مارک زاکربرگ، مدیرعامل متا، این مدل از سازوکاری برای تنظیم زمان پردازش استفاده می‌کند؛ به این معنا که هنگام مواجهه با واژه‌های دشوار، زمان بیشتری برای پردازش در نظر می‌گیرد و در مورد واژه‌های ساده سریع‌تر نتیجه را ثبت می‌کند. این رویکرد به گفته او می‌تواند دقت مدل را افزایش دهد. Muse Voice Transcribe برای شرایط واقعی و نه‌چندان ایده‌آل صوتی نیز آموزش داده شده است.

متا می‌گوید این مدل با داده‌های بیش از 70 زبان آموزش یافته و در زمان عرضه، عملکرد آن در 25 زبان اعتبارسنجی شده است. این مدل همچنین می‌تواند جلسات صوتی طولانی، حتی تا حدود یک ساعت، با حضور بیش از 20 گوینده را مدیریت کند. قابلیت تشخیص تفکیکی گویندگان (Speaker Diarization) نیز به مدل اجازه می‌دهد مشخص کند هر بخش از گفت‌وگو توسط کدام گوینده بیان شده است.

متا اعلام کرده است که Muse Voice Transcribe از امروز در حال عرضه است و از این فناوری در قابلیت دیکته صوتی اپلیکیشن مک متا نیز استفاده می‌شود. Muse Voice Transcribe جدیدترین محصول Meta Superintelligence Labs (MSL) و نخستین مدل صوتی بلادرنگ این آزمایشگاه محسوب می‌شود.