شرکت متا از نخستین مدل صوتی بلادرنگ خود با نام Muse Voice Transcribe رونمایی کرده که برای تبدیل گفتار به متن طراحی شده و به گفته متا، میتواند گفتوگوی همزمان بیش از ۲۰ گوینده را پردازش کند و در یک مکالمه، چند زبان را بهصورت همزمان تشخیص دهد. این مدل علاوه بر تشخیص گویندگان مختلف، قادر است هنگام تغییر زبان در میانه یک جمله نیز عملکرد خود را حفظ کند. به این پدیده که در آن گوینده در جریان یک مکالمه بین زبانهای مختلف جابهجا میشود، Code-switching گفته میشود.
Muse Voice Transcribe میتواند چنین جملاتی را نیز بهصورت متنی ثبت کند. به گفته مارک زاکربرگ، مدیرعامل متا، این مدل از سازوکاری برای تنظیم زمان پردازش استفاده میکند؛ به این معنا که هنگام مواجهه با واژههای دشوار، زمان بیشتری برای پردازش در نظر میگیرد و در مورد واژههای ساده سریعتر نتیجه را ثبت میکند. این رویکرد به گفته او میتواند دقت مدل را افزایش دهد. Muse Voice Transcribe برای شرایط واقعی و نهچندان ایدهآل صوتی نیز آموزش داده شده است.
متا میگوید این مدل با دادههای بیش از 70 زبان آموزش یافته و در زمان عرضه، عملکرد آن در 25 زبان اعتبارسنجی شده است. این مدل همچنین میتواند جلسات صوتی طولانی، حتی تا حدود یک ساعت، با حضور بیش از 20 گوینده را مدیریت کند. قابلیت تشخیص تفکیکی گویندگان (Speaker Diarization) نیز به مدل اجازه میدهد مشخص کند هر بخش از گفتوگو توسط کدام گوینده بیان شده است.
متا اعلام کرده است که Muse Voice Transcribe از امروز در حال عرضه است و از این فناوری در قابلیت دیکته صوتی اپلیکیشن مک متا نیز استفاده میشود. Muse Voice Transcribe جدیدترین محصول Meta Superintelligence Labs (MSL) و نخستین مدل صوتی بلادرنگ این آزمایشگاه محسوب میشود.
هنوز نظری ثبت نشده
نظرات شما درباره «مدل جدید هوش مصنوعی متا میتواند...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر