1

مایکروسافت به‌طور پیوسته در حال گسترش مجموعه مدل‌های MAI توسعه‌یافته داخلی خود است که حوزه‌هایی از تولید تصویر و استدلال گرفته تا کدنویسی و گفتار را پوشش می‌دهند. این شرکت ماه گذشته MAI-Transcribe-2 را معرفی کرده که در آزمایش‌های مایکروسافت عملکرد بهتری از مدل‌های رقیب OpenAI و گوگل در زمینه رونویسی داشت و هزینه استفاده از آن تنها 0.10 دلار به‌ازای هر ساعت بود.

مایکروسافت اکنون مجموعه مدل‌های هوش مصنوعی گفتاری خود را با 3 مدل جدید گسترش داده است: MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash. این مدل‌های جدید برای همکاری با یکدیگر و ایجاد عامل‌های صوتی مکالمه‌ای با تأخیر کم طراحی شده‌اند. برخلاف MAI-Transcribe-2 که تنها فایل‌های صوتی ضبط‌شده را پردازش می‌کند، MAI-Transcribe-2-Streaming برای کاربردهای بلادرنگ طراحی شده است.

این مدل به‌جای آنکه تا پایان صحبت گوینده منتظر بماند و سپس متن را ارائه کند، کمی بیش از 100ms پس از دریافت صدا، تولید نتایج اولیه رونویسی را آغاز می‌کند. مدل با در دسترس قرار گرفتن زمینه بیشتر، این نتایج را به‌طور پیوسته بازبینی می‌کند و سپس متن نهایی را ثبت می‌کند. MAI-Transcribe-2-Streaming از 60 زبان به همراه تشخیص خودکار و پیوسته زبان پشتیبانی می‌کند. مایکروسافت ادعا می‌کند این مدل در حال حاضر از نظر دقت متن‌های اولیه و نهایی، رتبه اول Artificial Analysis را در اختیار دارد.

در آزمایش‌های داخلی این شرکت برای دیکته و زیرنویس، کلمات در متن رونویسی‌شده 2 برابر سریع‌تر از نزدیک‌ترین رقیب ظاهر شدند. قیمت این مدل تا پایان سال 2026، 0.54 دلار به‌ازای هر ساعت صوت است. این رقم به‌طور قابل‌توجهی بیشتر از قیمت تبلیغاتی 0.10 دلار به‌ازای هر ساعت برای MAI-Transcribe-2 غیرجریانی است. مایکروسافت امروز همچنین MAI-Voice-2.1، جدیدترین مدل چندزبانه تبدیل متن به گفتار خود، را معرفی کرد.

مایکروسافت اوایل امسال MAI-Voice-2 و نسخه سریع‌تر MAI-Voice-2-Flash را معرفی کرده بود که پیش‌تر در Dynamics 365 Contact Center و Azure Voice Live مورد استفاده قرار گرفته بودند. MAI-Voice-2.1 از 23 زبان در 26 منطقه پشتیبانی می‌کند. یک صدای تولیدشده می‌تواند بین زبان‌ها جابه‌جا شود و در عین حفظ هویت یک گوینده، لهجه بومی هر زبان را نیز به خود بگیرد. هزینه MAI-Voice-2.1 برابر با 22 دلار به‌ازای هر 1 میلیون نویسه است.

برای سناریوهای حساس به تأخیر و کاربردهای با حجم بالا، مایکروسافت مدل MAI-Voice-2.1-Flash را معرفی کرده است. این مدل می‌تواند 45 ثانیه صوت را با تأخیر انتهابه‌انتهای حدود 150ms تولید کند. مایکروسافت ادعا می‌کند این مدل استنتاج را 55 درصد سریع‌تر انجام می‌دهد و حدود 60 درصد ارزان‌تر از مدل‌های مشابه است. قیمت آن 15 دلار به‌ازای هر 1 میلیون نویسه است. هر دو مدل صوتی جدید همچنین از شبیه‌سازی صدا در زبان‌های تحت پشتیبانی خود، تنها با استفاده از چند ثانیه صدای مرجع، پشتیبانی می‌کنند.

هر 3 مدل جدید از طریق Microsoft Foundry، MAI Playground و Vercel در دسترس هستند. مدل‌های Voice همچنین از طریق OpenRouter ارائه می‌شوند و پشتیبانی از LiveKit نیز به‌زودی اضافه خواهد شد. این مدل‌ها را می‌توان از طریق Azure Voice Live نیز مورد استفاده قرار داد.