مایکروسافت بهطور پیوسته در حال گسترش مجموعه مدلهای MAI توسعهیافته داخلی خود است که حوزههایی از تولید تصویر و استدلال گرفته تا کدنویسی و گفتار را پوشش میدهند. این شرکت ماه گذشته MAI-Transcribe-2 را معرفی کرده که در آزمایشهای مایکروسافت عملکرد بهتری از مدلهای رقیب OpenAI و گوگل در زمینه رونویسی داشت و هزینه استفاده از آن تنها 0.10 دلار بهازای هر ساعت بود.
مایکروسافت اکنون مجموعه مدلهای هوش مصنوعی گفتاری خود را با 3 مدل جدید گسترش داده است: MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash. این مدلهای جدید برای همکاری با یکدیگر و ایجاد عاملهای صوتی مکالمهای با تأخیر کم طراحی شدهاند. برخلاف MAI-Transcribe-2 که تنها فایلهای صوتی ضبطشده را پردازش میکند، MAI-Transcribe-2-Streaming برای کاربردهای بلادرنگ طراحی شده است.
این مدل بهجای آنکه تا پایان صحبت گوینده منتظر بماند و سپس متن را ارائه کند، کمی بیش از 100ms پس از دریافت صدا، تولید نتایج اولیه رونویسی را آغاز میکند. مدل با در دسترس قرار گرفتن زمینه بیشتر، این نتایج را بهطور پیوسته بازبینی میکند و سپس متن نهایی را ثبت میکند. MAI-Transcribe-2-Streaming از 60 زبان به همراه تشخیص خودکار و پیوسته زبان پشتیبانی میکند. مایکروسافت ادعا میکند این مدل در حال حاضر از نظر دقت متنهای اولیه و نهایی، رتبه اول Artificial Analysis را در اختیار دارد.
در آزمایشهای داخلی این شرکت برای دیکته و زیرنویس، کلمات در متن رونویسیشده 2 برابر سریعتر از نزدیکترین رقیب ظاهر شدند. قیمت این مدل تا پایان سال 2026، 0.54 دلار بهازای هر ساعت صوت است. این رقم بهطور قابلتوجهی بیشتر از قیمت تبلیغاتی 0.10 دلار بهازای هر ساعت برای MAI-Transcribe-2 غیرجریانی است. مایکروسافت امروز همچنین MAI-Voice-2.1، جدیدترین مدل چندزبانه تبدیل متن به گفتار خود، را معرفی کرد.
مایکروسافت اوایل امسال MAI-Voice-2 و نسخه سریعتر MAI-Voice-2-Flash را معرفی کرده بود که پیشتر در Dynamics 365 Contact Center و Azure Voice Live مورد استفاده قرار گرفته بودند. MAI-Voice-2.1 از 23 زبان در 26 منطقه پشتیبانی میکند. یک صدای تولیدشده میتواند بین زبانها جابهجا شود و در عین حفظ هویت یک گوینده، لهجه بومی هر زبان را نیز به خود بگیرد. هزینه MAI-Voice-2.1 برابر با 22 دلار بهازای هر 1 میلیون نویسه است.
برای سناریوهای حساس به تأخیر و کاربردهای با حجم بالا، مایکروسافت مدل MAI-Voice-2.1-Flash را معرفی کرده است. این مدل میتواند 45 ثانیه صوت را با تأخیر انتهابهانتهای حدود 150ms تولید کند. مایکروسافت ادعا میکند این مدل استنتاج را 55 درصد سریعتر انجام میدهد و حدود 60 درصد ارزانتر از مدلهای مشابه است. قیمت آن 15 دلار بهازای هر 1 میلیون نویسه است. هر دو مدل صوتی جدید همچنین از شبیهسازی صدا در زبانهای تحت پشتیبانی خود، تنها با استفاده از چند ثانیه صدای مرجع، پشتیبانی میکنند.
هر 3 مدل جدید از طریق Microsoft Foundry، MAI Playground و Vercel در دسترس هستند. مدلهای Voice همچنین از طریق OpenRouter ارائه میشوند و پشتیبانی از LiveKit نیز بهزودی اضافه خواهد شد. این مدلها را میتوان از طریق Azure Voice Live نیز مورد استفاده قرار داد.
هنوز نظری ثبت نشده
نظرات شما درباره «مایکروسافت مدل هوش مصنوعی جدیدی را...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر