در اکتبر 2025، مایکروسافت برای نخستین بار از مدل تولید تصویر داخلی خود، MAI-Image-1، رونمایی کرد که در جایگاه نهم جدول ردهبندی Arena برای تبدیل متن به تصویر قرار گرفت. در مارس امسال، مایکروسافت هوش مصنوعی مدل MAI-Image-2 را بهعنوان نسل دوم مدل تولید تصویر خود معرفی کرد که دارای بهبودهای چشمگیری بود. این مدل در جایگاه سوم جدول Arena قرار گرفت و تنها از مدلهای gemini-3.1-flash-image-preview از گوگل و gpt-image-1.5-high-fidelity از OpenAI عقبتر بود.
در ماه می، تیم هوش مصنوعی مایکروسافت از مدل MAI-Image-2.5 بهعنوان جدیدترین مدل متنبهتصویر خود رونمایی کرد که در جایگاه سوم جدول Arena قرار گرفت. امروز، مایکروسافت مدل MAI-Image-2.5-Pro را معرفی کرد که بالاترین کیفیت تصویر را در میان مدلهای این شرکت تا به امروز دارد. این مدل برای موارد استفادهای هدفگذاری شده است که به تولید و ویرایش دقیق تصویر، تصاویر اصلی (hero imagery) و نمایش دقیقتر متن درون تصاویر نیاز دارند.
هزینه مدل MAI-Image-2.5-Pro به ازای هر یک میلیون توکن ورودی متنی 5 دلار، به ازای هر یک میلیون توکن ورودی تصویری 8 دلار، و به ازای هر یک میلیون توکن خروجی تصویری 106 دلار خواهد بود. کاربران علاقهمند هماکنون میتوانند این مدل جدید را بهصورت رایگان در محیط آزمایشگاهی MAI Playground امتحان کنند. پس از اعلام دسترسی عمومی پیشنمایش در سال گذشته، مدل تولید گفتار MAI-Voice-1 مایکروسافت در آوریل امسال بهطور عمومی در دسترس قرار گرفت.
در کنفرانس Build، مایکروسافت از مدل MAI-Voice-2 و یک نوع سریعتر (flash variant) با پشتیبانی از بیش از 15 زبان اضافی و گزینههای صوتی جدید رونمایی کرد. مایکروسافت امروز از دسترسی عمومی پیشنمایش مدل MAI-Voice-2-Flash خبر داد؛ این مدل تبدیل متن به گفتار برای برنامههای صوتی با تأخیر کم و حجم بالا، مانند سیستمهای پاسخگویی به مشتریان، طراحی شده است.

مایکروسافت ادعا میکند که این مدل جدید، دو برابر سریعتر و 32 درصد ارزانتر از MAI-Voice-2 است و در عین حال، آهنگ و کیفیت صدای طبیعی را حفظ میکند. قیمت آن به ازای هر یک میلیون کاراکتر، 15 دلار تعیین شده است. مایکروسافت امروز تأکید کرد که هماکنون از چندین مدل داخلی MAI خود در خدمات تولیدی متعددی استفاده میکند. سرویس Bing Image Creator هماکنون بهطور کامل توسط مدل MAI-Image-2.5 پشتیبانی میشود و پاورپوینت نیز از MAI-Image-2.5 برای قابلیتهای تبدیل تصویر به تصویر استفاده میکند.
مایکروسافت اشاره کرد که تغییر به مدل MAI-Image-2، هزینههای GPU را در مقایسه با مدل GPT-Image-2 از OpenAI تا 84 درصد کاهش داده است. در سرویس OneDrive، مدل MAI-Image-2.5 هماکنون تجارب ویرایش تصویر را پشتیبانی میکند که نرخ ذخیرهسازی را 26 درصد افزایش، تأخیر P95 را حدود 25 درصد کاهش، و کارایی را در بارهای کاری با استفادهی متوسط، 2.5 برابر بیشتر کرده است.
مدل MAI-Voice-2-Flash هماکنون در مرکز تماس Dynamics 365 به کار گرفته شده و هزینههای GPU را تا 89 درصد کاهش داده است. این مدل اکنون بهعنوان بخشی از سرویس Azure Voice Live در دسترس است و به توسعهدهندگان امکان میدهد تا عاملهای گفتاربهگفتار با تأخیر کم بسازند. در نهایت، مدل MAI-Transcribe-1.5 هماکنون زمینهی رونویسی چندزبانه را در دستیار Dragon Copilot در 58 زبان پشتیبانی میکند.
هنوز نظری ثبت نشده
نظرات شما درباره «مایکروسافت با مدلهای جدید تصویر و...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر