1

در اکتبر 2025، مایکروسافت برای نخستین بار از مدل تولید تصویر داخلی خود، MAI-Image-1، رونمایی کرد که در جایگاه نهم جدول رده‌بندی Arena برای تبدیل متن به تصویر قرار گرفت. در مارس امسال، مایکروسافت هوش مصنوعی مدل MAI-Image-2 را به‌عنوان نسل دوم مدل تولید تصویر خود معرفی کرد که دارای بهبودهای چشمگیری بود. این مدل در جایگاه سوم جدول Arena قرار گرفت و تنها از مدل‌های gemini-3.1-flash-image-preview از گوگل و gpt-image-1.5-high-fidelity از OpenAI عقب‌تر بود.

در ماه می، تیم هوش مصنوعی مایکروسافت از مدل MAI-Image-2.5 به‌عنوان جدیدترین مدل متن‌به‌تصویر خود رونمایی کرد که در جایگاه سوم جدول Arena قرار گرفت. امروز، مایکروسافت مدل MAI-Image-2.5-Pro را معرفی کرد که بالاترین کیفیت تصویر را در میان مدل‌های این شرکت تا به امروز دارد. این مدل برای موارد استفاده‌ای هدف‌گذاری شده است که به تولید و ویرایش دقیق تصویر، تصاویر اصلی (hero imagery) و نمایش دقیق‌تر متن درون تصاویر نیاز دارند.

هزینه‌ مدل MAI-Image-2.5-Pro به ازای هر یک میلیون توکن ورودی متنی 5 دلار، به ازای هر یک میلیون توکن ورودی تصویری 8 دلار، و به ازای هر یک میلیون توکن خروجی تصویری 106 دلار خواهد بود. کاربران علاقه‌مند هم‌اکنون می‌توانند این مدل جدید را به‌صورت رایگان در محیط آزمایشگاهی MAI Playground امتحان کنند. پس از اعلام دسترسی عمومی پیش‌نمایش در سال گذشته، مدل تولید گفتار MAI-Voice-1 مایکروسافت در آوریل امسال به‌طور عمومی در دسترس قرار گرفت.

در کنفرانس Build، مایکروسافت از مدل MAI-Voice-2 و یک نوع سریع‌تر (flash variant) با پشتیبانی از بیش از 15 زبان اضافی و گزینه‌های صوتی جدید رونمایی کرد. مایکروسافت امروز از دسترسی عمومی پیش‌نمایش مدل MAI-Voice-2-Flash خبر داد؛ این مدل تبدیل متن به گفتار برای برنامه‌های صوتی با تأخیر کم و حجم بالا، مانند سیستم‌های پاسخگویی به مشتریان، طراحی شده است.

مایکروسافت ادعا می‌کند که این مدل جدید، دو برابر سریع‌تر و 32 درصد ارزان‌تر از MAI-Voice-2 است و در عین حال، آهنگ و کیفیت صدای طبیعی را حفظ می‌کند. قیمت آن به ازای هر یک میلیون کاراکتر، 15 دلار تعیین شده است. مایکروسافت امروز تأکید کرد که هم‌اکنون از چندین مدل داخلی MAI خود در خدمات تولیدی متعددی استفاده می‌کند. سرویس Bing Image Creator هم‌اکنون به‌طور کامل توسط مدل MAI-Image-2.5 پشتیبانی می‌شود و پاورپوینت نیز از MAI-Image-2.5 برای قابلیت‌های تبدیل تصویر به تصویر استفاده می‌کند.

مایکروسافت اشاره کرد که تغییر به مدل MAI-Image-2، هزینه‌های GPU را در مقایسه با مدل GPT-Image-2 از OpenAI تا 84 درصد کاهش داده است. در سرویس OneDrive، مدل MAI-Image-2.5 هم‌اکنون تجارب ویرایش تصویر را پشتیبانی می‌کند که نرخ ذخیره‌سازی را 26 درصد افزایش، تأخیر P95 را حدود 25 درصد کاهش، و کارایی را در بارهای کاری با استفاده‌ی متوسط، 2.5 برابر بیشتر کرده است.

مدل MAI-Voice-2-Flash هم‌اکنون در مرکز تماس Dynamics 365 به کار گرفته شده و هزینه‌های GPU را تا 89 درصد کاهش داده است. این مدل اکنون به‌عنوان بخشی از سرویس Azure Voice Live در دسترس است و به توسعه‌دهندگان امکان می‌دهد تا عامل‌های گفتار‌به‌گفتار با تأخیر کم بسازند. در نهایت، مدل MAI-Transcribe-1.5 هم‌اکنون زمینه‌ی رونویسی چندزبانه را در دستیار Dragon Copilot در 58 زبان پشتیبانی می‌کند.