1

امروز، شرکت‌های OpenAI و علی‌بابا مدل‌های جدید هوش مصنوعی صوتی را معرفی کردند که بر دو بخش متفاوت از زنجیره‌ صوتی متمرکز هستند. OpenAI از مدل‌های GPT-Live-Transcribe و GPT-Transcribe رونمایی کرد. مدل GPT-Live-Transcribe برای بارهای کاری تبدیل گفتار به متن زنده (live speech-to-text) با تأخیر کم طراحی شده است، در حالی که مدل GPT-Transcribe برای فایل‌های صوتی کامل‌شده و پردازش دسته‌ای ناهمگام (asynchronous batch processing) بهینه‌سازی شده است.

هر دو مدل اکنون می‌توانند از Free-Form Context درباره‌ ضبط، از جمله کلمات کلیدی، نام‌ها برای اصطلاحات تخصصی حوزه‌های خاص، و زبان‌های مورد انتظار برای بهبود دقت استفاده کنند. مدل GPT-Live-Transcribe همچنین می‌تواند به‌طور خودکار از نوبت‌های گفتاری رونویسی‌شده‌ی قبلی به‌عنوان زمینه استفاده کند. در بنچمارک Context Aware ASR شرکت OpenAI، افزودن زمینه، دقت معنایی را برای GPT-Live-Transcribe از 38.5 درصد به 44.6 درصد و برای GPT-Transcribe از 41.6 درصد به 45.2 درصد بهبود بخشید.

در یک بنچمارک جداگانه‌ی صوتی دنیای واقعی، مدل زنده نرخ خطای رونویسی 9.60 درصد را ثبت کرد، در مقایسه با 11.65 درصد برای مدل GPT-Realtime-Whisper. مدل GPT-Transcribe به نرخ خطای 8.98 درصد دست یافت که نسبت به 15.21 درصد برای مدل Whisper-1 کاهش یافته است. تحلیلگران Artificial Analysis نرخ خطای کلمه (word error rate) معادل 3.31 درصد را برای مدل GPT-Transcribe گزارش کردند که بهبود قابل‌قبولی نسبت به مدل‌های قبلی OpenAI محسوب می‌شود و قیمت این مدل 4.50 دلار به ازای هر 1,000 دقیقه تعیین شده است.

علی‌بابا از مدل‌های Qwen-Audio-3.0-Realtime Plus و Flash برای مکالمات مستقیم گفتار به گفتار (speech-to-speech) رونمایی کرد. این مدل‌های جدید مشابه مدل GPT-Live، از تعاملات دوطرفه‌ی کامل (full-duplex) پشتیبانی می‌کنند که به کاربران امکان می‌دهد در حین صحبت کردن هوش مصنوعی، آن را قطع کنند (همراه با قابلیت فراخوانی توابع (function calling) و صداهای شبیه‌سازی‌شده‌ی سفارشی).

در واقع، مدل Qwen-Audio-3.0-Realtime Plus علی‌بابا اکنون در شاخص Speech-to-Speech Index شرکت Artificial Analysis با امتیاز 84.1 درصد پیشتاز است و از مدل GPT-Realtime-2.1 High شرکت OpenAI با امتیاز 79.1 درصد جلوتر افتاده است. این مدل در آزمون‌های استدلال گفتاری، پویایی مکالمه و عملکرد عامل‌محور (agentic performance) این بنچمارک، رتبه‌ی اول را کسب کرد. یکی از معایب این است که مدل علی‌بابا برای شروع پاسخ‌دهی کندتر است. تحلیلگران Artificial Analysis دریافتند که زمان اولین خروجی صوتی (time to first audio) آن حدود 4 ثانیه است، در مقایسه با حدود 1.14 ثانیه برای مدل GPT-Realtime-2 High.