امروز، شرکتهای OpenAI و علیبابا مدلهای جدید هوش مصنوعی صوتی را معرفی کردند که بر دو بخش متفاوت از زنجیره صوتی متمرکز هستند. OpenAI از مدلهای GPT-Live-Transcribe و GPT-Transcribe رونمایی کرد. مدل GPT-Live-Transcribe برای بارهای کاری تبدیل گفتار به متن زنده (live speech-to-text) با تأخیر کم طراحی شده است، در حالی که مدل GPT-Transcribe برای فایلهای صوتی کاملشده و پردازش دستهای ناهمگام (asynchronous batch processing) بهینهسازی شده است.
هر دو مدل اکنون میتوانند از Free-Form Context درباره ضبط، از جمله کلمات کلیدی، نامها برای اصطلاحات تخصصی حوزههای خاص، و زبانهای مورد انتظار برای بهبود دقت استفاده کنند. مدل GPT-Live-Transcribe همچنین میتواند بهطور خودکار از نوبتهای گفتاری رونویسیشدهی قبلی بهعنوان زمینه استفاده کند. در بنچمارک Context Aware ASR شرکت OpenAI، افزودن زمینه، دقت معنایی را برای GPT-Live-Transcribe از 38.5 درصد به 44.6 درصد و برای GPT-Transcribe از 41.6 درصد به 45.2 درصد بهبود بخشید.
در یک بنچمارک جداگانهی صوتی دنیای واقعی، مدل زنده نرخ خطای رونویسی 9.60 درصد را ثبت کرد، در مقایسه با 11.65 درصد برای مدل GPT-Realtime-Whisper. مدل GPT-Transcribe به نرخ خطای 8.98 درصد دست یافت که نسبت به 15.21 درصد برای مدل Whisper-1 کاهش یافته است. تحلیلگران Artificial Analysis نرخ خطای کلمه (word error rate) معادل 3.31 درصد را برای مدل GPT-Transcribe گزارش کردند که بهبود قابلقبولی نسبت به مدلهای قبلی OpenAI محسوب میشود و قیمت این مدل 4.50 دلار به ازای هر 1,000 دقیقه تعیین شده است.
علیبابا از مدلهای Qwen-Audio-3.0-Realtime Plus و Flash برای مکالمات مستقیم گفتار به گفتار (speech-to-speech) رونمایی کرد. این مدلهای جدید مشابه مدل GPT-Live، از تعاملات دوطرفهی کامل (full-duplex) پشتیبانی میکنند که به کاربران امکان میدهد در حین صحبت کردن هوش مصنوعی، آن را قطع کنند (همراه با قابلیت فراخوانی توابع (function calling) و صداهای شبیهسازیشدهی سفارشی).
در واقع، مدل Qwen-Audio-3.0-Realtime Plus علیبابا اکنون در شاخص Speech-to-Speech Index شرکت Artificial Analysis با امتیاز 84.1 درصد پیشتاز است و از مدل GPT-Realtime-2.1 High شرکت OpenAI با امتیاز 79.1 درصد جلوتر افتاده است. این مدل در آزمونهای استدلال گفتاری، پویایی مکالمه و عملکرد عاملمحور (agentic performance) این بنچمارک، رتبهی اول را کسب کرد. یکی از معایب این است که مدل علیبابا برای شروع پاسخدهی کندتر است. تحلیلگران Artificial Analysis دریافتند که زمان اولین خروجی صوتی (time to first audio) آن حدود 4 ثانیه است، در مقایسه با حدود 1.14 ثانیه برای مدل GPT-Realtime-2 High.
هنوز نظری ثبت نشده
نظرات شما درباره «OpenAI و علیبابا مدلهای صوتی جدیدی...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر