اوپنایآی مدل صوتی جدید GPT-Live-1 را از طریق API در اختیار توسعهدهندگان قرار داد. این مدل همان فناوری صوتی جدیدی را به توسعهدهندگان میدهد که در نسخه ارتقایافته قابلیت صوتی ChatGPT به کار رفته است. برخلاف دستیارهای صوتی سنتی که معمولاً تا پایان صحبت کاربر منتظر میمانند، GPT-Live-1 میتواند همزمان به صحبت کردن و گوش دادن ادامه دهد. این قابلیت باعث میشود مکالمات صوتی طبیعیتر و روانتر باشند.
GPT-Live-1 برای ساخت دستیارهای صوتی در حوزههایی مانند پشتیبانی مشتریان، رزرو، آموزش زبان، خدمات سلامت و فرایندهای تجاری طراحی شده است. یکی از تفاوتهای مهم GPT-Live-1 با مدلهای Realtime فعلی OpenAI، نحوه تقسیم وظایف است. مدل جدید عمدتاً مسئول مدیریت خود مکالمه، گوش دادن، صحبت کردن، مکثها، قطع شدن صحبتها و تشخیص زمان نیاز به کمک بیشتر است. در همین حال، وظایف پیچیدهتر میتوانند به یک مدل قدرتمندتر در بخش پشتیبان واگذار شوند.
برای نمونه، یک توسعهدهنده میتواند GPT-Live-1 را برای کارهای سادهای مانند زمانبندی یا اعلام وضعیت سفارش به یک مدل ارزانتر متصل کند و درخواستهای پیچیدهتر را به GPT-6 Astra بسپارد. همچنین امکان اتصال GPT-Live-1 به مدلهای هوش مصنوعی شخص ثالث، چارچوبهای عاملمحور یا سرویسهای اختصاصی توسعهدهندگان وجود دارد. نکته مهم این است که در زمان انجام این وظایف در پسزمینه، مکالمه صوتی با کاربر متوقف نمیشود. OpenAI چندین بهبود را برای این مدل اعلام کرده است:
- مدیریت بهتر قطع شدن صحبتها با پردازش همزمان صدای ورودی و خروجی
- کنترل بیشتر روی لحن، سرعت صحبت و سبک مکالمه از طریق System Prompt
- تشخیص بهتر سکوت و نویز پسزمینه بدون قطع بیدلیل صحبت کاربر
- حفظ بهتر زمینه مکالمه در گفتوگوهای طولانی
- پشتیبانی از دستیارهای صوتی تلفنی از طریق یکپارچهسازی با سامانههای مخابراتی
- ارائه متن پیادهسازیشده گفتار و متن پاسخ بهصورت بومی
- درک بهتر دادههای ترکیبی از حروف و اعداد
- پشتیبانی از Keyword Biasing برای بهبود تشخیص واژههای خاص
OpenAI میگوید GPT-Live-1 در آزمون Full Duplex Bench نسبت به GPT-Realtime-2.1 حدود 30 واحد درصد عملکرد بهتری دارد. همچنین این شرکت اعلام کرده ترکیب GPT-Live-1 با GPT-6 Astra در سطح استدلال متوسط، در آزمون Tau3 که عملکرد دستیارهای صوتی را از ابتدا تا انتها ارزیابی میکند، رتبه نخست را به دست آورده است. OpenAI همزمان مجموعهای از صداهای جدید را برای تعاملات صوتی بلادرنگ معرفی کرده است.
این مجموعه با هدف ارائه لهجهها، گویشها و زبانهای متنوعتر عرضه شده و شامل Quartz، Ripple، Vesper، Willow، Stone، Gleam، Meridian، Bossa، Tempo، Beacon، Delta و Cinder میشود. GPT-Live-1 از همین حالا از طریق OpenAI API در دسترس توسعهدهندگان قرار دارد و هزینه لایه صوتی آن 0.05 دلار به ازای هر دقیقه است. البته این مبلغ تنها مربوط به لایه صوتی جلویی است و توسعهدهندگان باید هزینه مدل پشتیبان و ابزارهایی را که به GPT-Live-1 متصل میکنند، جداگانه پرداخت کنند.
هنوز نظری ثبت نشده
نظرات شما درباره «اوپنایآی مدل صوتی GPT-Live-1 را برای...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر