1

اوپن‌ای‌آی مدل صوتی جدید GPT-Live-1 را از طریق API در اختیار توسعه‌دهندگان قرار داد. این مدل همان فناوری صوتی جدیدی را به توسعه‌دهندگان می‌دهد که در نسخه ارتقایافته قابلیت صوتی ChatGPT به کار رفته است. برخلاف دستیارهای صوتی سنتی که معمولاً تا پایان صحبت کاربر منتظر می‌مانند، GPT-Live-1 می‌تواند هم‌زمان به صحبت کردن و گوش دادن ادامه دهد. این قابلیت باعث می‌شود مکالمات صوتی طبیعی‌تر و روان‌تر باشند.

GPT-Live-1 برای ساخت دستیارهای صوتی در حوزه‌هایی مانند پشتیبانی مشتریان، رزرو، آموزش زبان، خدمات سلامت و فرایندهای تجاری طراحی شده است. یکی از تفاوت‌های مهم GPT-Live-1 با مدل‌های Realtime فعلی OpenAI، نحوه تقسیم وظایف است. مدل جدید عمدتاً مسئول مدیریت خود مکالمه، گوش دادن، صحبت کردن، مکث‌ها، قطع شدن صحبت‌ها و تشخیص زمان نیاز به کمک بیشتر است. در همین حال، وظایف پیچیده‌تر می‌توانند به یک مدل قدرتمندتر در بخش پشتیبان واگذار شوند.

برای نمونه، یک توسعه‌دهنده می‌تواند GPT-Live-1 را برای کارهای ساده‌ای مانند زمان‌بندی یا اعلام وضعیت سفارش به یک مدل ارزان‌تر متصل کند و درخواست‌های پیچیده‌تر را به GPT-6 Astra بسپارد. همچنین امکان اتصال GPT-Live-1 به مدل‌های هوش مصنوعی شخص ثالث، چارچوب‌های عامل‌محور یا سرویس‌های اختصاصی توسعه‌دهندگان وجود دارد. نکته مهم این است که در زمان انجام این وظایف در پس‌زمینه، مکالمه صوتی با کاربر متوقف نمی‌شود. OpenAI چندین بهبود را برای این مدل اعلام کرده است:

  • مدیریت بهتر قطع شدن صحبت‌ها با پردازش هم‌زمان صدای ورودی و خروجی
  • کنترل بیشتر روی لحن، سرعت صحبت و سبک مکالمه از طریق System Prompt
  • تشخیص بهتر سکوت و نویز پس‌زمینه بدون قطع بی‌دلیل صحبت کاربر
  • حفظ بهتر زمینه مکالمه در گفت‌وگوهای طولانی
  • پشتیبانی از دستیارهای صوتی تلفنی از طریق یکپارچه‌سازی با سامانه‌های مخابراتی
  • ارائه متن پیاده‌سازی‌شده گفتار و متن پاسخ به‌صورت بومی
  • درک بهتر داده‌های ترکیبی از حروف و اعداد
  • پشتیبانی از Keyword Biasing برای بهبود تشخیص واژه‌های خاص

OpenAI می‌گوید GPT-Live-1 در آزمون Full Duplex Bench نسبت به GPT-Realtime-2.1 حدود 30 واحد درصد عملکرد بهتری دارد. همچنین این شرکت اعلام کرده ترکیب GPT-Live-1 با GPT-6 Astra در سطح استدلال متوسط، در آزمون Tau3 که عملکرد دستیارهای صوتی را از ابتدا تا انتها ارزیابی می‌کند، رتبه نخست را به دست آورده است. OpenAI هم‌زمان مجموعه‌ای از صداهای جدید را برای تعاملات صوتی بلادرنگ معرفی کرده است.

این مجموعه با هدف ارائه لهجه‌ها، گویش‌ها و زبان‌های متنوع‌تر عرضه شده و شامل Quartz، Ripple، Vesper، Willow، Stone، Gleam، Meridian، Bossa، Tempo، Beacon، Delta و Cinder می‌شود. GPT-Live-1 از همین حالا از طریق OpenAI API در دسترس توسعه‌دهندگان قرار دارد و هزینه لایه صوتی آن 0.05 دلار به ازای هر دقیقه است. البته این مبلغ تنها مربوط به لایه صوتی جلویی است و توسعه‌دهندگان باید هزینه مدل پشتیبان و ابزارهایی را که به GPT-Live-1 متصل می‌کنند، جداگانه پرداخت کنند.