1

شیائومی مدل جدید هوش مصنوعی CocktailASR-1 را معرفی کرده که برای برای حل یکی از چالش‌های قدیمی سامانه‌های تشخیص گفتار، یعنی تشخیص صدای فرد موردنظر در میان صحبت هم‌زمان چند نفر، طراحی شده است. این مدل بر پایه معماری سرتاسری مبتنی بر مدل زبانی بزرگ (LLM) ساخته شده و به‌جای آنکه ابتدا صداهای مختلف را از یکدیگر جدا کند و سپس فرایند تبدیل گفتار به متن را انجام دهد، می‌تواند با استفاده از نمونه‌ای از صدای گوینده به‌عنوان مرجع صوتی، مستقیماً گفتار همان فرد را از صدای ترکیبی تشخیص داده و رونویسی کند.

تشخیص گوینده حتی در میان چند صدای هم‌زمان

یکی از قابلیت‌های مهم CocktailASR-1، عملکرد آن در شرایطی است که چند نفر به‌طور هم‌زمان صحبت می‌کنند؛ مشکلی که در اصطلاح به «مسئله مهمانی کوکتل» (Cocktail Party Problem) شناخته می‌شود. مدل جدید علاوه بر محیط‌های چندگوینده، در شرایط تک‌گوینده نیز عملکرد رقابتی با مدل‌های متداول تشخیص گفتار دارد. نکته مهم‌تر اینکه اگر گوینده هدف اصلاً در فایل صوتی حضور نداشته باشد، مدل می‌تواند این موضوع را تشخیص دهد و به‌جای تولید متن اشتباه، خروجی خالی ارائه کند.

عملکرد قدرتمند در آزمایش‌ها

شیائومی می‌گوید CocktailASR-1 در مجموعه‌ای از آزمون‌های مربوط به گفتار چندگوینده و داده‌های واقعی و مصنوعی، عملکردی در سطح پیشرفته ارائه کرده است. این مدل تلاش می‌کند میان سه قابلیت مهم تعادل برقرار کند: تشخیص دقیق گوینده هدف، حفظ دقت در گفتار تک‌نفره و رد کردن ورودی‌هایی که حاوی صدای گوینده هدف نیستند. این مدل همچنین از حالت استدلال زنجیره‌ای (Chain-of-Thought) پشتیبانی می‌کند که می‌تواند مراحل استدلال مدل را در فرایند پردازش ارائه کند.

کاربرد در جلسات و محیط‌های شلوغ

فناوری CocktailASR-1 می‌تواند برای کاربردهایی مانند رونویسی جلسات، دستیارهای صوتی، تماس‌های چندنفره و سایر سامانه‌هایی که نیاز به شناسایی یک گوینده مشخص دارند مفید باشد. این رویکرد به‌ویژه در محیط‌هایی که صدای پس‌زمینه زیاد است یا چند نفر به‌طور هم‌زمان صحبت می‌کنند، اهمیت دارد. مدل‌های تشخیص گفتار معمولی در چنین شرایطی ممکن است کلمات گویندگان مختلف را با یکدیگر ترکیب کنند، اما CocktailASR-1 با استفاده از نمونه صدای گوینده هدف تلاش می‌کند تنها گفتار همان فرد را استخراج و به متن تبدیل کند.

CocktailASR-1 تازه‌ترین تلاش شیائومی برای توسعه مدل‌های پیشرفته تشخیص گفتار محسوب می‌شود. این شرکت پیش‌تر نیز MiMo-V2.5-ASR را برای تشخیص گفتار در محیط‌های نویزی، مکالمات چندگوینده و حتی گفتارهای دارای هم‌پوشانی عرضه کرده بود.