شیائومی مدل جدید هوش مصنوعی CocktailASR-1 را معرفی کرده که برای برای حل یکی از چالشهای قدیمی سامانههای تشخیص گفتار، یعنی تشخیص صدای فرد موردنظر در میان صحبت همزمان چند نفر، طراحی شده است. این مدل بر پایه معماری سرتاسری مبتنی بر مدل زبانی بزرگ (LLM) ساخته شده و بهجای آنکه ابتدا صداهای مختلف را از یکدیگر جدا کند و سپس فرایند تبدیل گفتار به متن را انجام دهد، میتواند با استفاده از نمونهای از صدای گوینده بهعنوان مرجع صوتی، مستقیماً گفتار همان فرد را از صدای ترکیبی تشخیص داده و رونویسی کند.
تشخیص گوینده حتی در میان چند صدای همزمان
یکی از قابلیتهای مهم CocktailASR-1، عملکرد آن در شرایطی است که چند نفر بهطور همزمان صحبت میکنند؛ مشکلی که در اصطلاح به «مسئله مهمانی کوکتل» (Cocktail Party Problem) شناخته میشود. مدل جدید علاوه بر محیطهای چندگوینده، در شرایط تکگوینده نیز عملکرد رقابتی با مدلهای متداول تشخیص گفتار دارد. نکته مهمتر اینکه اگر گوینده هدف اصلاً در فایل صوتی حضور نداشته باشد، مدل میتواند این موضوع را تشخیص دهد و بهجای تولید متن اشتباه، خروجی خالی ارائه کند.
عملکرد قدرتمند در آزمایشها
شیائومی میگوید CocktailASR-1 در مجموعهای از آزمونهای مربوط به گفتار چندگوینده و دادههای واقعی و مصنوعی، عملکردی در سطح پیشرفته ارائه کرده است. این مدل تلاش میکند میان سه قابلیت مهم تعادل برقرار کند: تشخیص دقیق گوینده هدف، حفظ دقت در گفتار تکنفره و رد کردن ورودیهایی که حاوی صدای گوینده هدف نیستند. این مدل همچنین از حالت استدلال زنجیرهای (Chain-of-Thought) پشتیبانی میکند که میتواند مراحل استدلال مدل را در فرایند پردازش ارائه کند.

کاربرد در جلسات و محیطهای شلوغ
فناوری CocktailASR-1 میتواند برای کاربردهایی مانند رونویسی جلسات، دستیارهای صوتی، تماسهای چندنفره و سایر سامانههایی که نیاز به شناسایی یک گوینده مشخص دارند مفید باشد. این رویکرد بهویژه در محیطهایی که صدای پسزمینه زیاد است یا چند نفر بهطور همزمان صحبت میکنند، اهمیت دارد. مدلهای تشخیص گفتار معمولی در چنین شرایطی ممکن است کلمات گویندگان مختلف را با یکدیگر ترکیب کنند، اما CocktailASR-1 با استفاده از نمونه صدای گوینده هدف تلاش میکند تنها گفتار همان فرد را استخراج و به متن تبدیل کند.
CocktailASR-1 تازهترین تلاش شیائومی برای توسعه مدلهای پیشرفته تشخیص گفتار محسوب میشود. این شرکت پیشتر نیز MiMo-V2.5-ASR را برای تشخیص گفتار در محیطهای نویزی، مکالمات چندگوینده و حتی گفتارهای دارای همپوشانی عرضه کرده بود.
هنوز نظری ثبت نشده
نظرات شما درباره «شیائومی مدل هوش مصنوعی CocktailASR-1 را...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر