گوگل از مدل صوتی جدیدی با نام Gemini 3.5 Transcribe رونمایی کرده که به گفته این شرکت، دقت بیشتری در تشخیص گفتار و تبدیل صدا به متن دارد. این مدل به خانواده صوتی Gemini میپیوندد و در کنار Gemini 3.5 Live و Gemini 3.5 Live Experimental قرار میگیرد. یکی از مهمترین قابلیتهای Gemini 3.5 Transcribe، توانایی آن در تبدیل گفتار نامنظم و پراکنده کاربران به متنی منسجم و قالببندیشده است.
این مدل میتواند اصلاحات و تصحیحهای انجامشده هنگام صحبتکردن را تشخیص دهد، کلمات و عبارتهای زائد را حذف کند و متن نهایی را با ساختاری مرتبتر ارائه دهد. همچنین کاربران میتوانند با فرمانهای صوتی، متن تولیدشده را ویرایش کنند. گوگل اعلام کرد که مدل جدید میتواند بهطور خودکار بیش از 85 زبان را تشخیص دهد. همچنین قابلیت یادگیری واژگان اختصاصی و شیوههای املایی ویژه را دارد و میتواند رشتههای ترکیبی از حروف و اعداد، مانند شماره سفارش و کدپستی، را با دقت بیشتری ثبت کند.

این مدل در پردازش فایلهای صوتی از پیش ضبطشده نیز قابلیتهای پیشرفتهای ارائه میدهد و میتواند گفتگوی حداکثر سه گوینده را از یکدیگر تفکیک کند و برای هر کلمه، برچسب زمانی ثبت کند که میتواند برای پیادهسازی محتوای پادکستها و گفتگوهای چندنفره کاربردی باشد. Gemini 3.5 Transcribe همچنین نیروی محرک قابلیت Rambler در برخی دستگاههای اندرویدی، از جمله سری پیکسل 11 و نسخه مکاواس اپلیکیشن Gemini است.
گوگل میگوید بهزودی امکان استفاده از قابلیت تبدیل گفتار به متن در هر فیلد متنی صفحات وب در مرورگر کروم فراهم خواهد شد. کاربران میتوانند از این قابلیت برای دیکتهکردن پاسخها و پستها یا ارسال درخواستهای صوتی به Gemini استفاده کنند. این مدل همچنین در پلتفرم توسعه عاملمحور Google Antigravity در دسترس قرار گرفته و قرار است به Search Live، Gemini Live، Google Docs، Keep و Gmail نیز افزوده شود. توسعهدهندگان نیز از طریق API به آن دسترسی خواهند داشت.
هنوز نظری ثبت نشده
نظرات شما درباره «مدل جدید Gemini میتواند گفتار پراکنده...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر