1

گوگل از مدل صوتی جدیدی با نام Gemini 3.5 Transcribe رونمایی کرده که به گفته این شرکت، دقت بیشتری در تشخیص گفتار و تبدیل صدا به متن دارد. این مدل به خانواده صوتی Gemini می‌پیوندد و در کنار Gemini 3.5 Live و Gemini 3.5 Live Experimental قرار می‌گیرد. یکی از مهم‌ترین قابلیت‌های Gemini 3.5 Transcribe، توانایی آن در تبدیل گفتار نامنظم و پراکنده کاربران به متنی منسجم و قالب‌بندی‌شده است.

این مدل می‌تواند اصلاحات و تصحیح‌های انجام‌شده هنگام صحبت‌کردن را تشخیص دهد، کلمات و عبارت‌های زائد را حذف کند و متن نهایی را با ساختاری مرتب‌تر ارائه دهد. همچنین کاربران می‌توانند با فرمان‌های صوتی، متن تولیدشده را ویرایش کنند. گوگل اعلام کرد که مدل جدید می‌تواند به‌طور خودکار بیش از 85 زبان را تشخیص دهد. همچنین قابلیت یادگیری واژگان اختصاصی و شیوه‌های املایی ویژه را دارد و می‌تواند رشته‌های ترکیبی از حروف و اعداد، مانند شماره سفارش و کدپستی، را با دقت بیشتری ثبت کند.

این مدل در پردازش فایل‌های صوتی از پیش ضبط‌شده نیز قابلیت‌های پیشرفته‌ای ارائه می‌دهد و می‌تواند گفتگوی حداکثر سه گوینده را از یکدیگر تفکیک کند و برای هر کلمه، برچسب زمانی ثبت کند که می‌تواند برای پیاده‌سازی محتوای پادکست‌ها و گفتگوهای چندنفره کاربردی باشد. Gemini 3.5 Transcribe همچنین نیروی محرک قابلیت Rambler در برخی دستگاه‌های اندرویدی، از جمله سری پیکسل 11 و نسخه مک‌اواس اپلیکیشن Gemini است.

گوگل می‌گوید به‌زودی امکان استفاده از قابلیت تبدیل گفتار به متن در هر فیلد متنی صفحات وب در مرورگر کروم فراهم خواهد شد. کاربران می‌توانند از این قابلیت برای دیکته‌کردن پاسخ‌ها و پست‌ها یا ارسال درخواست‌های صوتی به Gemini استفاده کنند. این مدل همچنین در پلتفرم توسعه عامل‌محور Google Antigravity در دسترس قرار گرفته و قرار است به Search Live، Gemini Live، Google Docs، Keep و Gmail نیز افزوده شود. توسعه‌دهندگان نیز از طریق API به آن دسترسی خواهند داشت.