1

تلفن‌های هوشمند مدت‌هاست قابلیت تبدیل گفتار به متن را ارائه می‌دهند، اما وضعیت برای تبدیل زبان اشاره به متن متفاوت بوده است. این شرایط امروز با عرضه خانواده Pixel 11 تغییر می‌کند؛ چرا که این سری نخستین دستگاه‌هایی است که مدل جدید DeepMind برای تبدیل زبان اشاره به متن (SL2T) را ارائه می‌کند. گوگل این مدل را در Gboard و Live Transcribe تعبیه کرده است و به کاربران ناشنوا و کم‌شنوا اجازه می‌دهد هر جایی که پیش‌تر از تایپ کردن استفاده می‌کردند، با زبان اشاره با تلفن خود ارتباط برقرار کنند.

در عمل، این قابلیت روشی سریع‌تر و طبیعی‌تر را در اختیار این کاربران قرار می‌دهد تا در وب جست‌وجو کنند، پیام بنویسند و با چت‌بات Gemini گوگل گفت‌وگو کنند. DeepMind بیان کرد:

در میان افراد ناشنوا، از نظر میزان تسلط بر زبان اشاره، گفتار، خواندن و نوشتن، تنوع زیادی وجود دارد؛ بنابراین، فراهم کردن دسترسی در تمامی شیوه‌های ارتباطی اهمیت دارد. افراد ناشنوا می‌توانند همانند افراد شنوا که از پردازش زبان گفتاری بهره می‌برند، از پردازش زبان اشاره استفاده کنند و این فناوری فرصت‌های تازه‌ای را برای کاهش شکاف ارتباطی میان جوامع ناشنوا و شنوا ایجاد می‌کند.

DeepMind مدل SL2T را با استفاده از بیش از 100,000 ساعت داده مربوط به زبان‌های اشاره مختلف آموزش داده است که حدود یک‌چهارم این مجموعه داده به زبان اشاره آمریکایی (ASL) اختصاص داشته است. به همین دلیل، این مدل در زمان عرضه تنها از تبدیل ASL به متن انگلیسی پشتیبانی می‌کند. گوگل قصد دارد در آینده زبان‌ها و دستگاه‌های بیشتری را تحت پوشش این قابلیت قرار دهد.

SL2T ویدئوی خام را مستقیما تفسیر نمی‌کند. در عوض، یک مدل جداگانه روی دستگاه، تصاویر را به نوعی اسکلت‌بندی متشکل از مختصات هندسی تبدیل می‌کند و این داده‌ها را به سرورهای گوگل ارسال می‌کند. این شرکت می‌گوید این روش با هدف محافظت از حریم خصوصی کاربران طراحی شده است. SL2T همچنین در مقایسه با سامانه‌های پیشین تبدیل زبان اشاره به متن تفاوت مهمی دارد؛ این مدل اسکلت‌بندی‌های دریافتی را مستقیما به متن تبدیل می‌کند و به جای آنکه ابتدا خروجی میانی موسوم به gloss تولید کند، مستقیما ترجمه را انجام می‌دهد. DeepMind توضیح می‌دهد:

Glossها نمی‌توانند جنبه‌های غنی و غیرخطی زبان‌های اشاره، مانند نشانگرهای غیر‌دستی و ساختارهای فضایی، را به طور کامل ثبت کنند. ترجمه مستقیم از نقاط شاخص، محدودیت‌های مصنوعی واژگان را از بین می‌برد و امکان می‌دهد کیفیت ترجمه مستقیما متناسب با حجم داده‌ها افزایش پیدا کند.

پشتیبانی از ASL شروع خوبی محسوب می‌شود، اما DeepMind اذعان دارد که هنوز کارهای بیشتری باید انجام شود. در سراسر جهان، بیش از 70 میلیون فرد ناشنوا و کم‌شنوا وجود دارند که از حدود 200 زبان اشاره برای برقراری ارتباط استفاده می‌کنند. نکته امیدوارکننده این است که SL2T به طور همزمان با استفاده از چندین زبان آموزش داده شده تا بتواند ساختارهای مشترک و زیربنایی میان این زبان‌ها را فرا بگیرد.