Google DeepMind представила ИИ для перевода жестового языка в текст
Google DeepMind разработала модель SL2T, которая переводит жестовый язык в текст в реальном времени. Технология встроена в новые функции для глухих и слабослышащих пользователей, открывая новые возможности для общения.
Google DeepMind представила новаторскую модель искусственного интеллекта, способную переводить жестовый язык в текст в реальном времени. Модель, получившая название SL2T (sign-language-to-text), уже интегрирована в новые функции компании, предназначенные для глухих и слабослышащих пользователей. Это первый значительный шаг к тому, чтобы сделать технологии доступными для сообщества, которое долгое время было обделено вниманием разработчиков.
Как работает модель SL2T
Модель SL2T использует передовые алгоритмы компьютерного зрения и обработки естественного языка. Она анализирует видеопоток с камеры устройства, распознает жесты и мимику, а затем преобразует их в письменный текст. По словам разработчиков, система способна обрабатывать до 30 кадров в секунду, что обеспечивает плавный и точный перевод. В основе модели лежит архитектура, аналогичная той, что используется в больших языковых моделях, но адаптированная для работы с визуальными данными.
Ключевая особенность SL2T — ее способность адаптироваться к различным диалектам жестового языка. В мире существует более 300 различных жестовых языков, и модель обучена распознавать их основные варианты, включая американский, британский и русский жестовые языки. Это достигается за счет обучения на огромном наборе данных, включающем видеозаписи носителей языка.
Предыстория и контекст
Разработка SL2T стала результатом многолетних исследований в области доступности. Google уже имеет опыт в этой сфере: ранее компания представила функции субтитров в реальном времени для видеозвонков и автоматическое распознавание речи для людей с нарушениями слуха. Однако все эти решения требовали, чтобы говорящий использовал голос, оставляя глухих пользователей в стороне.
Новая модель решает эту проблему, позволяя глухим людям общаться на их родном языке — жестовом. Это особенно важно, поскольку для многих глухих людей жестовый язык является первым и основным, а письменный язык — вторым. По данным Всемирной организации здравоохранения, в мире насчитывается более 1,5 миллиарда человек с нарушениями слуха, и для многих из них жестовый язык — единственный способ полноценного общения.
Чем SL2T отличается от существующих решений?
На рынке уже есть приложения для перевода жестового языка, но большинство из них работают только с ограниченным набором жестов или требуют специального оборудования. SL2T использует обычную камеру смартфона или ноутбука, что делает ее доступной для широкой аудитории. Кроме того, модель способна распознавать не только отдельные жесты, но и полные предложения, учитывая контекст и грамматику жестового языка, что значительно повышает точность перевода.
Технические детали и производительность
Модель SL2T построена на основе трансформерной архитектуры, аналогичной той, что используется в GPT и BERT. Она состоит из двух основных компонентов: визуального энкодера, который преобразует видеокадры в векторные представления, и текстового декодера, который генерирует текст. Для обучения использовалось более 400 000 часов видеозаписей жестового языка, что позволило модели достичь точности в 92% при переводе отдельных предложений и 85% при переводе непрерывной речи.
Для сравнения, предыдущие системы перевода жестового языка имели точность не выше 60-70%. Разработчики также отмечают, что модель может работать в реальном времени с задержкой менее 100 миллисекунд, что делает ее пригодной для живого общения. В настоящее время SL2T поддерживает английский, испанский, французский, немецкий, японский и русский жестовые языки, и список будет расширяться.
Кого затронет и как
Новая технология окажет значительное влияние на жизнь глухих и слабослышащих людей по всему миру. Она позволит им общаться с теми, кто не знает жестового языка, в повседневных ситуациях: в магазинах, банках, медицинских учреждениях и на работе. Для бизнеса это означает возможность обслуживать большее количество клиентов и создавать более инклюзивную среду.
В России, где проживает около 13 миллионов глухих и слабослышащих людей, технология может быть особенно востребована. Русский жестовый язык имеет свою грамматику и лексику, и SL2T уже обучена на его основе. Однако для полноценного внедрения потребуется адаптация к местным особенностям и интеграция с российскими платформами, такими как видеозвонки и мессенджеры.
Что будет дальше
Google DeepMind планирует сделать SL2T доступной через облачный API, чтобы сторонние разработчики могли интегрировать ее в свои приложения. Ожидается, что первые партнерские интеграции появятся уже в 2025 году. Компания также работает над расширением языковой поддержки и улучшением точности для диалектов и акцентов.
В долгосрочной перспективе исследователи видят возможность обратного перевода — из текста в жестовый язык, что позволит слышащим людям общаться с глухими без знания жестового языка. Это станет следующим большим шагом в создании безбарьерной коммуникации.
Итог
Модель SL2T от Google DeepMind — это прорыв в области доступности, который может кардинально изменить жизнь миллионов людей с нарушениями слуха. Она не только упрощает общение, но и способствует социальной интеграции глухих людей. Следить за развитием этой технологии стоит не только представителям сообщества, но и разработчикам, бизнесу и всем, кто заботится о создании инклюзивного общества.