Google DeepMind представила модель SL2T, которая переводит жестовый язык в текст. Первым устройством с новой функцией станет Pixel 11, выход которого запланирован на 20 августа 2026 года.
На старте система будет распознавать американский жестовый язык и переводить его на английский. Пользователи смогут вводить текст жестами в клавиатуре Gboard и приложении Live Transcribe. Доплачивать за эту возможность не придется.
SL2T анализирует не обычную видеозапись, а положение тела и движения человека. Данные о позе обрабатываются прямо на смартфоне, после чего серверы Google переводят их в текст. Такой подход сокращает объем передаваемой информации, хотя сам перевод выполняется не полностью на устройстве.
Создать универсальный переводчик жестов сложнее, чем может показаться. Жестовые языки отличаются грамматикой и словарем, а смысл зависит от движений рук и тела. Модель должна отслеживать все это с высокой частотой и без заметной задержки.
Разработчики отдельно учили SL2T работать в бытовых условиях. Система лучше распознает жесты одной рукой, когда другой пользователь держит телефон. Она также должна реже придумывать текст, если пользователь в этот момент ничего не показывает.
По данным Google DeepMind, в мире существует более 200 жестовых языков, которыми пользуются около 70 млн глухих и слабослышащих людей. Однако современные голосовые интерфейсы и автоматические переводчики для них почти недоступны.
Участники испытаний рассказали Google, что ввод жестами оказался быстрее и естественнее печати. Через Gboard так можно будет писать сообщения и документы, искать информацию в интернете или отправлять запросы Gemini.
Пока продукт поддерживает только одну языковую пару и один смартфон. Google планирует постепенно расширять список совместимых устройств.