Gemini выходит из чата: Google научила модель управлять роботами

Gemini выходит из чата: Google научила модель управлять роботами

Google DeepMind выпустила Gemini Robotics 2 — версию своей модели, которая управляет роботами. В том числе человекоподобными.

Обычная Gemini получает на входе текст и картинки, а на выходе выдаёт текст. Здесь на выходе — движения. Модель смотрит на сцену через камеру робота, слышит задание обычными словами и сама раскладывает его на последовательность действий.

В DeepMind это называют движением к «физическому AGI»: универсальный интеллект должен не только рассуждать, но и что-то делать руками.

Главная сложность робототехники — не мозги, а данные. В интернете лежат триллионы слов и миллиарды картинок, но почти нет записей того, как рука аккуратно берёт кружку и ставит её на полку. Такие данные собирают вручную, робот за роботом, час за часом.

Второй барьер — железо. У каждой модели робота своя механика и свои моторы, и то, что работало на одном манипуляторе, на другом не работает. Линейка Gemini Robotics — это попытка сделать один «мозг» для разных тел.

Дальше начинаются риски, о которых пишет Wired. Языковая модель умеет ошибаться уверенно — выдумать факт и не заметить этого. В чате цена такой ошибки — неверный абзац. У машины с моторами — разбитая посуда или сломанный палец.

Отдельная история — промпт-инъекции. Робот воспринимает мир через камеру, а значит в кадр можно положить лист бумаги с инструкцией. Для языковых моделей это давняя нерешённая уязвимость. В физическом мире у неё появляются руки.

Демороликов с гуманоидами за последние пару лет вышло много. Роботов, которые надёжно работают в чужом доме без оператора за кадром, — ни одного.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.