Сбербанк выпустил Kandinsky WM 1.0 — семейство нейросетей, которые генерируют видео по законам физики. Код и веса выложены под лицензией MIT: скачать и использовать может любой разработчик в мире бесплатно.
Это первое открытое российское семейство таких моделей. В мире их единицы.
Зачем это нужно
Есть отдельный класс систем — Physical AI, физический ИИ. Роботы, беспилотники, промышленные манипуляторы: всё, что должно понимать устройство реального мира и действовать в нём.
Проблема в данных. Языковые модели учат на интернете, он уже собран. Для физического ИИ открытых данных нужного масштаба нет вообще — их приходится добывать самому: устройства, датчики, операторы, контролируемая среда.
Автомобиль с камерами накапливает около 5000 часов записей в год. Современным моделям нужны миллионы часов.
А самое ценное не снять в принципе: ДТП, отказ оборудования, экстремальная погода. Именно к этим сценариям робота и надо готовить, но воспроизвести их вживую нельзя.
Ян Лекун, лауреат премии Тьюринга и один из «отцов» глубокого обучения, оценивал масштаб так: четырёхлетний ребёнок только через зрение получает больше информации, чем содержится во всех текстах, на которых обучены крупнейшие языковые модели.
Как обучали
В основе — Kandinsky 5.0 Video Lite. Её дообучили на нескольких миллионах реальных видеосцен: машины, роботы, производственные процессы.
Обычные видеогенераторы врут в мелочах — объекты деформируются, перспектива плывёт, движения выглядят неестественно. Для дорожных сцен добавили обучение с подкреплением: отдельные модели оценивали ролики на сохранение формы объектов, геометрию и естественность движения, и по этой обратной связи Kandinsky подтягивал физику.
«Знать нужное уравнение и уметь предсказать реальное событие — совершенно разные вещи, — говорит Денис Димитров, CTO Kandinsky и управляющий директор по исследованию данных Сбербанка. — Есть кейсы, которые вообще не описываются уравнениями, например поведение пешехода перед беспилотным автомобилем. Человек решает эту задачу не вычислением, а интуицией, накопленной из опыта. Наши модели учатся так же».
Kandinsky WM уже используют Центр робототехники Сбербанка — для обучения собственных роботов — и институт AIRI в своём дорожном симуляторе.
Ролики длятся около пяти секунд и показывают одно действие: взял, положил, разрезал, перестроился. До полноценной модели мира, которая разворачивает сцену во времени и работает симулятором, отсюда ещё далеко.