Flux 3: модель, которая учится видеть, слышать и понимать физику мира

Flux 3: модель, которая учится видеть, слышать и понимать физику мира

Компания Black Forest Labs — немецкий стартап, основанный бывшими создателями Stable Diffusion — представила Flux 3, новую модель для генерации изображений, видео и аудио. Модель доступна в раннем доступе.

Главное отличие Flux 3 от предыдущих версий: она учится сразу на трёх типах данных — изображениях, видео и звуке. Разработчики объясняют это так: каждый тип данных показывает только часть картины. Фото фиксирует пространство в один момент времени. Видео добавляет движение и физику. Звук раскрывает связи между событиями, которые не видно на картинке — например, как удар связан со звуком. Обучаясь на всём сразу, модель строит более полное представление о том, как устроен мир.

Технология называется Self-Flow. Она позволяет модели одновременно генерировать контент и понимать его — работать с изображением, видео и звуком в одной архитектуре.

Flux 3 умеет генерировать видео со звуком длиной до 20 секунд за один проход. Модель превращает текст в видео, оживляет статичное изображение, переносит персонажа из одного ролика в другой, дорисовывает видео по заданным ключевым кадрам и склеивает несколько коротких клипов в один длинный ролик.

В сравнительных тестах пользователи предпочли ролики Flux 3 роликам конкурентов: Luma Ray 3.2 — в 93% случаев, Runway Gen-4.5 — в 77%, Grok Imagine Video — в 69%, Kling v3 Pro — в 60%. Black Forest Labs уточняет, что тесты предварительные и результаты ещё изменятся до финального релиза.

Кроме генерации контента, Flux 3 научили предсказывать действия. Совместно с компанией mimic robotics разработчики создали Flux-mimic — модель для управления роботами-манипуляторами. Систему уже тестируют на производстве Audi.

Дальше Black Forest Labs планирует поэтапно открыть доступ: сначала видео и звук через API, затем управление роботами для партнёров, потом генерацию изображений и, наконец, версию с открытыми весами Flux 3 Dev.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.