Немецкая Black Forest Labs выпустила Flux 3 — нейросеть для видео, которая впервые в истории компании генерирует ролики длиной до 20 секунд сразу с нативным звуком, синхронизированным с картинкой. В первых тестах модель обошла Luma Ray 3.2 в 93% сравнений, Runway Gen-4.5 — в 77%, а против топовых конкурентов вроде Kling v3 Pro и Seedance 2.0 показала паритет или небольшое преимущество. Для тех, кто использует ии для создания видео в работе, это значит одно: озвучка роликов перестаёт быть отдельным этапом.

Чем Flux 3 отличается от других нейросетей для создания видео: лучшие нейросети для видео

До сих пор большинство инструментов генерировали немую картинку, а звук и голос добавляли отдельно — через TTS, библиотеки эффектов или ручной монтаж. Flux 3 обучен одновременно на изображениях, видео и аудио, поэтому модель сама понимает, какой звук должен сопровождать движение: шаги, удар, скрип двери, реплику персонажа. BFL особо отмечает качество мимики и синхронизацию губ с речью — а это ключевая проблема почти всех предыдущих генераторов.

Из практических функций: text-to-video, image-to-video (то есть полноценный ии для создания видео из фото), video-to-video, переходы по ключевым кадрам и склейка нескольких клипов в единую сцену через агентную логику. Поддерживается многоязычный диалог — значит, в теории можно получить генерацию видео с голосом сразу на русском.

Конвертер аудио — конвертировать и обработать аудио. Прямо на MyKreaTool.Открыть инструмент →

Зачем это предпринимателям и фрилансерам: ии для создания видео бесплатно

Если вы делаете рекламные ролики, контент для соцсетей или обучающие видео, Flux 3 закрывает сразу две боли: озвучку и монтаж. Раньше сборка 20-секундного ролика с голосом требовала отдельно генератора видео, отдельно TTS, отдельно ии для монтажа, который сводит всё воедино. Теперь это один прогон через модель. Для фрилансеров это прямой путь сократить время на заказ и взять больше проектов; для бизнеса — снизить стоимость видеорекламы без студии и актёров озвучки.

Что ещё готовит Black Forest Labs: нейросеть для видео из фото

Компания также анонсировала Flux 3 Image — обновлённую модель для генерации изображений со сложными промптами и точным текстом на разных языках, релиз в открытый доступ ожидается в ближайшие недели. Параллельно BFL совместно с Mimic Robotics разработала Flux-mimic — модель, которая предсказывает физические действия и уже тестируется на производственных задачах в Audi. Это показывает, куда в целом движутся технологии ии в видео: от генерации картинки к пониманию физики мира и связи между изображением, звуком и действием.

BFL честно предупреждает, что результаты сравнений предварительные и независимых тестов пока нет. Но даже с этой оговоркой Flux 3 — самая заметная нейросеть для генерации видео за последнее время именно из-за звука: раньше это была ниша Sora и пары нишевых проектов, теперь в гонку вступил ещё один сильный игрок.