У нейросети для видео Kandinsky 6.0 появилась генерация Full HD роликов длиной 5 секунд с синхронизированным звуком. Липсинк работает: губы персонажа двигаются в такт речи, а звук чистый — 44 кГц, без шипения. Модель выложили под лицензией MIT; она доступна на FAL, Diffusers, ComfyUI и других платформах.

Если коротко: ты пишешь текстом, что должно быть в кадре, — и получаешь готовый пятисекундный клип, где люди, животные и предметы двигаются естественно, по законам физики, а не дёргаются, как в старых генераторах. По замерам разработчиков Kandinsky 6.0 на 71% лучше Kandinsky 5.0, обходит Veo 3.1 Fast в анимации изображений и опережает LTX 2.5.

Что вообще произошло

Команда Kandinsky Lab выпустила новую версию видеомодели — Kandinsky 6.0 Video. Три главные вещи, которые нужно понять без технического жаргона:

• Видео теперь со звуком. Раньше нейросети для генерации видео выдавали немую картинку, и звук приходилось прикручивать отдельно. Здесь речь, музыка и фоновые шумы генерируются вместе с изображением.

• Губы попадают в слова. Если персонаж говорит, его артикуляция совпадает с произносимой фразой. Это открывает дорогу роликам, где герой реально «разговаривает», а не просто открывает рот.

• Физика стала правдоподобной. Люди, животные и предметы двигаются естественно — меньше сломанных рук и летающих чашек.

Ограничение пока одно: максимальная длительность — 5 секунд. Разработчики говорят, что будут её увеличивать.

Модель доступна на FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni, а страница проекта лежит на Hugging Face. Факты подтверждают независимые разборы — aicoder.com, explainx.ai и Форбс.

Что это даёт лично тебе

Владелец маленькой кофейни. Ему нужен ролик для соцсетей, но на съёмочную группу денег нет. Он пишет текстом сцену: бариста наливает кофе, пар поднимается, ложка звенит о чашку. У него 5-секундный клип со звуком — как раз для соцсетей с озвученными персонажами.

Фрилансер-дизайнер. Раньше рекламу товара приходилось рисовать в монтажке или заказывать съёмку. Теперь он делает продуктовые ролики без съёмочной группы: товар двигается, звучит, выглядит живо. Это ещё один пункт в портфолио и ещё одна услуга, которую можно продавать.

Репетитор по истории. Он оживляет историческую фигуру — условного Наполеона, который говорит 5 секунд на камеру.

Мама двоих детей, которая ведёт блог. Ей нравится ASMR, но записывать звуки самой долго. Она генерирует клип с дождём, шорохом страниц, треском свечи — и выкладывает готовое видео с естественными звуками.

Студент перед защитой проекта. Вместо статичной картинки на слайде — пятисекундная анимация, где схема собирается на глазах. Реклама продукта — и без съёмочной команды.

Продавец на маркетплейсе. Короткий ролик с товаром в движении цепляет лучше фото. Он собирает 5-секундные сцены и склеивает их в один ролик.

Как попробовать прямо сейчас

Шаг 1. Начни с бесплатного пути — зайди на страницу модели. Открой Kandinsky 6.0 Pro на Hugging Face. Там лежат сама модель и примеры: посмотри, что она уже умеет, — это самая честная проверка, прежде чем тратить время.

Шаг 2. Придумай сцену и озвучку. Пяти секунд хватает на одно действие: «человек поднимает чашку и говорит одну фразу». Не пытайся уместить сюжет на три минуты — не влезет.

Шаг 3. Опиши это текстом. Чем конкретнее, тем лучше: кто в кадре, что делает, какой звук, какой свет. Пример готового промпта — в бонусе в конце статьи.

Шаг 4. Выбери, где запускать. Если у тебя мощный компьютер — ставь ComfyUI или Diffusers и крути модель локально. Если железа нет — используй FAL, облачный вариант, где модель уже развёрнута. Для быстрых экспериментов этого достаточно.

Шаг 5. Проверь результат и склей. Сгенерируй 5 секунд, посмотри, поправь описание и сгенерируй снова. Нужен ролик длиннее — сделай несколько коротких сцен и соедини их в обычном монтажном приложении на телефоне.

Шаг 6. Помощник для идей. Если сценарий не идёт, открой Gemini и попроси: «Придумай 10 сцен по 5 секунд для рекламы кофейни, с описанием звука и движения камеры». Оттуда бери готовые описания и неси в генератор.

Плюсы и что изменится дальше

Раньше видео с ИИ было дорогой игрушкой: либо платные сервисы с ограничениями, либо немые клипы без звука. Сейчас ты получаешь открытую модель под MIT — то есть её можно свободно использовать и встраивать в свои проекты, а звук и картинка идут одним куском. Для обычного человека это значит, что порог входа упал: не нужна камера, свет, микрофон и актёр.

Конвертер аудио — конвертировать и обработать аудио. Прямо на MyKreaTool.Открыть инструмент →

Логика простая: длительность вырастет со временем, а привычка «сначала сгенерирую, потом посмотрю» станет обычной. Тот, кто освоит промпты для видео сегодня, будет просто быстрее остальных, когда ограничение в 5 секунд снимут.

Честно о минусах

Пять секунд — это правда мало: полноценную историю на таком отрезке не расскажешь, придётся собирать из кусочков. Чтобы гонять модель на своём компьютере, нужна приличная видеокарта — на слабом ноутбуке локальный запуск не потянет, придётся идти в облако. И лицензия MIT снимает вопрос платы, но не отменяет правил площадок, куда ты выкладываешь результат.

Сделай один шаг сегодня

Kandinsky 6.0 Video — уже доступный рабочий инструмент. Не нужно учиться монтажу месяцами: возьми одну свою задачу — ролик для товара, оживление персонажа для урока, ASMR для блога — и сделай первую пятисекундную сцену. Выбирай инструмент под задачу: если Kandinsky 6.0 Video решает её, начни с него.

Сделай конкретное действие прямо сейчас: открой страницу модели на Hugging Face, посмотри примеры и сохрани эту статью в закладки. А если что-то не получилось или хочешь показать свой первый клип — напиши в комментариях в @aigoby.

🎁 Бонус: готовый промпт

Скопируй и подставь своё:

```

Сцена: бариста в маленькой кофейне наливает кофе в белую чашку, крупный план

Движение камеры: медленный наезд на чашку

Звук: шипение пара, звон ложки о чашку, тихая музыка на фоне

Речь: бариста говорит фразу «Свежий, только что сварил»

Свет: тёплый утренний свет из окна

Стиль: реалистичное видео, Full HD, естественная физика

Длительность: 5 секунд

```

Чек-лист перед генерацией:

• одно действие на 5 секунд — не больше;

• звук описан отдельной строкой;

• фраза для речи короткая, иначе не влезет по времени;

• камера обозначена (наезд, статика, облёт) — так кадр живее;

• свет и стиль заданы — иначе нейросеть выберет случайно.