У нейросети для видео Kandinsky 6.0 появилась генерация Full HD роликов длиной 5 секунд с синхронизированным звуком. Липсинк работает: губы персонажа двигаются в такт речи, а звук чистый — 44 кГц, без шипения. Модель выложили под лицензией MIT; она доступна на FAL, Diffusers, ComfyUI и других платформах.
Если коротко: ты пишешь текстом, что должно быть в кадре, — и получаешь готовый пятисекундный клип, где люди, животные и предметы двигаются естественно, по законам физики, а не дёргаются, как в старых генераторах. По замерам разработчиков Kandinsky 6.0 на 71% лучше Kandinsky 5.0, обходит Veo 3.1 Fast в анимации изображений и опережает LTX 2.5.
Что вообще произошло
Команда Kandinsky Lab выпустила новую версию видеомодели — Kandinsky 6.0 Video. Три главные вещи, которые нужно понять без технического жаргона:
• Видео теперь со звуком. Раньше нейросети для генерации видео выдавали немую картинку, и звук приходилось прикручивать отдельно. Здесь речь, музыка и фоновые шумы генерируются вместе с изображением.
• Губы попадают в слова. Если персонаж говорит, его артикуляция совпадает с произносимой фразой. Это открывает дорогу роликам, где герой реально «разговаривает», а не просто открывает рот.
• Физика стала правдоподобной. Люди, животные и предметы двигаются естественно — меньше сломанных рук и летающих чашек.
Ограничение пока одно: максимальная длительность — 5 секунд. Разработчики говорят, что будут её увеличивать.
Модель доступна на FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni, а страница проекта лежит на Hugging Face. Факты подтверждают независимые разборы — aicoder.com, explainx.ai и Форбс.
Что это даёт лично тебе
Владелец маленькой кофейни. Ему нужен ролик для соцсетей, но на съёмочную группу денег нет. Он пишет текстом сцену: бариста наливает кофе, пар поднимается, ложка звенит о чашку. У него 5-секундный клип со звуком — как раз для соцсетей с озвученными персонажами.
Фрилансер-дизайнер. Раньше рекламу товара приходилось рисовать в монтажке или заказывать съёмку. Теперь он делает продуктовые ролики без съёмочной группы: товар двигается, звучит, выглядит живо. Это ещё один пункт в портфолио и ещё одна услуга, которую можно продавать.
Репетитор по истории. Он оживляет историческую фигуру — условного Наполеона, который говорит 5 секунд на камеру.
Мама двоих детей, которая ведёт блог. Ей нравится ASMR, но записывать звуки самой долго. Она генерирует клип с дождём, шорохом страниц, треском свечи — и выкладывает готовое видео с естественными звуками.
Студент перед защитой проекта. Вместо статичной картинки на слайде — пятисекундная анимация, где схема собирается на глазах. Реклама продукта — и без съёмочной команды.
Продавец на маркетплейсе. Короткий ролик с товаром в движении цепляет лучше фото. Он собирает 5-секундные сцены и склеивает их в один ролик.
Как попробовать прямо сейчас
Шаг 1. Начни с бесплатного пути — зайди на страницу модели. Открой Kandinsky 6.0 Pro на Hugging Face. Там лежат сама модель и примеры: посмотри, что она уже умеет, — это самая честная проверка, прежде чем тратить время.
Шаг 2. Придумай сцену и озвучку. Пяти секунд хватает на одно действие: «человек поднимает чашку и говорит одну фразу». Не пытайся уместить сюжет на три минуты — не влезет.
Шаг 3. Опиши это текстом. Чем конкретнее, тем лучше: кто в кадре, что делает, какой звук, какой свет. Пример готового промпта — в бонусе в конце статьи.
Шаг 4. Выбери, где запускать. Если у тебя мощный компьютер — ставь ComfyUI или Diffusers и крути модель локально. Если железа нет — используй FAL, облачный вариант, где модель уже развёрнута. Для быстрых экспериментов этого достаточно.
Шаг 5. Проверь результат и склей. Сгенерируй 5 секунд, посмотри, поправь описание и сгенерируй снова. Нужен ролик длиннее — сделай несколько коротких сцен и соедини их в обычном монтажном приложении на телефоне.
Шаг 6. Помощник для идей. Если сценарий не идёт, открой Gemini и попроси: «Придумай 10 сцен по 5 секунд для рекламы кофейни, с описанием звука и движения камеры». Оттуда бери готовые описания и неси в генератор.
Плюсы и что изменится дальше
Раньше видео с ИИ было дорогой игрушкой: либо платные сервисы с ограничениями, либо немые клипы без звука. Сейчас ты получаешь открытую модель под MIT — то есть её можно свободно использовать и встраивать в свои проекты, а звук и картинка идут одним куском. Для обычного человека это значит, что порог входа упал: не нужна камера, свет, микрофон и актёр.
Логика простая: длительность вырастет со временем, а привычка «сначала сгенерирую, потом посмотрю» станет обычной. Тот, кто освоит промпты для видео сегодня, будет просто быстрее остальных, когда ограничение в 5 секунд снимут.
Честно о минусах
Пять секунд — это правда мало: полноценную историю на таком отрезке не расскажешь, придётся собирать из кусочков. Чтобы гонять модель на своём компьютере, нужна приличная видеокарта — на слабом ноутбуке локальный запуск не потянет, придётся идти в облако. И лицензия MIT снимает вопрос платы, но не отменяет правил площадок, куда ты выкладываешь результат.
Сделай один шаг сегодня
Kandinsky 6.0 Video — уже доступный рабочий инструмент. Не нужно учиться монтажу месяцами: возьми одну свою задачу — ролик для товара, оживление персонажа для урока, ASMR для блога — и сделай первую пятисекундную сцену. Выбирай инструмент под задачу: если Kandinsky 6.0 Video решает её, начни с него.
Сделай конкретное действие прямо сейчас: открой страницу модели на Hugging Face, посмотри примеры и сохрани эту статью в закладки. А если что-то не получилось или хочешь показать свой первый клип — напиши в комментариях в @aigoby.
🎁 Бонус: готовый промпт
Скопируй и подставь своё:
```
Сцена: бариста в маленькой кофейне наливает кофе в белую чашку, крупный план
Движение камеры: медленный наезд на чашку
Звук: шипение пара, звон ложки о чашку, тихая музыка на фоне
Речь: бариста говорит фразу «Свежий, только что сварил»
Свет: тёплый утренний свет из окна
Стиль: реалистичное видео, Full HD, естественная физика
Длительность: 5 секунд
```
Чек-лист перед генерацией:
• одно действие на 5 секунд — не больше;
• звук описан отдельной строкой;
• фраза для речи короткая, иначе не влезет по времени;
• камера обозначена (наезд, статика, облёт) — так кадр живее;
• свет и стиль заданы — иначе нейросеть выберет случайно.



Комментарии 0