Tavus показала Griffin — аватар, в котором реалистичный ИИ генерирует видео в реальном времени, а задержка видеогенерации — 0,43 секунды на NVIDIA H100. Это не заранее сделанный ролик: модель рисует лицо, взгляд, мимику и жесты прямо во время разговора. Griffin-Lite выдаёт 720p при 25 fps, а сам аватар продолжает слушать и смотреть на тебя, даже когда отвечает.
Что вообще произошло
Tavus представила Griffin — real-time ИИ-аватар, то есть цифрового человека, который разговаривает с тобой в прямом эфире. Он получает твою речь и видео: слышит, что ты сказал, и одновременно видит тебя. Причём даже в тот момент, когда Griffin отвечает сам, он продолжает слушать и смотреть — как живой человек, который не выключается на середине твоей фразы.
Дальше самое интересное. Аватар параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр. Он умеет синхронно двигать губами, кивнуть во время твоей реплики, отвести взгляд в сторону, поменять выражение лица, вставить короткую фразу — или замолчать, если его перебили. Раньше создание ИИ-аватара сводилось к «оживлению» статичной картинки, теперь речь идёт о полноценном собеседнике, который реагирует на тебя в моменте.
Технически это устроено так: модель собирает видео кусками по 320 мс, где один latent — это 8 кадров, а на каждый такой кусок уходит всего 3 diffusion steps (шага генерации изображения). После этого кусок сразу декодируется и отправляется зрителю на том конце. Именно за счёт такой схемы картинка успевает появляться на экране почти без паузы.
Почему 0,43 секунды — не вся правда
Здесь важно не обмануться красивой цифрой. 0,43 секунды — это задержка именно видеогенератора после поступления управляющего аудиосигнала, а не скорость всего разговора. В полном разговорном тесте NVIDIA медианная реакция Griffin составила около 1,9–2,2 секунды в зависимости от задачи. То есть в живой беседе пауза между твоим вопросом и ответом аватара будет заметно длиннее, чем в тесте одного узла системы.
По железу Tavus тоже раскрывает не всё. Тест видеогенератора проводился на NVIDIA H100, но сколько GPU нужно на одну сессию и на каких конфигурациях работает весь Griffin, компания пока не сообщает. Поэтому утверждать, что «один Griffin = один H100», нельзя. В разделе благодарностей Tavus отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview — то есть за техническую базу, на которой всё это запускалось для исследовательского доступа.
И ещё один момент, который многое объясняет. По данным The Decoder, почти половина участников теста приняли аватара Tavus за реального человека во время минутного звонка. Именно поэтому вопрос «ты точно сможешь отличить его от человека?» — не хайп ради хайпа.
Что это даёт лично тебе
Давай по конкретным людям, без абстракций.
• Фрилансер-дизайнер, который ненавидит камеру. Он годами отказывался от видеозвонков с клиентами, писал всё текстом. С ИИ-аватаром он один раз настраивает внешний вид и дальше отправляет клиенту видеоответы, не включая свою камеру и не тратя час на перезапись дублей.
• Владелец кофейни. Новичок-бариста выходит на смену и задаёт вопросы не сонному управляющему, а виртуальному наставнику: как настроить кофемолку, что делать с жалобой на горький эспрессо. Аватар отвечает голосом и при этом «смотрит» на собеседника, а не висит статичной картинкой.
• Мама двоих детей, которой некогда водить ребёнка на разговорный английский. Домашний репетитор-аватар не устаёт, не раздражается на двадцатую ошибку и готов болтать с ребёнком сколько угодно — пусть пока и с паузой в 1,9–2,2 секунды.
• Студент перед защитой диплома. Он прогоняет выступление с аватаром в роли комиссии: тот перебивает, отводит взгляд, задаёт неудобный вопрос — и к реальной защите человек приходит уже с тренировкой, а не с дрожащими руками.
• Блогер или эксперт. Вместо одного видео «для всех» он записывает короткие персональные ответы подписчикам — и выглядит в них как живой человек, а не как текст с зачитанным голосом.
• Небольшой бизнес с заявками ночью. Виртуальный собеседник на странице может первым поздороваться и уточнить, что нужно клиенту, пока ты спишь, а утром ты читаешь готовый список запросов. Это не замена продавцу, но первый контакт уже не теряется.
Как попробовать прямо сейчас
• Шаг 1. Загляни на официальную страницу Griffin от Tavus — там показано, как выглядит аватар и что входит в research preview.
• Шаг 2. Прочитай разбор характеристик и бенчмарков на Kingy.ai и короткую новость на The Rundown — так ты поймёшь, где технология уже работает, а где пока только обещания.
• Шаг 3. Если хочешь разобраться, на чём вообще крутятся такие модели, открой страницу NVIDIA по искусственному интеллекту — именно на H100 гоняли тест видеогенератора Griffin.
• Шаг 4. Напиши сценарий первой минуты разговора: с чего аватар здоровается, что должен выяснить у собеседника, чем заканчивает. Одна минута — идеальный первый тест.
• Шаг 5. Пока доступ ограничен (research preview — это ранний, исследовательский доступ), потренируйся на своём сценарии вслух и запиши себя. Когда откроется доступ, у тебя уже будет готовый материал, а не паника перед пустым экраном.
Плюсы, минусы и что будет дальше
Главный плюс — генерация в реальном времени. Это не монтаж и не заранее отрендеренный ролик: аватар реагирует на перебивание, кивает, отводит взгляд, меняет выражение лица. Картинка 720p при 25 fps для разговора по видео вполне достаточна, а задержка видеогенератора 0,43 секунды означает, что картинка почти не отстаёт от звука.
Минусы тоже есть. В полноценной беседе пауза 1,9–2,2 секунды ощущается как «человек задумался» — иногда это нормально, иногда раздражает. Про железо ясности нет: сколько GPU нужно на одну сессию, Tavus не говорит, так что рассчитывать на «поставил дома и запустил» пока рано. И доступ исследовательский, а не массовый.
Что это меняет для обычного человека? Через несколько месяцев такие аватары логично станут дешевле и доступнее — и тогда «снять видео» перестанет быть отдельной задачей на вечер. Ты просто наговариваешь мысль, а собеседник на экране её произносит с естественной мимикой и взглядом.
Вывод и одно действие на сегодня
Griffin пока доступен в research preview, но показывает, что ИИ-аватары становятся практичнее: 0,43 секунды задержки видеогенератора, реакция на перебивание, 720p и 25 fps, медианная реакция в разговоре около 1,9–2,2 секунды. Это уже не «говорящая фотография» — это виртуальный собеседник, который смотрит на тебя и слушает, пока говорит сам.
Сделай одно действие прямо сейчас: открой страницу Griffin от Tavus, посмотри демо и подумай, где бы ты применил такого аватара — в работе, учёбе или бизнесе. Самые интересные идеи разберём отдельным постом.
🎁 Бонус для тебя
Готовый промпт для сценария первой минуты разговора с ИИ-аватаром. Скопируй и подставь своё:
```text
Ты — сценарист диалога с ИИ-аватаром (real-time, 720p, 25 fps, пауза ответа около 2 секунд).
Задача: написать сценарий первой минуты разговора.
Контекст:
• Кто говорит с аватаром: [например, новый клиент / студент / подписчик]
• Цель разговора: [например, узнать, нужна ли консультация]
• Тон аватара: [например, дружелюбный, спокойный, деловой]
Сделай так:
1. Реплика-приветствие — максимум 2 предложения.
2. Три открытых вопроса, которые аватар задаёт по очереди и ждёт ответа.
3. Две короткие реакции на перебивание: «извини, договори» и «да, слушаю».
4. Один невербальный момент: где аватар кивает, отводит взгляд или меняет выражение лица.
5. Финальная фраза-завершение и следующий шаг для собеседника.
Формат: таблица из трёх колонок — реплика / что делает аватар (жест, взгляд) / сколько секунд пауза после.
```
А если хочешь сначала разобраться в технической базе — держи короткий чек-лист: посмотри демо на странице Tavus, прочитай разбор бенчмарков, найди, где в твоей работе теряется время на видео, и напиши одну пробную минутную сцену. Этого достаточно, чтобы не отстать, когда такие аватары станут обыденностью.



Комментарии 0