Говорящий аватар от Google Gemini 3.8 Live создаёт ИИ-лицо, которое разговаривает с тобой в реальном времени: видео идёт со скоростью 24 кадра в секунду, а язык можно менять прямо посреди беседы, всего их 97. Это не озвученная картинка. Аватар слышит тебя, видит через камеру, отвечает голосом с движением губ и мимикой и параллельно может лезть в рабочие системы, например проверять бронь. Пока функция запущена в корпоративной платформе Gemini Enterprise, но направление понятно уже сейчас.

Что произошло на самом деле: как создать ИИ аватар

Google представила Gemini 3.8 Live with Live Avatar. Модель принимает голос, изображение, видео и текст, а отвечает анимированным персонажем: с синхронизацией губ, мимикой и голосом.

Раньше это выглядело так: есть чат-бот, к нему приклеили отдельный генератор «говорящей головы». Получалось медленно и криво. Здесь аватар встроен прямо в разговорную модель, то есть это единый организм, а не два устройства, связанных скотчем.

Что ещё важно знать:

• Мимика следует за интонацией. Ответ звучит спокойно, лицо спокойное. Тема серьёзная, выражение меняется.

• 97 языков в одной сессии. Начал по-русски, переключился на испанский, и губы подстроятся под новую речь без перезапуска.

• Affective dialogue. Модель учитывает темп речи, паузы и эмоции собеседника. Спокойный вопрос и раздражённая жалоба для неё звучат по-разному, и манера ответа меняется.

• Proactive audio. Фильтрует фоновый шум и чужие разговоры, отвечает только когда обращаются именно к ней. Для магазина или гостиницы, где вокруг всегда кто-то говорит, это спасение.

Агент работает, пока вы разговариваете: ии аватар видео

Самая практичная фишка связана с вызовом функций. Function calling значит, что модель может обращаться к внешним сервисам: проверить бронь, найти заказ в CRM, запросить данные из внутренней системы.

Раньше голосовому помощнику приходилось замолкать и ждать ответа сервера. Помнишь это «Ваш запрос обрабатывается, оставайтесь на линии»? Gemini 3.8 Live продолжает разговор, а нужная операция выполняется в фоне.

В демонстрации Google виртуальный сотрудник регистрирует гостя в отеле: аватар разговаривает с человеком и параллельно обращается к системе бронирования. Так работает хороший администратор: поддерживает беседу и одновременно стучит по клавишам.

Что под капотом, коротко и без нудности: создание ии аватара

Для тех, кто хочет заказать или собрать такое решение, вот факты из документации Google Cloud:

• Связь идёт через постоянное двустороннее соединение WebSocket. Не нужно отправлять новый запрос на каждую реплику, поток данных идёт непрерывно.

• Модель принимает аудио, текст и кадры видео. Видео анализируется с частотой до одного кадра в секунду.

• На выходе: звук, текст и MP4-видео с аватаром, 24 кадра в секунду.

• Контекстное окно до 128 тысяч токенов. Простыми словами, это «память» одного разговора: сколько информации модель держит в голове внутри сессии.

• Идентификатор модели в API: `gemini-3.8-live`.

Есть готовые персонажи и набор голосов. Компаниям также разрешат создавать собственного аватара по одному референсному изображению: модель сохранит внешность и превратит статичную картинку в говорящего цифрового сотрудника. Но пока кастомные аватары доступны только отдельным клиентам после согласования с Google Cloud.

Что это даёт лично тебе: ии для аватара

Даже если ты не собираешься лезть в API, вот как такая технология может пригодиться в жизни. Это возможные сценарии, а не готовые продукты.

• Владелец кофейни или небольшого отеля. Виртуальный администратор встречает гостей, отвечает на вопросы, ищет бронь в системе, а ты не держишь человека на ресепшене круглосуточно.

• Фрилансер-консультант. Ты продаёшь услуги иностранным клиентам. Аватар, который переключается между языками на лету, может провести первичную консультацию, пока ты спишь.

• Онлайн-школа или репетитор. Персонаж-«учитель» не просто читает текст, а слышит, где ученик запнулся, и меняет темп объяснения.

• Интернет-магазин. Вместо чата с шаблонными ответами: лицо, которое находит заказ в CRM и объясняет, где посылка.

• Мама двоих детей, которая учит английский. Разговорный тренажёр с живым собеседником, который поправляет и не устаёт.

• Творчество. Персонаж для проекта, канала или бренда, который умеет говорить с аудиторией, а не только красиво выглядеть.

Конвертер аудио — конвертировать и обработать аудио. Прямо на MyKreaTool.Открыть инструмент →

Как попробовать прямо сейчас: сделать аватар ии

Честно: сама функция Live Avatar запущена в Gemini Enterprise. Это корпоративная платформа, и для обычного пользователя открытого бесплатного доступа к аватарам в источнике не указано. Но подготовиться и потренироваться на обычном Gemini можно уже сегодня.

1. Зайди в Gemini: gemini.google.com и войди через Google-аккаунт.

2. Потренируйся формулировать задачу. Опиши свой сценарий (администратор, консультант, репетитор) обычным текстом и попроси набросать сценарий диалога. Это твоя заготовка на будущее.

3. Проверь голосовой режим, если он доступен в твоём приложении. Поговори с ассистентом вслух и посмотри, как он реагирует на паузы и перебивания.

4. Собери «паспорт» будущего аватара: имя, характер, тон общения, что он должен уметь проверять (бронь, заказ, расписание) и чего делать нельзя.

5. Если у компании есть Google Cloud, спроси у администратора про Gemini Enterprise и доступ к `gemini-3.8-live`. Для своих аватаров нужно согласование с Google Cloud.

Плюсы, и что изменится в ближайшее время: ии аватар бесплатно

Главный плюс: разговор наконец перестаёт быть похож на общение с автоответчиком. Нет пауз-«загрузки», есть живая мимика, реакция на эмоции и работа в фоне. Один человек с одним аватаром может обслуживать клиентов на 97 языках, а раньше для этого нужен был целый штат.

Если технология дойдёт до массовых тарифов, логично ждать, что появятся сервисы «ИИ-сотрудник под ключ» для небольшого бизнеса. Но это прогноз, а не обещание Google.

Минусы и ограничения: аватар ии помощь

Пока это корпоративный продукт. Свои аватары по одному фото доступны не всем, а после согласования с Google Cloud. Есть жёсткие рамки: нельзя использовать изображения несовершеннолетних и знаменитостей, а на лицо и голос нужны законные права. Ищущим бесплатные ИИ-аватары в источнике никаких бесплатных лимитов не обещано, так что проверяй условия сам.

Вывод и что сделать сегодня: как создать ии аватара

ИИ получил лицо, и это лицо умеет слушать, чувствовать интонацию и работать одновременно с разговором. Сегодня достаточно одного шага: открой Gemini и опиши свой идеальный виртуальный сотрудник по шаблону ниже. Когда доступ дойдёт до тебя, у тебя уже будет готовое задание. А если у тебя уже есть идея для аватара, напиши в комментариях @aigoby, обсудим.

Бонус: готовый промпт для копирования, чтобы создать ии аватар бесплатно

Вставь в Gemini и подставь свои данные:

```

Ты помогаешь мне спроектировать виртуального сотрудника с говорящим аватаром.

Моя сфера: [кофейня / отель / онлайн-школа / консалтинг].

Клиенты: [кто они, на каких языках говорят].

Задачи аватара: [встреча гостя, ответы на вопросы, проверка заказа или брони].

Что нужно проверять во внешних системах: [CRM, бронирование, расписание].

Составь: 1) имя и характер персонажа, 2) тон общения в спокойной и конфликтной ситуации,

3) сценарий приветствия и трёх типичных диалогов, 4) список того, чего аватар делать не должен.

```

Мини-чек-лист перед запуском аватара:

• Есть право на лицо и голос персонажа.

• Нет изображений несовершеннолетних и знаменитостей.

• Понятно, к каким системам аватар должен обращаться.

• Прописаны границы: на какие вопросы он передаёт разговор человеку.