Говорящий аватар от Google Gemini 3.8 Live создаёт ИИ-лицо, которое разговаривает с тобой в реальном времени: видео идёт со скоростью 24 кадра в секунду, а язык можно менять прямо посреди беседы, всего их 97. Это не озвученная картинка. Аватар слышит тебя, видит через камеру, отвечает голосом с движением губ и мимикой и параллельно может лезть в рабочие системы, например проверять бронь. Пока функция запущена в корпоративной платформе Gemini Enterprise, но направление понятно уже сейчас.
Что произошло на самом деле: как создать ИИ аватар
Google представила Gemini 3.8 Live with Live Avatar. Модель принимает голос, изображение, видео и текст, а отвечает анимированным персонажем: с синхронизацией губ, мимикой и голосом.
Раньше это выглядело так: есть чат-бот, к нему приклеили отдельный генератор «говорящей головы». Получалось медленно и криво. Здесь аватар встроен прямо в разговорную модель, то есть это единый организм, а не два устройства, связанных скотчем.
Что ещё важно знать:
• Мимика следует за интонацией. Ответ звучит спокойно, лицо спокойное. Тема серьёзная, выражение меняется.
• 97 языков в одной сессии. Начал по-русски, переключился на испанский, и губы подстроятся под новую речь без перезапуска.
• Affective dialogue. Модель учитывает темп речи, паузы и эмоции собеседника. Спокойный вопрос и раздражённая жалоба для неё звучат по-разному, и манера ответа меняется.
• Proactive audio. Фильтрует фоновый шум и чужие разговоры, отвечает только когда обращаются именно к ней. Для магазина или гостиницы, где вокруг всегда кто-то говорит, это спасение.
Агент работает, пока вы разговариваете: ии аватар видео
Самая практичная фишка связана с вызовом функций. Function calling значит, что модель может обращаться к внешним сервисам: проверить бронь, найти заказ в CRM, запросить данные из внутренней системы.
Раньше голосовому помощнику приходилось замолкать и ждать ответа сервера. Помнишь это «Ваш запрос обрабатывается, оставайтесь на линии»? Gemini 3.8 Live продолжает разговор, а нужная операция выполняется в фоне.
В демонстрации Google виртуальный сотрудник регистрирует гостя в отеле: аватар разговаривает с человеком и параллельно обращается к системе бронирования. Так работает хороший администратор: поддерживает беседу и одновременно стучит по клавишам.
Что под капотом, коротко и без нудности: создание ии аватара
Для тех, кто хочет заказать или собрать такое решение, вот факты из документации Google Cloud:
• Связь идёт через постоянное двустороннее соединение WebSocket. Не нужно отправлять новый запрос на каждую реплику, поток данных идёт непрерывно.
• Модель принимает аудио, текст и кадры видео. Видео анализируется с частотой до одного кадра в секунду.
• На выходе: звук, текст и MP4-видео с аватаром, 24 кадра в секунду.
• Контекстное окно до 128 тысяч токенов. Простыми словами, это «память» одного разговора: сколько информации модель держит в голове внутри сессии.
• Идентификатор модели в API: `gemini-3.8-live`.
Есть готовые персонажи и набор голосов. Компаниям также разрешат создавать собственного аватара по одному референсному изображению: модель сохранит внешность и превратит статичную картинку в говорящего цифрового сотрудника. Но пока кастомные аватары доступны только отдельным клиентам после согласования с Google Cloud.
Что это даёт лично тебе: ии для аватара
Даже если ты не собираешься лезть в API, вот как такая технология может пригодиться в жизни. Это возможные сценарии, а не готовые продукты.
• Владелец кофейни или небольшого отеля. Виртуальный администратор встречает гостей, отвечает на вопросы, ищет бронь в системе, а ты не держишь человека на ресепшене круглосуточно.
• Фрилансер-консультант. Ты продаёшь услуги иностранным клиентам. Аватар, который переключается между языками на лету, может провести первичную консультацию, пока ты спишь.
• Онлайн-школа или репетитор. Персонаж-«учитель» не просто читает текст, а слышит, где ученик запнулся, и меняет темп объяснения.
• Интернет-магазин. Вместо чата с шаблонными ответами: лицо, которое находит заказ в CRM и объясняет, где посылка.
• Мама двоих детей, которая учит английский. Разговорный тренажёр с живым собеседником, который поправляет и не устаёт.
• Творчество. Персонаж для проекта, канала или бренда, который умеет говорить с аудиторией, а не только красиво выглядеть.
Как попробовать прямо сейчас: сделать аватар ии
Честно: сама функция Live Avatar запущена в Gemini Enterprise. Это корпоративная платформа, и для обычного пользователя открытого бесплатного доступа к аватарам в источнике не указано. Но подготовиться и потренироваться на обычном Gemini можно уже сегодня.
1. Зайди в Gemini: gemini.google.com и войди через Google-аккаунт.
2. Потренируйся формулировать задачу. Опиши свой сценарий (администратор, консультант, репетитор) обычным текстом и попроси набросать сценарий диалога. Это твоя заготовка на будущее.
3. Проверь голосовой режим, если он доступен в твоём приложении. Поговори с ассистентом вслух и посмотри, как он реагирует на паузы и перебивания.
4. Собери «паспорт» будущего аватара: имя, характер, тон общения, что он должен уметь проверять (бронь, заказ, расписание) и чего делать нельзя.
5. Если у компании есть Google Cloud, спроси у администратора про Gemini Enterprise и доступ к `gemini-3.8-live`. Для своих аватаров нужно согласование с Google Cloud.
Плюсы, и что изменится в ближайшее время: ии аватар бесплатно
Главный плюс: разговор наконец перестаёт быть похож на общение с автоответчиком. Нет пауз-«загрузки», есть живая мимика, реакция на эмоции и работа в фоне. Один человек с одним аватаром может обслуживать клиентов на 97 языках, а раньше для этого нужен был целый штат.
Если технология дойдёт до массовых тарифов, логично ждать, что появятся сервисы «ИИ-сотрудник под ключ» для небольшого бизнеса. Но это прогноз, а не обещание Google.
Минусы и ограничения: аватар ии помощь
Пока это корпоративный продукт. Свои аватары по одному фото доступны не всем, а после согласования с Google Cloud. Есть жёсткие рамки: нельзя использовать изображения несовершеннолетних и знаменитостей, а на лицо и голос нужны законные права. Ищущим бесплатные ИИ-аватары в источнике никаких бесплатных лимитов не обещано, так что проверяй условия сам.
Вывод и что сделать сегодня: как создать ии аватара
ИИ получил лицо, и это лицо умеет слушать, чувствовать интонацию и работать одновременно с разговором. Сегодня достаточно одного шага: открой Gemini и опиши свой идеальный виртуальный сотрудник по шаблону ниже. Когда доступ дойдёт до тебя, у тебя уже будет готовое задание. А если у тебя уже есть идея для аватара, напиши в комментариях @aigoby, обсудим.
Бонус: готовый промпт для копирования, чтобы создать ии аватар бесплатно
Вставь в Gemini и подставь свои данные:
```
Ты помогаешь мне спроектировать виртуального сотрудника с говорящим аватаром.
Моя сфера: [кофейня / отель / онлайн-школа / консалтинг].
Клиенты: [кто они, на каких языках говорят].
Задачи аватара: [встреча гостя, ответы на вопросы, проверка заказа или брони].
Что нужно проверять во внешних системах: [CRM, бронирование, расписание].
Составь: 1) имя и характер персонажа, 2) тон общения в спокойной и конфликтной ситуации,
3) сценарий приветствия и трёх типичных диалогов, 4) список того, чего аватар делать не должен.
```
Мини-чек-лист перед запуском аватара:
• Есть право на лицо и голос персонажа.
• Нет изображений несовершеннолетних и знаменитостей.
• Понятно, к каким системам аватар должен обращаться.
• Прописаны границы: на какие вопросы он передаёт разговор человеку.

Комментарии 0