Google Gemini 3.5 Transcribe убирает «эээ» и «ммм» из расшифровки автоматически и распознаёт более 85 языков — это новая ИИ-транскрипция, которую компания представила 26 августа 2026 года как замену модели Chirp 3. Google называет её «значительным шагом вперёд» по точности и качеству многоязычной расшифровки. Для тех, кто ведёт подкасты, интервью или созвоны, это готовый инструмент, который экономит часы ручной чистки текста.
Что умеет новая модель: от русской речи в текст до перевода
Gemini 3.5 Transcribe — это не просто перевод голоса в текст. Модель автоматически форматирует расшифровку и вычищает речевые паразиты: «эм», «ну», «типа того» исчезают сами, без ручной правки. Отдельная фишка — редактирование голосом: можно надиктовать правки прямо во время транскрибации, и ИИ внесёт их в текст естественным образом.
Ещё модель умеет:
- определять до трёх разных говорящих в записи и подписывать, кто что сказал;
- проставлять тайм-коды для каждого слова;
- подстраиваться под кастомный словарь — если у вас специфичные термины, имена или профессиональный жаргон, модель научится писать их правильно, а не как получится.
Зачем фрилансерам и предпринимателям нужна расшифровка аудио в текст?
Если вы делаете транскрибацию 85 языков для клиентов, ведёте подкаст или расшифровываете созвоны с командой — это прямая экономия времени. Раньше причёсывание автоматической расшифровки съедало едва ли не больше времени, чем сама транскрибация. Теперь удаление речевых паразитов ИИ берёт на себя черновую работу, а вам остаётся только финальная вычитка.
Для тех, кто ищет нейросеть для подкастов — это готовое решение под монетизацию: можно предлагать клиентам чистые расшифровки эпизодов, субтитры и текстовые версии выпусков как отдельную услугу.
Как получить доступ и начать записывать речь в текст?
Gemini Audio 3.5 уже раскатывается: с сегодняшнего дня Gemini 3.5 Transcribe доступна на английском языке всем пользователям приложения Gemini на macOS, а также в функции надиктовки Rambler на Android в отдельных странах. Разработчики могут попробовать модель в публичном превью через Gemini API — в AI Studio и Antigravity. Поддержка Chrome, по словам Google, появится позже.
Важный нюанс: изначально Google анонсировала ещё и обновления Gemini 3.5 Live и Live Experimental — они должны были улучшить обработку прерываний речи и добавить пошаговое «рассуждение вслух» при сложных задачах. Но уже после публикации новости Google уточнила: эти модели пока не запускаются, дата релиза не названа. Так что пока в деле только транскрипция.
Что в итоге: быстрая расшифровка аудио и удобный перевод текста в речь онлайн
Это уже вторая новинка в линейке Gemini Audio 3.5 после Live Translate — и всё это на фоне того, что обещанная ещё в июне флагманская модель Gemini 3.5 Pro так и не вышла. Похоже, Google методично выкатывает узкие, но практичные инструменты для голоса и звука, пока основной релиз откладывается. Для вас как пользователя это хорошая новость: ИИ для улучшения речи и работы с аудио развивается быстрее, чем большие модели, а значит, рабочие инструменты появляются уже сейчас, а не «когда-нибудь».



Комментарии 0