Речь в текст: Grok Voice Transcribe 2.0 расшифровывает любые аудио в 2 раза точнее — это новая модель распознавания речи от SpaceXAI, которая при той же цене вдвое точнее своей предыдущей версии и лидирует по точности среди 32 потоковых моделей на публичном рейтинге Artificial Analysis. Если тебе надоело вручную править кривые расшифровки созвонов, интервью или голосовых заметок — самое время присмотреться к этому инструменту.
Что произошло: расшифровка аудио стала доступнее
SpaceXAI выпустила Grok Voice Transcribe 2.0 — модель, которая переводит голос в текст (то, что называется «речь в текст» или «голос в текст»). Построена она на той же звуковой технологии, что уже работает в голосовом помощнике Grok в автомобилях Tesla, обрабатывает call-центры и озвучку видео. Разница с обычными сервисами расшифровки в том, что модель обучали не на чистой студийной записи с одним спикером, а на «грязном» реальном звуке: плохая телефонная связь, несколько говорящих одновременно, акценты, надиктованные номера телефонов и email.
Что это значит на пальцах: большинство сервисов расшифровки аудио хорошо справляются, когда ты говоришь один, чётко и в тихой комнате. А как только начинается настоящая жизнь — шумное кафе, созвон с плохим интернетом, продавец с акцентом диктует номер карты — точность у конкурентов падает. Grok Voice Transcribe 2.0 как раз тренировали на таких сложных условиях, и по итогам он занял первое место по точности среди потоковых моделей.
Отдельно интересен блок про многоязычность — модель сама определяет язык речи и умеет на лету переключаться между языками прямо в одной записи. На коротких голосовых командах (там, где обычно мало контекста для распознавания языка) процент ошибок упал с 20,6% до 6,8% — почти в три раза.
Что это даёт лично тебе: преврати голос в текст легко
• Фрилансер-транскрибатор или журналист. Берёшь диктофонную запись интервью с шумом улицы на фоне — раньше половину приходилось переслушивать и исправлять руками, теперь черновой текст можно сразу редактировать, а не расшифровывать с нуля.
• Владелец сети точек продаж или кофейни. Звонки клиентов идут через обычную телефонную линию (это называется телефония, там звук хуже, чем в приложении) — модель отдельно тестировали именно на таких звонках, и по ним она обходит все конкурирующие модели.
• Мама в декрете, ведущая семейный блог или подкаст. Записала голосовую заметку с идеями для видео, пока укладывала ребёнка — фоновый шум и обрывистая речь больше не превращают расшифровку в кашу.
• Специалист поддержки клиентов или отдела продаж. Клиент диктует номер телефона, email или код подтверждения на слух — модель отдельно училась распознавать именно такие «спутанные» данные и переводить их в письменный вид (цифрами, а не буквами).
• Преподаватель или студент, ведущий конспекты лекций. Запись лекции на смешении языков (например, часть на русском, часть терминов на английском) модель распознаёт в одном проходе, без разрывов на разные файлы.
• Автор YouTube или Reels с озвучкой. Нужны субтитры с таймингом под каждое слово — модель отдаёт временные метки начала и конца каждого слова вместе с уверенностью распознавания.
Как попробовать прямо сейчас: русская речь в текст за несколько кликов
1. Зайди на grok.com — это официальный сайт Grok, через него удобнее всего познакомиться с голосовыми функциями компании.
2. Найди раздел, посвящённый голосовым возможностям Grok (Grok Voice), и попробуй надиктовать что-то голосом — так ты почувствуешь ту же звуковую технологию, на которой построена Transcribe 2.0.
3. Если тебе нужна именно расшифровка файлов или потокового звука для своих задач (например, встроить в свой сервис или скрипт), у SpaceXAI есть отдельная документация и живая демонстрация модели — на официальной странице анонса есть кнопки «Try It Live» и «View Docs», через них разработчики подключают Speech-to-Text API.
4. Если ты уже пользуешься похожим сервисом через API — хорошая новость: по словам разработчиков, апгрейд с версии 1.0 на 2.0 происходит без изменений кода, то есть точность улучшается «сама собой».
Плюсы и что изменится: какие типы речи в тексте теперь доступны
Плюсы:
• Вдвое точнее предыдущей версии по цене без изменений — то есть ты платишь столько же, а ошибок в расшифровке становится в разы меньше.
• Отдельная разметка по говорящим (кто что сказал) — бесплатно, без доплаты.
• Можно расшифровывать сразу до 8 звуковых дорожек по отдельности (актуально, если запись многоканальная, например с нескольких микрофонов).
• Можно заранее передать модели до 100 специфичных терминов (названия продуктов, медицинские термины) — и она будет их точнее узнавать.
• Автоматически убирает слова-паразиты вроде «эм» и «ну» из итогового текста.
• Числа, даты, суммы, телефоны и email распознаются и записываются сразу в привычном письменном виде, а не «на слух».
Ограничения: в исходном материале SpaceXAI не приводит данных по стоимости в рублях, ограничениям для русского языка отдельно и доступности бесплатного тарифа — только общий факт, что цена осталась на уровне версии 1.0. Прежде чем встраивать модель в рабочий процесс, стоит уточнить актуальные условия на официальной странице.
Что делать сегодня: прочитать в голос текст стало проще
Через полгода такие модели, скорее всего, станут стандартом для любых call-центров и сервисов автоматической расшифровки — конкуренция уже сейчас идёт на десятые доли процента ошибок. Не жди — зайди на grok.com, протестируй голосовую функцию на своей задаче (созвон, лекция, голосовая заметка) и посмотри на разницу в качестве сам. Поделись результатом или задай вопрос в комментариях @aigoby — соберём подборку живых кейсов от читателей.
🎁 Бонус — чек-лист, на что смотреть при выборе сервиса расшифровки аудио:
• Проверь точность именно на «грязном» звуке (шум, акцент, плохая связь), а не на чистой студийной записи из демо
• Убедись, что есть разметка по говорящим (диаризация), если работаешь с интервью или созвонами
• Проверь, различает ли сервис несколько языков в одной записи, если ты работаешь с русским и английским одновременно
• Уточни, форматирует ли сервис числа, даты и email в привычный письменный вид или отдаёт их «как услышал»
• Сравни цену за 1000 минут расшифровки у разных сервисов, а не только общую точность



Комментарии 0