Grok Voice Transcribe 2.0: точность транскрипции выросла вдвое при той же цене

0
cover-out-0-26.jpg-26

Grok Voice Transcribe 2.0 снижает Word Error Rate с 20,6% до 6,8% на многоязычных коротких фразах и занимает первое место среди 32 стриминговых моделей на публичном лидерборде Artificial Analysis. Цена осталась прежней: $0,10/час для batch и $0,20/час для стриминга.

Что изменилось по сравнению с версией 1.0

SpaceXAI обучила модель на шумном многоязычном аудио из реальных сред — телефонные линии с помехами, конкурирующие голоса, местные акценты, произносимые вслух номера телефонов и адреса электронной почты. Аудиофундамент — тот же, что стоит за Grok Voice: ежедневно эта система обрабатывает десятки тысяч звонков в службу поддержки, транскрибирует миллионы часов видеонарратива и работает в качестве ассистента в автомобилях Tesla.

Результаты внутренних тестов зафиксировали улучшения на английских звонках в поддержку, диалогах Grok, произносимых учётных данных и коротких командах на 19 языках. На тестах телефонной передачи (telephony audio) модель обогнала все протестированные системы. На публичном лидерборде Artificial Analysis — первое место из 32 стриминговых моделей.

Попробовать AI-генерацию бесплатно можно в нашем чат-боте ВКонтакте — отправь команду «Start» в диалог сообщества, чтобы начать генерацию. Оплатить зарубежный сервис из России можно через Плати по миру — виртуальная карта выпускается моментально, пополняется рублями через СБП, которые конвертируются в $ или €.

Возможности API

Модель поддерживает десятки языков с автоматическим определением и обработкой переключений между языками внутри одной записи. API принимает batch-задания, файлы, URL и реальные потоки.

Из конкретных функций:

  • Временные метки на уровне слов и оценки уверенности
  • Диаризация (разделение по спикерам) без доплаты
  • До 8 отдельных каналов для параллельной транскрипции
  • Biasing — смещение до 100 специализированных терминов
  • Форматирование чисел, дат, валют, телефонных номеров и email-адресов
  • Удаление слов-паразитов и определение смены очерёдности для голосовых агентов

Существующие интеграции получают обновление без изменений в коде. Версия 1.0 будет выведена из обращения в ближайшие недели — пока можно явно указать grok-voice-transcribe-1.0, чтобы временно остаться на ней.

Что это значит для AI-креатора

Если ты работаешь с транскрипцией видео для Reels или YouTube — это один из редких случаев, когда телефонная модель точнее студийной. Материал, снятый на смартфон в шумной среде (улица, конференция, коворкинг), традиционно ломает автосубтитры. Grok Voice Transcribe 2.0 обучена именно на таком аудио.

Для тех, кто делает субтитры к подкастам или озвучке — диаризация бесплатно и временные метки на уровне слов позволяют автоматизировать разбивку по репликам без постобработки в сторонних сервисах вроде Syntx AI.

Цена $0,10/час за batch — при среднем подкасте в 40-60 минут это меньше $0,10 за эпизод. Стриминг обходится вдвое дороже ($0,20/час), но включает всё то же самое: диаризацию, метки и ключевые термины.

В России сравнимые по доступности инструменты — SaluteSpeech от Сбера и Yandex SpeechKit. Оба работают с кириллицей и русским нативно, но данных о сравнении с телефонным аудио и результатами на Artificial Analysis по ним нет.

Итог

  • Word Error Rate на многоязычных коротких фразах: с 20,6% до 6,8%
  • Первое место из 32 стриминговых моделей на лидерборде Artificial Analysis
  • Диаризация, временные метки и ключевые термины без доплаты к базовой цене
  • Batch: $0,10/час, стриминг: $0,20/час — цена не изменилась относительно версии 1.0
  • Существующие API-интеграции обновляются автоматически, без правок в коде
  • Версия 1.0 уйдёт в deprecation в течение нескольких недель

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Политика конфиденциальности