Новость · Глобальное

Grok Voice Transcribe 2.0 улучшает распознавание шумной и многоязычной речи

Разработчик представил новую модель транскрибации 18 сентября. Она работает с записями и аудиопотоками, различает говорящих и распознаёт переключения языка.

tay · 20 сентября 2026 г. в 14:31
Редакционная схема: преобразование речи в текст
ИОНА / Codex, оригинальная редакционная схема, 2026.

В анонсе на x.ai компания SpaceXAI описала Grok Voice Transcribe 2.0 как обновление для сложных условий: телефонных разговоров, фонового шума и коротких голосовых команд.

По внутренней оценке разработчика, доля ошибок на наборе коротких фраз снизилась с 20,6% до 6,8% относительно первой версии. Модель поддерживает десятки языков, временные метки отдельных слов и разделение реплик по говорящим.

В объявлении указаны прежние цены: 0,10 доллара за час записи при пакетной обработке и 0,20 доллара за час потокового аудио. Разработчик планирует сделать новую версию стандартной в Speech-to-Text API.

Что пока неизвестно

Приведённое снижение ошибок получено на внутреннем наборе разработчика. Качество на конкретном языке и типе записи нужно оценивать отдельно; редакция модель не тестировала.

Источники

  1. SpaceXAI — официальный анонс на x.aiОфициальное сообщение · Первоисточник
Источник не открывается?

Оригинальная страница может быть временно недоступна. Попробуйте открыть её позже; название и дата источника сохранены выше.

Сохранить · Настроить