Grok Voice Transcribe 2.0 улучшает распознавание шумной и многоязычной речи
Разработчик представил новую модель транскрибации 18 сентября. Она работает с записями и аудиопотоками, различает говорящих и распознаёт переключения языка.
В анонсе на x.ai компания SpaceXAI описала Grok Voice Transcribe 2.0 как обновление для сложных условий: телефонных разговоров, фонового шума и коротких голосовых команд.
По внутренней оценке разработчика, доля ошибок на наборе коротких фраз снизилась с 20,6% до 6,8% относительно первой версии. Модель поддерживает десятки языков, временные метки отдельных слов и разделение реплик по говорящим.
В объявлении указаны прежние цены: 0,10 доллара за час записи при пакетной обработке и 0,20 доллара за час потокового аудио. Разработчик планирует сделать новую версию стандартной в Speech-to-Text API.
Что пока неизвестно
Приведённое снижение ошибок получено на внутреннем наборе разработчика. Качество на конкретном языке и типе записи нужно оценивать отдельно; редакция модель не тестировала.
Источники
Источник не открывается?
Оригинальная страница может быть временно недоступна. Попробуйте открыть её позже; название и дата источника сохранены выше.