SpaceXAI выпустила новую модель Grok Voice Transcribe 2.0 для преобразования речи в текст. По заявлению разработчиков, она допускает вдвое меньше ошибок, чем предыдущая версия, при той же стоимости. Модель ориентирована на сложные записи, включая телефонные разговоры с помехами, одновременную речь нескольких людей, а также региональные акценты и диалекты.
Источник изображения: Grok
Grok Voice Transcribe 2.0, как сообщает MarkTechPost, построена на базе аудиомодели, которая используется в Grok Voice. Технология уже ежедневно обрабатывает десятки тысяч звонков в службы поддержки, расшифровывает миллионы часов видеоматериалов и применяется в голосовом ассистенте автомобилей Tesla. Для обучения использовались многоязычные записи с шумами и помехами, после чего модель дополнительно дорабатывалась методами постобучения.
В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по показателю AA-WER Streaming. Компания также протестировала её на четырёх внутренних наборах данных: телефонных разговорах; диалогах с Grok; произнесённых номерах телефонов, обычных и электронных адресах; коротких фразах для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 показала лучшие результаты, чем версия 1.0, однако внутренние данные предоставлены самой SpaceXAI и независимо не подтверждались.