MWS AI открыла инструмент RESON и бенчмарк RESON OSD для оценки ASR

MWS AI выложила в открытый доступ инструмент RESON для анализа качества ASR-моделей и бенчмарк RESON OSD для оценки русскоязычного распознавания речи. Бенчмарк содержит 12 114 аудиозаписей — около 37 часов 52 минут в телефонном канале 8 кГц.

Главное
  • RESON считает метрики ASR, разбирает ошибки на уровне слов и сравнивает модели на статистическую значимость улучшений.
  • RESON OSD включает датасеты General и Numeric в чистой и шумной версиях, всего 12 114 записей.
  • В разметке бенчмарка есть пунктуация, капитализация, а также версии с англицизмами и денормализованными числами.
Схема оценки качества распознавания речи: аудиозаписи телефонного канала и метрики ASR-моделей
Фото: Хабр: Машинное обучение

MWS AI выложила в открытый доступ инструмент RESON (Research Engine for Speech & Observation Notes) и бенчмарк RESON OSD для оценки русскоязычных ASR-моделей. Об этом рассказал техлид команды ASR ML направления Audiogram Александр Шевченко.

Что умеет RESON

RESON — это инструмент для анализа качества ASR-моделей. Он считает метрики, разбирает ошибки на уровне отдельных слов, сравнивает модели на предмет статистически значимых улучшений и строит интерактивные HTML-отчёты. Работать с ним можно через CLI или Python API.

Помимо стандартного WER, в RESON добавлены две собственные метрики — MWA и WIS. Авторы объясняют, что одного WER недостаточно: он даёт одно агрегированное число на весь датасет и не показывает, какие слова важны для конкретного сценария.

Что внутри RESON OSD

RESON OSD — открытый бенчмарк для оценки качества русскоязычных ASR-моделей. Он состоит из двух датасетов, записанных в разных акустических условиях: General и Numeric. Каждый представлен в условно чистой (quietly) и шумной (noisily) версиях.

Всего в бенчмарке 12 114 аудиозаписей, около 37 часов 52 минут аудио, телефонный канал 8 кГц. В разметке транскрипций есть пунктуация и капитализация, дополнительно — версии с англицизмами и денормализованными числами.

Зачем это нужно

По словам авторов, WER не отвечает на вопросы, где именно модель ошибается и что чинить в первую очередь. Две модели с почти одинаковым WER могут вести себя по-разному: у одной больше вставок, у другой — удалений, и для голосового бота это разные проблемы.

Отдельная сложность — вариативность написания англицизмов. В примере из статьи «кешбэк» встречался 152 раза, и у пяти моделей из восьми recall по этому слову был 0% при общем WER 5–13%. Формально это ошибки, но модель услышала слово верно и записала его другим допустимым способом.

Чтобы понять, стало ли лучше после дообучения, RESON проверяет статистическую значимость через bootstrap. В примере из статьи улучшение WER с 5,36% до 5,04% оказалось значимым: CI95 = [−0.54; −0.09], p = 0.0015.

Для профиТехнические детали: архитектура, цифры, ссылки

Состав RESON OSD: датасеты General и Numeric, каждый в версиях quietly и noisily. Всего 12 114 аудиозаписей, ~37 часов 52 минуты, телефонный канал 8 кГц. В разметке — пунктуация, капитализация, версии с англицизмами и денормализованными числами.

Метрики RESON: WER, а также собственные MWA и WIS. Поддерживается разбор ошибок на уровне слов, сравнение моделей через bootstrap и интерактивные HTML-отчёты.

Интерфейсы: CLI и Python API.

Пример bootstrap-проверки: падение WER с 5,36% до 5,04% дало CI95 = [−0.54; −0.09], p = 0.0015.

Что это значит для России

RESON и RESON OSD выложены в открытый доступ и ориентированы на русскоязычное распознавание речи, в том числе в телефонном канале 8 кГц. Это делает бенчмарк применимым к задачам голосовых ботов и контакт-центров, где качество ASR критично для сценариев.

Инструмент развивает MWS AI — российская команда, работающая над ASR/TTS-платформой Audiogram. Датасет и код доступны публично, что позволяет российским разработчикам использовать их для внутренних замеров и сравнения моделей.

Вопросы и ответы

Что такое RESON OSD?
Открытый бенчмарк из двух датасетов — General и Numeric — в чистой и шумной версиях. Всего 12 114 аудиозаписей, около 37 часов 52 минут, телефонный канал 8 кГц.
Чем RESON отличается от обычного подсчёта WER?
RESON разбирает ошибки на уровне слов, считает собственные метрики MWA и WIS, сравнивает модели на статистическую значимость через bootstrap и строит HTML-отчёты.
Кто выпустил инструменты?
Команда ASR ML направления Audiogram в MWS AI. Об этом рассказал техлид Александр Шевченко.