speech-recognition
Войти
Обзоры

· 24 минуты чтения

Что такое WER, и как измеряют точность распознавания речи

Сервисы транскрибации и разработчики моделей любят круглые цифры: «точность — 95%». За этой цифрой обычно стоит метрика WER — Word Error Rate, доля ошибок относительно эталонной расшифровки. Разбираем, как она считается, что показывает и почему одинаковый процент у двух сервисов не означает одинаковое качество текста.

Обложка статьи «Что такое WER, и как измеряют точность распознавания речи»

На сайтах сервисов распознавания речи почти всегда есть процент: «точность 95%», «до 99% точности». Цифра выглядит убедительно и понятно — но только до первого вопроса о том, как именно её получили.

Означает ли 95%, что из каждых ста слов ровно 95 будут написаны правильно? Можно ли сравнить этот показатель с 97% у соседнего сервиса? И будет ли расшифровка с более высоким процентом полезнее для вашей задачи? На все три вопроса ответ короче, чем хотелось бы: не обязательно.

Чтобы разобраться, нужно посмотреть на метрику, которая стоит за такими заявлениями. В распознавании речи стандартом де-факто много лет остаётся WER — Word Error Rate, частота ошибок в словах. Метрика проста в расчёте и удобна для сравнения систем, но легко вводит в заблуждение, если не знать её ограничений.

Коротко

WER (Word Error Rate) — метрика, которая показывает количество ошибок распознавания относительно количества слов в эталонной расшифровке. Учитываются три вида расхождений: замены слов, пропуски и лишние вставленные слова. Формула: WER = (S + D + I) / N. Чем ниже WER, тем меньше ошибок относительно эталона.

WER удобен для сравнения систем в одинаковых условиях, но не описывает качество расшифровки целиком. Он не различает безобидную и критичную ошибку, не оценивает пунктуацию, разделение спикеров, тайм-коды и читаемость текста, зависит от правил подготовки эталона и из-за вставок может превышать 100%.

Что такое WER и что он вообще измеряет

Чтобы измерить ошибку, её нужно с чем-то сравнить. Поэтому для расчёта WER всегда требуются два текста — и в этом первая неочевидная деталь метрики.

  • Эталон (reference) — корректная расшифровка записи, подготовленная человеком. Это точка отсчёта, и её качество определяет всё измерение.
  • Гипотеза (hypothesis) — текст, который выдала система распознавания. Именно его сравнивают с эталоном.

Дальше два текста выравнивают друг относительно друга и считают, сколько правок нужно внести в гипотезу, чтобы получить эталон. Самый простой случай — одно расхождение в одном слове:

  • Эталон: «Мы встретимся завтра утром».
  • Результат распознавания: «Мы встретимся завтра вечером».

Система ошиблась в одном слове из четырёх. На таких различиях и строится расчёт: WER не «понимает» текст и не оценивает, насколько ошибка меняет смысл. Он механически считает расхождения между двумя последовательностями слов.

WER — это мера расхождения между текстом системы и эталоном, а не оценка смысла. Без эталона и правил сравнения цифра просто не появится: «объективного WER» у записи самой по себе не бывает.

Какие ошибки учитывает WER

Метрика различает ровно три типа расхождений. Их обозначают латинскими буквами, и в таком виде они попадают в формулу.

Из чего складывается WER

Замены (S) — слово распознано как другое

Пропуски (D) — слово потерялось

Вставки (I) — появилось лишнее слово

Сумма ошибок делится на число слов в эталоне (N)

Word Error Rate

Все три типа ошибок равноценны: метрика складывает их в одну сумму, не различая, какая из них важнее для читателя.

Замена (substitution)

Слово эталона заменено другим словом. Это самый частый тип ошибки распознавания: система выбрала похоже звучащий, но неверный вариант. «Встреча состоится завтра» превращается в «встреча состоится утром».

Именно к заменам относятся самые опасные ошибки — в именах, числах, датах и терминах. Для метрики они ничем не отличаются от замены вводного слова.

Пропуск (deletion)

Слово было в записи, но в расшифровку не попало. Типичные причины — тихая речь, наложение голосов, обрыв на границе фрагмента. Из «встреча состоится завтра утром» остаётся «встреча состоится утром».

Вставка (insertion)

В расшифровке появилось слово, которого в записи не было. Из «встреча состоится утром» получается «встреча состоится завтра утром». Вставки возникают на шуме, музыке и в паузах — в крайнем виде это галлюцинации моделей распознавания, когда система дописывает целые фразы.

Тип ошибкиЧто произошлоПример
Замена (substitution, S)Слово эталона заменено другим словом«встреча состоится завтра» → «встреча состоится утром»
Пропуск (deletion, D)Слово из эталона не попало в расшифровку«встреча состоится завтра утром» → «встреча состоится утром»
Вставка (insertion, I)В расшифровке появилось слово, которого не было в записи«встреча состоится утром» → «встреча состоится завтра утром»
Три типа ошибок, которые попадают в формулу WER. Больше метрика ничего не считает.

WER учитывает замены, пропуски и вставки — и складывает их с одинаковым весом. Ошибка в фамилии и потерянное «ну» дают одинаковый вклад в итоговую цифру.

Как рассчитывается WER

Формула короткая и легко считается вручную на небольшом фрагменте:

WER = (S + D + I) / N

  • S (substitutions) — количество замен;
  • D (deletions) — количество пропусков;
  • I (insertions) — количество лишних вставленных слов;
  • N — количество слов в эталонной расшифровке.

Чаще результат приводят к процентам: WER = ((S + D + I) / N) × 100%. Значение 0 означает полное совпадение с эталоном, а рост цифры — рост числа расхождений.

Как посчитать WER: пример на десяти словах

Возьмём короткую фразу и разберём расхождения по одному. Пример условный, но устроен так, чтобы в нём встретились все три типа ошибок сразу.

Разбор одного предложения

Эталон

Встреча с подрядчиком состоится в пятницу утром в нашем офисе

Результат распознавания

Встреча с подрядчиком состоится в субботу в нашем новом офисе

В эталоне 10 слов. Расхождений три, и все они разного типа — их разбираем ниже.

Эталон

…состоится в **пятницу**…

Результат распознавания

…состоится в **субботу**…

Причина: Замена: слово эталона заменено другим. S = 1.

Формально одна ошибка. Практически — изменился день встречи.

Эталон

…в пятницу **утром** в нашем…

Результат распознавания

…в субботу в нашем…

Причина: Пропуск: слова «утром» в расшифровке нет. D = 1.

Такие потери типичны для тихой речи и для стыков фрагментов.

Эталон

…в нашем офисе

Результат распознавания

…в нашем **новом** офисе

Причина: Вставка: появилось слово, которого в записи не было. I = 1.

Вставка добавляет ошибку, но не отнимает верно распознанное слово эталона.
Обе строки состоят из десяти слов — одинаковая длина ничего не говорит о числе ошибок.

Дальше остаётся подставить значения. Порядок действий такой же на любом объёме текста:

  1. Считаем слова в эталоне: N = 10.
  2. Считаем замены: S = 1 («пятницу» → «субботу»).
  3. Считаем пропуски: D = 1 (потеряно «утром»).
  4. Считаем вставки: I = 1 (добавлено «новом»).
  5. Складываем ошибки: 1 + 1 + 1 = 3.
  6. Делим на длину эталона: WER = 3 / 10 = 0,3, то есть 30%.

Правильная формулировка результата: отношение количества учитываемых ошибок к количеству слов эталона составило 30%. Заманчиво сказать проще — «модель распознала 70% слов», — но это уже другое утверждение, и в нашем примере оно неверно.

Проверим. Из десяти слов эталона система верно воспроизвела восемь: ошибочными оказались только «пятницу» и «утром». Это 80% слов эталона, а не 70%. Разница возникла из-за вставки: лишнее слово добавило ошибку, но ничего не отняло у правильно распознанных.

WER 30% в этом примере уживается с 80% верно распознанных слов эталона. Поэтому «100% минус WER» — удобное приближение, а не тождество.

Может ли WER быть больше 100%

Да, может — и это не курьёз, а прямое следствие формулы. В числителе стоит сумма трёх видов ошибок, а в знаменателе — длина эталона, и ничто не мешает первой превысить вторую.

Достаточно, чтобы система дописала слов больше, чем было сказано. На музыкальной заставке, длинной паузе или шуме модель иногда выдаёт текст, которого в записи нет вообще, — а каждое такое слово считается вставкой.

Когда ошибок больше, чем слов

Эталон

Спасибо, на этом всё

Результат распознавания

Спасибо, на этом всё. Продолжение следует. Подписывайтесь на канал и не забывайте ставить лайки

Причина: Все слова эталона распознаны верно, но модель дописала ещё десять на пустом фрагменте: S = 0, D = 0, I = 10 при N = 4.

WER = (0 + 0 + 10) / 4 = 2,5, то есть 250%. При этом ни одно слово исходной фразы не потеряно.
Пример условный, но механизм реальный: типовые фразы из субтитров — характерный вид галлюцинаций моделей распознавания.

Отсюда видно, почему формулировка «WER — это просто 100% минус точность» слишком груба. Величина, у которой нет верхней границы, не может быть зеркальным отражением величины, ограниченной сотней процентов.

Верхней границы у WER нет. Если в отчёте встретилось значение выше 100%, это обычно означает не поломку метрики, а систему, которая добавила лишний текст.

WER и «процент точности» — это одно и то же?

Для простоты часто пишут: Accuracy ≈ 100% − WER. Как указание направления это верно: чем ниже значение, тем меньше словесных расхождений с эталоном. Как точное равенство — нет.

  • WER учитывает вставки. Лишние слова добавляют ошибки, не уменьшая число верно распознанных слов эталона, — связь между двумя величинами перестаёт быть линейной.
  • WER может превышать 100%. «Точность» в таком случае оказалась бы отрицательной, что бессмысленно.
  • Разные эталоны дают разные результаты. Дословная расшифровка с междометиями и «причёсанный» текст — это два разных эталона для одной записи.
  • Нормализация текста меняет подсчёт. Убрали пунктуацию и регистр, развернули сокращения, записали числа цифрами — цифра сдвинулась.
  • Метрика ничего не говорит о значимости ошибки. Перепутанная фамилия и потерянное «ну» весят одинаково.

Вывод простой: заявление «точность распознавания 95%» без описания методики даёт гораздо меньше информации, чем кажется. Неизвестно, на каком языке и на каких записях получена цифра, что считалось ошибкой, как готовился эталон и входила ли в подсчёт пунктуация.

Что про WER часто понимают неправильно

Миф
WER 5% означает, что ровно 95% слов распознаны верно

Это приближение, а не равенство. Из-за вставок сумма ошибок не привязана к числу слов эталона: в разобранном выше примере WER равен 30%, а верно распознаны 80% слов эталона.

Миф
WER не может быть больше 100%

Может. Если система дописала больше слов, чем было в эталоне, число ошибок превысит N — и значение уйдёт за 100%. Верхней границы у метрики нет.

Миф
Сервис с меньшим WER всегда лучше

Меньше словесных ошибок — это хорошо, но сравнение имеет смысл только при одинаковой методике. И даже тогда сервис с чуть большим WER может выигрывать по именам, числам, разделению спикеров и удобству редактора.

Миф
У записи есть одно правильное значение WER

Нет. Значение зависит от эталона и правил нормализации: считать ли междометия, учитывать ли регистр и пунктуацию, как записывать числа. Меняются правила — меняется цифра.

Правда
WER полезен для сравнения систем распознавания

Да, при одинаковых условиях: одна и та же запись, один эталон, одни правила подсчёта. Именно так метрику и используют в исследованиях — как инструмент сравнения, а не как обещание качества.

Читая «точность 95%», спрашивайте: на каких записях, с каким эталоном и по каким правилам нормализации. Без этих трёх ответов цифра не сравнима ни с чем.

Почему одинаковый WER может означать разное качество

Метрика считает ошибки, но не взвешивает их. Две расшифровки с одной ошибкой на одинаковом объёме текста дадут одинаковый WER — и при этом окажутся принципиально разными по пригодности.

Одна ошибка, разные последствия

Что было в записи

встреча в пятницу

Что попало в расшифровку

встреча в субботу

Причина: Одна замена. Формально — одна ошибка.

Изменился факт, на который будут опираться участники. Ошибку не видно по тексту: фраза выглядит нормальной.

Что было в записи

это было очень интересно

Что попало в расшифровку

это было интересно

Причина: Один пропуск. Формально — тоже одна ошибка.

Смысл сохранился почти полностью. В большинстве задач такую потерю никто не заметит.
Вклад в метрику одинаковый. Практическая цена — несопоставимая. Это главное ограничение WER как показателя качества.

Список критичных ошибок у каждой задачи свой, но чаще всего он выглядит примерно так:

  • «не назначать» → «назначать» — потерянное отрицание переворачивает решение;
  • 15 000 → 50 000 — одно слово меняет сумму в разы;
  • Иванов → Иваненко — не тот человек в протоколе;
  • 12 марта → 20 марта — не та дата в договорённостях.

Если обобщить, ошибки удобнее делить не по типу операции, которой их посчитала формула, а по тому, что происходит с содержанием текста.

Ошибки с одинаковым весом в метрике

Почти не влияют на результат
  • Междометия и слова-паразиты: «ну», «вот», «э-э»

  • Повторы и оговорки, которые говорящий сам исправил

  • Усилительные слова: «очень», «прямо», «довольно»

  • Вариант формы слова, не меняющий смысл фразы

  • Разное написание чисел: «двести» и «200»

Меняют содержание
  • Отрицания: потерянное или добавленное «не»

  • Суммы, проценты, номера документов

  • Фамилии, названия компаний и продуктов

  • Даты, сроки и время встреч

  • Термины, от которых зависит трактовка

  • Дописанные фразы, которых в записи не было

Для WER обе колонки равноценны. Для читателя расшифровки — нет. Поэтому оценивать результат приходится ещё и вручную.

Практический вывод: чем выше цена ошибки, тем меньше смысла в средней метрике. Для судебных заседаний, медицинских приёмов и переговоров важнее не общий процент, а то, сколько ошибок пришлось на значимые данные — и все ли они найдены при проверке.

WER считает ошибки, но не взвешивает их. Расшифровку с 8% расхождений, среди которых неверная дата платежа, придётся сверять с записью целиком; расшифровку с 14%, где потерялись одни вводные слова, можно брать в работу почти сразу.

Что WER оценивает, а что нет

Метрика создавалась для оценки распознавания слов — и делает ровно это. Всё остальное, из чего складывается впечатление от расшифровки, остаётся за её границами: разделение спикеров, тайм-коды и оформление текста — отдельные этапы обработки, разобранные в статье о том, как работает распознавание речи.

WER оцениваетWER не оценивает
Замены словДиаризацию
ПропускиПунктуацию как самостоятельное качество
ВставкиТайм-коды
Количество словесных ошибокСаммари
Удобство итоговой расшифровки
Прочерк в левой колонке не случаен: список того, что метрика не охватывает, длиннее списка того, что она считает.

Отдельно стоит сказать про разделение спикеров. WER сравнивает слова, а не разметку по говорящим: в подсчёт входит только то, какие слова написаны, но не то, чьей репликой они помечены. Поменяйте в готовой расшифровке метки спикеров местами — ни одно слово не изменится, и значение метрики останется прежним. Как устроена сама задача, разобрано в статье что такое диаризация и как нейросеть разделяет спикеров.

Сюда же относится всё, что пользователь на самом деле оценивает в готовом результате: точность тайм-кодов, расстановка абзацев, качество саммари, читаемость текста, удобство поиска и правки. Ни один из этих параметров в WER не входит. Саммари, например, оценивается совсем иначе — как оно строится и где ошибается, разобрано в статье как AI делает саммари аудио и видео.

Пользователь оценивает весь результат, а метрика — только слова. Поэтому сервис с лучшим WER не обязан быть лучшим сервисом.

Почему WER разных сервисов нельзя сравнивать напрямую

Чтобы два числа можно было поставить рядом, они должны быть получены в одинаковых условиях. Для WER это означает совпадение сразу по нескольким пунктам:

  • одни и те же аудиозаписи;
  • один и тот же эталон, подготовленный по одним правилам;
  • одинаковая нормализация текста перед сравнением;
  • один язык;
  • сопоставимые условия записи: акустика, число говорящих, тематика;
  • одинаковая методика подсчёта ошибок.

Если сервис А публикует WER 5%, а сервис Б — 7%, но измерения проводились на разных наборах данных, вывод «А точнее» не следует ни из чего. Вполне возможно, что А тестировался на студийной начитке, а Б — на записях совещаний, и при равных условиях порядок оказался бы обратным.

Отсюда правило чтения любых опубликованных цифр: сравнимы только показатели из одного теста. Числа из разных отчётов, полученные на разных данных, сопоставлять нельзя — даже если они выглядят одинаково аккуратно.

Сравнение WER имеет смысл только внутри одного теста: одна запись, один эталон, одни правила. Всё остальное — сопоставление двух не связанных между собой чисел.

От чего зависит WER на конкретной записи

Даже у одной и той же системы показатель гуляет в разы в зависимости от материала. Ниже — основные факторы; подробный разбор причин ошибок есть в отдельном материале, здесь важно другое: все они влияют на цифру, которую вы получите.

ФакторЧто меняется для системы распознавания
Качество аудиоШум, эхо и расстояние до микрофона делают звучание слов неоднозначным
Язык записиДля разных языков доступно разное количество обучающих данных
Акцент и дикцияНепривычное произношение сдвигает выбор в сторону более частотных слов
Число участниковПерекрывающаяся речь мешает и распознаванию, и разделению реплик
ТерминологияРедкие имена, названия и аббревиатуры встречались модели реже обычных слов
Тип записиСтудийный подкаст и разговор в шумном кафе — принципиально разные задачи
Таблица показывает направление влияния, а не измеренную величину: насколько сильно каждый фактор сдвинет цифру, зависит от конкретной записи.

Особенно заметен вклад лексики. Имена, названия компаний и профессиональные термины — предсказуемое слабое место, и частично оно лечится подсказками: глоссарий для транскрибации смещает вероятности в сторону нужных слов. Механику ошибок в именах разбирает материал почему нейросети ошибаются в именах и терминах.

Остальное определяется условиями записи — и это та часть, на которую можно повлиять заранее: 12 способов повысить точность распознавания. А если один и тот же файл в двух сервисах дал разный текст, причины разобраны в статье почему сервисы расшифровывают запись по-разному.

У системы нет «своего» WER — есть WER на конкретном материале. Меняется материал, меняется и цифра, причём в разы.

Почему результаты лабораторных тестов отличаются от реальных записей

Показатели моделей публикуют по тестовым наборам данных — заранее собранным коллекциям записей с проверенными расшифровками. Такие наборы нужны, чтобы разные системы можно было сравнивать в одинаковых условиях, но они не обязаны походить на вашу рабочую запись.

Что стоит за красивой и за реальной цифрой

Чистый тестовый набор
  • Записи отобраны заранее и одинаковы для всех систем

  • Эталон вычитан и опубликован вместе с набором

  • Правила нормализации зафиксированы до измерения

  • Материал однороден: один сценарий записи, одна тематика

Ваша рабочая запись
  • Файл один и случайный: какой получился, такой и расшифровываем

  • Эталона нет — сравнивать вывод системы не с чем

  • Правила подсчёта никто не фиксировал, оценка идёт на глаз

  • Следующая запись не похожа на предыдущую

Слева — условия измерения, справа — условия работы. Цифра, полученная в левой колонке, ничего не обещает правой.

Различается не только организация измерения, но и сама акустика: шум, эхо, расстояние до микрофона, одновременная речь. Что из этого можно поправить на стороне записи, разобрано отдельно — как подготовить запись к расшифровке.

Показатель на тестовом наборе описывает этот набор, а не вашу запись. Чем меньше ваш материал похож на студийную начитку, тем меньше смысла в чужих процентах.

Можно ли самостоятельно проверить точность транскрибации

Можно, и для этого не нужны специальные инструменты — только аккуратность. На фрагменте в несколько сотен слов расчёт делается вручную за полчаса.

  1. Выберите репрезентативный фрагмент. Не самый удачный и не самый тяжёлый, а типичный для ваших задач: обычная акустика, обычное число участников, обычная лексика.
  2. Подготовьте эталон вручную. Расшифруйте фрагмент сами, с точными именами, числами и датами. Заранее решите, записывать ли междометия и оговорки, — это правило должно быть одинаковым для всех проверок.
  3. Получите автоматическую расшифровку того же фрагмента.
  4. Приведите тексты к сопоставимому виду. Уберите пунктуацию, приведите к нижнему регистру, договоритесь о записи чисел. Иначе вы будете считать не ошибки распознавания, а различия в оформлении.
  5. Сравните слова по порядку, отмечая расхождения.
  6. Посчитайте S, D и I — замены, пропуски и вставки.
  7. Подставьте в формулу WER = (S + D + I) / N, где N — число слов в вашем эталоне.

И главное ограничение самостоятельного теста: одна короткая запись не даёт основания выбрать сервис. Возьмите несколько записей разных типов — те, с которыми вы реально работаете. Разброс между ними обычно окажется больше, чем разница между сервисами на одном файле.

Посчитать WER самому несложно. Сложнее — сделать это честно: одинаковые правила, проверенный эталон и несколько разных записей вместо одной удачной.

Как сравнивать сервисы транскрибации на практике

WER стоит считать не вместо оценки результата, а вместе с ней. Ниже — набор параметров, который описывает качество расшифровки полнее, чем один процент. Какие данные сверять с записью в первую очередь и почему они подводят чаще прочих — разобрано в статье какие ошибки важно проверять вручную.

На что смотреть, кроме процента точности

Текст
  • Значимые данные: имена, суммы, даты, отрицания, термины — выборочная сверка с записью

  • Наличие дописанного текста, которого не было в записи

  • Пунктуация и разбиение на абзацы

Всё остальное
  • Разделение спикеров и корректность границ реплик

  • Точность тайм-кодов и удобство перехода к аудио

  • Качество саммари и структуры итогового документа

  • Удобство редактора и поиска по расшифровке

  • Работа с вашими типами записей, а не с демонстрационным файлом

Главный принцип формулируется одной фразой: лучший тест сервиса — несколько ваших собственных типичных записей, а не заявленный разработчиком процент точности. Чужая цифра описывает чужой материал.

В Speech Recognition первые 45 минут доступны бесплатно после входа через Яндекс — этого достаточно, чтобы прогнать пару своих записей и посмотреть на результат целиком: текст, разделение спикеров, тайм-коды, саммари и экспорт. Если запись длиннее 45 минут, резать её не нужно — сервис сам предложит выбрать фрагмент под бесплатные минуты. Имена и термины стоит заранее внести в глоссарий в профиле, иначе вы проверите сервис в заведомо худших для него условиях.

Вопрос «у какого сервиса выше точность» ответа не имеет: процент без методики ничего не измеряет. Проверяемый вопрос звучит иначе — справится ли сервис с той записью, которую вы принесёте ему завтра, и на него отвечает не реклама, а пробная расшифровка.

Что в итоге

WER — базовая метрика оценки распознавания речи. Она учитывает замены, пропуски и вставки и считается по формуле WER = (S + D + I) / N: чем ниже значение, тем меньше ошибок относительно эталона. Свою задачу метрика решает хорошо — сравнивать системы между собой в одинаковых, заранее зафиксированных условиях.

Но это инструмент исследователя, а не обещание качества. WER не различает важные и безобидные ошибки, не оценивает диаризацию, пунктуацию, тайм-коды и саммари, зависит от эталона и правил нормализации и не имеет верхней границы. Поэтому «100% минус WER» — приближение, а не определение точности.

Для пользователя из всего этого следует один практический вывод. Заявленный процент — это в лучшем случае справка об условиях чужого теста; чтобы понять, подходит ли сервис вам, нужны ваши собственные записи и оценка не только слов, но и всего результата. Как устроена работа с расшифровкой в сервисе, описано в руководстве пользователя.

Главное про WER: он считает расхождения с эталоном, а не пользу текста. Надпись «точность 95%» без методики — не показатель качества, а рекламная строка.

Частые вопросы

WER (Word Error Rate) — доля ошибок распознавания относительно количества слов в эталонной расшифровке. Считаются три типа расхождений: замены слов, пропуски и лишние вставленные слова. Их сумма делится на число слов эталона: WER = (S + D + I) / N. Чем ниже значение, тем меньше ошибок.

Универсального порога нет. Приемлемое значение зависит от языка, типа записи, качества звука, лексики и задачи: для черновика личных заметок допустимо одно, для юридического документа — совсем другое. Кроме того, цифры сравнимы только внутри одного теста с одинаковым эталоном и одинаковой нормализацией, поэтому «хороший WER» без описания условий ничего не значит.

В отношении количества словесных ошибок — да. Но WER не оценивает итоговый результат целиком: он не учитывает значимость конкретной ошибки, разделение спикеров, пунктуацию, тайм-коды и читаемость текста. Расшифровка с меньшим WER может оказаться менее пригодной, если ошибки пришлись на имена, суммы или даты.

Да. В числителе стоит сумма замен, пропусков и вставок, а в знаменателе — число слов эталона, и первая величина ничем не ограничена. Если система дописала слов больше, чем было сказано — например, добавила текст на музыкальной вставке или в паузе, — значение легко превысит 100%.

Как грубый ориентир — иногда да, как точное равенство — нет. Вставки добавляют ошибки, не уменьшая число верно распознанных слов эталона; WER может превышать 100%, и тогда «точность» стала бы отрицательной; на результат влияют правила подготовки эталона и нормализации текста. Кроме того, метрика ничего не говорит о смысловой значимости ошибок.

Классический WER работает на уровне слов, а знаки препинания обычно убирают при нормализации текста перед сравнением — вместе с регистром и различиями в записи чисел. Итог зависит от конкретной методики: если пунктуацию оставить в подсчёте, цифра будет другой. Поэтому качество расстановки знаков оценивают отдельно.

Нет. WER сравнивает текст с эталоном и не проверяет, кому приписана реплика. Для оценки диаризации используются собственные метрики — прежде всего DER (diarization error rate), который отдельно считает пропущенную речь, ложно отмеченную речь и путаницу между говорящими.

Потому что за ними стоят разные тесты: разные записи, языки, эталоны и правила подсчёта. Показатель, полученный на чистой студийной начитке, будет заметно лучше показателя на записи совещания, даже если система одна и та же. Сравнивать такие цифры между собой некорректно — сравнимы только результаты одного теста.

Полезное по теме

Страницы сервиса, на которых удобно проверить качество распознавания на своём материале:


Проверьте точность на своей записи

Чужие проценты описывают чужие записи. Загрузите аудио или видео в Speech Recognition и оцените результат целиком: текст, разделение спикеров, тайм-коды и саммари. Имена и термины можно заранее добавить в глоссарий. Первые 45 минут доступны бесплатно.

Читайте также

Все статьи