speech-recognition
Войти
Практика

· 12 минут чтения

Что такое глоссарий в распознавании речи и как он повышает точность транскрибации

Расшифровка получилась хорошей, но фамилия партнёра превратилась в другую, препарат — в незнакомое слово, а аббревиатура распалась на буквы. Это самый частый и при этом самый поправимый тип ошибок: чаще всего его снимает глоссарий — короткий список слов, который вы передаёте сервису до обработки.

Обложка статьи «Что такое глоссарий в распознавании речи и как он повышает точность транскрибации»

Пользователи часто удивляются: модель уверенно разбирает беглую речь, справляется с шумом и расставляет знаки препинания — но раз за разом ошибается в фамилии коллеги, названии препарата или профессиональном сокращении. Выглядит нелогично: слово произнесено чётко, а в тексте оно другое.

На самом деле логика тут прямая. Редкие слова и собственные имена реже встречались в данных, на которых модель училась, поэтому при малейшей неоднозначности звучания она выбирает более привычный вариант. Именно эту ситуацию и лечит глоссарий.

Коротко

Глоссарий в распознавании речи — это список слов, который вы передаёте сервису до обработки записи: фамилии участников, названия компаний и продуктов, профессиональные термины и аббревиатуры. Он не переписывает готовый текст, а смещает выбор модели в сторону нужной лексики там, где звучание допускает несколько прочтений.

Глоссарий помогает, когда основная проблема — специальная терминология и имена. Он не спасает запись с сильным шумом, перегруженным микрофоном или неразборчивой речью: там теряется сам сигнал, и подсказывать модели попросту нечего.

Что такое глоссарий простыми словами

Представьте, что в записи регулярно звучит фамилия Шварцкопф или название препарата, которое в обычной речи почти не встречается. Модель слышит последовательность звуков и подбирает наиболее вероятное слово — а вероятность считается по тому, как часто слова встречались в обучающих данных. Редкая фамилия проигрывает привычной, и в тексте появляется «Шварц копф» или «Шварцкоп».

Глоссарий сообщает системе заранее: в этой записи, скорее всего, прозвучат вот такие слова. Теперь при похожем звучании у нужного варианта появляется преимущество, и модель выбирает его чаще.

Какие слова чаще всего вызывают ошибки

Ошибки распределены неравномерно: обычная разговорная речь распознаётся уверенно, а сложности концентрируются в нескольких предсказуемых категориях. Как раз их и стоит собирать в глоссарий.

Тип словаПочему возникают ошибкиПример подмены
ФамилииРедко встречаются в обучающих данных, проигрывают частотным вариантамСоколовский → Соколов
Имена и отчестваСливаются в беглой речи, окончания смазываютсяПётр Ильич → Пётр Ильин
Названия компанийЧасто это обычные слова в необычном сочетании«Вектор» → вектор
Бренды и продуктыИностранное написание при русском произношенииMiro → миро
ЛекарстваДлинные, редкие, без опоры на контекстКсарелто → Сарелта
Медицинские диагнозыЛатинские корни и сокращенияХОБЛ → хобл
Юридические терминыПохожи на общеупотребительные словавиндикационный → индикационный
Технические сокращенияПроизносятся по-разному даже одним человекомCI/CD → сиайсиди
АббревиатурыМогут читаться по буквам или как словоНИОКР → ниокр / эн-и-о-ка-эр
Иностранные слова в русской речиМодель переключается между языкамиdeadline → дедлайн / дэдлайн
Категории, ради которых глоссарий обычно и заводят.

Общее у всех категорий одно: слово редкое, а похожий на него по звучанию вариант — частый. Именно в этой ситуации подсказка даёт максимальный эффект.

Как работает глоссарий

Без математики принцип такой. Модель на каждом шаге оценивает несколько вариантов того, что было сказано, и выбирает наиболее вероятный с учётом звучания и языкового контекста. Глоссарий добавляется к этому контексту как подсказка: перечисленные слова становятся для модели ожидаемыми, и при близком звучании выбор смещается к ним.

Где глоссарий вступает в дело

Аудиозапись

Модель распознавания

Глоссарий как контекст: ожидаемые имена и термины

Выбор варианта с учётом подсказки

Готовая расшифровка

Подсказка работает во время распознавания, а не после него: она влияет на выбор слова, а не правит готовый текст.

До и после

Без глоссария

Назначить препарат Сарелта по одной таблетке

С глоссарием

Назначить препарат Ксарелто по одной таблетке

Причина: Название препарата редкое, и модель выбрала более «произносимый» вариант.

Что делать: В списке подсказок: Ксарелто.

Без глоссария

Договор согласовали с Соколовым из компании Вектор

С глоссарием

Договор согласовали с Соколовским из компании «Вектор»

Причина: Частотная фамилия вытеснила редкую, а название компании распозналось как обычное слово.

Что делать: В списке подсказок: Соколовский, ООО «Вектор».

Без глоссария

Отчёт по ниокр сдаём в пятницу

С глоссарием

Отчёт по НИОКР сдаём в пятницу

Причина: Аббревиатура прозвучала как слово и записалась строчными буквами.

Что делать: В списке подсказок: НИОКР.

Примеры условные. Они показывают типовые случаи, а не гарантированный результат: на вашей записи модель может выбрать иначе.

В каких сферах глоссарий особенно полезен

Чем более специализированная лексика в записи, тем заметнее эффект. Ниже — области, где разница видна практически сразу.

Медицина

Названия препаратов, диагнозы, схемы приёма, фамилии врачей и пациентов. Здесь ошибка не косметическая: перепутанное название лекарства или дозировка меняют смысл документа. Подробнее о сценариях — на странице расшифровки для медицины.

Юриспруденция

Номера и названия нормативных актов, юридические термины, фамилии участников процесса, названия организаций. Многие термины похожи на обычные слова, и без подсказки модель выбирает бытовой вариант. Сценарии — на странице юридической расшифровки.

Маркетинг и продажи

Названия брендов, продуктов, тарифов и конкурентов, англицизмы вроде «ретеншн» и «медиаплан». В расшифровках интервью и фокус-групп важно, чтобы бренд писался одинаково во всём тексте — иначе по нему не получится ни искать, ни считать упоминания. См. расшифровку для маркетинга.

HR и корпоративные встречи

Имена кандидатов и сотрудников, названия отделов, внутренние сокращения и названия систем. Такие слова редко встречаются за пределами компании, зато в записи повторяются постоянно. См. расшифровку для HR.

Наука и IT

Узкие термины, названия методик, технологий, языков программирования и библиотек. Отдельная сложность — смешение языков: английские названия в русской речи произносятся с русской фонетикой, и без подсказки модель записывает их на слух.

Когда глоссарий помогает, а когда бесполезен

Честный ответ на этот вопрос экономит время: глоссарий решает одну задачу и не решает другую. Пытаться вылечить им плохую запись — потерянные полчаса.

Границы возможностей

Помогает
  • Профессиональная терминология, которая повторяется в записи.

  • Редкие фамилии, имена и названия компаний.

  • Аббревиатуры и внутренние сокращения.

  • Названия продуктов, препаратов, методик и технологий.

  • Иностранные слова в русской речи.

Не поможет
  • Сильный фоновый шум, из-за которого слово физически не различить.

  • Фрагмент, который не разбирает и человек при прослушивании.

  • Перегруженный микрофон: пики срезаны, часть звука потеряна.

  • Очень невнятная или слишком быстрая речь.

  • Одновременная речь нескольких участников.

Простое правило: подсказка помогает выбрать между похожими вариантами, но не восстанавливает то, чего в записи нет.

Если запись изначально сложная, начинать нужно не с глоссария, а с условий записи — это даёт несравнимо больший эффект. Разбор факторов и того, что можно исправить, — в материале «Как повысить точность распознавания речи».

Как составить хороший глоссарий

Хороший список — короткий и конкретный. Он не описывает предметную область целиком, а перечисляет то, что действительно прозвучит в этой записи и что модель без подсказки, скорее всего, испортит.

Что включить в список

Обязательно
  • Фамилии участников записи — в том написании, которое считается правильным.

  • Названия компаний и продуктов, включая кавычки и организационную форму, если они важны.

  • Ключевые термины предметной области, которые повторяются.

  • Аббревиатуры и внутренние сокращения — заглавными буквами.

По необходимости
  • Иностранные названия, если они звучат в русской речи.

  • Редкие географические названия и топонимы.

  • Названия методик, стандартов и документов, на которые ссылаются.

Практический ориентир — несколько десятков слов на запись. Этого достаточно, чтобы закрыть то, что реально вызывает ошибки, и при этом не размывать подсказку. Многие сервисы к тому же прямо ограничивают её длину: например, в Speech Recognition поле глоссария рассчитано на 500 символов, и это как раз про «несколько десятков позиций».

Правило отбора простое: если без подсказки слово стабильно распознаётся верно — в глоссарии оно не нужно. Место в списке ограничено, и тратить его стоит на проблемные слова.

Чем глоссарий отличается от других способов исправить термины

Проблему редких слов можно решать по-разному, и глоссарий — только один из инструментов. Разница между ними в том, на каком этапе они вмешиваются.

  • Глоссарий работает во время распознавания. Он влияет на выбор слова, поэтому в тексте сразу появляется правильный вариант — вместе с верным написанием и заглавными буквами.
  • Ручная правка в редакторе работает после. Она точна, потому что решение принимает человек, но её приходится повторять на каждой новой записи.
  • Автозамена по списку тоже работает после, причём вслепую: она не знает, что было в аудио, и заменит слово даже там, где произнесено похожее, но другое.
  • Повторная обработка ничего не добавляет к знаниям модели. Если слово редкое, повторный запуск, скорее всего, даст ту же ошибку — если только вы не изменили условия, например не заполнили глоссарий.

Отсюда понятная последовательность: сначала глоссарий, потому что он снимает ошибку в источнике, потом редактор для того, что осталось. Автозамену стоит держать на самый крайний случай — на длинном тексте она создаёт больше проблем, чем решает.

Как проверить, что глоссарий сработал

Эффект от подсказки легко измерить, и это стоит сделать один раз, чтобы понимать, чего от неё ждать на ваших записях.

  1. Возьмите короткий фрагмент записи, где заведомо звучат проблемные слова: минуты три-пять достаточно.
  2. Обработайте его без глоссария и выпишите, что именно распозналось неверно.
  3. Заполните список этими словами — в том написании, которое считаете правильным.
  4. Обработайте тот же фрагмент ещё раз и сравните оба текста поиском по нужному слову.
  5. Посчитайте не только исправленные места, но и новые ошибки: если подсказка начала подставляться там, где её не было, список стоит сократить.

Такой замер занимает минут двадцать и сразу показывает границу применимости: обычно часть слов исправляется полностью, часть — через раз, а часть не поддаётся, потому что проблема не в лексике, а в звуке. Последняя группа и есть сигнал, что дальше нужно работать с условиями записи, а не со списком.

Глоссарий стоит оценивать по конкретным словам, а не по общему впечатлению от текста: «стало лучше» — плохая метрика, «фамилия теперь распознаётся во всех девяти случаях» — хорошая.

Распространённые ошибки

  • Слишком длинный список. Чем больше слов, тем слабее эффект каждого: подсказка размывается, а иногда и вытесняет реально сказанное.
  • Общеупотребительные слова. «Договор», «встреча», «отчёт» модель и так распознаёт верно — они только занимают место.
  • Разные написания одного термина. «ООО Вектор», «ООО «Вектор»» и «Вектор» в одном списке мешают друг другу: выберите одну форму.
  • Список «на все случаи жизни». Глоссарий под конкретный тип записей работает лучше, чем универсальный на сто позиций.
  • Неактуальный список. Люди меняются, продукты переименовываются: устаревшие имена начинают подставляться вместо новых.
  • Расчёт на глоссарий вместо проверки. Даже с подсказкой имена и цифры в ответственных документах сверяют по записи.

Что в итоге

Глоссарий — не волшебная кнопка и не исправление плохой записи. Это узкий инструмент для одной конкретной проблемы: редкие слова, которые модель подменяет частотными. В записях с профессиональной лексикой, фамилиями и аббревиатурами он снимает заметную часть правок и, что важнее, делает написание одинаковым по всему тексту.

Порядок действий, если расшифровки регулярно требуют правок: сначала улучшить условия записи, затем собрать короткий список проблемных слов, и только потом смотреть, что осталось. Обычно после этих двух шагов остаётся вычитка, а не переписывание.

Если вы работаете с медицинскими, юридическими, техническими или другими специализированными записями, удобно, когда список терминов задаётся один раз и применяется ко всем задачам. В Speech Recognition глоссарий заполняется в профиле — имена, термины и аббревиатуры через запятую — и учитывается при обработке; как это устроено, описано в справке.

Глоссарий стоит завести, если в ваших записях регулярно повторяются одни и те же имена и термины. Полчаса на составление списка окупаются на первой же расшифровке.

Частые вопросы

Нет. Если вы работаете с однотипными записями — например, совещаниями одной команды, — достаточно одного списка: имена коллег, названия проектов и внутренние сокращения повторяются из встречи в встречу. Отдельный список имеет смысл собирать под нетипичную запись: конференцию с незнакомыми спикерами или интервью в новой предметной области.

Объём подсказки почти всегда ограничен, потому что она передаётся модели вместе с записью. Практический ориентир — несколько десятков позиций; в Speech Recognition поле рассчитано на 500 символов. Это не недостаток: длинный список работает хуже короткого, так как размывает подсказку.

Почти нет. Глоссарий помогает выбрать правильный вариант, когда модель колеблется между похожими словами. Если из-за шума слово физически не различить, выбирать не из чего — подсказка не восстановит потерянный сигнал. В такой ситуации эффективнее переписать или улучшить запись.

Нет, это только вредит. Общеупотребительная лексика распознаётся уверенно, а место в списке ограничено. Добавляйте только то, что без подсказки распознаётся неправильно: редкие фамилии, названия, термины и аббревиатуры.

Автозамена работает после распознавания: она находит слово в готовом тексте и меняет его на другое, не зная, что было в аудио. Глоссарий влияет на само распознавание — модель учитывает подсказку в момент выбора слова. Поэтому глоссарий не создаёт ложных замен там, где произнесено похожее, но другое слово, а автозамена — легко.

Такое возможно, если добавить слова, похожие по звучанию на частотные, и при этом редко встречающиеся в записи: модель начнёт подставлять их вместо реально сказанного. Поэтому список стоит держать коротким, релевантным конкретным записям и время от времени пересматривать.

Полезное по теме

Где глоссарий чаще всего нужен и как им пользоваться:


Свой список терминов в Speech Recognition

Глоссарий заполняется в профиле один раз и учитывается при обработке всех ваших записей: имена, названия компаний, термины и аббревиатуры через запятую. Первые 45 минут расшифровки доступны бесплатно — этого достаточно, чтобы проверить эффект на своей записи.

Читайте также

Все статьи