· 12 минут чтения
Что такое глоссарий в распознавании речи и как он повышает точность транскрибации
Расшифровка получилась хорошей, но фамилия партнёра превратилась в другую, препарат — в незнакомое слово, а аббревиатура распалась на буквы. Это самый частый и при этом самый поправимый тип ошибок: чаще всего его снимает глоссарий — короткий список слов, который вы передаёте сервису до обработки.
Пользователи часто удивляются: модель уверенно разбирает беглую речь, справляется с шумом и расставляет знаки препинания — но раз за разом ошибается в фамилии коллеги, названии препарата или профессиональном сокращении. Выглядит нелогично: слово произнесено чётко, а в тексте оно другое.
На самом деле логика тут прямая. Редкие слова и собственные имена реже встречались в данных, на которых модель училась, поэтому при малейшей неоднозначности звучания она выбирает более привычный вариант. Именно эту ситуацию и лечит глоссарий.
Коротко
Глоссарий в распознавании речи — это список слов, который вы передаёте сервису до обработки записи: фамилии участников, названия компаний и продуктов, профессиональные термины и аббревиатуры. Он не переписывает готовый текст, а смещает выбор модели в сторону нужной лексики там, где звучание допускает несколько прочтений.
Глоссарий помогает, когда основная проблема — специальная терминология и имена. Он не спасает запись с сильным шумом, перегруженным микрофоном или неразборчивой речью: там теряется сам сигнал, и подсказывать модели попросту нечего.
Что такое глоссарий простыми словами
Представьте, что в записи регулярно звучит фамилия Шварцкопф или название препарата, которое в обычной речи почти не встречается. Модель слышит последовательность звуков и подбирает наиболее вероятное слово — а вероятность считается по тому, как часто слова встречались в обучающих данных. Редкая фамилия проигрывает привычной, и в тексте появляется «Шварц копф» или «Шварцкоп».
Глоссарий сообщает системе заранее: в этой записи, скорее всего, прозвучат вот такие слова. Теперь при похожем звучании у нужного варианта появляется преимущество, и модель выбирает его чаще.
Какие слова чаще всего вызывают ошибки
Ошибки распределены неравномерно: обычная разговорная речь распознаётся уверенно, а сложности концентрируются в нескольких предсказуемых категориях. Как раз их и стоит собирать в глоссарий.
| Тип слова | Почему возникают ошибки | Пример подмены |
|---|---|---|
| Фамилии | Редко встречаются в обучающих данных, проигрывают частотным вариантам | Соколовский → Соколов |
| Имена и отчества | Сливаются в беглой речи, окончания смазываются | Пётр Ильич → Пётр Ильин |
| Названия компаний | Часто это обычные слова в необычном сочетании | «Вектор» → вектор |
| Бренды и продукты | Иностранное написание при русском произношении | Miro → миро |
| Лекарства | Длинные, редкие, без опоры на контекст | Ксарелто → Сарелта |
| Медицинские диагнозы | Латинские корни и сокращения | ХОБЛ → хобл |
| Юридические термины | Похожи на общеупотребительные слова | виндикационный → индикационный |
| Технические сокращения | Произносятся по-разному даже одним человеком | CI/CD → сиайсиди |
| Аббревиатуры | Могут читаться по буквам или как слово | НИОКР → ниокр / эн-и-о-ка-эр |
| Иностранные слова в русской речи | Модель переключается между языками | deadline → дедлайн / дэдлайн |
Общее у всех категорий одно: слово редкое, а похожий на него по звучанию вариант — частый. Именно в этой ситуации подсказка даёт максимальный эффект.
Как работает глоссарий
Без математики принцип такой. Модель на каждом шаге оценивает несколько вариантов того, что было сказано, и выбирает наиболее вероятный с учётом звучания и языкового контекста. Глоссарий добавляется к этому контексту как подсказка: перечисленные слова становятся для модели ожидаемыми, и при близком звучании выбор смещается к ним.
Где глоссарий вступает в дело
Аудиозапись
Модель распознавания
Глоссарий как контекст: ожидаемые имена и термины
Выбор варианта с учётом подсказки
Готовая расшифровка
До и после
Без глоссария
Назначить препарат Сарелта по одной таблетке
С глоссарием
Назначить препарат Ксарелто по одной таблетке
Причина: Название препарата редкое, и модель выбрала более «произносимый» вариант.
Что делать: В списке подсказок: Ксарелто.
Без глоссария
Договор согласовали с Соколовым из компании Вектор
С глоссарием
Договор согласовали с Соколовским из компании «Вектор»
Причина: Частотная фамилия вытеснила редкую, а название компании распозналось как обычное слово.
Что делать: В списке подсказок: Соколовский, ООО «Вектор».
Без глоссария
Отчёт по ниокр сдаём в пятницу
С глоссарием
Отчёт по НИОКР сдаём в пятницу
Причина: Аббревиатура прозвучала как слово и записалась строчными буквами.
Что делать: В списке подсказок: НИОКР.
В каких сферах глоссарий особенно полезен
Чем более специализированная лексика в записи, тем заметнее эффект. Ниже — области, где разница видна практически сразу.
Медицина
Названия препаратов, диагнозы, схемы приёма, фамилии врачей и пациентов. Здесь ошибка не косметическая: перепутанное название лекарства или дозировка меняют смысл документа. Подробнее о сценариях — на странице расшифровки для медицины.
Юриспруденция
Номера и названия нормативных актов, юридические термины, фамилии участников процесса, названия организаций. Многие термины похожи на обычные слова, и без подсказки модель выбирает бытовой вариант. Сценарии — на странице юридической расшифровки.
Маркетинг и продажи
Названия брендов, продуктов, тарифов и конкурентов, англицизмы вроде «ретеншн» и «медиаплан». В расшифровках интервью и фокус-групп важно, чтобы бренд писался одинаково во всём тексте — иначе по нему не получится ни искать, ни считать упоминания. См. расшифровку для маркетинга.
HR и корпоративные встречи
Имена кандидатов и сотрудников, названия отделов, внутренние сокращения и названия систем. Такие слова редко встречаются за пределами компании, зато в записи повторяются постоянно. См. расшифровку для HR.
Наука и IT
Узкие термины, названия методик, технологий, языков программирования и библиотек. Отдельная сложность — смешение языков: английские названия в русской речи произносятся с русской фонетикой, и без подсказки модель записывает их на слух.
Когда глоссарий помогает, а когда бесполезен
Честный ответ на этот вопрос экономит время: глоссарий решает одну задачу и не решает другую. Пытаться вылечить им плохую запись — потерянные полчаса.
Границы возможностей
Помогает
Профессиональная терминология, которая повторяется в записи.
Редкие фамилии, имена и названия компаний.
Аббревиатуры и внутренние сокращения.
Названия продуктов, препаратов, методик и технологий.
Иностранные слова в русской речи.
Не поможет
Сильный фоновый шум, из-за которого слово физически не различить.
Фрагмент, который не разбирает и человек при прослушивании.
Перегруженный микрофон: пики срезаны, часть звука потеряна.
Очень невнятная или слишком быстрая речь.
Одновременная речь нескольких участников.
Если запись изначально сложная, начинать нужно не с глоссария, а с условий записи — это даёт несравнимо больший эффект. Разбор факторов и того, что можно исправить, — в материале «Как повысить точность распознавания речи».
Как составить хороший глоссарий
Хороший список — короткий и конкретный. Он не описывает предметную область целиком, а перечисляет то, что действительно прозвучит в этой записи и что модель без подсказки, скорее всего, испортит.
Что включить в список
Обязательно
Фамилии участников записи — в том написании, которое считается правильным.
Названия компаний и продуктов, включая кавычки и организационную форму, если они важны.
Ключевые термины предметной области, которые повторяются.
Аббревиатуры и внутренние сокращения — заглавными буквами.
По необходимости
Иностранные названия, если они звучат в русской речи.
Редкие географические названия и топонимы.
Названия методик, стандартов и документов, на которые ссылаются.
Практический ориентир — несколько десятков слов на запись. Этого достаточно, чтобы закрыть то, что реально вызывает ошибки, и при этом не размывать подсказку. Многие сервисы к тому же прямо ограничивают её длину: например, в Speech Recognition поле глоссария рассчитано на 500 символов, и это как раз про «несколько десятков позиций».
Правило отбора простое: если без подсказки слово стабильно распознаётся верно — в глоссарии оно не нужно. Место в списке ограничено, и тратить его стоит на проблемные слова.
Чем глоссарий отличается от других способов исправить термины
Проблему редких слов можно решать по-разному, и глоссарий — только один из инструментов. Разница между ними в том, на каком этапе они вмешиваются.
- Глоссарий работает во время распознавания. Он влияет на выбор слова, поэтому в тексте сразу появляется правильный вариант — вместе с верным написанием и заглавными буквами.
- Ручная правка в редакторе работает после. Она точна, потому что решение принимает человек, но её приходится повторять на каждой новой записи.
- Автозамена по списку тоже работает после, причём вслепую: она не знает, что было в аудио, и заменит слово даже там, где произнесено похожее, но другое.
- Повторная обработка ничего не добавляет к знаниям модели. Если слово редкое, повторный запуск, скорее всего, даст ту же ошибку — если только вы не изменили условия, например не заполнили глоссарий.
Отсюда понятная последовательность: сначала глоссарий, потому что он снимает ошибку в источнике, потом редактор для того, что осталось. Автозамену стоит держать на самый крайний случай — на длинном тексте она создаёт больше проблем, чем решает.
Как проверить, что глоссарий сработал
Эффект от подсказки легко измерить, и это стоит сделать один раз, чтобы понимать, чего от неё ждать на ваших записях.
- Возьмите короткий фрагмент записи, где заведомо звучат проблемные слова: минуты три-пять достаточно.
- Обработайте его без глоссария и выпишите, что именно распозналось неверно.
- Заполните список этими словами — в том написании, которое считаете правильным.
- Обработайте тот же фрагмент ещё раз и сравните оба текста поиском по нужному слову.
- Посчитайте не только исправленные места, но и новые ошибки: если подсказка начала подставляться там, где её не было, список стоит сократить.
Такой замер занимает минут двадцать и сразу показывает границу применимости: обычно часть слов исправляется полностью, часть — через раз, а часть не поддаётся, потому что проблема не в лексике, а в звуке. Последняя группа и есть сигнал, что дальше нужно работать с условиями записи, а не со списком.
Глоссарий стоит оценивать по конкретным словам, а не по общему впечатлению от текста: «стало лучше» — плохая метрика, «фамилия теперь распознаётся во всех девяти случаях» — хорошая.
Распространённые ошибки
- Слишком длинный список. Чем больше слов, тем слабее эффект каждого: подсказка размывается, а иногда и вытесняет реально сказанное.
- Общеупотребительные слова. «Договор», «встреча», «отчёт» модель и так распознаёт верно — они только занимают место.
- Разные написания одного термина. «ООО Вектор», «ООО «Вектор»» и «Вектор» в одном списке мешают друг другу: выберите одну форму.
- Список «на все случаи жизни». Глоссарий под конкретный тип записей работает лучше, чем универсальный на сто позиций.
- Неактуальный список. Люди меняются, продукты переименовываются: устаревшие имена начинают подставляться вместо новых.
- Расчёт на глоссарий вместо проверки. Даже с подсказкой имена и цифры в ответственных документах сверяют по записи.
Что в итоге
Глоссарий — не волшебная кнопка и не исправление плохой записи. Это узкий инструмент для одной конкретной проблемы: редкие слова, которые модель подменяет частотными. В записях с профессиональной лексикой, фамилиями и аббревиатурами он снимает заметную часть правок и, что важнее, делает написание одинаковым по всему тексту.
Порядок действий, если расшифровки регулярно требуют правок: сначала улучшить условия записи, затем собрать короткий список проблемных слов, и только потом смотреть, что осталось. Обычно после этих двух шагов остаётся вычитка, а не переписывание.
Если вы работаете с медицинскими, юридическими, техническими или другими специализированными записями, удобно, когда список терминов задаётся один раз и применяется ко всем задачам. В Speech Recognition глоссарий заполняется в профиле — имена, термины и аббревиатуры через запятую — и учитывается при обработке; как это устроено, описано в справке.
Глоссарий стоит завести, если в ваших записях регулярно повторяются одни и те же имена и термины. Полчаса на составление списка окупаются на первой же расшифровке.
Частые вопросы
Нет. Если вы работаете с однотипными записями — например, совещаниями одной команды, — достаточно одного списка: имена коллег, названия проектов и внутренние сокращения повторяются из встречи в встречу. Отдельный список имеет смысл собирать под нетипичную запись: конференцию с незнакомыми спикерами или интервью в новой предметной области.
Объём подсказки почти всегда ограничен, потому что она передаётся модели вместе с записью. Практический ориентир — несколько десятков позиций; в Speech Recognition поле рассчитано на 500 символов. Это не недостаток: длинный список работает хуже короткого, так как размывает подсказку.
Почти нет. Глоссарий помогает выбрать правильный вариант, когда модель колеблется между похожими словами. Если из-за шума слово физически не различить, выбирать не из чего — подсказка не восстановит потерянный сигнал. В такой ситуации эффективнее переписать или улучшить запись.
Нет, это только вредит. Общеупотребительная лексика распознаётся уверенно, а место в списке ограничено. Добавляйте только то, что без подсказки распознаётся неправильно: редкие фамилии, названия, термины и аббревиатуры.
Автозамена работает после распознавания: она находит слово в готовом тексте и меняет его на другое, не зная, что было в аудио. Глоссарий влияет на само распознавание — модель учитывает подсказку в момент выбора слова. Поэтому глоссарий не создаёт ложных замен там, где произнесено похожее, но другое слово, а автозамена — легко.
Такое возможно, если добавить слова, похожие по звучанию на частотные, и при этом редко встречающиеся в записи: модель начнёт подставлять их вместо реально сказанного. Поэтому список стоит держать коротким, релевантным конкретным записям и время от времени пересматривать.
Полезное по теме
Где глоссарий чаще всего нужен и как им пользоваться:
Свой список терминов в Speech Recognition
Глоссарий заполняется в профиле один раз и учитывается при обработке всех ваших записей: имена, названия компаний, термины и аббревиатуры через запятую. Первые 45 минут расшифровки доступны бесплатно — этого достаточно, чтобы проверить эффект на своей записи.