· 24 минуты чтения
Почему нейросети ошибаются в именах, фамилиях и профессиональных терминах
Слово, произнесённое громко и отчётливо, всё равно может попасть в расшифровку неправильно — и это не сбой. Разборчивость решает не всё: у редкого имени или термина почти всегда есть похожий по звучанию сосед, который встречается в языке заметно чаще. Итог зависит от того, какой из вариантов лучше объясняет запись целиком, — и редкая лексика в этом сравнении проигрывает регулярно.
Разборчивость и правильность записи — не одно и то же. Фамилию можно произнести медленно, в тишине и прямо в микрофон, а в тексте получить другую, отличающуюся одной буквой. Ни техника, ни темп речи тут ни при чём: слово было слышно прекрасно.
Заметнее всего это на записях, расшифрованных в целом хорошо. Сорок минут беглой речи с оговорками и наложениями разбираются почти без правок, а единственная ошибка приходится ровно на то слово, ради которого запись и делалась. Закономерность здесь есть: чем важнее слово для дела — новое название, узкий термин, чья-то фамилия, — тем реже оно встречается в языке.
Объяснение «модель не знает редких слов» звучит убедительно, но оно слишком грубое и часто просто неверное. Настоящая причина интереснее: система вообще не сопоставляет звуку единственно правильное слово — она выбирает между вариантами. И у редкой лексики в этом выборе плохие стартовые позиции.
Коротко
Система распознавания речи опирается не только на звучание. На итоговый вариант влияют три вещи сразу: акустическая информация, языковой контекст и вероятностная оценка возможных последовательностей слов. Поэтому редкое имя или термин может уступить более привычному варианту, который модель считает более вероятным в данном контексте.
Отсюда главный вывод: ошибка в фамилии обычно означает не «этого слова нет в словаре модели», а «из нескольких похожих по звучанию вариантов выбран частотный». Хороший звук снимает часть таких ситуаций, но не все — у неоднозначности бывает не акустическая, а лексическая природа.
Почему обычные слова распознаются легче редких
Распознавание речи — не побуквенный перевод звука в текст. Модель решает задачу выбора: какая текстовая последовательность лучше всего объясняет то, что слышно в записи. Допустимых решений почти всегда несколько, и одно из них становится результатом.
Для повседневной лексики выбор обычно очевиден. «Договорились» и «договорилась» различаются одним безударным звуком, но контекст фразы снимает вопрос: соседние слова, согласование по роду, привычные обороты. Здесь языковая статистика работает на пользователя.
С редкой лексикой тот же механизм иногда работает против пользователя. Складывается неудачное сочетание условий:
- слово встречается значительно реже — и в речи, и в текстах;
- у него есть похожий по звучанию распространённый сосед;
- контекст фразы допускает оба варианта — и правильный, и посторонний;
- при близкой акустике модель склоняется к последовательности, которая в целом выглядит более вероятной.
Почему редкое слово превращается в другое
Аудио: произнесено редкое слово
Несколько акустически похожих вариантов
Анализ контекста и вероятности последовательностей
Выбор наиболее вероятного варианта
Иногда — не тот термин
Оговорка здесь принципиальная. ASR-системы устроены по-разному: одни предсказывают текст последовательно и опираются на уже сгенерированные слова, другие подключают отдельную языковую модель на этапе декодирования, третьи комбинируют подходы и добавляют собственные словари. Описывать все современные модели как устроенные одинаково некорректно — и это одна из причин, почему один и тот же термин у разных сервисов выходит по-разному. Из каких этапов вообще складывается обработка записи, разобрано отдельно: как работает распознавание речи: от аудиозаписи до готового текста.
Редкое слово проигрывает не потому, что его «нет в словаре», а потому, что при похожем звучании более частотный вариант объясняет запись почти так же хорошо — и выигрывает по совокупной вероятности.
Почему особенно сложно распознавать имена и фамилии
Имена и фамилии — худший случай сразу по нескольким признакам. Дело не только в редкости: у них огромное пространство вариантов и почти нет опоры в контексте.
Вариантов больше, чем в любой другой категории
Множество фамилий и их вариантов написания несопоставимо больше словаря обычных слов, и оно открытое — постоянно пополняется. К этому добавляется склонение: «Астахову», «Астаховым», «Астаховой» — модель выбирает не только основу, но и форму, а формы тоже звучат похоже.
Похожие фамилии различаются одним звуком
Условный пример: «Астахов» и «Остахов» отличаются одним безударным гласным, который в беглой речи практически неразличим. Похожая история с парами вроде «Иванов» и «Ивановский»: вся разница — в безударном хвосте слова, а его в быстром темпе легко проглотить. Человек в такой ситуации переспрашивает; система обязана выдать один вариант.
Редкая фамилия почти не поддержана контекстом
Во фразе «передайте документы …» на месте пропуска подходит любая фамилия. Контекст подсказывает, что дальше идёт имя собственное, но не какое именно. Для частотных фамилий этого хватает, для редких — нет: акустика допускает несколько прочтений, а языковая статистика их почти не различает.
Иностранные имена звучат не так, как пишутся по-русски
Иностранное имя внутри русской фразы попадает в двойную неоднозначность: сначала его нужно разобрать на слух, потом записать кириллицей. Один и тот же звук законно передаётся по-разному — начальный h традиционно становится то «х», то «г»: «Ханс» и «Ганс», «Хайне» и «Гейне». Оба написания встречаются в текстах, и звук не подсказывает, какое из них нужно вам.
Одно название — несколько допустимых написаний
Даже при верно разобранном звуке остаётся вопрос орфографии: слитно или через дефис, с прописной или строчной буквы, кириллицей или латиницей. Это тоже выбор варианта, но «правильный» здесь задаётся не записью, а внешним источником — паспортом, договором, списком участников.
Правильное написание имени — не всегда информация из звука. Иногда её физически нет в записи, и взять её можно только из внешнего источника.
Почему названия компаний и брендов тоже становятся проблемой
Названия компаний, продуктов и внутренних проектов ломаются по тем же причинам, что и фамилии, но добавляют собственные сложности.
- Необычное написание. Слитные конструкции, заглавные буквы внутри слова, дефисы, латиница посреди русской фразы.
- Английское название, произнесённое по-русски. На слух это русская фонетика, а записать нужно латиницей или устоявшейся транслитерацией.
- Искусственно созданные слова. У них нет ни привычного окружения, ни родственных слов в языке — опор для выбора минимум.
- Сочетания букв и цифр. Вслух они произносятся свободно, а записываются строго.
- Новые бренды. Название могло почти не встречаться в данных, на которых училась модель.
- Совпадение с обычным словом. Здесь частотность работает против названия: нарицательное слово почти всегда вероятнее.
Условные примеры показывают, как это выглядит. Название «Вектор» в устной фразе неотличимо от обычного слова и легко теряет и кавычки, и прописную букву. «Айти-Лайн» может выйти как «IT Line», «АйТиЛайн» или «ай ти лайн» — звуку соответствуют все варианты сразу. Проект «М4» в расшифровке превращается в «эм четыре», потому что именно так он и прозвучал.
У бренда ошибка часто не в звуке, а в оформлении: регистр, кавычки, дефис, латиница или кириллица. Ничего из этого в аудиосигнале не содержится.
Почему профессиональные термины распознаются хуже
Профессиональная лексика собирает перечисленные сложности сразу: она редкая, часто заимствованная, насыщена сокращениями и произносится быстро — специалисты между собой не проговаривают знакомые слова по слогам.
Ниже — короткие примеры по областям. Задача не перечислить сферы, а показать, что у каждой свой набор тяжёлых слов.
Медицина
Названия препаратов — часто искусственные и похожие друг на друга, — диагнозы, анатомические термины, латинские наименования, дозировки и фамилии врачей нередко идут в одной фразе. Отдельный слой — сокращения, принятые внутри отделения. Сценарий целиком описан на странице расшифровки для медицины.
Юриспруденция
Специализированные понятия, названия и реквизиты нормативных документов, номера дел, фамилии участников процесса, аббревиатуры ведомств. Здесь замена слова похожим меняет не вид формулировки, а её смысл — подробнее на странице для юристов.
IT
Названия библиотек, сервисов и технологий, англоязычные термины внутри русской фразы, глаголы от английских корней, номера версий и сокращения. Такая речь двуязычна по своей природе, а язык записи система определяет обычно один на файл.
Наука и образование
Узкая терминология, обозначения величин, фамилии исследователей в ссылках на работы, аббревиатуры методов. На лекции к этому добавляется расстояние до микрофона, а на семинаре — реплики из аудитории. Учебные сценарии собраны на странице для образования.
Бизнес
Названия компаний, продуктов и внутренних проектов, корпоративные сокращения, имена, которые внутри команды понятны всем, а снаружи не значат ничего. Именно эта лексика повторяется от встречи к встрече — и именно её выгоднее всего подсказать системе заранее.
Перечислять сферы можно долго, но полезнее другой разрез — по тому, что именно остаётся для системы неоднозначным. Природа неоднозначности у разных слов разная, и одно слово нередко проигрывает сразу по нескольким причинам.
| Природа неоднозначности | Что именно конкурирует | Где встречается чаще всего |
|---|---|---|
| Звуковая близость | Варианты различаются одним коротким или безударным звуком, который в беглой речи почти не проговаривается | Похожие фамилии, приставки терминов, формы одного слова |
| Разная частотность | Оба прочтения допустимы акустически, но одно встречалось в текстах многократно чаще | Редкие фамилии, узкие термины, недавно появившиеся названия |
| Пустой контекст | Соседние слова не сужают выбор: на этом месте фразы уместен любой вариант из целого класса | Имена собственные, номера, перечисления |
| Границы слов | Один и тот же звуковой поток делится на слова несколькими способами | Сокращения по буквам, составные и слитные названия |
| Способ записи | Звук разобран верно, но у него несколько законных написаний | Иностранные имена, бренды, аббревиатуры |
| Смена языка | У звучания есть законные прочтения сразу в двух языках, встретившихся в одной фразе | Англоязычные термины и названия в русской речи |
Сложна не «профессиональная тема» сама по себе. Обычные предложения в медицинской или юридической записи распознаются так же, как везде, — спотыкается модель именно на терминах.
Почему аббревиатуры — отдельная проблема
Сокращения ломаются иначе, чем обычные слова, и заметнее. Причина в том, что одна и та же аббревиатура существует сразу в нескольких видах.
- Её произносят по буквам («эн-дэ-эс»), читают как слово («НИОКР») или смешивают оба способа.
- У многих сокращений несколько расшифровок, и выбор между ними задаётся только темой разговора.
- Произнесённая по буквам аббревиатура акустически похожа на набор коротких слов — и может быть записана именно так.
- Часть сокращений совпадает по звучанию с обычными словами, и тогда побеждает обычное слово.
- В разговорной речи сокращения склоняют и превращают в жаргон — «эйчары», «зэпэ», — а устойчивой формы записи у таких вариантов часто просто нет.
Отдельный слой — оформление. Даже верно разобранное сокращение можно записать прописными, строчными, с точками или латиницей, и решает это чаще постобработка сервиса, а не сама модель распознавания. Поэтому «ндс» и «НДС» в двух расшифровках — не всегда разница в качестве распознавания, иногда это разные правила нормализации текста.
В аббревиатуре модель решает две задачи сразу: что прозвучало и как это записать. Ошибка возможна на каждой из них по отдельности.
Как контекст помогает — и когда он же приводит к ошибке
Контекст — главный помощник модели и одновременно источник самых обидных ошибок. Оба сценария стоит разобрать вместе, иначе легко решить, что контекст всегда снимает неоднозначность.
Когда контекст помогает
Фраза «пациенту назначили препарат …» сама подсказывает: дальше, вероятно, название лекарства, а не глагол и не имя человека. Это сужает пространство вариантов и повышает шанс, что редкое слово будет разобрано верно. Так же работает связная тема разговора: если вся встреча про логистику, профильные термины становятся для модели ожидаемыми.
Когда контекст приводит к ошибке
Обратная ситуация: редкое слово акустически близко к распространённому, и языковая статистика уверенно предлагает привычный вариант. Модель выбирает последовательность, которая лучше выглядит как связный русский текст, — и в расшифровке появляется гладкая фраза с неправильным словом. Заметить такую ошибку по одному тексту почти невозможно: она не выглядит как ошибка.
Как выглядит выбор между похожими вариантами
…этот вопрос мы обсуждали с …
Астаховым
Астаховой
Остаховым
Асташовым
Отсюда корректная формулировка: контекст не исправляет распознавание, а участвует в нём. Это дополнительный источник информации, который может как помочь, так и увести в сторону.
На частотной лексике контекст обычно спасает, на редкой — иногда добивает. Считать его встроенным корректором ошибок неверно.
Как это выглядит в готовой расшифровке
Ниже — условные примеры. Они показывают механизм, а не результаты тестирования конкретных моделей: приписывать реальным сервисам ошибки, которых никто не измерял, мы не будем.
Услышал одно — выбрал похожее
Прозвучало
Документы передали Остахову
Модель записала
Документы передали Астахову
Причина: Безударный гласный в начале фамилии почти не различается на слух, а более частотный вариант лучше поддержан языковой статистикой.
Что делать: Перечислить фамилии участников до обработки и сверить написание по списку.
Прозвучало
Это регулируется НПА
Модель записала
Это регулируется эн пэ а
Причина: Аббревиатура произнесена по буквам, и модель разобрала её как последовательность коротких слов — акустически это одно и то же.
Что делать: Внести сокращение в подсказку и проверить его оформление в тексте.
Прозвучало
В анамнезе гипотония
Модель записала
В анамнезе гипертония
Причина: Безударные «гипо-» и «гипер-» в беглой речи различаются одним звуком, а второй вариант встречается в текстах несопоставимо чаще.
Что делать: Слушать такие места по тайм-коду: состояния противоположные, и ошибка переворачивает смысл записи.
Прозвучало
Договор с «Вектором» подписан
Модель записала
Договор с вектором подписан
Причина: Название совпадает с обычным словом, а информации о кавычках и прописной букве в звуке нет вообще.
Что делать: Задать название в нужном виде заранее и поправить оформление в редакторе.
Прозвучало
Доклад Ханса Мюллера
Модель записала
Доклад Ганса Мюллера
Причина: Начальный звук традиционно передаётся на русском двумя способами, и оба написания законны.
Что делать: Сверить написание по программе мероприятия или списку авторов — звук здесь не поможет.
Почему хороший звук не гарантирует правильные термины
Это самый неочевидный тезис статьи: запись может быть безупречной, а фамилия всё равно окажется другой. Причина в том, что ошибки распознавания бывают разной природы, и лечатся они разными средствами.
Акустическая проблема — система плохо разобрала, какие звуки прозвучали. Виноваты шум, эхо, расстояние до микрофона, перегрузка, сжатие в канале связи. Это действительно решается подготовкой записи, и об этом есть отдельный разбор: как повысить точность распознавания речи.
Лексическая и контекстная неоднозначность — звуки различимы, но им соответствует несколько допустимых прочтений. Здесь класс микрофона уже ничего не решает: информации в сигнале достаточно, не хватает оснований выбрать между вариантами.
Хороший звук ≠ отсутствие всех ошибок
Что действительно снимает чистая запись
Слова, утонувшие в шуме и не попавшие в текст
Смазанные окончания и согласные из-за эха
Потери на тихих репликах с дальнего конца стола
Искажения от перегрузки и многократного сжатия
Часть путаницы между говорящими
Обрывы фраз на нестабильной связи
Что остаётся и на идеальной записи
Выбор между похожими по звучанию фамилиями
Транслитерация иностранных имён и названий
Расшифровка и оформление аббревиатур
Редкий термин против частотного соседа
Регистр, кавычки, дефисы и латиница в названиях
Новые слова, о которых у модели мало статистики
Хороший звук уменьшает одну группу ошибок, а не все. Имена, термины и аббревиатуры остаются в зоне риска даже на студийной записи.
Ошибка в фамилии — это галлюцинация?
Слово «галлюцинация» в последние годы приклеилось к любой ошибке распознавания, и это мешает разбираться в причинах. Два явления стоит развести прямо.
Разница не терминологическая. У этих ошибок разные причины и разные способы борьбы: замену похожим словом уменьшает список ожидаемой лексики, а галлюцинации — работа с тишиной, шумом и настройками обработки. Назвав одно другим, вы будете лечить не ту проблему.
Почему один и тот же термин разные модели распознают по-разному
Одно и то же слово в одной и той же записи два сервиса могут записать по-разному, и это нормальная ситуация. Различаться может почти каждое звено:
- архитектура модели и способ, которым она учитывает контекст;
- состав обучающих данных, в том числе доля профессиональной речи;
- параметры декодирования — как именно выбирается итоговая последовательность;
- постобработка: нормализация чисел, регистра и сокращений;
- поддержка пользовательских словарей и подсказок;
- версия модели, которая могла обновиться без единого изменения в интерфейсе.
Отсюда практичная рекомендация: если для вас критична терминология, сравнивайте сервисы на собственной записи и именно по значимым словам, а не по общему впечатлению от текста. Подробный разбор — в статье почему сервисы по-разному расшифровывают одну и ту же запись.
Что происходит с новыми словами
Отдельная категория — лексика, которой почти не было в данных: недавно вышедший продукт, новая компания, свежий профессиональный термин, фамилия малоизвестного человека.
Логика та же, что и с редкими словами, только выражена сильнее. У модели мало статистической информации не только о самом слове, но и о том, в каком окружении оно обычно встречается, — значит, конкурирующие варианты получают преимущество.
Новое слово — это не «нераспознаваемое слово», а слово с повышенным риском. Именно такие слова выгоднее всего перечислить заранее.
Как уменьшить количество ошибок в именах и терминах
Полностью убрать этот тип ошибок нельзя: часть неоднозначности заложена в самой задаче. Но заметно сократить их количество реально, и способов немного — они закрывают разные слои проблемы.
Качественная исходная запись
Чистый звук не решает проблему терминологии, но не даёт двум сложностям сложиться в одну. Хуже всего, когда редкое слово произнесено быстро, тихо или одновременно с чужой репликой: к лексической неоднозначности добавляется акустическая, и шансов на верный вариант почти не остаётся. Если впереди фамилия или незнакомый собеседнику термин — произнесите их отчётливее и в паузе, а не поверх чужой речи.
Оригинал файла вместо пересланной копии
Каждое пересохранение и пересылка через мессенджер отнимают детали звука, а именно детали различают похожие слова. Если оригинал доступен, загружайте его: сервис принимает и аудио, и видео и сам извлекает звуковую дорожку, так что конвертировать запись заранее не нужно.
Глоссарий: сказать заранее, чего ожидать
Если заранее известно, что в записи прозвучат определённые фамилии, названия или профессиональные термины, их можно перечислить до обработки — тогда система будет ожидать эти слова, и при близком звучании выбор сместится в их сторону. Как это устроено и где границы приёма, подробно разобрано в отдельном материале: что такое глоссарий в распознавании речи и как он повышает точность транскрибации.
Переоценивать приём не стоит. Подсказка смещает вероятности, а не задаёт текст: она не гарантирует правильного распознавания каждого добавленного слова и никак не помогает там, где слово утонуло в шуме.
Проверка критически важных элементов
Самый надёжный шаг — и единственный, который работает всегда. Высокая общая точность расшифровки не отменяет проверки значимых данных: именно на них приходится основная цена ошибки. Речь об именах и должностях, суммах и числах, датах и сроках, названиях препаратов и организаций, номерах договоров и дел, терминах и аббревиатурах — обо всём, что потом переносится в документы и решения.
Как проверять критичные места
Порядок работы
Находить значимые слова поиском по расшифровке, а не перечитывать текст подряд
Открывать спорное место по тайм-коду и слушать, а не догадываться
Править текст в редакторе расшифровки, чтобы исправления попали во все форматы экспорта
Неразборчивый фрагмент отмечать как неразборчивый, а не выбирать правдоподобный вариант
С чем сверять написание
Имена и должности — со списком участников или программой встречи
Названия компаний и продуктов — с договором, сайтом или презентацией
Суммы, даты и номера — с первичными документами, а не с памятью
Термины и аббревиатуры — с профильным справочником или глоссарием проекта
Порядок такой: чистая запись убирает акустический слой ошибок, заранее перечисленная лексика — часть лексического, проверка закрывает остаток. Ни один шаг не заменяет два других.
Какие ошибки особенно важно проверять вручную
Не все ошибки одинаково дороги. Ниже — данные, ради которых расшифровку стоит открывать вместе с аудио, даже если текст в целом выглядит безупречно.
| Тип данных | Почему важна проверка |
|---|---|
| Имена и фамилии | Ошибка может изменить идентификацию человека |
| Названия препаратов | Похожие названия могут иметь разное значение |
| Суммы | Одна цифра может изменить смысл договорённости |
| Даты и сроки | Ошибка влияет на фактическую информацию |
| Юридические термины | Замена слова может изменить смысл формулировки |
| Названия компаний | Важны для документов, публикаций и аналитики |
Список не универсальный: у каждой задачи свой набор критичных полей. Ориентироваться стоит на цену ошибки, а не на то, что выглядит подозрительно. Подозрительное как раз чаще всего оказывается верным: неправильно распознанное слово обычно выглядит совершенно естественно.
Автоматическая расшифровка — рабочий текст, а не заверенная стенограмма. Значимые данные в ней сверяются с записью независимо от того, насколько гладко она читается.
Ошибка в одном слове не всегда означает плохую расшифровку
Ещё один полезный сдвиг оптики. В получасовой записи система может верно распознать несколько тысяч слов, но пользователь запомнит одну неправильно написанную фамилию — и оценит по ней всю работу.
Это объяснимо: ошибки в именах, числах и терминах семантически заметнее прочих. Пропущенное «ну» или «как бы» не меняет ничего, а перевранная фамилия меняет смысл предложения и подрывает доверие ко всему тексту сразу.
Отсюда мысль, которую стоит держать в голове: общая статистическая точность и практическая цена конкретной ошибки — разные вещи. Как именно измеряют точность и почему проценты сами по себе мало что говорят о вашей записи, разобрано в статье что такое WER и как измеряют точность распознавания речи.
Одна ошибка в фамилии не делает расшифровку плохой, но может сделать её непригодной для конкретной задачи. Смотреть стоит не на долю ошибок, а на то, куда пойдёт текст.
Как с этим работает Speech Recognition
Если в записях регулярно встречаются одни и те же фамилии, названия и термины, полезно сообщить системе о них заранее — это ровно тот случай, когда подсказка приносит максимум пользы.
- Глоссарий в профиле — до 500 символов через запятую. Вносить туда стоит ровно то, что разбиралось выше как трудная лексика: то, чего модель не может вывести из контекста. Список передаётся как подсказка и применяется ко всем новым задачам.
- Редактор расшифровки — оставшиеся места правятся прямо в тексте, без выгрузки файла; исправления попадают в экспорт PDF, DOCX, TXT и SRT.
- Тайм-коды у реплик и поиск по расшифровке — спорное слово находится поиском и проверяется прослушиванием нужного фрагмента.
Чего глоссарий не делает: он не гарантирует правильного написания каждого слова из списка и не спасает запись с сильным шумом или неразборчивой речью. Это инструмент против лексической неоднозначности, а не универсальное средство, — и рассчитывать на него стоит именно так.
Что в итоге
Автоматическое распознавание не превращает звуки в буквы механически. Оно выбирает наиболее правдоподобную расшифровку из нескольких возможных, учитывая и акустику, и языковой контекст. Обычные слова в этом выборе почти не проигрывают, редкие — проигрывают регулярно.
Имена, фамилии, бренды, аббревиатуры и профессиональные термины — как раз та лексика, где вариантов много, а поддержки со стороны контекста мало. Поэтому запись может быть расшифрована почти идеально и споткнуться ровно на самом важном слове.
- Ошибка в фамилии — обычно не незнание слова, а выбор более вероятного варианта.
- Хороший звук снимает акустическую часть проблемы и не снимает лексическую.
- Контекст может и помочь, и увести в сторону: это источник информации, а не корректор.
- Заранее перечисленная лексика уменьшает количество ошибок, но ничего не гарантирует.
- Замена похожим словом и галлюцинация — разные явления с разными причинами.
- Критичные имена, числа, даты и термины проверяются вручную независимо от общей точности.
Самое важное слово в записи почти всегда оказывается самым редким. Планируйте это заранее: перечислите ожидаемую лексику до обработки и сверьте её после.
Частые вопросы
Потому что распознавание — это выбор наиболее вероятной последовательности слов, а не побуквенный перевод звука в текст. Обычная лексика опирается на контекст и статистику языка, а редкая фамилия конкурирует с похожими по звучанию и более частотными вариантами. Контекст фразы при этом почти не помогает: на месте имени собственного подходит любое имя.
Из-за сочетания двух факторов: термин акустически близок к распространённому слову, а языковой контекст допускает оба варианта. В такой ситуации привычное слово даёт последовательность, которая в целом выглядит более вероятной, и выигрывает. Ошибка при этом выглядит гладко: по одному тексту, без сверки с записью, её почти не видно.
Иногда да. Модели собирают текст не из готовых слов целиком, а из более мелких единиц и опираются на акустику, поэтому незнакомая последовательность может быть выведена верно. Но вероятность ошибки на таком слове выше: у системы мало информации и о самом слове, и о его типичном окружении. Результат зависит от языка, чёткости произношения, контекста и конкретной системы.
Их нужно не только разобрать на слух, но и записать кириллицей, а правил передачи часто несколько: начальный h становится то «х», то «г», ударение в русской речи смещается, произношение может не совпадать с ожидаемым написанием. В итоге звуку соответствуют сразу несколько законных вариантов написания, и выбрать между ними по одной акустике невозможно.
Работают три вещи вместе: качественная запись без шума и наложения голосов, заранее переданный список ожидаемых терминов и имён, проверка результата по значимым словам. Первое снимает акустическую неопределённость, второе смещает выбор в сторону нужной лексики, третье ловит остаток. По отдельности ни один из шагов проблему не закрывает.
Нет. Глоссарий предназначен прежде всего для слов, которые известны заранее, и работает как подсказка: он смещает вероятности, а не задаёт текст. Он не исправляет проблемы плохого звука, сильного шума, одновременной речи и не гарантирует правильного написания каждого слова из списка.
Те, что дальше уйдут в документ или решение: фамилии и должности участников, названия компаний, продуктов и препаратов, номера договоров и дел, суммы и даты, профильные термины и аббревиатуры. Отбирать их стоит по цене ошибки, а не по внешнему виду текста — подмена похожим по звучанию словом читается совершенно естественно. Быстрее всего искать такие места поиском по расшифровке: нашли значимое слово, открыли его тайм-код, послушали.
Полезное по теме
Страницы сервиса, где чаще всего встречается специализированная лексика:
Проверьте на своей записи
Загрузите аудио или видео и посмотрите, как сервис справляется именно с вашей лексикой: фамилиями участников, названиями и профессиональными терминами. Ожидаемые слова можно заранее перечислить в глоссарии, а спорные места — прослушать по тайм-кодам и поправить в редакторе. Первые 45 минут доступны бесплатно.