· 22 минуты чтения
Почему нейросети иногда «галлюцинируют» при транскрибации
Иногда в расшифровке появляется фраза, которую никто не произносил: текст во время тишины, повтор предыдущего абзаца, реплика на чужом языке. Это не «фантазия» модели и не сбой сервиса, а следствие того, как устроено распознавание речи. Разбираем механизм, виды таких ошибок и способы их не пропустить.
Знакомая ситуация: вы открываете готовую расшифровку часовой встречи, проглядываете текст — и натыкаетесь на предложение, которого точно никто не говорил. Или на английскую фразу посреди русского разговора. Или на «Спасибо за внимание» в том месте, где в записи была только тишина и шорох микрофона.
Первая реакция обычно одна: модель сломалась. Вторая — недоверие ко всей расшифровке: если здесь придумано, где ещё? На самом деле у таких вставок есть понятное объяснение, и, что важнее, есть признаки, по которым их можно находить, не переслушивая запись целиком.
Ещё одна сложность в том, что «галлюцинацией» пользователи называют почти любую странность в тексте: перепутанных спикеров, неверную пунктуацию, искажённую фамилию. Это разные явления с разными причинами, и лечатся они тоже по-разному. Дальше — что считать галлюцинацией, откуда она берётся и что с этим делать.
Коротко
Галлюцинация при транскрибации — это ситуация, когда модель генерирует текст, не соответствующий аудиосигналу: во фразу добавляются слова, которых не было, в паузе появляется целое предложение, повторяется уже сказанное. Причины — недостаток акустической информации, шум, длинные паузы, ошибки определения языка и высокая неопределённость модели на конкретном участке.
При этом далеко не каждая ошибка распознавания является галлюцинацией. Перепутанные спикеры, неверная пунктуация или похожее по звучанию слово — обычные ошибки, у них другая природа. Разделять их полезно практически: галлюцинации ищут в паузах и на шумных участках, а ошибки в именах — сверкой со списком участников.
Что такое галлюцинация при транскрибации
Термин пришёл из работы с языковыми моделями: галлюцинацией называют уверенно сформулированный текст, не опирающийся на источник. В распознавании речи источник — это звук. Значит, галлюцинация здесь — фрагмент расшифровки, которому в аудио ничего не соответствует.
Ключевое слово — «не соответствует». Если в записи прозвучало «Соколовский», а в тексте появилось «Соколов», это ошибка распознавания: звук был, модель выбрала неверный вариант. Если же в записи была пауза, а в тексте появилось «Продолжение следует», то соответствия нет вообще — вот это галлюцинация.
Различие не академическое. От типа ошибки зависит, что делать: галлюцинации ищут по границам сегментов и в тишине, ошибки диаризации — по репликам с неожиданной сменой роли, ошибки в именах — сверкой с документами. Одна проверка не заменяет другую.
Галлюцинация — это не «модель ошиблась», а «модель написала то, чего в звуке не было». Всё остальное — обычные ошибки распознавания, и бороться с ними нужно иначе.
Чем это отличается от галлюцинаций чат-ботов
Слово пришло из мира текстовых языковых моделей, где галлюцинацией называют выдуманный факт: несуществующую статью, неверную дату, ссылку в никуда. Там модель отвечает на вопрос, опираясь на всё, что усвоила при обучении, и проверить её можно только внешними источниками.
В распознавании речи ситуация проще и в каком-то смысле удобнее: у нас есть эталон — сама запись. Любую спорную строку можно послушать и сразу понять, было ли там что-то. Именно поэтому исходный файл стоит хранить до тех пор, пока текст не проверен: без аудио спорный фрагмент перестаёт быть проверяемым.
Общее у двух явлений одно: и там, и там модель не «врёт намеренно», а выбирает наиболее вероятное продолжение при недостатке опоры. Разница в том, что в транскрибации недостаток опоры имеет физическую природу — в записи действительно не было звука, который можно было бы распознать.
Почему вообще возникают галлюцинации
Современные системы распознавания не переводят звук в текст побуквенно. Они предсказывают следующий фрагмент текста, опираясь сразу на несколько источников: акустические признаки текущего участка, языковую модель — знание о том, какие слова обычно идут друг за другом, — и уже сгенерированный контекст, то есть то, что модель написала до этого.
Пока звук разборчивый, решающий голос за акустикой: сигнал однозначно указывает на конкретные слова. Но чем меньше в аудио полезной информации — шум, дальний микрофон, пауза, музыка, — тем меньше акустических оснований для выбора и тем больше вес языковой части. В пределе, когда речи нет вовсе, модель опирается почти только на то, какие последовательности слов вероятны сами по себе. Именно тогда и появляется правдоподобный текст, не связанный с записью.
Как возникает галлюцинация
Аудио
Недостаточно акустической информации
Рост неопределённости на участке
Языковая модель начинает достраивать текст
Генерация лишнего текста
Что происходит на участке без речи
…спасибо, на этом всё. [пауза, шорох микрофона]
[тишина]
Спасибо за внимание.
Продолжение следует…
Субтитры сделал…
Отсюда же характерная особенность галлюцинаций: они выглядят гладко. Это не набор случайных символов, а обычная человеческая фраза — часто та, что тысячи раз встречалась в обучающих данных: благодарность зрителям, титры, подпись переводчика. Модель не «придумывает» в человеческом смысле, а выбирает статистически удобное продолжение.
Как модель читает длинную запись
Ещё одна важная деталь — запись обрабатывается не целиком, а окнами по несколько десятков секунд. Модели семейства Whisper, например, работают с фрагментами по 30 секунд: длинный файл нарезается на такие куски, и каждый распознаётся отдельно. Результат предыдущего окна при этом обычно передаётся дальше как контекст — чтобы фраза, начатая в одном фрагменте, корректно продолжилась в следующем.
У этого механизма есть обратная сторона. Во-первых, границы окон почти никогда не совпадают с границами фраз: модель вынуждена как-то завершить обрывок, и если сигнал в этот момент слабый, окончание достраивается. Во-вторых, ошибка, попавшая в контекст, влияет на следующий шаг — так короткая выдуманная фраза иногда тянет за собой ещё одну.
Отсюда практическое следствие: подозрительные фрагменты чаще встречаются не в середине связного разговора, а на стыках — там, где заканчивается один смысловой кусок и начинается другой, или там, где речь прерывается паузой.
Почему всплывают именно служебные фразы
Обучающие данные больших систем распознавания собирались из открытых источников, включая видео с субтитрами. Вместе с речью в них попало огромное количество служебных строк: благодарности зрителям, призывы подписаться, подписи авторов субтитров, названия студий. В самой записи этим строкам обычно соответствует музыка, заставка или тишина.
Модель усвоила устойчивую связь: за таким «звуковым фоном» следует такой текст. Поэтому в паузе она чаще выдаёт «Спасибо за внимание», чем случайный набор слов, — статистически это самое ожидаемое продолжение. Это гипотеза, объясняющая наблюдения сообщества, а не результат контролируемого эксперимента, но она хорошо согласуется и с составом данных, и с тем, какие именно фразы всплывают.
Какие бывают галлюцинации
Разные ситуации выглядят по-разному и обнаруживаются по разным признакам. Ниже — основные виды, которые встречаются на практике.
Общее у них одно: тексту не соответствует звук. Различаются место, где вставка появляется, и то, как её проще всего заметить.
Несуществующие слова и фразы
Самый прямой случай: в тексте появляется предложение, которого никто не произносил. Обычно это происходит на границах сегментов — модель обрабатывает запись кусками, и на стыке кусков ей нужно чем-то закончить фразу. Если сигнал в этот момент слабый, окончание достраивается по смыслу.
Обнаружить такие вставки помогает простой признак: фраза стилистически выбивается из разговора. В рабочем совещании внезапно появляется формула из видеоблога, в интервью — обращение к зрителям. Если фраза выглядит как «дежурная», её стоит проверить по записи.
Повторение текста
Модель повторяет предложение, абзац или целую реплику по нескольку раз подряд. Механизм зациклирования такой: сгенерированный текст попадает в контекст следующего шага, и если акустика не даёт опоры, наиболее вероятным продолжением оказывается то же самое предложение. Дальше цикл поддерживает сам себя.
Чаще всего повторы возникают на длинных однородных участках: тишина, ровный гул, аплодисменты, музыкальная заставка. Заметить их легко — визуально текст выглядит как копипаст. Опаснее короткие повторы внутри осмысленного фрагмента: они маскируются под нормальную устную речь, в которой люди действительно повторяются.
Текст на другом языке
Здесь важно разделить два случая, которые внешне похожи. Первый: модель неверно определила язык записи и распознаёт русскую речь как, например, английскую — получается транслитерация или бессмысленный набор слов. Это ошибка определения языка, а не галлюцинация: звук модель слышит, но интерпретирует в неверной системе.
Второй случай: на участке без разборчивой речи появляется фраза на другом языке — типовая строка из субтитров вроде благодарности зрителям. Здесь соответствия звуку нет вовсе, и это уже галлюцинация. Практическое различие простое: в первом случае «переведён» реальный фрагмент разговора, во втором — текст возник там, где говорить было нечему.
Речь в шуме
Музыка с вокалом, гул кафе, вентилятор, аплодисменты, шум улицы иногда превращаются в слова. Причина в том, что многие фоновые звуки речеподобны по частотному составу: в них есть ритм и переходы, похожие на слоги. Модель, обученная находить речь, находит её и там, где речи нет.
Отдельный случай — фоновая музыка с текстом: тогда в расшифровку попадают обрывки песни вперемешку с репликами. Это не галлюцинация в строгом смысле — звук был, — но результат столь же неудобен: строки песни в стенограмме совещания выглядят как чужие реплики.
Галлюцинации во время тишины
Парадоксально, но полное отсутствие сигнала иногда опаснее слабого. Слабый сигнал всё-таки ограничивает выбор: акустика подсказывает хотя бы приблизительную структуру слогов. В тишине ограничений нет, и модель выбирает продолжение почти свободно.
Поэтому типовые места для таких вставок предсказуемы: длинная пауза посреди записи, тишина в конце файла, шорох при выключении диктофона, «хвост» голосового сообщения. Обсуждения в репозитории Whisper полны именно таких примеров, и разработчики отдельно отмечают, что определение речи на входе (VAD) помогает, но не устраняет проблему полностью.
Как это выглядит в расшифровке
Что было в записи
Тишина в конце файла, щелчок микрофона
Что появилось в тексте
Спасибо за внимание.
Причина: Акустических оснований нет, выбирается типовая для обучающих данных фраза.
Что делать: Обрезать тишину в конце записи перед загрузкой.
Что было в записи
Аплодисменты после выступления
Что появилось в тексте
Аплодисменты. Аплодисменты. Аплодисменты.
Причина: Однородный шум удерживает модель в цикле: сгенерированное попадает в контекст следующего шага.
Что делать: Повторы легко заметить глазами — такие блоки удаляют при вычитке.
Что было в записи
Пауза в русской записи
Что появилось в тексте
Thank you for watching!
Причина: Служебные строки из субтитров встречались в обучающих данных тысячи раз.
Что делать: Проверить, что на этом тайм-коде в аудио действительно есть речь.
Примеры и обсуждения: обсуждение галлюцинаций на записях без речи (openai/whisper #1606), обсуждение «Who is DimaTorzok?» в репозитории openai/whisper
Обрывки на границах фрагментов
Менее заметный, но частый случай: фраза в тексте оборвана и «дозаписана» неверно. Человек сказал «нужно согласовать с юристами до…», окно закончилось, и в расшифровке появляется «…до конца недели», хотя в записи прозвучало «до вторника». Формально это тоже генерация текста без опоры на звук, только замаскированная под правдоподобное окончание.
Такие вставки опаснее откровенных «Спасибо за внимание»: они не выбиваются из контекста и читаются естественно. Единственный надёжный способ их поймать — сверять с записью те места, где называются сроки, суммы и условия.
Чужая речь на фоне
Отдельная категория — не выдуманный, а «лишний» текст: голос из телевизора, разговор за соседним столом, объявление в аэропорту, реплики дубляжа в видео. Формально это не галлюцинация: звук был, и модель честно его распознала. Но в стенограмме встречи фраза диктора выглядит как реплика участника, и последствия те же самые.
Отличить помогает диаризация: посторонняя речь обычно попадает в отдельного «спикера» или приписывается тому, кто в этот момент молчал. Если в расшифровке появился участник, которого на встрече не было, это почти всегда фон.
DimaTorzok и другие «подписи»
Самый известный русскоязычный пример — строка «Субтитры сделал DimaTorzok», которая появляется в конце голосовых сообщений и роликов. Это тот же механизм: на участке без речи модель дописывает фразу, тысячи раз встречавшуюся в субтитрах, вместе с ником автора. Имя здесь — не сбой конкретного сервиса и не пасхалка, а след обучающих данных.
История этого случая, разбор того, откуда взялось имя, и коллекция похожих «подписей» — в отдельном материале: кто такой DimaTorzok и почему его имя появляется в расшифровках. Для нашей темы важно другое: это частный случай общего явления, а не отдельная болезнь.
Что часто принимают за галлюцинации
Половина жалоб на «выдумки нейросети» относится к ошибкам другой природы. Разделять их стоит хотя бы потому, что исправляются они разными способами, а некоторые вообще не являются ошибками.
- Путаница спикеров. Слова распознаны верно, но приписаны не тому участнику. Это ошибка диаризации — отдельного алгоритма, который делит запись по голосам. К генерации текста она отношения не имеет.
- Неверная пунктуация. Точка не там, где нужно, меняет смысл фразы, но текст при этом соответствует звуку. Пунктуация восстанавливается по интонации и контексту, и на устной речи это трудная задача.
- Ошибка в имени. Редкая фамилия заменяется частотной — «Соколовский» превращается в «Соколова». Звук был, выбран неверный вариант: это классическая ошибка распознавания, которую лечит глоссарий.
- Замена похожего слова. «Пять» вместо «опять», «стоит» вместо «стоил» — та же природа, что и ошибка в имени.
- Ошибка определения языка. Иногда действительно приводит к бессмысленному тексту, но исходно это неверная интерпретация реального звука, а не выдумка.
| Что видно в тексте | Галлюцинация? | Что происходит на самом деле |
|---|---|---|
| Добавлено предложение, которого не было | Да | Классический случай: тексту не соответствует никакой звук |
| Во время тишины появился текст | Да | Нет акустических оснований, выбирается типовая фраза |
| Повторился абзац или реплика | Обычно да | Зацикливание: сгенерированный текст попадает в контекст следующего шага |
| Вместо «Петров» стало «Петрова» | Обычно нет | Ошибка распознавания: звук был, выбран более частотный вариант |
| Перепутаны спикеры | Нет | Ошибка диаризации — деления записи по голосам |
| Неверная пунктуация | Нет | Восстановление знаков по интонации и контексту |
| Текст на другом языке | Не всегда | Если «переведён» реальный фрагмент — ошибка определения языка; если возник в паузе — галлюцинация |
Практический признак: если на этом тайм-коде в записи есть речь — это ошибка распознавания. Если речи нет — галлюцинация.
Как найти галлюцинации в готовой расшифровке
Перечитывать всю расшифровку в поисках выдумок бессмысленно: галлюцинации распределены по тексту не случайно. Они концентрируются там, где записи было нечего распознавать, и почти не встречаются в середине связного разговора с хорошим звуком.
Отсюда рабочий порядок: сначала пройтись по местам повышенного риска, а уже потом, если материал ответственный, читать текст целиком.
- Начало и конец файла. Тишина перед первой фразой и «хвост» после последней — самые частые места вставок.
- Паузы в середине. Перерыв, задумчивое молчание, техническая заминка — всё, что длилось дольше нескольких секунд.
- Музыка и аплодисменты. Заставки, фоновая музыка, овации после выступления.
- Повторяющиеся блоки. Одинаковые предложения подряд видно даже при беглом просмотре.
- Фразы не в стиле разговора. Формулы из видеороликов, обращения к зрителям, названия студий.
- Стыки смысловых кусков. Места, где тема резко меняется, — там проходили границы окон обработки.
- Сроки, суммы и условия. Не потому, что их часто выдумывают, а потому, что цена ошибки здесь максимальна.
Проверять удобнее по тайм-кодам: в расшифровке каждая реплика привязана ко времени, поэтому спорную строку можно послушать за пару секунд, не отматывая запись вручную. Если фраза вызывает сомнение, а на этом месте в аудио тишина или шум — перед вами галлюцинация, и строку нужно удалить, а не «поправить».
Правило простое: сомнительная фраза плюс отсутствие речи на её тайм-коде — это выдуманный текст. Если речь есть, значит, это обычная ошибка распознавания, и её исправляют по звуку.
Что делать, если галлюцинация уже попала в текст
- Послушать это место по тайм-коду. Половина подозрений снимается сразу: фраза действительно звучала, просто неожиданно.
- Удалить вставку, а не переписывать её. Если звука не было, «правильного» варианта не существует — в тексте не должно остаться ничего.
- Проверить соседние строки. Ошибка попадает в контекст следующего шага, поэтому рядом может оказаться ещё одна выдуманная фраза.
- Отметить неразборчивый фрагмент явно. Пометка вида «[неразборчиво]» честнее, чем правдоподобная догадка: читатель увидит, что здесь данных нет.
- Пересобрать запись, если вставок много. Обрезать тишину, загрузить исходный файл вместо пересланного — часто это убирает большую часть проблемы.
- Сохранить исходное аудио. Пока запись есть, любой спорный фрагмент проверяем; после её удаления текст остаётся единственным источником и проверить его уже нечем.
Почему качество записи так сильно влияет
Вероятность галлюцинаций напрямую связана с тем, сколько разборчивой речи дошло до модели. Чем меньше полезного сигнала, тем чаще ей приходится опираться на языковые ожидания — и тем выше шанс, что она достроит лишнее.
- Шум маскирует слабые звуки речи и сам может быть распознан как речь, особенно если это гул голосов.
- Дальний микрофон ослабляет голос относительно помещения: в записи остаётся больше отражений, чем прямого сигнала.
- Эхо размывает границы слов, из-за чего модель хуже определяет, где кончается одно слово и начинается другое.
- Несколько говорящих одновременно дают смесь сигналов, из которой не восстанавливается ни одна из реплик целиком.
- Телефонный канал и мессенджеры обрезают частоты и применяют шумоподавление: часть акустических признаков теряется до распознавания.
- Низкий битрейт и повторное пережатие убирают детали, по которым различаются похожие звуки.
- Длинные паузы — участки, где акустика вообще ничего не подсказывает.
| Условия записи | Вероятность галлюцинаций |
|---|---|
| Один человек, хороший микрофон | Очень низкая |
| Интервью двух человек в тихой комнате | Низкая |
| Совещание с несколькими участниками | Средняя |
| Телефонный разговор | Средняя |
| Запись на улице | Повышенная |
| Шумное кафе | Высокая |
| Музыка на фоне или вместо речи | Высокая |
| Длинная тишина в записи | Высокая |
Отдельно стоит сказать про сжатие. Пересланное несколько раз голосовое сообщение или видео, скачанное и загруженное заново, проходят через кодек не один раз. Каждый проход убирает детали, по которым различаются похожие звуки, — и то, что человеку кажется «просто чуть хуже», для модели означает меньше признаков для решения. Поэтому исходный файл почти всегда даёт более чистый результат, чем его пересланная копия.
Помогает и предварительное определение речи: перед распознаванием запись можно разметить на участки с речью и без неё, а «пустые» просто не отдавать модели. Это заметно снижает число вставок в тишине, но не устраняет их полностью — короткие паузы внутри фразы и шум, похожий на речь, такая фильтрация пропускает.
Отсюда следует неочевидный вывод: бороться с галлюцинациями удобнее не после расшифровки, а до неё — улучшая запись. Подробный разбор факторов и того, что можно исправить, — в материале «Как повысить точность распознавания речи».
Как уменьшить вероятность галлюцинаций
Полностью исключить такие ошибки нельзя, но их вероятность заметно снижается простыми мерами. Часть из них относится к записи, часть — к работе с готовым текстом.
Как снизить вероятность галлюцинаций
До записи
Выбрать тихое помещение: главный враг — не громкость шума, а его близость к уровню голоса.
Расположить микрофон ближе к говорящему, а не в центре стола.
Выключить фоновую музыку — особенно с вокалом.
Договориться говорить по очереди, а при возможности писать участников на отдельные дорожки.
Перед загрузкой
Загружать исходный файл, а не пересланную и пережатую копию.
Обрезать длинную тишину в начале и в конце.
Внести имена участников и термины в глоссарий профиля.
После расшифровки
Просмотреть места, где в записи были паузы, музыка или аплодисменты.
Проверить фразы, которые стилистически выбиваются из разговора.
Сверить имена, числа и даты по записи или документам.
Перед публикацией проверить каждую цитату по исходному аудио.
Проверку упрощают инструменты вокруг текста: тайм-коды позволяют перейти к нужному месту записи одним кликом, поиск — быстро найти подозрительную фразу, а встроенный редактор — сразу поправить текст. Смысл не в том, чтобы перечитывать всё подряд, а в том, чтобы точечно проверять места повышенного риска.
Самый надёжный способ борьбы с галлюцинациями — не постобработка, а хорошая запись: чем больше разборчивой речи в файле, тем меньше модели приходится достраивать.
Нужно ли бояться галлюцинаций
Спокойный ответ: на хороших записях современные модели работают стабильно, и большинство расшифровок обходится без выдуманных фрагментов. Но полностью исключить их вероятность нельзя, и частота зависит от модели, настроек и условий записи — универсальной цифры здесь не существует, а тем, кто её называет, стоит задать вопрос о методике.
Разумная стратегия — соотносить объём проверки с ценой ошибки. Для личных заметок и поиска по записи достаточно бегло просмотреть текст. Для статьи или отчёта — сверить цитаты и цифры. Для юридически значимых документов, медицинских материалов и публикаций — проверять результат по исходной записи, а не полагаться на автоматический текст как на окончательный.
Полезно помнить, что поведение зависит не только от модели, но и от того, как она запущена. Размер окна, передача контекста между фрагментами, предварительная фильтрация участков без речи, параметры декодирования — всё это меняет и частоту вставок, и их характер. Поэтому сравнивать «модель А галлюцинирует чаще модели Б» без описания настроек и данных бессмысленно: слишком много переменных.
И ещё одно наблюдение, важное для ожиданий: чем лучше запись, тем менее заметна разница между сервисами. На чистой диктовке приличный результат даёт почти любая современная система; расходятся они как раз на сложном материале — шуме, наложении голосов, плохом канале связи.
Полезно помнить и обратную сторону: человек в расшифровке тоже ошибается — пропускает слова, неверно слышит фразы, устаёт на длинных записях. Сравнение подходов и того, когда какой уместен, — в материале «AI-транскрибация или ручная расшифровка».
Что в итоге
Галлюцинации — не признак «плохой нейросети» и не случайный сбой. Это следствие того, как устроено распознавание: модель совмещает акустические данные с языковыми ожиданиями, и когда акустики не хватает, вес ожиданий растёт. В паузе, в шуме, на музыкальной вставке модели буквально нечего распознавать — и она достраивает наиболее типичное продолжение.
Отсюда три практических следствия. Первое: галлюцинации предсказуемы по месту — их ищут там, где речи мало или нет. Второе: они отличаются от обычных ошибок распознавания, и путать их не стоит. Третье: качество записи влияет на их вероятность сильнее, чем выбор сервиса.
Чем больше разборчивой речи попало в запись, тем меньше модели приходится догадываться — и тем реже в расшифровке появляется то, чего никто не говорил.
Частые вопросы
Это фрагмент расшифровки, которому в аудио не соответствует никакой звук: добавленное предложение, текст в паузе, повтор уже сказанного. От обычной ошибки распознавания галлюцинация отличается тем, что при ошибке звук был и модель выбрала неверный вариант, а при галлюцинации распознавать было нечего.
Модель предсказывает текст, опираясь и на звук, и на языковые закономерности. Когда акустической информации мало — шум, дальний микрофон, обрывок фразы на границе сегмента, — решение всё больше определяется тем, какое продолжение вероятно с точки зрения языка. Так в тексте появляются слова, которых в записи не было.
Есть два разных случая. Если модель неверно определила язык записи, она интерпретирует реальную речь в чужой системе — получается транслитерация или бессмыслица; это ошибка определения языка. Если же иностранная фраза возникла на участке без речи, это галлюцинация: обычно всплывает типовая строка из субтитров вроде благодарности зрителям.
В тишине у модели нет акустических подсказок, ограничивающих выбор, поэтому она опирается почти только на вероятность самих последовательностей слов. Служебные фразы из субтитров и роликов встречались в обучающих данных очень часто, и именно они чаще всего оказываются самым вероятным продолжением.
Да, это частный случай галлюцинации на участке без речи: модель дописывает типовую подпись из субтитров вместе с ником. Подробный разбор истории и коллекция похожих строк — в отдельной статье о феномене DimaTorzok.
Сгенерированный текст попадает в контекст следующего шага. Если на этом участке акустика не даёт опоры — тишина, ровный гул, аплодисменты, — самым вероятным продолжением оказывается та же самая фраза, и цикл поддерживает сам себя. Внешне это выглядит как копипаст в расшифровке.
Явление свойственно генеративным моделям распознавания в целом, но частота и характер вставок различаются: они зависят от архитектуры, обучающих данных, настроек декодирования и предварительной фильтрации участков без речи. Утверждать, что какая-то модель «не галлюцинирует», без замеров нельзя.
Полной гарантии нет. Вероятность заметно снижают хорошая запись, отсутствие музыки и длинных пауз, загрузка исходного файла без повторного пережатия, а также предварительное определение участков с речью. Для ответственных материалов остаётся проверка по исходному аудио.
В первую очередь — участки, где в записи были паузы, музыка, аплодисменты или сильный шум; фразы, стилистически выбивающиеся из разговора; повторяющиеся блоки текста. Отдельно проверяют имена, числа и даты, а перед публикацией — каждую цитату.
Улучшить запись до того, как она попадёт в сервис: тихое помещение, микрофон ближе к говорящему, речь по очереди, без фоновой музыки. Добавить имена и термины в глоссарий. После расшифровки — проверить места повышенного риска по тайм-кодам и сохранить исходный файл, чтобы было с чем сверяться.
Полезное по теме
Страницы сервиса, которые помогут получить более чистый результат:
Проверьте качество на своей записи
Загрузите аудио или видео в Speech Recognition и оцените результат на собственном материале. Если запись содержит важные цитаты, цифры или юридически значимые сведения, обязательно сверьте их с исходным аудио. Первые 45 минут доступны бесплатно.