speech-recognition
Войти
Почему нейросети делают так?

· 23 минуты чтения

Самые странные ошибки нейросетей при распознавании речи

Нейросеть может почти идеально расшифровать часовое интервью, а через минуту написать целое предложение там, где в записи только тишина. Или правильно разобрать сложную профессиональную речь и тут же превратить фамилию в набор посторонних слов. Собрали странные эффекты распознавания речи, часть из них воспроизвели сами — и разобрались, почему система, которая обычно работает точно, иногда ведёт себя настолько неожиданно.

Обложка статьи «Самые странные ошибки нейросетей при распознавании речи»

Странные ошибки распознавания речи выглядят обиднее обычных. С опечаткой в сложном термине можно смириться — понятно, откуда она взялась. Но когда в расшифровке пустой записи вдруг появляется вежливое «Thank you», а посреди русского разговора выскакивает английская фраза, возникает ощущение, что модель занимается чем-то своим.

Объяснение у всех этих случаев есть, и оно довольно простое. Но чтобы говорить о них предметно, нужны не пересказы чужих скриншотов, а воспроизводимые примеры. Поэтому мы собрали шесть тестовых записей без единого слова речи и прогнали их через тот же движок распознавания, который работает в сервисе. Результаты — включая те, где не произошло ничего интересного, — дальше в статье.

Сразу предупредим: многие громкие истории про распознавание речи на проверке не воспроизводятся — наш тест это тоже показал. Зато то, что воспроизводится, оказывается устроено интереснее, чем городская легенда.

Коротко: почему возникают странные ошибки

Модель распознавания не переводит звук в буквы по словарю. Она подбирает наиболее вероятную последовательность слов для каждого фрагмента аудио, опираясь одновременно на акустику и на языковые закономерности. Когда акустической информации мало — тишина, шум, слабый или необычный сигнал, — вес языковых ожиданий растёт, и модель может выдать текст, которому в звуке ничего не соответствует.

При этом «странная ошибка» — не одно явление, а минимум четыре разных: ошибка в словах, ошибка определения языка, ошибка разделения говорящих и галлюцинация. Они возникают на разных этапах обработки, и лечатся по-разному.

Случай 1. Фраза появилась во время тишины

Самый известный из странных эффектов: в записи пауза, а в расшифровке — законченное предложение. Мы попробовали воспроизвести его двумя способами: на цифровой тишине и на «комнатной» тишине с очень тихим фоном.

На обоих файлах не появилось ни одного слова: модель вернула пустой результат. А вот третий файл — тихий фон с редкими короткими звуками — дал вот что.

Три минуты пустой комнаты, речи нет ни секунды

Что было в записи

Тихий фон, на 23-й секунде короткий скрип

Что выдала модель

Yeah.

Оценка уверенности слова — 0,37

Что было в записи

Тихий фон, на 66-й секунде короткий скрип

Что выдала модель

Thank you.

Фрагменту присвоен говорящий SPEAKER_00, оценки слов — 0,18 и 0,23

Что было в записи

Тихий фон, на 158-й секунде короткий скрип

Что выдала модель

Hmm.

Оценка уверенности слова — 0,39
Повторный прогон того же файла дал ровно тот же результат, прогон на втором сервере — тоже

Самое интересное — на что именно среагировала модель. В записи было двенадцать коротких событий трёх типов: щелчки, шорохи и «скрипы». Щелчки и шорохи — широкополосные шумовые всплески — не дали ничего. Все три фразы пришлись на скрипы: короткий периодический тон около 180 герц с плавным нарастанием и затуханием, то есть сигнал в диапазоне человеческого голоса. При этом связь не стопроцентная: скрипов было пять из двенадцати событий, а текст породили три из них.

Заметьте, что чистая цифровая тишина и ровный шум в нашем тесте молчали. Утверждение «любая ASR-система обязательно пишет текст в тишине» неверно: многое зависит от конкретной модели, версии, настроек и от того, что именно записано на «пустом» участке.

Это галлюцинация: звука, которому соответствовал бы текст, в записи нет. Искать такие места нужно там, где речи мало или нет вовсе, — в паузах, в начале и в конце записи.

Случай 2. Шум превратился в слова

Второй по популярности сюжет: «включили запись дождя, а получили стихотворение». Мы проверили белый шум, розовый шум (спектрально он близок к шуму дождя и вентилятора) и инструментальную музыку без вокала.

Результат честно скучный

Что было в записи

Белый шум, 3 минуты

Что выдала модель

Пусто: ни одного слова

Что было в записи

Розовый шум, 3 минуты

Что выдала модель

Пусто: ни одного сегмента

Что было в записи

Инструментальное арпеджио без вокала, 3 минуты

Что выдала модель

Пусто: модель вернула нулевой результат

Отрицательный результат — тоже результат: ни одного слова ни на одном из файлов

И это хорошо согласуется с предыдущим случаем. Ровный шум не похож на речь ничем: у него нет ни периодичности голоса, ни характерной для речи структуры чередования звуков и пауз. А вот короткий тональный «скрип» на тихом фоне похож — и именно он породил текст.

Неречевое аудио далеко не всегда превращается в текст. Наш тест это подтверждает: три разных типа шума и музыка дали пустой результат. А если текст на таком фрагменте всё же появляется — это галлюцинация, а не ошибка распознавания: соответствующего звука в записи просто нет.

Случай 3. Расшифровка переключилась на другой язык

Обратите внимание на предыдущий эксперимент: все три фразы в «пустой комнате» вышли по-английски, хотя английской речи там не было — как, впрочем, и русской. Язык записи модель тоже определяет — и на записи без речи ей просто не из чего его определять.

Мы прогнали тот же файл ещё раз, принудительно указав русский язык. Так можно сделать только при прямом обращении к движку распознавания: в самом сервисе язык загруженной записи определяется автоматически, переключателя в интерфейсе нет. Тайм-коды совпали до сотых долей секунды, а текст стал другим.

Один и тот же файл, два разных языка

Язык распознавания

Автоопределение (модель выбрала английский)

Что выдала модель

23 с — «Yeah.» · 66 с — «Thank you.» · 158 с — «Hmm.»

Язык распознавания

Принудительно русский

Что выдала модель

23 с — «Да.» · 66 с — «Продолжение следует...» · 158 с — «Угу.»

Причина: Акустические события те же самые. Меняется только то, из какого набора вероятных фраз модель выбирает продолжение.

Тот же скрип на 66-й секунде стал то «Thank you», то «Продолжение следует...» — двумя самыми известными субтитровыми штампами

Это, пожалуй, самая наглядная демонстрация механизма во всей статье. Никакого «услышанного» текста не существует: есть акустическое событие и есть языковая модель, которая подставляет к нему самую вероятную фразу. Смените язык — и на том же самом месте появится другая фраза, столь же уверенная.

В настоящих записях смена языка возникает и по другим причинам: короткий фрагмент, иностранное имя или термин, переключение говорящего между языками, слабый сигнал. Важно, что текст на чужом языке — не всегда галлюцинация: иногда это именно ошибка определения языка, и разбираются с ней иначе. Подробно этот механизм разобран в статье как нейросеть определяет язык аудиозаписи.

Один и тот же участок аудио может дать разный текст в зависимости от выбранного языка. Если расшифровка вдруг «заговорила» на другом языке, сначала проверяют определение языка, и только потом подозревают галлюцинацию.

Случай 4. Нейросеть придумала странное или несуществующее слово

Классика жанра: в тексте появляется слово, которого нет в языке, или слово настолько неожиданное, что читатель перечитывает фразу дважды. Обычно за этим стоит одна из трёх причин.

  • Акустическая неоднозначность. Смазанный или тихий участок допускает несколько прочтений, и модель выбирает не то, которое имел в виду говорящий.
  • Редкая лексика. Термин, фамилия или аббревиатура встречались модели редко, поэтому более частая последовательность обычных слов побеждает по совокупной вероятности.
  • Сборка по частям. В моделях вроде Whisper текст собирается не из целых слов, а из подсловных фрагментов, и на стыке они могут сложиться в последовательность, которой в языке нет. В системах с фиксированным словарём такой эффект невозможен — там ошибка всегда будет существующим словом.

Это обычная ошибка распознавания, а не галлюцинация: звук на этом месте был, модель выбрала неверный вариант. Проверяется прослушиванием соответствующего тайм-кода.

Случай 5. Фамилия превратилась в обычные слова

Частая разновидность предыдущего случая — и самая заметная для читателя. Редкая фамилия распознаётся как более привычная последовательность: типичная схема замены выглядит так, что «Ивановских» превращается в «и Вановских», а незнакомая модели фамилия — в два коротких обычных слова. Своего прогона на речи у нас пока нет, поэтому пример здесь иллюстративный: он показывает схему, а не результат нашего теста.

Причина не в том, что имени «нет в словаре». У моделей такого типа словаря в привычном смысле нет: они собирают текст из подсловных фрагментов и могут написать любое сочетание букв. Проблема в вероятностях: редкое имя проигрывает частым словам, которые звучат почти так же, — подробный разбор в статье почему нейросети ошибаются в именах, фамилиях и терминах.

  • Собственные имена статистически редки, и контекст фразы обычно не помогает выбрать между «Соколов» и «Соколовский».
  • Правильное написание часто физически отсутствует в звуке: заглавная буква, дефис, кавычки, латиница или кириллица — всё это на слух неразличимо.
  • В записи с несколькими участниками имя нередко произносят быстро и неразборчиво — именно там, где акустики меньше всего.

Практический способ борьбы один: заранее передать модели список имён и терминов. Как это работает и почему длинный список хуже короткого — в статье про глоссарий для транскрибации.

Тоже обычная ошибка распознавания. В отличие от галлюцинации, она лечится подсказкой: имена из глоссария заметно меняют расклад вероятностей.

Случай 6. Одна фраза начала повторяться

Выглядит это так: «Спасибо за внимание. Спасибо за внимание. Спасибо за внимание» — и дальше на несколько экранов. Или зацикленный кусок предыдущей реплики, повторённый десяток раз подряд.

Зацикливание — известная особенность авторегрессионных моделей: каждое следующее слово выбирается с оглядкой на уже сгенерированные, и на участке с бедной акустикой модель может попасть в петлю, где самым вероятным продолжением оказывается повтор только что написанного. В карточке модели Whisper это названо прямо: архитектура делает модель склонной к порождению повторяющегося текста, и подбор параметров декодирования смягчает проблему, но не устраняет её.

Важная оговорка: повтор не всегда означает сбой модели. Иногда человек действительно повторяется, иногда запись содержит эхо, а иногда одна и та же реплика попала в две соседние части записи. Поэтому в таблице ниже этот случай честно помечен как «зависит от причины».

Повтор — сигнал посмотреть на тайм-коды. Если каждой копии фразы соответствует свой участок аудио, это особенность записи; если все копии стоят на одном месте, это сбой декодирования.

Случай 7. Спикер появился там, где никто не говорил

Вернёмся к нашему эксперименту с пустой комнатой. Одна из трёх фантомных фраз — «Thank you» на 66-й секунде — получила метку говорящего SPEAKER_00. То есть модуль разделения по голосам не просто пропустил фрагмент, а отнёс его к одному из голосов: на вход он получил участок, уже помеченный как речь.

Ничего мистического в этом нет: разделение по говорящим — отдельная технология, которая работает поверх результата распознавания. Она получает на вход участок, помеченный как речь, и её задача — приписать его какому-то голосу. Если участок попал в обработку по ошибке, метка тоже окажется ошибочной.

В обычных записях ошибки разделения выглядят иначе: один человек по ходу записи распадается на двух «спикеров», два похожих голоса склеиваются в одного, короткие реплики уходят не тому участнику. Причины — смена расстояния до микрофона, качество связи, перебивания, похожие тембры. Механизм подробно разобран в статье что такое диаризация.

Это ошибка диаризации, а не распознавания слов. Текст может быть верным до буквы и при этом приписан не тому человеку — и наоборот, метка говорящего может появиться там, где речи вообще не было.

Случай 8. Слова верные, но сказаны не тем человеком

Отдельно стоит выделить случай, в котором расшифровка выглядит безупречной. Все слова распознаны верно, пунктуация на месте, читать приятно — и только реплика приписана не тому участнику. Глазами такая ошибка не ловится вообще: в тексте нет ничего подозрительного.

Между тем цена у неё выше, чем у обычной лексической ошибки. Неверно распознанное слово читатель чаще всего достроит по контексту. Перепутанного говорящего он не достроит никак — и последствия зависят от того, зачем нужна запись.

  • Интервью. Меняется автор цитаты: слова журналиста уходят собеседнику или наоборот. Для публикации это прямая фактическая ошибка.
  • Совещание. Меняется владелец обязательства: «я сделаю к пятнице» оказывается сказанным другим человеком, и в протоколе появляется поручение не тому.
  • Юридически значимая запись. Меняется тот, кто что признал или на что согласился, — а это уже вопрос не удобства, а содержания документа.

Практический вывод простой: разметку говорящих нужно просматривать отдельно от слов. Это независимый слой результата, и правильность текста ничего не говорит о правильности подписей.

Это ошибка диаризации. Она не видна при чтении, не исправляется контекстом и стоит дороже лексической — потому что меняет не формулировку, а автора.

Случай 9. Расшифровка звучит идеально — но этого никто не говорил

Самый неприятный случай, потому что он не выглядит как ошибка. Предложение грамматически правильное, вписывается в тему разговора, стоит на своём месте — и его просто не было в записи.

В нашем тесте именно так выглядит фраза «Продолжение следует...» на 66-й секунде. Она безупречна: обычная русская фраза, привычная концовка, ноль признаков сбоя. Проверить её можно только одним способом — послушать эту секунду в аудио. Никакой анализ текста тут не поможет.

Полный разбор механизма — в статье почему нейросети галлюцинируют при транскрибации, а что именно стоит перепроверять в готовом тексте, разобрано в материале можно ли доверять автоматической расшифровке.

Это галлюцинация в чистом виде — и самая опасная её разновидность. Языковая правдоподобность ничего не говорит о соответствии записи: гладкий текст не признак точности, а иногда прямо наоборот, потому что гладкими получаются именно вставки.

А где DimaTorzok?

DimaTorzok — самый известный представитель этого семейства: ник автора субтитров, который попал в обучающие данные и с тех пор всплывает в расшифровках русскоязычных записей на местах, где речи нет. По сути это тот же механизм, что и «Продолжение следует...» в нашем тесте, только имя вместо фразы.

История этого случая, коллекция родственных артефактов и обсуждение в репозитории модели — в отдельной статье: кто такой DimaTorzok и почему его имя появляется в расшифровках.

Ошибка или галлюцинация?

Прежде чем классифицировать конкретный фрагмент, полезно понять, к какому вопросу он вообще относится. Все странности из статьи раскладываются на четыре группы, и в каждой свой виновник.

Карта странных ошибок

Что сказано?

Слово заменено похожим

Фамилия стала обычными словами

Фраза зациклилась

Ошибка распознавания или галлюцинация

На каком языке?

Русская речь стала английским текстом

Фрагмент на чужом языке

Ошибка определения языка

Кто сказал?

Один человек стал двумя

Реплика приписана не тому

Спикер там, где нет речи

Ошибка диаризации

Была ли речь вообще?

Текст в тишине

Осмысленная фраза в шуме

Галлюцинация

Четыре разных вопроса — четыре разных модуля обработки и четыре разных способа проверки

Термин «галлюцинации распознавания речи» применяют почти к любой странности в тексте, и из-за этого теряется практический смысл. Разница простая: если звук на этом месте был, а модель выбрала неверный вариант — это обычная ошибка транскрибации. Если звука не было вовсе — галлюцинация.

СитуацияЧто это
Одно слово заменено похожимОбычная ошибка распознавания
Фамилия стала другим словомОшибка распознавания
Спикеры перепутаныОшибка диаризации
Русская речь распознана как другой языкВозможная ошибка определения языка
В шуме появился осмысленный текстВозможная галлюцинация
В тишине возникло целое предложениеВозможная галлюцинация
Фраза повторилась много разЗависит от причины и модели
Как классифицировать странный фрагмент

Слово «возможная» здесь не для страховки. Без исходного аудио спорный случай классифицировать нельзя: то, что выглядит как галлюцинация в шуме, может оказаться тихой репликой, которую человек на слух не разобрал, а модель разобрала.

Классификация нужна не ради терминологии, а ради действий: галлюцинации ищут в паузах, ошибки в именах — глоссарием и сверкой со списком участников, ошибки диаризации — просмотром реплик, ошибки языка — проверкой определения языка.

Почему эти ошибки кажутся человеку особенно нелогичными

Мы ожидаем линейной зависимости: сложная запись — много ошибок, простая запись — мало. У модели сложность распределена иначе, и именно поэтому её ошибки выглядят абсурдными.

Что кажется сложным человекуЧто реально сложно модели
Шумная запись с улицыТихая пауза без речи
Быстрая эмоциональная речьОдно редкое слово среди обычных
Длинная двухчасовая встречаКороткая реплика в один слог
Профессиональный жаргонДва человека, говорящие одновременно
Шумная запись часто содержит достаточно контекста и распознаётся нормально, а трёхсекундная пауза даёт странный сегмент

Второй источник удивления — неравномерность. Пятьдесят минут встречи распознаны отлично, и на этом фоне одна фантомная фраза читается как поломка всей системы. На самом деле это нормальное поведение вероятностной модели: она не «понимает» запись целиком, а принимает решение по каждому короткому фрагменту отдельно.

То, что кажется простым человеку, не обязательно просто для модели. И наоборот: сложная на слух запись может распознаться лучше, чем тихая и «чистая».

Наш тест целиком

Полные результаты, включая скучные. Все файлы — по 3 минуты, синтезированы специально для этого теста, прогонялись 27 августа 2026 года через движок распознавания сервиса с включённым разделением по говорящим.

Что подавалиЧто выдала модельЧто это значит
Цифровая тишина (нулевой сигнал)ПустоНи одного слова, ни одного сегмента
Очень тихий фон, «комнатная тишина»ПустоРовный тихий шум сам по себе текста не породил
Белый шумПустоШирокополосный шум не похож на речь
Розовый шум (близок к дождю и вентилятору)ПустоТот же вывод, что и с белым шумом
Инструментальное арпеджио без вокалаПустоМузыка без голоса текста не дала
Тихий фон плюс щелчки, шорохи и скрипы«Yeah», «Thank you», «Hmm»Три фразы, все — на коротких тональных звуках в диапазоне голоса
Шесть записей без речи

Главный вывод теста обратный расхожему: чтобы получить фантомную фразу, нужен сигнал, отдалённо похожий на голос. Ровный шум и тишина в нашем прогоне не дали ни одного слова — текст появился только там, где был короткий тон в диапазоне голоса.

Что делать, если встретилась странная ошибка

  1. Открыть тайм-код спорного фрагмента и послушать несколько секунд до и после — это сразу отделяет обычную ошибку транскрибации от галлюцинации и отвечает на вопрос, почему AI ошибается именно здесь.
  2. Посмотреть, есть ли на этом месте речь вообще. Нет речи — вставка; речь есть — обычная ошибка распознавания.
  3. Проверить язык фрагмента: текст на чужом языке часто означает ошибку определения языка, а не выдумку.
  4. Проверить метку говорящего: слова могут быть верными, но приписанными не тому участнику.
  5. Поправить текст в редакторе — исходная расшифровка при этом сохраняется отдельно.
  6. Повторяющиеся имена и термины внести в глоссарий, чтобы следующая запись распозналась лучше.
  7. Для критически важных данных — цифр, сроков, обязательств — сверяться с исходной записью, а не с текстом.

Почти вся диагностика сводится к одному действию: послушать оригинал на нужной секунде. Поэтому запись стоит хранить до тех пор, пока текст не проверен.

Проверяем на Speech Recognition

Все собственные примеры в этой статье получены на том же движке распознавания, который работает в сервисе: мы не проверяли «какую-то нейросеть вообще», а отправляли файлы прямо в него, минуя остальную обработку.

Уточним про сам тест: файлы мы отправляли прямо в движок распознавания, чтобы увидеть его сырой ответ без промежуточных шагов обработки. Пять записей из шести не дали ни одного слова — распознавать в них было нечего. При обычной загрузке такая запись доходит до конца и получает отдельный исход «Речи нет»: сервис прямо сообщает, что речи в файле не нашлось, и возвращает списанные минуты. Если вы это увидели, проверять стоит не сервис, а звук — слышна ли на записи речь и не писал ли микрофон в пустоту.

Обещать, что странных ошибок не будет, мы не станем: это противоречило бы всему написанному выше. Что действительно помогает — не «более умная модель», а возможность быстро проверить подозрительное место.

  • Тайм-коды у каждой реплики. Клик по фрагменту перематывает запись на нужную секунду — спорное место проверяется за пару секунд. Исходный файл хранится семь дней: пока он есть, клик перематывает плеер, дальше остаётся переход к нужной реплике в тексте, поэтому спорные места стоит слушать в первую неделю.
  • Разделение по спикерам. Отдельный слой, который стоит просматривать независимо от слов: ошибки диаризации словами не видны.
  • Поиск по расшифровке. Быстрый способ собрать все вхождения имени или суммы и проверить их подряд.
  • Редактор. Правки сохраняются поверх исходного текста распознавания и попадают в выгрузку.
  • Глоссарий в профиле. Имена и термины передаются модели заранее как подсказка: они повышают шанс, что редкое слово будет записано верно, но гарантии не дают.

Современные системы распознавания обычно хорошо справляются с качественной речью, но полностью исключить необычные ошибки нельзя. Проверить, как сервис справится именно с вашей записью, можно на бесплатном лимите — первые 45 минут доступны без оплаты.

Что в итоге

Странные ошибки распознавания устроены менее загадочно, чем выглядят. Модель подбирает наиболее вероятный текст для каждого фрагмента звука; когда акустики мало, решение принимается почти без опоры на запись, и на поверхность всплывают самые частые фразы из обучающих данных — благодарности зрителям, «продолжение следует», короткие междометия.

Наш тест показал обе стороны этого механизма. Ровный шум, музыка и тишина не породили ни одного слова. А три коротких тональных звука на тихом фоне превратились в три уверенные фразы, одна из которых даже получила говорящего, — и при смене языка распознавания те же самые звуки стали другими фразами на тех же самых секундах.

Правильная реакция на странный фрагмент — не «модель сломалась», а «посмотрим, что на этой секунде в аудио». В девяти случаях из десяти этого достаточно, чтобы понять, что произошло.

Частые вопросы

Может, но не обязана. В нашем тесте цифровая тишина и ровный тихий фон не дали ни одного слова, а тихий фон с короткими тональными звуками дал три фразы. Дело не в тишине как таковой, а в том, есть ли на «пустом» участке сигнал, отдалённо похожий на голос, и как система определяет границы речи.

Потому что некоторые неречевые звуки по акустическим признакам частично напоминают речь: периодические тона в диапазоне голоса, ритмические структуры, отдельные всплески. Ровный широкополосный шум на речь не похож — белый и розовый шум в нашем тесте текста не породили. Опаснее всего слабая речь на фоне шума: признаки речи есть, а информации мало.

Возможных причин несколько: ошибка определения языка на коротком или слабом фрагменте, иностранное имя или термин, переключение говорящего между языками, отсутствие речи на участке вообще. Это не всегда галлюцинация: сначала стоит проверить, какой язык система определила для записи и для конкретного фрагмента.

В моделях вроде Whisper текст собирается не из целых слов, а из подсловных фрагментов, и выбирается наиболее вероятная последовательность. На неоднозначном участке фрагменты могут сложиться в сочетание, которого в языке нет; в системах с фиксированным словарём такой эффект невозможен — там ошибкой окажется существующее слово. Чаще всего это происходит с редкой лексикой: имена, термины и аббревиатуры проигрывают по вероятности более частым словам с похожим звучанием.

Это известная особенность авторегрессионного декодирования: каждое следующее слово выбирается с учётом уже написанных, и на участке с бедной акустикой самым вероятным продолжением может оказаться повтор предыдущей фразы. Повторяющиеся фрагменты упомянуты среди ограничений и в публикации Whisper, и в карточке модели. Но повтор в тексте не всегда сбой: иногда повторяется сам говорящий или фрагмент попал в две соседние части записи.

Разделение по говорящим — отдельная технология, которая работает поверх распознавания и группирует участки по голосовым признакам. Она ошибается при смене расстояния до микрофона, плохой связи, коротких репликах, похожих тембрах и перебиваниях. В нашем тесте метка говорящего появилась даже там, где речи не было вообще: участок ошибочно попал в обработку как речевой.

Наличием звука. Если на спорном месте в записи есть речь, а в тексте выбран неверный вариант — это ошибка распознавания. Если на этом месте речи нет, а текст есть — галлюцинация. Разделять их полезно практически: ошибки в словах уменьшаются качеством записи и глоссарием, а галлюцинации ищут в паузах, в начале и в конце записи.

Потому что это следствие самого способа работы, а не недоработки. Модель всегда выдаёт наиболее вероятную гипотезу для фрагмента, даже когда акустических данных почти нет. Сильная модель ошибается реже, но принципиально от таких ситуаций не застрахована — поэтому важные фрагменты сверяют с записью независимо от того, какая система делала расшифровку.


Попробовать на своей записи

Загрузите аудио или видео и посмотрите, как сервис справится именно с вашим материалом: текст, разделение по спикерам, тайм-коды для проверки спорных мест и саммари. Первые 45 минут доступны бесплатно.

Читайте также

Все статьи