· 23 минуты чтения
Почему разные сервисы по-разному расшифровывают одну и ту же запись
Один файл, два сервиса — и два немного разных текста. Причина почти никогда не сводится к тому, что «там нейросеть хуже»: распознавание речи — это цепочка этапов, и модель в ней только одно звено. Разбираем, что происходит с записью до и после модели и как из-за этого расходятся результаты.
Простой эксперимент, который многие проводили: одна и та же запись загружается в несколько сервисов, а на выходе — три версии одной реплики. «Мы обсудили запуск проекта в сентябре», «Мы обсудили запуск продукта в сентябре», «Мы обсудили запуск проекта с сентября». Все три выглядят правдоподобно, но смысл у них разный.
Первый вывод напрашивается сам: где-то стоит хорошая нейросеть, а где-то плохая. На практике причины сложнее, и в этом легко убедиться: один и тот же файл, отправленный дважды в один и тот же сервис, тоже иногда даёт слегка разный текст.
Дело в том, что автоматическое распознавание — не буквальное «снятие» текста со звука. Система выбирает наиболее вероятную последовательность слов, а до и после этого выбора происходит ещё десяток преобразований. Разные технологические цепочки приходят к разным вариантам — и это не всегда означает, что один сервис хуже другого во всём.
Коротко
Один и тот же файл расшифровывается по-разному, потому что сервисы используют разные модели, версии, настройки и этапы обработки. На результат влияют преобразование звука, определение участков с речью, разбиение записи на фрагменты, определение языка, параметры выбора слов, словари и подсказки, разделение спикеров и последующее оформление текста.
Даже одинаковая базовая модель не гарантирует идентичный результат: достаточно другой длины фрагментов, другого порога определения речи или другой постобработки. Поэтому сравнение сервисов не сводится к вопросу «Whisper там или не Whisper».
Сервис транскрибации — это не только модель
Когда говорят «сервис использует Whisper», это описывает лишь один этап работы. Между загруженным файлом и готовым текстом стоит конвейер, где каждый шаг влияет на результат.
- Загрузка файла и приведение его к формату, который принимает модель.
- Выделение звуковой дорожки, если загружено видео.
- Нормализация громкости, приведение к нужной частоте дискретизации, сведение каналов.
- Определение участков с речью и отсев тишины.
- Разбиение записи на фрагменты подходящей длины.
- Определение языка — один раз для файла или по фрагментам.
- Работа модели распознавания.
- Сборка фрагментов в единый текст.
- Разделение спикеров отдельным модулем.
- Восстановление пунктуации и оформление текста.
- Нормализация: числа, сокращения, регистр, иногда редактура.
- Тайм-коды, саммари, экспорт.
Модель — только один этап
Аудиофайл
Предобработка
Определение речи (VAD)
Сегментация
ASR-модель
Диаризация и тайм-коды
Постобработка
Готовый текст
Сравнивая сервисы, вы сравниваете не модели, а конвейеры целиком. Одинаковое название модели ничего не говорит о том, что происходит со звуком до неё и с текстом после.
Почему разные модели дают разный результат
Начнём всё же с самой модели: различия между ними реальны, просто они не единственная причина расхождений.
Разные обучающие данные
Модели различаются составом того, на чём учились: набором языков, количеством примеров, долей шумных записей, представленностью акцентов, телефонной речи, профессиональной терминологии, подготовленной и спонтанной речи. Модель, которая много слышала телефонных разговоров, устойчивее на узкой полосе частот; модель, обученной преимущественно на студийной речи, такой звук даётся хуже.
Точный состав закрытых наборов данных обычно не раскрывается, и утверждать что-то о нём по результату нельзя. Про Whisper известно из публикации, что модель обучалась на большом многоязычном массиве аудио с текстовыми соответствиями, собранном из открытых источников. Это дало ей устойчивость к разным условиям записи, но не одинаковую точность для всех языков и тематик.
Разный размер и архитектура
Модели одной линейки различаются числом параметров. Небольшая работает быстрее и дешевле, крупная обычно лучше удерживает сложный контекст и реже путается в редких словах. Но это не универсальное правило: на чистой диктовке разница между средней и крупной моделью может быть незаметной, а специализированная модель иногда обходит универсальную в своей области.
Отдельный случай — облегчённые версии, полученные из крупных. Например, large-v3-turbo — сокращённый вариант large-v3 с меньшим числом слоёв декодера: он заметно быстрее, но авторы прямо отмечают, что на части языков качество может быть ниже исходной модели. Это типичный размен скорости на устойчивость, и разные сервисы решают его по-разному.
Разная специализация
Кроме универсальных многоязычных моделей существуют специализированные: для телефонных разговоров, для диктовки, для встреч, для медицинской лексики, адаптированные под конкретный язык. Крупные платформы распознавания прямо предлагают выбирать модель под тип аудио и дополнительно адаптировать её под нужную лексику.
Отсюда типичная ситуация: сервис, выигравший на вашем совещании, проигрывает на записи телефонного звонка — просто потому, что под этот тип аудио у него ничего не настроено.
Разные версии одной линейки
Модель обновляется, и сервис может перейти на новую версию, ничего не меняя в интерфейсе. Формулировка «на базе Whisper» не раскрывает ни версию, ни способ запуска, ни настройки. Поэтому два продукта «на Whisper» — это, строго говоря, два неизвестных конвейера с общим названием одного из звеньев.
Почему один сервис оказывается точнее другого
Прямой ответ: чаще не из-за базовой модели, а из-за того, что остальная цепочка лучше подходит именно к этому типу записи. Разберём звенья по порядку.
Предобработка аудио
До модели файл проходит преобразование: извлечение дорожки из видео, приведение к нужной частоте дискретизации, сведение стерео в моно, нормализация громкости, иногда шумоподавление и фильтрация музыки. Каждый шаг может как помочь, так и навредить.
Агрессивное шумоподавление — характерный пример. Оно убирает гул, но вместе с ним съедает тихие согласные и «хвосты» слов, и на записи с далёким микрофоном результат иногда становится хуже, чем без обработки. Сведение стерео в моно тоже неоднозначно: если собеседники были записаны в разные каналы, при сведении теряется естественная подсказка для разделения спикеров.
Обнаружение речи и тишины
VAD (voice activity detection) — это отдельный шаг, который отвечает на вопрос «где в записи речь, а где тишина, музыка или шум». Участки без речи можно не отдавать модели: это экономит время и снижает риск лишнего текста в паузах.
Но порог чувствительности приходится выбирать. Слишком строгий — и тихая реплика с дальнего конца стола будет отброшена как тишина. Слишком мягкий — и модель получит гул кафе как речь. Разные сервисы настраивают этот порог по-разному, поэтому один теряет тихую фразу, а другой на том же месте выдаёт бессмысленный фрагмент.
Разбиение длинной записи
Модели работают с фрагментами ограниченной длины — у Whisper это окно в 30 секунд. Часовой файл нарезается на такие куски, и здесь появляется сразу несколько развилок: какой длины делать фрагменты, резать ли строго по времени или по паузам, делать ли перекрытие между соседними кусками, передавать ли текст предыдущего фрагмента как контекст.
Границы почти никогда не совпадают с границами фраз. Если фрагмент обрывается на середине предложения, модель вынуждена как-то его закончить — отсюда расхождения в словах и пунктуации именно на стыках. Перекрытие фрагментов уменьшает потери, передача контекста улучшает связность, но переносит ошибку дальше: неверно распознанное имя в одном куске повышает шанс, что оно так же неверно распознается в следующем.
Один часовой файл — это не один непрерывный контекст для модели, а десятки фрагментов. Многие расхождения между сервисами возникают именно на их границах.
Определение языка
Язык можно определить один раз по началу записи, а можно переопределять по фрагментам. Первый способ устойчивее на однородной записи, второй лучше справляется со сменой языка, но чаще ошибается на коротких и шумных кусках. Некоторые сервисы позволяют указать язык вручную, некоторые ограничивают список поддерживаемых, а некоторые умеют переключаться в режим перевода — и тогда на выходе будет английский текст вместо русского.
Ошибка определения языка дороже большинства других: она портит не отдельное слово, а весь фрагмент. Русская речь, распознанная как английская, превращается в транслитерацию или бессмыслицу.
Глоссарий и контекстные подсказки
Многие системы позволяют заранее передать список слов: фамилии, названия компаний и продуктов, аббревиатуры, профессиональные термины, географические названия. Это повышает вероятность, что модель выберет нужный вариант из нескольких похожих по звучанию. Google, например, документирует такой механизм адаптации к специфической лексике; в Whisper похожую роль играет начальная подсказка.
Важные оговорки. Глоссарий не гарантирует правильного результата: он смещает вероятности, а не задаёт текст. Чрезмерное усиление термина способно привести к обратному эффекту — слово начнёт появляться там, где звучало другое, похожее. И реализации у сервисов разные: где-то это список слов, где-то фраза-контекст, где-то полноценная адаптация модели.
Пунктуация и нормализация текста
Один сервис выдаёт «ну мы это как бы обсудили вчера», другой — «Мы обсудили это вчера». Разница может не иметь никакого отношения к распознаванию: второй просто удалил слова-паразиты, восстановил регистр, расставил знаки и, возможно, слегка отредактировал фразу.
Поэтому при сравнении важно разделять три вещи: что было распознано, как это оформлено и что дописала или убрала постобработка. Иначе более гладкий текст будет автоматически принят за более точный — а это разные свойства.
Числа, сокращения и регистр
Отдельный источник расхождений — нормализация. «Двести пятьдесят тысяч» можно оставить словами, а можно записать как «250 000»; «пятнадцатое» — как «15-е»; «эн-дэ-эй» — как «NDA». Одни сервисы приводят числа к цифрам всегда, другие только в определённых контекстах, третьи не трогают вовсе.
Для чтения цифровая запись удобнее, но у неё есть цена. Во-первых, при переводе в цифры иногда теряется исходная формулировка — «пара сотен» превращается в «200». Во-вторых, автоматическое приведение может ошибиться в порядке: «двести пятьдесят тысяч» и «двести пятьдесят» различаются одним словом, а в цифрах — тремя нулями. Поэтому в договорных и финансовых материалах суммы стоит проверять по записи независимо от того, как красиво они оформлены.
Сюда же относится восстановление регистра и разбиение на абзацы. Это чистое оформление: содержание не меняется, а вот впечатление от качества расшифровки — сильно.
Почему одна и та же модель иногда выдаёт разный текст
Прямой ответ: при полностью зафиксированных условиях результат может быть стабильным, но «полностью зафиксированные условия» — это больше, чем одинаковый файл и одинаковая модель.
Вероятностный характер выбора
Модель не сопоставляет звуку единственно верное слово. Она оценивает несколько продолжений и выбирает одно. Когда звучание неоднозначно — «проекта» и «продукта» на шумной записи различаются одним неударным слогом, — вероятности близки, и небольшой сдвиг в настройках или в контексте меняет выбор.
Как получается один вариант из нескольких
Аудио допускает несколько прочтений
Модель оценивает вероятности вариантов
Настройки декодирования влияют на выбор
Сервис выводит один вариант
Параметры декодирования
У выбора есть настройки. Температура управляет разбросом: при нуле модель каждый раз берёт самый вероятный вариант, при большем значении допускает менее очевидные. Поиск по лучу (beam search) рассматривает несколько последовательностей целиком, а не выбирает слова по одному. Дополнительные параметры отвечают за подавление повторов и за то, сколько вариантов сравнивать между собой.
В описании Whisper есть и механика повторных попыток: если у распознанного фрагмента слишком низкая средняя уверенность или подозрительно высокая степень сжатия текста — признак зацикливания, — фрагмент распознаётся заново с увеличенной температурой. То есть один и тот же кусок записи может обрабатываться несколько раз, и какой из результатов попадёт в текст, зависит от порогов.
Другие границы фрагментов
Даже при той же модели повторная обработка может нарезать запись иначе: определение речи сработало чуть по-другому, граница фразы сместилась, в контекст попал другой предыдущий текст. Дальше расхождение накапливается — меняются отдельные слова, а иногда и целые предложения.
Обновления инфраструктуры
Между двумя запусками могла обновиться версия модели, модуль определения речи, библиотека вывода, модель диаризации или формат постобработки. Пользователь этого не видит: интерфейс прежний, кнопка та же. Но утверждать, что любое изменение результата вызвано обновлением, тоже нельзя — сначала стоит исключить более простые причины.
Детерминированность и воспроизводимость
Детерминированный режим — это когда одинаковые входные данные и настройки дают одинаковый выход. На практике полная воспроизводимость упирается в детали: версии библиотек, тип оборудования, параллельные вычисления, порядок суммирования чисел с плавающей точкой, квантование модели. На разных видеокартах один и тот же файл может дать текст с мелкими отличиями.
Стоит добавить, что стабильность — это тоже свойство сервиса, и его можно проверить. Загрузите одну и ту же запись дважды и сравните результаты: если текст совпал слово в слово, цепочка зафиксирована жёстко. Если разошёлся на десятке мест, это не обязательно плохо, но полезно знать заранее — особенно если вы собираетесь ссылаться на расшифровку в документе.
Правильная формулировка — не «нейросеть каждый раз выдаёт новое», а «результат воспроизводим настолько, насколько зафиксирована вся цепочка». Обычно пользователю недоступна и половина её параметров.
Что влияет на итоговую расшифровку
Сводная таблица факторов — от свойств исходного файла до обновлений сервиса. Она же удобна как чек-лист при разборе конкретного расхождения.
| Группа факторов | Параметр | Как может повлиять |
|---|---|---|
| Исходный файл | Формат и кодек | Потери и искажения после преобразования |
| Исходный файл | Количество каналов | Возможность разделить собеседников |
| Исходный файл | Частота дискретизации | Обрезанные верхние частоты хуже различают похожие звуки |
| Аудио | Громкость | Тихая речь может распознаваться хуже |
| Аудио | Шум и музыка | Повышают неоднозначность |
| Аудио | Перекрытие голосов | Усложняет распознавание и диаризацию |
| Модель | Тип и размер | Влияет на скорость, языки и устойчивость |
| Модель | Версия | Новая версия может давать другой результат |
| Модель | Квантование | Ускоряет вывод, но может слегка менять текст |
| Язык | Автоопределение | Ошибка языка влияет на весь фрагмент |
| Сегментация | Длина фрагмента | Меняет объём доступного контекста |
| Сегментация | Перекрытие | Может уменьшить потери на границах |
| VAD | Порог речи | Влияет на пропуск тихих реплик и обработку шума |
| Декодирование | Температура | Влияет на вариативность выбора |
| Декодирование | Beam search | Меняет способ выбора последовательности |
| Декодирование | Пороги повторной попытки | Определяют, когда фрагмент распознаётся заново |
| Контекст | Предыдущий текст | Может помогать связности или переносить ошибку |
| Глоссарий | Имена и термины | Повышает шанс распознать нужную лексику |
| Диаризация | Число спикеров | Влияет на распределение реплик |
| Постобработка | Пунктуация | Меняет читаемость, но не всегда содержание |
| Постобработка | Редактура | Может сгладить или исказить устную речь |
| Сервис | Обновление алгоритмов | Может изменить результат повторной обработки |
Точнее ли сервис, если его текст выглядит аккуратнее
Прямой ответ: не обязательно. Хорошая пунктуация и литературное оформление улучшают читаемость, но могут маскировать ошибки в словах, именах, цифрах и отрицаниях. Гладкий текст читается как достоверный — это когнитивная ловушка, а не свойство расшифровки.
Один фрагмент записи, две расшифровки
Что выдал сервис
ну мы с петровым обсудили это вчера договорились на двести тысяч до пятнадцатого
Что с этим не так
Оформление слабое, но все значимые слова на месте
Причина: Нет заглавных букв и знаков препинания, слова-паразиты не убраны.
Что делать: Такой текст неудобно читать, но по нему можно работать: фамилия, сумма и дата верны.
Что выдал сервис
Мы с Петровой обсудили это вчера и договорились на 250 000 до 15-го.
Что с этим не так
Текст выглядит идеально, но искажены факты
Причина: Фамилия изменена, сумма другая, а гладкая форма не даёт заподозрить ошибку.
Что делать: Проверять надо не оформление, а соответствие записи: имена, числа, даты, отрицания.
Оценивайте расшифровку по соответствию аудио и по цене конкретной ошибки, а не по внешней гладкости текста. Подробнее о том, как это связано с выбором между автоматической и ручной обработкой, — в материале «AI-транскрибация или ручная расшифровка».
Разделение спикеров — отдельная задача
Распознавание речи и диаризация — связанные, но разные процессы, и выполняют их обычно разные модели. Поэтому сервис может верно распознать все слова и при этом перепутать, кто их произнёс, — или наоборот.
Три разных вопроса к записи
Распознавание
Что сказано?
Текст реплик
Диаризация
Кто и когда говорил?
Спикер 1, Спикер 2…
Идентификация
Какой конкретно человек говорил?
Требует образцов голоса
- Слова распознаны верно, но реплики приписаны не тому участнику.
- Смена говорящего определена правильно, а текст реплики — с ошибкой.
- Два похожих голоса объединены в одного спикера.
- Один человек разделён на двух — например, когда он отходил от микрофона.
- Перебивания и одновременная речь распределены произвольно.
На результат диаризации влияет и то, как записан звук. Если участники сидели за одним микрофоном, алгоритм различает их только по тембру — и на похожих голосах ошибается чаще. Если каждый писался в свой канал или на свою дорожку, задача становится почти тривиальной: границы реплик известны заранее. Поэтому сервис, «плохо разделяющий спикеров» на записи с телефона в центре стола, на записи из видеоконференции с отдельными дорожками может отработать безупречно.
Отсюда практический вывод для сравнения: качество диаризации нужно оценивать отдельно от качества текста. Сервис, который лучше пишет слова, может хуже делить их по говорящим, и для протокола совещания это окажется важнее.
Как правильно сравнивать сервисы транскрибации
Большинство «сравнений» в интернете не выдерживают проверки: разные файлы, разные режимы, один короткий фрагмент и вывод об общем превосходстве. Ниже — порядок, который даёт осмысленный результат.
- Использовать оригинальный файл. Нельзя сравнивать исходный WAV в одном сервисе и ту же запись, скачанную из мессенджера, — в другом: они физически разные.
- Зафиксировать режим. Язык, транскрибация или перевод, разделение спикеров, глоссарий, автоматическая редактура, формат результата — везде одинаково.
- Взять несколько типов записей. Чистая диктовка, диалог двух человек, шумная запись, запись с терминами, телефонный разговор, длинный файл с паузами.
- Подготовить эталон. Проверенный человеком текст с правилами дословности, точными именами и цифрами; действительно неразборчивые места отмечаются как неразборчивые.
- Сравнивать типы ошибок, а не только их количество. Отдельно: замены, пропуски, добавления, имена, числа, отрицания, термины, язык, спикеры, тайм-коды, выдуманные вставки.
- Учитывать назначение. Лучший результат для субтитров и для юридической записи — это разные вещи.
- Проверить повторяемость. Обработать спорную запись ещё раз и посмотреть, совпал ли текст, изменились ли сегменты и спикеры.
Как провести честный тест
Условия
Одинаковый исходный файл во всех сервисах.
Одинаковый язык и режим обработки.
Несколько типов записей, а не один удобный фрагмент.
Глоссарий либо везде включён, либо везде выключен.
Оценка
Эталон проверен человеком по исходному аудио.
Ошибки взвешены по значимости: имя и сумма важнее пропущенного междометия.
Разделение спикеров оценивается отдельно от текста.
Зафиксированы дата теста и версии сервисов.
Результат сравнивается до ручной правки, а не после.
Частые ошибки сравнения
- Один короткий фрагмент. На тридцати секундах чистой речи различий почти не видно — сервисы расходятся как раз на сложном материале.
- Разные исходники. Один сервис получает оригинал, другой — копию из мессенджера. Дальше сравнивается не качество распознавания, а качество файлов.
- Сравнение оформленного текста с дословным. Если один сервис редактирует речь, а другой пишет как есть, «победит» первый — просто потому, что его текст приятнее читать.
- Оценка на глаз без эталона. Без проверенного текста легко засчитать правдоподобную ошибку как верный вариант — особенно в именах и числах.
- Подсчёт ошибок без веса. Десять пропущенных междометий и одна перевранная сумма дают одинаковый вклад в простую метрику, но не в вашу задачу.
- Разные режимы. У одного включена диаризация и глоссарий, у другого нет — сравниваются разные продукты, а не разные модели.
Почему нельзя выбрать сервис по проценту точности
Прямой ответ: рекламный процент почти ничего не говорит о вашей записи. Чтобы цифра что-то значила, нужно знать, на каком языке и на каком наборе данных она получена, что считалось ошибкой и входила ли в подсчёт пунктуация.
- Показатель мог быть измерен на другом языке — качество распознавания сильно различается по языкам.
- Тестовый набор мог состоять из чистой подготовленной речи, а у вас совещание в переговорке.
- Неизвестно, что считалось ошибкой: пунктуация, регистр и числа часто выносятся за скобки.
- Имена и цифры в метрике обычно весят столько же, сколько любое другое слово.
- Показатель модели не равен показателю сервиса: между ними вся остальная цепочка.
- Средняя точность по набору не описывает конкретный файл.
Распространённая метрика — WER (word error rate): доля замен, пропусков и вставок относительно числа слов эталона. Она удобна для сравнения моделей между собой, но не показывает, насколько критична каждая ошибка. Расшифровка с WER 5%, где перепутана фамилия и сумма, для договора хуже, чем расшифровка с WER 12% без единой ошибки в значимых данных.
Может ли один сервис быть лучшим для всех записей
Практичнее говорить не об абсолютном лидере, а о том, какой сервис лучше подходит под ваш язык, качество звука и рабочий сценарий. Различия обычно распределены неравномерно: один сильнее в именах благодаря глоссарию, другой лучше делит спикеров, третий даёт более дословный текст, четвёртый — сразу читаемую редакцию.
Это не значит, что любой плохой результат можно оправдать «спецификой записи». Базовые вещи всё равно проверяются: стабильность обработки, вменяемость текста на нормальном звуке, отсутствие выдуманных вставок, работа с длинными файлами, предсказуемость повторного запуска.
Вопрос «какой сервис лучший» стоит заменить на «какой сервис лучше справляется с моими записями» — ответ на него можно получить за один вечер на собственных файлах.
Что делать, если два сервиса дали разные варианты
- Прослушать спорный фрагмент по тайм-коду — в половине случаев вопрос снимается сразу.
- Сравнить варианты именно на этом отрезке, а не по тексту целиком.
- Проверить имя, термин или цифру по внешнему источнику: списку участников, договору, документации.
- Убедиться, что в обоих сервисах указан один и тот же язык.
- Проверить, не применялась ли автоматическая редактура: гладкий текст мог быть переписан.
- Добавить термин в глоссарий и обработать запись повторно, если такая возможность есть.
- При плохом звуке признать фрагмент неразборчивым, а не выбирать более правдоподобную формулировку.
- Для значимых материалов сохранить исходное аудио вместе с проверенным текстом.
Последний пункт важнее, чем кажется: пока запись есть, любой спорный фрагмент проверяем. После её удаления текст остаётся единственным источником, и восстановить истину уже нечем. Если в расшифровке встречаются фразы, которых в записи не было, стоит прочитать разбор галлюцинаций при транскрибации.
Как Speech Recognition формирует результат
Чтобы не быть голословными, опишем собственную цепочку — по тем этапам, которые действительно есть в обработке.
- Предобработка. Загруженный файл приводится к одному виду: звуковая дорожка извлекается из видео, аудио пересобирается в моно 16 кГц во FLAC. Модель всегда получает звук в одном формате, независимо от того, что вы загрузили.
- Распознавание. Используется Whisper large-v3-turbo, запускаемый через WhisperX — реализацию, которая добавляет определение участков с речью и выравнивание тайм-кодов по словам.
- Язык. Определяется автоматически по записи; отдельного ручного переключателя в интерфейсе нет.
- Глоссарий. Имена, термины и аббревиатуры из профиля (до 500 символов) передаются модели как начальная подсказка — это смещает вероятности в сторону нужной лексики, но не гарантирует её.
- Разделение спикеров. Отдельный модуль на базе pyannote, а не сама модель распознавания. Он включается в режиме «по ролям + саммари».
- Роли и саммари. Их формирует отдельная языковая модель по готовой расшифровке. Текст реплик при этом не переписывается: постобработка добавляет подписи ролей и саммари, а не редактирует распознанное.
- Тайм-коды, поиск, редактор, экспорт. Работают поверх готового текста и на само распознавание не влияют.
- Данные. Расшифровки не используются для обучения моделей, обработка идёт на собственных серверах в России.
Что в итоге
Расхождения между сервисами — не признак того, что где-то стоит «плохая нейросеть». Одинаковый файл проходит через разные цепочки: по-разному преобразуется звук, по-разному определяются участки речи, по-разному нарезаются фрагменты, по-разному оформляется текст. Модель — важное звено, но одно из многих.
Практический вывод простой. Сравнивайте сервисы на своих записях, а не по рекламным процентам; оценивайте текст по значимым ошибкам, а не по гладкости; проверяйте разделение спикеров отдельно от слов; и держите под рукой исходное аудио, пока результат не проверен.
Одинаковая модель не гарантирует одинаковый текст, а разный текст не доказывает разницу в качестве моделей. Смотреть нужно на всю цепочку — и на то, насколько она подходит вашим записям.
Частые вопросы
Потому что сервисы используют разные модели, версии и настройки, а кроме модели различаются подготовка звука, определение участков с речью, длина фрагментов, определение языка, работа с глоссарием, разделение спикеров и оформление текста. Итоговый текст формирует вся цепочка обработки.
Да, и это обычная ситуация. Различаться могут версия модели и её квантование, параметры декодирования, предобработка аудио, границы фрагментов, порог определения речи, передача контекста между фрагментами и постобработка текста. Название модели описывает только одно звено.
Причиной могут быть ненулевая температура при декодировании, автоматические повторные попытки на неудачных фрагментах, другое разбиение записи, другой контекст от предыдущего фрагмента, обновление инфраструктуры или обработка на другом оборудовании. При полностью зафиксированных условиях результат может оставаться одинаковым.
Универсального лидера для всех языков и типов записей нет. Крупные модели обычно устойчивее на сложном звуке, специализированные могут выигрывать в своей области — например, на телефонии. Сравнивать стоит на материалах, похожих на ваши реальные задачи.
Сам контейнер — редко, а вот кодек, степень сжатия, частота дискретизации, число каналов и предыдущие преобразования влияют напрямую: они определяют, сколько информации осталось в звуке. Пересланная несколько раз копия объективно хуже исходного файла.
Обычно из-за подсказок: списка слов, глоссария или адаптации модели под специфическую лексику. Помогают также специализированная модель и постобработка, сверяющая написание. При этом подсказки смещают вероятности, а не гарантируют результат.
Нет. Пунктуация, заглавные буквы и удаление слов-паразитов относятся к оформлению текста, а не к распознаванию. Гладкий текст может содержать неверную фамилию, сумму или дату — и именно из-за гладкости ошибку сложнее заметить.
Потому что за разделение говорящих отвечает отдельная задача — диаризация, и решает её обычно отдельная модель. Она может объединить похожие голоса, разделить одного человека на двух или неверно распределить реплики при перебиваниях, никак не влияя при этом на текст.
Нет. Один файл показывает качество только на конкретном сочетании языка, акустики, числа говорящих и темы. Для осмысленного вывода нужно несколько типов записей: чистая речь, диалог, шум, термины, телефон и длинный файл с паузами.
Повторный запуск полезен, чтобы оценить стабильность: совпал ли текст, не изменились ли сегменты и спикеры. Но он не заменяет сверку с исходным аудио — если оба запуска ошиблись одинаково, совпадение ничего не докажет.
Прослушать спорный фрагмент по тайм-коду и проверить значимые имена, термины, даты и числа по надёжным источникам. Если звук неразборчив, честнее отметить фрагмент как неразборчивый, чем выбрать более правдоподобную формулировку.
Полезное по теме
Страницы сервиса, которые помогут проверить результат на своих записях:
Сравнивайте сервисы на своей записи
Загрузите аудио или видео в Speech Recognition и оцените, как сервис распознаёт именно ваш язык, тематику и условия записи. Для имён, терминов и аббревиатур можно заранее заполнить глоссарий, а важные фрагменты — проверить по тайм-кодам. Первые 45 минут доступны бесплатно.