· 22 минуты чтения
Кто такой DimaTorzok, и почему его имя появляется в расшифровках?
DimaTorzok — ник автора субтитров к роликам на YouTube, чья подпись попала в обучающие данные Whisper. Модель запомнила её как типичное продолжение тишины в конце видео и иногда дописывает в расшифровку, хотя в записи этих слов не было. Это не сбой конкретной версии и не вирус, а побочный эффект того, как устроено современное распознавание речи.
Сценарий почти всегда один. Человек отправляет голосовое сообщение или загружает запись на расшифровку, получает текст — и в самом конце, там, где уже никто не говорит, обнаруживает строку: «Субтитры сделал DimaTorzok».
Этого имени нет ни в записи, ни в настройках, ни в интерфейсе. Оно появляется само — и появляется у разных людей, в разных приложениях, на разных записях.
Как это выглядит
В записи
Конец голосового сообщения: пауза, шорох одежды, щелчок микрофона
Модель выдала
Субтитры сделал DimaTorzok
В записи
Тишина в конце видеозаписи
Модель выдала
Продолжение следует…
В записи
Фоновая музыка без речи
Модель выдала
Редактор субтитров А.Синецкая Корректор А.Егорова
Примеры и обсуждения: обсуждение «Who is DimaTorzok?» в репозитории openai/whisper, обсуждение галлюцинаций на записях без речи (openai/whisper #1606)
Столкнуться с этим можно в Telegram, CapCut, DaVinci Resolve, в редакторах субтитров и на сайтах для расшифровки записей. Общее у всех этих продуктов одно: под капотом у них Whisper — открытая модель распознавания речи, которую OpenAI выложила в сентябре 2022 года.
Кто такой DimaTorzok
DimaTorzok — псевдоним человека, который делал русские субтитры к роликам на YouTube и подписывал свою работу строкой «Субтитры сделал DimaTorzok». Сообщество связывает этот ник с каналом GMD13; по публикациям в СМИ, речь идёт о субтитрах примерно 2016–2017 годов. Сам автор давно не активен, а его подпись пережила и канал, и эпоху: она осталась внутри модели, обученной на видео с субтитрами.
Никакого отношения к OpenAI, к разработке Whisper или к сервисам расшифровки этот человек не имеет. Его имя попало в модель тем же способом, что и миллионы других слов, — вместе с текстом, который кто-то когда-то выложил в интернет.
Заметили закономерность далеко не сразу. Сначала это выглядело как единичный курьёз: странная строка в конце файла, которую проще стереть, чем объяснить. Потом оказалось, что имя видят разные люди на разных записях, и в обсуждениях репозитория Whisper появился прямой вопрос — «Who is DimaTorzok?». Там же прозвучало первое внятное объяснение: это подпись переводчика из обучающих данных, которую модель приняла за часть звуковой дорожки.
Как имя стало известным
Сентябрь 2022
OpenAI публикует Whisper с открытыми весами. Модель быстро становится отраслевым стандартом: её встраивают в десятки продуктов, от мессенджеров до видеоредакторов.
2023
В обсуждениях репозитория копятся однотипные жалобы: на тишине и шуме модель дописывает благодарности за просмотр, призывы подписаться и подписи авторов субтитров. Появляются первые обходные приёмы.
Начало 2024
Русскоязычные пользователи публично разбирают, что Whisper выдаёт на чистой тишине: «Продолжение следует…» и титры вымышленных редакторов. Становится понятно, что дело в данных, а не в конкретной записи.
Июнь 2024
Выходит первое крупное исследование галлюцинаций Whisper на конференции ACM FAccT — с количественными оценками, а не отдельными наблюдениями.
Октябрь 2024
В обсуждениях openai/whisper появляется вопрос «Who is DimaTorzok?». В том же месяце Associated Press публикует расследование о галлюцинациях Whisper в медицинских расшифровках.
2025
Исследователи локализуют источник проблемы внутри самой модели и показывают, что частоту галлюцинаций на неречевых фрагментах можно снизить более чем на 80% практически без потери точности распознавания.
2026
Имя окончательно превращается в мем и попадает в федеральные СМИ. На практике артефакт встречается заметно реже — но не исчез.
DimaTorzok — не пасхалка и не персонаж, придуманный нейросетью. Это подпись реального человека, попавшая в обучающие данные и закрепившаяся в модели как речевой шаблон для ситуации «речи нет».
Почему нейросеть вообще может придумать слово
Интуитивно распознавание речи кажется переводом звука в буквы: услышал — записал. Современные модели работают иначе. Whisper не расшифровывает звук по кусочкам, а предсказывает наиболее вероятную последовательность слов, которая могла бы соответствовать этому звуку. Ближайшая аналогия — не диктофон, а автодополнение в телефоне, только подсказки строятся не по первым буквам, а по акустическому сигналу.
Что происходит с записью внутри модели
Аудиозапись
Извлечение акустических признаков (спектрограмма)
Энкодер: звук превращается в набор числовых представлений
Декодер: слово за словом предсказывает наиболее вероятное продолжение
Готовая расшифровка
На каждом шаге декодер опирается на две вещи: на звук и на уже написанный текст. Пока речь разборчива, звук доминирует — и расшифровка получается точной. Как только акустических данных становится мало, вес звука падает, а вес языковой привычки растёт. Модель всё равно обязана выдать какое-то продолжение, и она выдаёт то, что чаще всего встречалось в похожих ситуациях при обучении.
Что модель считает вероятным продолжением тишины в конце ролика
…речь закончилась, дальше — тишина и шорох
Субтитры сделал DimaTorzok
Продолжение следует…
Спасибо за просмотр!
Подписывайтесь на канал
пустая строка
Есть и второй усилитель. По умолчанию Whisper передаёт в следующее окно уже полученный текст — так модель лучше держит контекст длинного разговора. Но если в предыдущем окне возникла выдуманная фраза, она попадает во вход следующего шага и повышает вероятность продолжения в том же духе. Отсюда знакомый эффект: одна лишняя строка, затем вторая, затем один и тот же текст повторяется десять раз подряд.
Модель не «ошибается в букве» — она выбирает самую вероятную гипотезу. Если акустических оснований для выбора нет, решение принимает языковая статистика, накопленная при обучении.
Что такое галлюцинации при распознавании речи
Галлюцинация в распознавании речи — это связный текст, которого в записи не было вообще: не искажённое слово, а добавленный фрагмент. Термин пришёл из области языковых моделей и означает не сбой программы, а уверенно сгенерированный, но не подкреплённый входными данными результат.
Полезно различать три разных явления, которые пользователи часто называют одним словом «ошибка».
- Ошибка распознавания. Слово услышано неточно: «поставщик» превратился в «поставку». Звук есть, соответствие частичное.
- Подмена слова. Модель выбрала другое слово, похожее по звучанию, но подходящее по смыслу фразы: «Иванов» вместо «Иванцов». Это уже влияние языковой модели, но опора на звук сохраняется.
- Галлюцинация. В записи нет ничего — или есть шум, — а в тексте появляется законченная фраза. Связь со звуком отсутствует полностью.
Ошибка или галлюцинация: быстрая проверка
| Что видно в расшифровке | Обычная ошибка | Галлюцинация |
|---|---|---|
| Слово услышано неправильно | — | |
| Перепутано имя или фамилия | — | |
| Неверное окончание или форма слова | — | |
| Придумана целая фраза | — | |
| Добавлен текст, которого не было в записи | — | |
| Одна и та же фраза повторяется подряд | — | |
| Внезапный переход на другой язык | — |
| Признак | Обычная ошибка | Галлюцинация |
|---|---|---|
| Связь со звуком | Есть: слово звучало похоже | Отсутствует: произнесённого источника нет |
| Как выглядит в тексте | Опечатка, неверная форма, перепутанный термин | Целая осмысленная фраза не по теме |
| Когда возникает | На сложной лексике, именах, быстрой речи | На тишине, шуме, музыке, очень тихом голосе |
| Как заметить | Заметна при вычитке по смыслу | Часто заметна сразу: фраза выпадает из контекста |
| Что помогает | Глоссарий, качество записи, ручная правка | Отсечение неречевых фрагментов, проверка начала и конца текста |
Предсказания модели могут включать текст, который в действительности не был произнесён.
Галлюцинация отличается от ошибки не масштабом, а природой: ошибка — это неверно услышанное слово, галлюцинация — текст, у которого вообще нет звукового источника.
Почему именно DimaTorzok
Первую версию Whisper обучили на 680 тысячах часов аудио с расшифровками, собранных в интернете. Разметка здесь «слабая»: тексты брали такими, какими их выложили люди, — включая субтитры к видео. Ровно поэтому модель хорошо держит разговорную речь, акценты и шум: она видела реальные записи, а не студийные наборы данных.
У этого подхода есть обратная сторона. В субтитрах встречается не только речь. Там есть описания звуков, названия каналов, реклама, благодарности за просмотр и подписи тех, кто эти субтитры сделал. Для модели это такой же текст, как и всё остальное, — и он тоже привязан к какому-то куску звука. Чаще всего к тому, где никто не говорит: к финальным титрам, музыкальной концовке, паузе перед выключением камеры.
Как подпись переводчика становится частью модели
Автор делает субтитры и подписывает их в конце файла
Ролик с субтитрами попадает в обучающий корпус
Подписи стоят там, где речи нет: титры, музыка, тишина
Модель выучивает устойчивую связку «нет речи → подпись автора»
На тишине модель воспроизводит выученный шаблон
Второй фактор — язык. В корпусе первой версии около 65% времени приходилось на английскую речь с английскими расшифровками и ещё 18% — на переводы на английский. На все остальные 96 языков вместе взятых оставалось примерно 17%. Русская доля в этом остатке невелика, а значит, каждый часто повторяющийся шаблон весит для русского языка больше, чем аналогичный шаблон для английского. Отсюда и результат: англоязычные пользователи чаще видят «Thank you for watching», а русскоязычные — DimaTorzok.
Что подтверждено, а что остаётся гипотезой
- Подтверждено: Whisper склонен генерировать текст на фрагментах без речи — это признаёт сама OpenAI и фиксируют независимые исследования.
- Подтверждено: обучающий корпус собирался из интернета вместе с субтитрами, и служебные строки из субтитров в нём есть.
- Подтверждено: строка с ником DimaTorzok воспроизводится у множества независимых пользователей и в разных продуктах на базе Whisper.
- Наиболее вероятное объяснение: подпись попала в корпус из субтитров конкретного автора и закрепилась из-за частого повторения в неречевых фрагментах.
- Не проверяемо снаружи: сколько именно роликов с этой подписью было в данных и почему закрепился именно этот ник, а не десятки других. Состав корпуса не публиковался.
- Неверно: утверждение, что причина установлена документально. Никакого разбора со стороны OpenAI не публиковалось.
Миф или правда
В модели нет ни правила, ни списка фраз для вставки. Строка появляется как наиболее вероятное продолжение — тем же механизмом, что и обычные слова.
Ни вредоносного кода, ни постороннего вмешательства здесь нет. Веса Whisper открыты и многократно проверены сообществом.
Склонность достраивать текст на неречевых фрагментах свойственна всей архитектуре. Разные версии и обвязки снижают частоту, но не устраняют явление полностью.
Одинаковые строки возникают в разных продуктах, потому что в основе у них одна и та же модель. Сервис влияет на подготовку звука и фильтрацию результата, но не на природу явления.
Модель выбирает самую правдоподобную последовательность слов. Когда звук ничего не подсказывает, правдоподобной оказывается фраза, часто встречавшаяся в похожем контексте при обучении.
Имя закрепилось не из-за уникальности, а из-за повторяемости: подпись стояла там, где речи нет, и таких примеров в данных оказалось достаточно, чтобы модель связала тишину именно с ней.
Какие ещё странные ошибки встречаются
DimaTorzok — самый известный, но далеко не единственный случай. У каждого языка есть свой набор «призраков», и все они происходят из того же источника — служебных строк в субтитрах.
Коллекция типичных галлюцинаций
В записи
Тишина в конце англоязычного ролика
Модель выдала
Thank you for watching!
В записи
Музыкальная заставка без слов
Модель выдала
Subtitles by the Amara.org community
В записи
Пауза в записи на турецком
Модель выдала
Altyazı M.K.
В записи
Долгая пауза посреди диктофонной записи
Модель выдала
Спасибо за внимание. Спасибо за внимание. Спасибо за внимание.
Примеры и обсуждения: обсуждение «Who is DimaTorzok?» в репозитории openai/whisper, обсуждение галлюцинаций на записях без речи (openai/whisper #1606)
Кроме вставок и повторов встречается ещё несколько узнаваемых сюжетов:
- Внезапная смена языка. Whisper определяет язык по началу записи. Если первые секунды — шум, музыка или молчание, определение может уйти в сторону, и дальше модель добросовестно расшифровывает русскую речь как, например, японскую. Помогает явное указание языка, если сервис это позволяет.
- Приветствия и призывы подписаться в начале файла — те же субтитровые шаблоны, только из вступлений роликов.
- Фантомная пунктуация и эмодзи на музыкальных фрагментах: символы вроде ♪ в субтитрах обозначают музыку, и модель воспроизводит их как «услышанное».
- Выдуманные имена и названия на плохо слышных фрагментах: модель подставляет знакомое сочетание звуков вместо незнакомого.
- Пропуск речи. Обратная ситуация: очень тихую реплику модель может посчитать шумом и не расшифровать вовсе.
Все эти артефакты — один и тот же класс явлений. Понимая механизм, их легко узнавать: они всегда возникают там, где речь прерывается или тонет в фоне.
Почему это происходит именно на плохих записях
Качество записи определяет, сколько информации получает модель. Чем меньше информации, тем больше решение зависит от языковой статистики — и тем выше шанс, что вместо расшифровки появится выдуманный текст.
Одна и та же модель, два сценария
Разборчивая запись
Чистый звук, речь близко к микрофону
Акустические признаки однозначны
Варианты продолжения отсекаются звуком
Точная расшифровка
Проблемная запись
Шум, музыка, паузы, тихий голос
Акустических признаков мало или нет
Выбор определяется языковой статистикой
Возможна галлюцинация
На практике вероятность вставок повышают вполне конкретные вещи:
- Тишина и длинные паузы — главный фактор. Особенно опасны хвосты записей, где диктофон продолжал писать после разговора.
- Музыка и фоновые звуки. Модель обучалась на роликах, где под музыку часто шли титры, — и воспроизводит эту связку.
- Очень тихий голос и удалённый микрофон: речь на грани различимости даёт слабые признаки, которых не хватает для уверенного выбора.
- Сильное сжатие. Низкий битрейт срезает высокие частоты, а вместе с ними — различия между похожими звуками. Если есть выбор, сохраняйте WAV или MP3 высокого качества.
- Несколько говорящих одновременно. Наложение голосов ломает акустическую картину: модель слышит смесь, а не реплики.
- Обрывки речи — незаконченные фразы, помехи связи, вырезанные фрагменты: модель пытается достроить фразу до осмысленной.
- Сильная реверберация больших помещений: отражения размывают границы слов.
Можно ли воспроизвести DimaTorzok специально?
Иногда да — и это самый простой способ убедиться, что явление реально. Обычно берут запись без речи: чистую тишину, комнатный шум, музыкальный фрагмент или очень тихий голос, и отправляют её на распознавание с русским языком. Гарантии нет: результат зависит от версии модели, длительности фрагмента и настроек сервиса — некоторые сервисы отсекают неречевые участки ещё до распознавания, и тогда на выходе будет пусто.
Угадайте результат
Тридцать секунд тишины с едва слышным шумом кондиционера. Что выдаст модель?
Подсказка: правильных ответов здесь может быть несколько, а «пустая строка» — лишь один из вариантов.
Чаще всего — короткую фразу из субтитров
Это может быть пустой результат, если неречевой фрагмент отсекли заранее. Но если фрагмент дошёл до модели, типичный ответ — «Продолжение следует…», «Спасибо за просмотр» или подпись автора субтитров. Причём один и тот же файл при повторном запуске может дать разный результат.
Почему повторный запуск даёт другой текст, хотя запись не менялась? Причин несколько. Whisper использует стратегию с повторными попытками: если результат не проходит внутренние проверки качества, декодирование перезапускается с большей «температурой», то есть с большей долей случайности. Кроме того, разные реализации по-разному режут запись на фрагменты, а вычисления на видеокарте не гарантируют побитово одинаковый результат. Для разборчивой речи эти различия незаметны, но на пограничных фрагментах они и решают, появится вставка или нет.
Галлюцинации возникают не «когда повезёт», а там, где модели не хватает звука. Это делает их предсказуемыми: смотреть нужно на тишину, шум и края записи.
Можно ли полностью избежать таких ошибок
Полностью — нет. Пока распознавание строится на вероятностном предсказании текста, у модели остаётся возможность выдать правдоподобную, но неверную гипотезу. Это свойство архитектуры, а не дефект сборки, и обещать стопроцентную защиту было бы нечестно.
При этом частоту таких ошибок реально снижают — и за последние годы её снизили заметно. Что работает на стороне сервиса:
- Детектор речи (VAD). Запись предварительно размечается на участки с речью и без, и в модель попадают только речевые фрагменты. Это убирает главный источник галлюцинаций — тишину.
- Отказ от переноса контекста между окнами: выдуманная фраза не попадает во вход следующего шага и не тянет за собой повторы.
- Пороги уверенности. Whisper умеет оценивать вероятность того, что в окне нет речи, и отбрасывать такие сегменты. Механизм помогает, но не решает всё: часть галлюцинаций модель выдаёт с высокой уверенностью.
- Постфильтрация известных шаблонов — отсечение характерных субтитровых строк из готового текста.
- Новые версии моделей, обученные с учётом этой проблемы.
Что может сделать сам пользователь — и это по-прежнему самый сильный рычаг:
- Обрезать начало и конец записи, если там нет речи. Пять секунд тишины в хвосте — самый частый источник лишней строки.
- Писать звук ближе к говорящему: встроенный микрофон ноутбука в переговорной даёт заметно больше проблем, чем петличка или телефон на столе.
- Не экономить на битрейте и не пережимать файл повторно. Исходник лучше пересланной копии.
- Избегать музыки и посторонних звуков на фоне, когда это возможно.
- Разделять записи с несколькими говорящими по ролям — режим с диаризацией лучше справляется с многоголосьем, чем сплошная расшифровка.
- Добавлять имена, термины и названия компаний в глоссарий: подсказка помогает модели выбрать правильное написание вместо похожего по звучанию.
- Проверять результат в местах, где запись была тяжёлой: границы фрагментов, паузы, реплики издалека.
Качество записи остаётся главным фактором точности. Никакая модель не восстановит информацию, которой не было в звуке, — она может только правдоподобно её достроить. Подробный разбор всех факторов — в руководстве как повысить точность распознавания речи.
Что это значит для пользователей сервисов транскрибации
Практический вывод спокойный: на нормальных записях автоматическая расшифровка работает хорошо, и галлюцинации там — редкость. Проблема касается не всего текста, а конкретных мест, и эти места легко предсказать.
Когда ошибки практически незаметны
- Разборчивая речь, микрофон рядом с говорящим.
- Интервью и подкасты, записанные в тихом помещении.
- Диктовка, голосовые заметки, монолог без фонового шума.
- Записи звонков и совещаний с нормальной связью и без наложения голосов.
Когда результат стоит проверить обязательно
- Запись с улицы, из машины, из зала — всё, где много фонового звука.
- Записи с длинными паузами и «хвостами» после окончания разговора.
- Телефонные разговоры низкого качества и пересланные сжатые файлы.
- Материалы, где цена ошибки высока: медицинские и юридические записи, финансовые условия, всё, что уходит в документ или публикацию.
Это не повод отказываться от автоматической расшифровки. Ручная расшифровка часа записи занимает несколько часов работы и тоже содержит ошибки — просто другие. Разумный режим — использовать модель для черновика и проверять места повышенного риска. В нашем сервисе для этого есть глоссарий и встроенный редактор: термины и имена задаются заранее, а любую строку можно поправить прямо в браузере. Список поддерживаемых языков тоже стоит проверить заранее — на языках с малым объёмом обучающих данных ошибок закономерно больше.
Автоматическая расшифровка — надёжный черновик, а не заверенная стенограмма. Проверка нужна не всему тексту, а именам, числам и фрагментам, записанным в сложных условиях.
Почему эта история интересна разработчикам
DimaTorzok обсуждают не потому, что это серьёзная проблема — сама по себе лишняя строка в конце файла безобидна. Обсуждают потому, что это редкий случай, когда фундаментальное свойство больших нейросетей видно невооружённым глазом и объясняется одной фразой.
Все крупные генеративные модели устроены похоже: они предсказывают правдоподобное продолжение, а не извлекают факты из хранилища. Поэтому и ошибаются они одинаково — уверенно и связно.
- Языковые модели выдумывают ссылки, цитаты и источники. Самый известный пример — дело Mata v. Avianca в 2023 году, когда юрист приложил к иску шесть судебных решений, сгенерированных чат-ботом; ни одного из них не существовало.
- Модели с поиском могут корректно найти источник и всё равно исказить его содержание при пересказе.
- Модели распознавания речи выдумывают услышанное — ровно то, что мы разбираем в этой статье.
Разница только в модальности. Общая причина одна: обучение на больших неидеальных данных даёт модели статистику мира, а не его понимание. Поэтому в местах, где данных не хватает, статистика заполняет пробел сама.
История с одной строкой в конце расшифровки — компактная иллюстрация того, как устроены современные AI-модели: они не воспроизводят реальность, а достраивают её до правдоподобной.
Что в итоге
DimaTorzok — это подпись человека, делавшего субтитры к видео, которая попала в обучающие данные Whisper и закрепилась как шаблон для фрагментов без речи. Модель не шутит, не ломается и не помнит этого человека: она воспроизводит статистическую связь, выученную из данных.
Эта история хорошо показывает, где проходит граница возможностей современных систем. Качество распознавания за последние годы выросло радикально — на разборчивой записи модели работают на уровне, который ещё недавно казался недостижимым. Но они остаются вероятностными: там, где сигнала нет, вместо честного «не знаю» может появиться правдоподобная выдумка.
Отсюда и практический вывод, который не изменится с выходом следующих версий: чем лучше запись, тем меньше модели приходится догадываться. А имена, числа и всё, что попадает в документы, стоит перечитывать глазами — независимо от того, какая технология использовалась для расшифровки.
Частые вопросы
Это псевдоним человека, который делал русские субтитры к роликам на YouTube и подписывал их строкой «Субтитры сделал DimaTorzok». Ролики с такими субтитрами попали в обучающие данные модели Whisper, и подпись закрепилась в ней как типичный текст для фрагментов без речи. К разработке Whisper и к сервисам расшифровки этот человек отношения не имеет.
Потому что модель не считывает звук буквально, а предсказывает наиболее вероятное продолжение текста. На тишине, шуме или музыке акустических подсказок нет, и решение принимает языковая статистика. В обучающих данных за такими фрагментами часто следовала подпись автора субтитров — её модель и воспроизводит.
Ни то, ни другое в привычном смысле. Это известное свойство архитектуры: OpenAI прямо предупреждает, что модель может выдавать текст, которого в записи не было. Сервисы на базе Whisper влияют на подготовку звука и фильтрацию результата, но природу явления не меняют — поэтому одинаковые строки появляются в разных продуктах.
Нет. Никакого вредоносного кода здесь нет, и посторонний доступ к вашим файлам ни при чём. Веса Whisper открыты, поведение воспроизводится на локальной установке без интернета.
Так называют связный текст, которого в записи не было вообще: не искажённое слово, а добавленную фразу. Галлюцинации возникают в основном на фрагментах без разборчивой речи — тишине, шуме, музыке, очень тихом голосе.
Потому что она обязана выдать наиболее вероятное продолжение, даже если оснований для выбора нет. Модель распознавания речи опирается на звук и на уже сгенерированный текст; когда звук неинформативен, вес языковой статистики становится решающим, и появляется правдоподобная, но не соответствующая записи фраза.
Полностью — нет, пока распознавание основано на вероятностном предсказании. Частоту заметно снижают: предварительная разметка речи детектором VAD, отказ от переноса контекста между фрагментами, пороги уверенности и фильтрация известных шаблонов. Исследования 2025 года показали, что целевое дообучение отдельных компонентов модели убирает более 80% таких вставок почти без потери точности.
Да. Выдуманные ссылки и цитаты у больших языковых моделей — то же самое явление в другой модальности. Любая генеративная модель, обученная предсказывать правдоподобное продолжение, способна выдать уверенный и связный, но неверный результат.
Если результат не проходит внутренние проверки качества, декодирование перезапускается с большей долей случайности. Кроме того, разные реализации по-разному режут запись на фрагменты, а вычисления на видеокарте не дают побитово одинакового результата. На разборчивой речи разница незаметна, на пограничных фрагментах — решает исход.
Как надёжному черновику — да. На разборчивой записи точность высокая, а ручная расшифровка часа аудио занимает несколько часов и тоже содержит ошибки. Разумный подход: использовать автоматический текст как основу и проверять имена, числа, названия и фрагменты, записанные в сложных условиях.
Полезное по теме
Материалы и страницы сервиса, которые помогут получить более точный результат.
Нужна расшифровка записи?
Загрузите аудио или видео — сервис вернёт текст, при необходимости с разбивкой по ролям и кратким саммари. Первые 45 минут бесплатно, результат можно поправить во встроенном редакторе.