speech-recognition
Войти
Почему нейросети делают так?

· 22 минуты чтения

Кто такой DimaTorzok, и почему его имя появляется в расшифровках?

DimaTorzok — ник автора субтитров к роликам на YouTube, чья подпись попала в обучающие данные Whisper. Модель запомнила её как типичное продолжение тишины в конце видео и иногда дописывает в расшифровку, хотя в записи этих слов не было. Это не сбой конкретной версии и не вирус, а побочный эффект того, как устроено современное распознавание речи.

Обложка статьи «Кто такой DimaTorzok, и почему его имя появляется в расшифровках?»

Сценарий почти всегда один. Человек отправляет голосовое сообщение или загружает запись на расшифровку, получает текст — и в самом конце, там, где уже никто не говорит, обнаруживает строку: «Субтитры сделал DimaTorzok».

Этого имени нет ни в записи, ни в настройках, ни в интерфейсе. Оно появляется само — и появляется у разных людей, в разных приложениях, на разных записях.

Как это выглядит

В записи

Конец голосового сообщения: пауза, шорох одежды, щелчок микрофона

Модель выдала

Субтитры сделал DimaTorzok

В записи

Тишина в конце видеозаписи

Модель выдала

Продолжение следует…

В записи

Фоновая музыка без речи

Модель выдала

Редактор субтитров А.Синецкая Корректор А.Егорова

Примеры и обсуждения: обсуждение «Who is DimaTorzok?» в репозитории openai/whisper, обсуждение галлюцинаций на записях без речи (openai/whisper #1606)

Типичные строки, которые модель дописывает там, где речи нет. Формулировки повторяются от записи к записи — это не случайный набор слов.

Столкнуться с этим можно в Telegram, CapCut, DaVinci Resolve, в редакторах субтитров и на сайтах для расшифровки записей. Общее у всех этих продуктов одно: под капотом у них Whisper — открытая модель распознавания речи, которую OpenAI выложила в сентябре 2022 года.

Кто такой DimaTorzok

DimaTorzok — псевдоним человека, который делал русские субтитры к роликам на YouTube и подписывал свою работу строкой «Субтитры сделал DimaTorzok». Сообщество связывает этот ник с каналом GMD13; по публикациям в СМИ, речь идёт о субтитрах примерно 2016–2017 годов. Сам автор давно не активен, а его подпись пережила и канал, и эпоху: она осталась внутри модели, обученной на видео с субтитрами.

Никакого отношения к OpenAI, к разработке Whisper или к сервисам расшифровки этот человек не имеет. Его имя попало в модель тем же способом, что и миллионы других слов, — вместе с текстом, который кто-то когда-то выложил в интернет.

Заметили закономерность далеко не сразу. Сначала это выглядело как единичный курьёз: странная строка в конце файла, которую проще стереть, чем объяснить. Потом оказалось, что имя видят разные люди на разных записях, и в обсуждениях репозитория Whisper появился прямой вопрос — «Who is DimaTorzok?». Там же прозвучало первое внятное объяснение: это подпись переводчика из обучающих данных, которую модель приняла за часть звуковой дорожки.

Как имя стало известным

Сентябрь 2022

OpenAI публикует Whisper с открытыми весами. Модель быстро становится отраслевым стандартом: её встраивают в десятки продуктов, от мессенджеров до видеоредакторов.

2023

В обсуждениях репозитория копятся однотипные жалобы: на тишине и шуме модель дописывает благодарности за просмотр, призывы подписаться и подписи авторов субтитров. Появляются первые обходные приёмы.

Начало 2024

Русскоязычные пользователи публично разбирают, что Whisper выдаёт на чистой тишине: «Продолжение следует…» и титры вымышленных редакторов. Становится понятно, что дело в данных, а не в конкретной записи.

Июнь 2024

Выходит первое крупное исследование галлюцинаций Whisper на конференции ACM FAccT — с количественными оценками, а не отдельными наблюдениями.

Октябрь 2024

В обсуждениях openai/whisper появляется вопрос «Who is DimaTorzok?». В том же месяце Associated Press публикует расследование о галлюцинациях Whisper в медицинских расшифровках.

2025

Исследователи локализуют источник проблемы внутри самой модели и показывают, что частоту галлюцинаций на неречевых фрагментах можно снизить более чем на 80% практически без потери точности распознавания.

2026

Имя окончательно превращается в мем и попадает в федеральные СМИ. На практике артефакт встречается заметно реже — но не исчез.

DimaTorzok — не пасхалка и не персонаж, придуманный нейросетью. Это подпись реального человека, попавшая в обучающие данные и закрепившаяся в модели как речевой шаблон для ситуации «речи нет».

Почему нейросеть вообще может придумать слово

Интуитивно распознавание речи кажется переводом звука в буквы: услышал — записал. Современные модели работают иначе. Whisper не расшифровывает звук по кусочкам, а предсказывает наиболее вероятную последовательность слов, которая могла бы соответствовать этому звуку. Ближайшая аналогия — не диктофон, а автодополнение в телефоне, только подсказки строятся не по первым буквам, а по акустическому сигналу.

Что происходит с записью внутри модели

Аудиозапись

Извлечение акустических признаков (спектрограмма)

Энкодер: звук превращается в набор числовых представлений

Декодер: слово за словом предсказывает наиболее вероятное продолжение

Готовая расшифровка

Ключевой этап — последний: текст не «считывается» со звука, а порождается как самая вероятная гипотеза.

На каждом шаге декодер опирается на две вещи: на звук и на уже написанный текст. Пока речь разборчива, звук доминирует — и расшифровка получается точной. Как только акустических данных становится мало, вес звука падает, а вес языковой привычки растёт. Модель всё равно обязана выдать какое-то продолжение, и она выдаёт то, что чаще всего встречалось в похожих ситуациях при обучении.

Что модель считает вероятным продолжением тишины в конце ролика

…речь закончилась, дальше — тишина и шорох

Субтитры сделал DimaTorzok

34%

Продолжение следует…

21%

Спасибо за просмотр!

18%

Подписывайтесь на канал

14%

пустая строка

13%
Числа условные и приведены для иллюстрации принципа: реальные вероятности зависят от версии модели, языка и конкретного фрагмента. Важен сам механизм — выбирается наиболее вероятный вариант, а не «правильный».

Есть и второй усилитель. По умолчанию Whisper передаёт в следующее окно уже полученный текст — так модель лучше держит контекст длинного разговора. Но если в предыдущем окне возникла выдуманная фраза, она попадает во вход следующего шага и повышает вероятность продолжения в том же духе. Отсюда знакомый эффект: одна лишняя строка, затем вторая, затем один и тот же текст повторяется десять раз подряд.

Модель не «ошибается в букве» — она выбирает самую вероятную гипотезу. Если акустических оснований для выбора нет, решение принимает языковая статистика, накопленная при обучении.

Что такое галлюцинации при распознавании речи

Галлюцинация в распознавании речи — это связный текст, которого в записи не было вообще: не искажённое слово, а добавленный фрагмент. Термин пришёл из области языковых моделей и означает не сбой программы, а уверенно сгенерированный, но не подкреплённый входными данными результат.

Полезно различать три разных явления, которые пользователи часто называют одним словом «ошибка».

  1. Ошибка распознавания. Слово услышано неточно: «поставщик» превратился в «поставку». Звук есть, соответствие частичное.
  2. Подмена слова. Модель выбрала другое слово, похожее по звучанию, но подходящее по смыслу фразы: «Иванов» вместо «Иванцов». Это уже влияние языковой модели, но опора на звук сохраняется.
  3. Галлюцинация. В записи нет ничего — или есть шум, — а в тексте появляется законченная фраза. Связь со звуком отсутствует полностью.

Ошибка или галлюцинация: быстрая проверка

Что видно в расшифровкеОбычная ошибкаГаллюцинация
Слово услышано неправильноОбычная ошибка
Перепутано имя или фамилияОбычная ошибка
Неверное окончание или форма словаОбычная ошибка
Придумана целая фразаГаллюцинация
Добавлен текст, которого не было в записиГаллюцинация
Одна и та же фраза повторяется подрядГаллюцинация
Внезапный переход на другой языкГаллюцинация
Критерий один: у обычной ошибки есть звуковой источник, пусть и расслышанный неверно. У галлюцинации источника нет вообще.
ПризнакОбычная ошибкаГаллюцинация
Связь со звукомЕсть: слово звучало похожеОтсутствует: произнесённого источника нет
Как выглядит в текстеОпечатка, неверная форма, перепутанный терминЦелая осмысленная фраза не по теме
Когда возникаетНа сложной лексике, именах, быстрой речиНа тишине, шуме, музыке, очень тихом голосе
Как заметитьЗаметна при вычитке по смыслуЧасто заметна сразу: фраза выпадает из контекста
Что помогаетГлоссарий, качество записи, ручная правкаОтсечение неречевых фрагментов, проверка начала и конца текста
Чем эти два случая различаются по сути
Предсказания модели могут включать текст, который в действительности не был произнесён.
OpenAI, описание модели Whisperкарточка модели Whisper large-v3

Галлюцинация отличается от ошибки не масштабом, а природой: ошибка — это неверно услышанное слово, галлюцинация — текст, у которого вообще нет звукового источника.

Почему именно DimaTorzok

Первую версию Whisper обучили на 680 тысячах часов аудио с расшифровками, собранных в интернете. Разметка здесь «слабая»: тексты брали такими, какими их выложили люди, — включая субтитры к видео. Ровно поэтому модель хорошо держит разговорную речь, акценты и шум: она видела реальные записи, а не студийные наборы данных.

У этого подхода есть обратная сторона. В субтитрах встречается не только речь. Там есть описания звуков, названия каналов, реклама, благодарности за просмотр и подписи тех, кто эти субтитры сделал. Для модели это такой же текст, как и всё остальное, — и он тоже привязан к какому-то куску звука. Чаще всего к тому, где никто не говорит: к финальным титрам, музыкальной концовке, паузе перед выключением камеры.

Как подпись переводчика становится частью модели

Автор делает субтитры и подписывает их в конце файла

Ролик с субтитрами попадает в обучающий корпус

Подписи стоят там, где речи нет: титры, музыка, тишина

Модель выучивает устойчивую связку «нет речи → подпись автора»

На тишине модель воспроизводит выученный шаблон

Второй фактор — язык. В корпусе первой версии около 65% времени приходилось на английскую речь с английскими расшифровками и ещё 18% — на переводы на английский. На все остальные 96 языков вместе взятых оставалось примерно 17%. Русская доля в этом остатке невелика, а значит, каждый часто повторяющийся шаблон весит для русского языка больше, чем аналогичный шаблон для английского. Отсюда и результат: англоязычные пользователи чаще видят «Thank you for watching», а русскоязычные — DimaTorzok.

Что подтверждено, а что остаётся гипотезой

  • Подтверждено: Whisper склонен генерировать текст на фрагментах без речи — это признаёт сама OpenAI и фиксируют независимые исследования.
  • Подтверждено: обучающий корпус собирался из интернета вместе с субтитрами, и служебные строки из субтитров в нём есть.
  • Подтверждено: строка с ником DimaTorzok воспроизводится у множества независимых пользователей и в разных продуктах на базе Whisper.
  • Наиболее вероятное объяснение: подпись попала в корпус из субтитров конкретного автора и закрепилась из-за частого повторения в неречевых фрагментах.
  • Не проверяемо снаружи: сколько именно роликов с этой подписью было в данных и почему закрепился именно этот ник, а не десятки других. Состав корпуса не публиковался.
  • Неверно: утверждение, что причина установлена документально. Никакого разбора со стороны OpenAI не публиковалось.

Миф или правда

Миф
Whisper специально вставляет имя DimaTorzok

В модели нет ни правила, ни списка фраз для вставки. Строка появляется как наиболее вероятное продолжение — тем же механизмом, что и обычные слова.

Миф
Это вирус или взлом модели

Ни вредоносного кода, ни постороннего вмешательства здесь нет. Веса Whisper открыты и многократно проверены сообществом.

Миф
Ошибка была только в одной версии Whisper и давно исправлена

Склонность достраивать текст на неречевых фрагментах свойственна всей архитектуре. Разные версии и обвязки снижают частоту, но не устраняют явление полностью.

Миф
Виноват сервис, который вы используете

Одинаковые строки возникают в разных продуктах, потому что в основе у них одна и та же модель. Сервис влияет на подготовку звука и фильтрацию результата, но не на природу явления.

Правда
Это следствие вероятностной природы модели

Модель выбирает самую правдоподобную последовательность слов. Когда звук ничего не подсказывает, правдоподобной оказывается фраза, часто встречавшаяся в похожем контексте при обучении.

Имя закрепилось не из-за уникальности, а из-за повторяемости: подпись стояла там, где речи нет, и таких примеров в данных оказалось достаточно, чтобы модель связала тишину именно с ней.

Какие ещё странные ошибки встречаются

DimaTorzok — самый известный, но далеко не единственный случай. У каждого языка есть свой набор «призраков», и все они происходят из того же источника — служебных строк в субтитрах.

Коллекция типичных галлюцинаций

В записи

Тишина в конце англоязычного ролика

Модель выдала

Thank you for watching!

В записи

Музыкальная заставка без слов

Модель выдала

Subtitles by the Amara.org community

В записи

Пауза в записи на турецком

Модель выдала

Altyazı M.K.

В записи

Долгая пауза посреди диктофонной записи

Модель выдала

Спасибо за внимание. Спасибо за внимание. Спасибо за внимание.

Классическое зацикливание: выдуманная фраза попадает в контекст следующего шага и воспроизводится снова.

Примеры и обсуждения: обсуждение «Who is DimaTorzok?» в репозитории openai/whisper, обсуждение галлюцинаций на записях без речи (openai/whisper #1606)

Наборы фраз отличаются по языкам, но механизм один: это текст из субтитров, привязанный к фрагментам без речи.

Кроме вставок и повторов встречается ещё несколько узнаваемых сюжетов:

  • Внезапная смена языка. Whisper определяет язык по началу записи. Если первые секунды — шум, музыка или молчание, определение может уйти в сторону, и дальше модель добросовестно расшифровывает русскую речь как, например, японскую. Помогает явное указание языка, если сервис это позволяет.
  • Приветствия и призывы подписаться в начале файла — те же субтитровые шаблоны, только из вступлений роликов.
  • Фантомная пунктуация и эмодзи на музыкальных фрагментах: символы вроде ♪ в субтитрах обозначают музыку, и модель воспроизводит их как «услышанное».
  • Выдуманные имена и названия на плохо слышных фрагментах: модель подставляет знакомое сочетание звуков вместо незнакомого.
  • Пропуск речи. Обратная ситуация: очень тихую реплику модель может посчитать шумом и не расшифровать вовсе.

Все эти артефакты — один и тот же класс явлений. Понимая механизм, их легко узнавать: они всегда возникают там, где речь прерывается или тонет в фоне.

Почему это происходит именно на плохих записях

Качество записи определяет, сколько информации получает модель. Чем меньше информации, тем больше решение зависит от языковой статистики — и тем выше шанс, что вместо расшифровки появится выдуманный текст.

Одна и та же модель, два сценария

Разборчивая запись

Чистый звук, речь близко к микрофону

Акустические признаки однозначны

Варианты продолжения отсекаются звуком

Точная расшифровка

Проблемная запись

Шум, музыка, паузы, тихий голос

Акустических признаков мало или нет

Выбор определяется языковой статистикой

Возможна галлюцинация

Причинно-следственная связь простая: меньше звуковой информации — больше догадок.

На практике вероятность вставок повышают вполне конкретные вещи:

  • Тишина и длинные паузы — главный фактор. Особенно опасны хвосты записей, где диктофон продолжал писать после разговора.
  • Музыка и фоновые звуки. Модель обучалась на роликах, где под музыку часто шли титры, — и воспроизводит эту связку.
  • Очень тихий голос и удалённый микрофон: речь на грани различимости даёт слабые признаки, которых не хватает для уверенного выбора.
  • Сильное сжатие. Низкий битрейт срезает высокие частоты, а вместе с ними — различия между похожими звуками. Если есть выбор, сохраняйте WAV или MP3 высокого качества.
  • Несколько говорящих одновременно. Наложение голосов ломает акустическую картину: модель слышит смесь, а не реплики.
  • Обрывки речи — незаконченные фразы, помехи связи, вырезанные фрагменты: модель пытается достроить фразу до осмысленной.
  • Сильная реверберация больших помещений: отражения размывают границы слов.

Можно ли воспроизвести DimaTorzok специально?

Иногда да — и это самый простой способ убедиться, что явление реально. Обычно берут запись без речи: чистую тишину, комнатный шум, музыкальный фрагмент или очень тихий голос, и отправляют её на распознавание с русским языком. Гарантии нет: результат зависит от версии модели, длительности фрагмента и настроек сервиса — некоторые сервисы отсекают неречевые участки ещё до распознавания, и тогда на выходе будет пусто.

Угадайте результат

Тридцать секунд тишины с едва слышным шумом кондиционера. Что выдаст модель?

Подсказка: правильных ответов здесь может быть несколько, а «пустая строка» — лишь один из вариантов.

Чаще всего — короткую фразу из субтитров

Это может быть пустой результат, если неречевой фрагмент отсекли заранее. Но если фрагмент дошёл до модели, типичный ответ — «Продолжение следует…», «Спасибо за просмотр» или подпись автора субтитров. Причём один и тот же файл при повторном запуске может дать разный результат.

Почему повторный запуск даёт другой текст, хотя запись не менялась? Причин несколько. Whisper использует стратегию с повторными попытками: если результат не проходит внутренние проверки качества, декодирование перезапускается с большей «температурой», то есть с большей долей случайности. Кроме того, разные реализации по-разному режут запись на фрагменты, а вычисления на видеокарте не гарантируют побитово одинаковый результат. Для разборчивой речи эти различия незаметны, но на пограничных фрагментах они и решают, появится вставка или нет.

Галлюцинации возникают не «когда повезёт», а там, где модели не хватает звука. Это делает их предсказуемыми: смотреть нужно на тишину, шум и края записи.

Можно ли полностью избежать таких ошибок

Полностью — нет. Пока распознавание строится на вероятностном предсказании текста, у модели остаётся возможность выдать правдоподобную, но неверную гипотезу. Это свойство архитектуры, а не дефект сборки, и обещать стопроцентную защиту было бы нечестно.

При этом частоту таких ошибок реально снижают — и за последние годы её снизили заметно. Что работает на стороне сервиса:

  • Детектор речи (VAD). Запись предварительно размечается на участки с речью и без, и в модель попадают только речевые фрагменты. Это убирает главный источник галлюцинаций — тишину.
  • Отказ от переноса контекста между окнами: выдуманная фраза не попадает во вход следующего шага и не тянет за собой повторы.
  • Пороги уверенности. Whisper умеет оценивать вероятность того, что в окне нет речи, и отбрасывать такие сегменты. Механизм помогает, но не решает всё: часть галлюцинаций модель выдаёт с высокой уверенностью.
  • Постфильтрация известных шаблонов — отсечение характерных субтитровых строк из готового текста.
  • Новые версии моделей, обученные с учётом этой проблемы.

Что может сделать сам пользователь — и это по-прежнему самый сильный рычаг:

  1. Обрезать начало и конец записи, если там нет речи. Пять секунд тишины в хвосте — самый частый источник лишней строки.
  2. Писать звук ближе к говорящему: встроенный микрофон ноутбука в переговорной даёт заметно больше проблем, чем петличка или телефон на столе.
  3. Не экономить на битрейте и не пережимать файл повторно. Исходник лучше пересланной копии.
  4. Избегать музыки и посторонних звуков на фоне, когда это возможно.
  5. Разделять записи с несколькими говорящими по ролям — режим с диаризацией лучше справляется с многоголосьем, чем сплошная расшифровка.
  6. Добавлять имена, термины и названия компаний в глоссарий: подсказка помогает модели выбрать правильное написание вместо похожего по звучанию.
  7. Проверять результат в местах, где запись была тяжёлой: границы фрагментов, паузы, реплики издалека.

Качество записи остаётся главным фактором точности. Никакая модель не восстановит информацию, которой не было в звуке, — она может только правдоподобно её достроить. Подробный разбор всех факторов — в руководстве как повысить точность распознавания речи.

Что это значит для пользователей сервисов транскрибации

Практический вывод спокойный: на нормальных записях автоматическая расшифровка работает хорошо, и галлюцинации там — редкость. Проблема касается не всего текста, а конкретных мест, и эти места легко предсказать.

Когда ошибки практически незаметны

  • Разборчивая речь, микрофон рядом с говорящим.
  • Интервью и подкасты, записанные в тихом помещении.
  • Диктовка, голосовые заметки, монолог без фонового шума.
  • Записи звонков и совещаний с нормальной связью и без наложения голосов.

Когда результат стоит проверить обязательно

  • Запись с улицы, из машины, из зала — всё, где много фонового звука.
  • Записи с длинными паузами и «хвостами» после окончания разговора.
  • Телефонные разговоры низкого качества и пересланные сжатые файлы.
  • Материалы, где цена ошибки высока: медицинские и юридические записи, финансовые условия, всё, что уходит в документ или публикацию.

Это не повод отказываться от автоматической расшифровки. Ручная расшифровка часа записи занимает несколько часов работы и тоже содержит ошибки — просто другие. Разумный режим — использовать модель для черновика и проверять места повышенного риска. В нашем сервисе для этого есть глоссарий и встроенный редактор: термины и имена задаются заранее, а любую строку можно поправить прямо в браузере. Список поддерживаемых языков тоже стоит проверить заранее — на языках с малым объёмом обучающих данных ошибок закономерно больше.

Автоматическая расшифровка — надёжный черновик, а не заверенная стенограмма. Проверка нужна не всему тексту, а именам, числам и фрагментам, записанным в сложных условиях.

Почему эта история интересна разработчикам

DimaTorzok обсуждают не потому, что это серьёзная проблема — сама по себе лишняя строка в конце файла безобидна. Обсуждают потому, что это редкий случай, когда фундаментальное свойство больших нейросетей видно невооружённым глазом и объясняется одной фразой.

Все крупные генеративные модели устроены похоже: они предсказывают правдоподобное продолжение, а не извлекают факты из хранилища. Поэтому и ошибаются они одинаково — уверенно и связно.

  • Языковые модели выдумывают ссылки, цитаты и источники. Самый известный пример — дело Mata v. Avianca в 2023 году, когда юрист приложил к иску шесть судебных решений, сгенерированных чат-ботом; ни одного из них не существовало.
  • Модели с поиском могут корректно найти источник и всё равно исказить его содержание при пересказе.
  • Модели распознавания речи выдумывают услышанное — ровно то, что мы разбираем в этой статье.

Разница только в модальности. Общая причина одна: обучение на больших неидеальных данных даёт модели статистику мира, а не его понимание. Поэтому в местах, где данных не хватает, статистика заполняет пробел сама.

История с одной строкой в конце расшифровки — компактная иллюстрация того, как устроены современные AI-модели: они не воспроизводят реальность, а достраивают её до правдоподобной.

Что в итоге

DimaTorzok — это подпись человека, делавшего субтитры к видео, которая попала в обучающие данные Whisper и закрепилась как шаблон для фрагментов без речи. Модель не шутит, не ломается и не помнит этого человека: она воспроизводит статистическую связь, выученную из данных.

Эта история хорошо показывает, где проходит граница возможностей современных систем. Качество распознавания за последние годы выросло радикально — на разборчивой записи модели работают на уровне, который ещё недавно казался недостижимым. Но они остаются вероятностными: там, где сигнала нет, вместо честного «не знаю» может появиться правдоподобная выдумка.

Отсюда и практический вывод, который не изменится с выходом следующих версий: чем лучше запись, тем меньше модели приходится догадываться. А имена, числа и всё, что попадает в документы, стоит перечитывать глазами — независимо от того, какая технология использовалась для расшифровки.

Частые вопросы

Это псевдоним человека, который делал русские субтитры к роликам на YouTube и подписывал их строкой «Субтитры сделал DimaTorzok». Ролики с такими субтитрами попали в обучающие данные модели Whisper, и подпись закрепилась в ней как типичный текст для фрагментов без речи. К разработке Whisper и к сервисам расшифровки этот человек отношения не имеет.

Потому что модель не считывает звук буквально, а предсказывает наиболее вероятное продолжение текста. На тишине, шуме или музыке акустических подсказок нет, и решение принимает языковая статистика. В обучающих данных за такими фрагментами часто следовала подпись автора субтитров — её модель и воспроизводит.

Ни то, ни другое в привычном смысле. Это известное свойство архитектуры: OpenAI прямо предупреждает, что модель может выдавать текст, которого в записи не было. Сервисы на базе Whisper влияют на подготовку звука и фильтрацию результата, но природу явления не меняют — поэтому одинаковые строки появляются в разных продуктах.

Нет. Никакого вредоносного кода здесь нет, и посторонний доступ к вашим файлам ни при чём. Веса Whisper открыты, поведение воспроизводится на локальной установке без интернета.

Так называют связный текст, которого в записи не было вообще: не искажённое слово, а добавленную фразу. Галлюцинации возникают в основном на фрагментах без разборчивой речи — тишине, шуме, музыке, очень тихом голосе.

Потому что она обязана выдать наиболее вероятное продолжение, даже если оснований для выбора нет. Модель распознавания речи опирается на звук и на уже сгенерированный текст; когда звук неинформативен, вес языковой статистики становится решающим, и появляется правдоподобная, но не соответствующая записи фраза.

Полностью — нет, пока распознавание основано на вероятностном предсказании. Частоту заметно снижают: предварительная разметка речи детектором VAD, отказ от переноса контекста между фрагментами, пороги уверенности и фильтрация известных шаблонов. Исследования 2025 года показали, что целевое дообучение отдельных компонентов модели убирает более 80% таких вставок почти без потери точности.

Да. Выдуманные ссылки и цитаты у больших языковых моделей — то же самое явление в другой модальности. Любая генеративная модель, обученная предсказывать правдоподобное продолжение, способна выдать уверенный и связный, но неверный результат.

Если результат не проходит внутренние проверки качества, декодирование перезапускается с большей долей случайности. Кроме того, разные реализации по-разному режут запись на фрагменты, а вычисления на видеокарте не дают побитово одинакового результата. На разборчивой речи разница незаметна, на пограничных фрагментах — решает исход.

Как надёжному черновику — да. На разборчивой записи точность высокая, а ручная расшифровка часа аудио занимает несколько часов и тоже содержит ошибки. Разумный подход: использовать автоматический текст как основу и проверять имена, числа, названия и фрагменты, записанные в сложных условиях.


Нужна расшифровка записи?

Загрузите аудио или видео — сервис вернёт текст, при необходимости с разбивкой по ролям и кратким саммари. Первые 45 минут бесплатно, результат можно поправить во встроенном редакторе.