· 21 минута чтения
Что такое диаризация, и как нейросеть разделяет спикеров
Если в записи один голос, достаточно превратить речь в текст. Как только участников становится двое или пятеро, сплошной текст почти бесполезен: непонятно, кто задал вопрос, кто согласился и кто взял задачу. За то, чтобы реплики разошлись по говорящим, отвечает отдельная технология — диаризация.
Представьте два файла. В первом — интервью: два человека, вопрос и ответ. Во втором — рабочая встреча на пятерых, где реплики идут вперемешку, кто-то уточняет, кто-то поддакивает, кто-то подключился по телефону. Расшифровка обоих файлов без разметки выглядит одинаково: длинное полотно текста без единого указания на автора.
С интервью такое полотно ещё можно разобрать по смыслу — вопросы обычно отличаются от ответов. Со встречей на пятерых это уже работа: приходится слушать запись заново и вручную расставлять, кто что произнёс. Ради этого расшифровку и заказывали, а экономии не вышло. Ниже — что именно делает диаризация, как она примерно устроена, почему ошибается и чем отличается от определения личности по голосу.
Коротко
Диаризация спикеров — это автоматическое разделение аудиозаписи на фрагменты в зависимости от того, кто говорит. Система находит моменты смены говорящего и распределяет речь между условными участниками: Спикер 1, Спикер 2, Спикер 3.
Диаризация не занимается словами — за текст отвечает распознавание речи. И она не устанавливает, кому именно принадлежит голос: «Спикер 1» — это метка, а не имя. Привычный вид протокола получается, когда результаты двух технологий совмещают: текст реплики, тайм-код и говорящий.
| Спикер | Тайм-код | Реплика |
|---|---|---|
| Спикер 1 | 00:12 | Когда планируем запуск? |
| Спикер 2 | 00:16 | Предлагаю начать в понедельник. |
| Спикер 3 | 00:21 | Тогда тестирование нужно закончить до пятницы. |
Что такое диаризация и чем она отличается от транскрибации
Транскрибация отвечает на вопрос «что сказали?»: она превращает звучащую речь в текст. Диаризация отвечает на другой вопрос — «кто и когда говорил?»: она размечает запись по говорящим, ничего не зная о содержании реплик.
Это две разные задачи, и решают их обычно две разные модели. Модель распознавания речи занята словами: в описании Whisper, например, речь идёт о распознавании и переводе, а разделение говорящих в её задачи не входит. Разметку по спикерам строит отдельный конвейер, который работает с тем же аудио параллельно.
| Технология | На какой вопрос отвечает |
|---|---|
| Распознавание речи | Что было сказано? |
| Диаризация | Кто и когда говорил? |
| Транскрибация + диаризация | Кто что сказал? |
Транскрибация и диаризация: три вопроса к одной записи
Что сказали?
Распознавание речи
Слова, предложения, пунктуация
Тайм-коды фраз и слов
Текст записи
Кто говорил?
Диаризация
Границы смены говорящего
Условные метки: Спикер 1, Спикер 2…
Разметка записи по спикерам
Кто что сказал?
Совместное использование технологий
Текст и разметка накладываются друг на друга
Реплики с авторами и тайм-кодами
Разделение важно ещё и потому, что качество у этих задач независимое. Безупречный текст может достаться расшифровке с перепутанными участниками, а аккуратная разметка — тексту с ошибками в терминах: одно про другое ничего не говорит. Поэтому текст и разметку стоит оценивать отдельно; подробнее об этом — в разборе, почему разные сервисы по-разному расшифровывают одну и ту же запись.
И сразу важная оговорка. Метки «Спикер 1» и «Спикер 2» означают только одно: в записи есть как минимум два разных голоса, и система развела их по разным группам. Кто эти люди, диаризация не знает — это уже задача другой технологии, и следующий раздел о том, чем они различаются.
Транскрибация превращает звук в текст, диаризация делит запись по говорящим. Это разные технологии с разным качеством, и их результаты имеет смысл проверять по отдельности.
Диаризация и распознавание личности — это одно и то же?
Прямой ответ: нет. Диаризация отвечает на вопрос «сколько в записи разных голосов и где каждый из них звучит», а не на вопрос «чей это голос». Это две разные задачи, и вторая требует данных, которых в обычной записи нет.
Speaker diarization — разделение спикеров. Система сравнивает голоса внутри одной записи, группирует похожие фрагменты и присваивает группам условные идентификаторы. Никакой внешней информации для этого не нужно: достаточно самого файла.
Speaker identification — идентификация говорящего. Здесь система пытается сопоставить голос с конкретным человеком из заранее подготовленной базы. Для этого нужны образцы голоса каждого участника, согласие этих людей и отдельная процедура — обычная транскрибация ничего подобного не делает.
| Задача | Что получается на выходе | Что для этого нужно |
|---|---|---|
| Диаризация (speaker diarization) | Спикер 1, Спикер 2, Спикер 3 с тайм-кодами | Только сама запись |
| Идентификация (speaker identification) | Анна, Михаил | База образцов голоса и согласие участников |
| Верификация (speaker verification) | Ответ «это тот же голос» или «другой» | Эталонный образец конкретного человека |
Отсюда следует практическое свойство меток: они условны и действуют только внутри одного файла. «Спикер 1» во вчерашней записи и «Спикер 1» в сегодняшней — это, вообще говоря, разные люди. Номер не связан ни с какой устойчивой характеристикой человека и за пределами своей записи ничего не значит.
Диаризация отвечает «здесь говорит другой человек», а не «здесь говорит Иван Петров». Определение личности по голосу — отдельная задача, требующая образцов голоса и согласия участников.
Как нейросеть понимает, что говорит другой человек
Прямой ответ: она никого не «узнаёт». Система сравнивает участки записи между собой и предполагает, что похоже звучащие фрагменты принадлежат одному человеку, а заметно отличающиеся — разным. Всё разделение строится на сравнении внутри одной записи.
Ниже — упрощённая последовательность шагов. Она описывает общий принцип, по которому устроено большинство современных решений, а не конкретную реализацию.
Шаг 1. Найти в записи речь
Сначала система определяет, где в файле вообще есть человеческая речь, а где тишина, шум, музыка или посторонние звуки. Этот этап называется определением речевой активности. Он экономит вычисления и, главное, не даёт алгоритму принять гул кондиционера за ещё одного участника — и встречается не только в диаризации: тот же шаг есть в общей цепочке обработки записи, о которой рассказывает статья как работает распознавание речи: от аудиозаписи до готового текста.
Шаг 2. Разбить речь на короткие фрагменты
Найденная речь нарезается на небольшие отрезки. Здесь есть компромисс: чем короче фрагмент, тем точнее можно поймать момент смены говорящего, но тем меньше в нём информации о голосе. Чем длиннее — тем надёжнее сравнение, но выше риск, что в один отрезок попадут сразу два человека.
Шаг 3. Описать голос набором признаков
Для каждого фрагмента модель вычисляет компактное числовое описание голоса. Это не «высота голоса» и не один параметр: в описание попадает то, как распределена энергия по спектру, какие резонансы даёт речевой тракт конкретного человека, какова окраска гласных, как произносятся согласные, какова манера и темп речи. Признаков десятки, и по отдельности они ничего не значат — работает только их сочетание.
Важная деталь: такое описание отражает не «человека вообще», а то, как его голос звучит именно в этой записи. Микрофон, расстояние, помещение и канал связи входят в звук наравне с самим голосом — и это одна из причин последующих ошибок.
Шаг 4. Сравнить фрагменты между собой
Дальше алгоритм измеряет, насколько описания фрагментов близки друг к другу, и объединяет похожие. По сути это группировка: близкие по звучанию отрезки собираются в один кластер, далёкие расходятся по разным. Никакого внешнего эталона здесь нет — только взаимные расстояния внутри записи.
Шаг 5. Сформировать группы спикеров
Получившиеся группы и есть предполагаемые участники: эти фрагменты — Спикер 1, эти — Спикер 2, эти — Спикер 3. Здесь же определяется и число говорящих: если оно не задано заранее, система оценивает его сама по структуре записи.
Шаг 6. Совместить разметку с расшифровкой
Последний шаг — наложить разметку по спикерам на распознанный текст с тайм-кодами. Границы двух разметок совпадают не идеально: одна строилась по акустике, другая по словам. Отсюда типичные мелкие расхождения на стыках — короткое «да» в начале чужой реплики или последнее слово фразы, ушедшее к следующему спикеру.
Как работает диаризация
Аудиозапись с несколькими голосами
Определение участков речи
Разделение на речевые фрагменты
Анализ и сравнение голосовых признаков
Группировка фрагментов по спикерам
Спикер 1 / Спикер 2 / Спикер 3
Совмещение с расшифровкой
Диаризация — это сравнение голосов внутри одной записи и группировка похожих фрагментов. Система не узнаёт людей, а замечает, что звучание изменилось, — поэтому всё, что меняет звук, влияет и на разметку.
Что происходит, когда люди говорят одновременно
Прямой ответ: это один из самых сложных случаев для диаризации, и качество разметки на таких участках закономерно снижается.
Причина в природе записи. Когда двое говорят в один микрофон одновременно, в файл попадает не два сигнала, а один — их сумма. Числовое описание такого фрагмента получается смешанным: оно не похоже ни на первого участника, ни на второго, и сравнивать его с «чистыми» отрезками бессмысленно.
К обычной задаче добавляется ещё одна: нужно не просто найти речь, но и понять, что говорящих в этот момент несколько. Это отдельная подзадача — обнаружение перекрывающейся речи, и решается она не всегда. Если наложение не распознано, фрагмент целиком достаётся одному спикеру — чаще всего тому, чей голос в этот момент звучал громче.
Где разметке приходится ставить границу
Вопрос и ответ без пересечения
Короткий вопрос, пауза, длинный ответ. Границу можно поставить в тишине между репликами, и она совпадёт с границей фразы в тексте — в расшифровке получаются две аккуратные реплики с разными авторами.
Поддакивание внутри чужой реплики
Одна длинная реплика и короткое «угу» посередине. Чтобы отразить это точно, разметку пришлось бы разрезать на три части. Чаще вставка не выделяется в отдельную реплику вовсе и остаётся внутри чужого блока.
Перебивание с длительным наложением
Второй участник вступает задолго до конца чужой фразы. В зоне наложения однозначной границы просто нет: где именно закончится один спикер и начнётся другой, разметка решает приблизительно — сдвиг на несколько секунд здесь обычное дело.
Обещать, что перекрывающаяся речь всегда разделяется корректно, было бы неправдой — ни для одной современной системы. Разумное ожидание другое: короткие наложения обычно переживаются нормально, а участки, где несколько человек говорят наперебой, стоит проверять вручную.
Одновременная речь бьёт по обеим задачам сразу: слова смешиваются, а голосовые признаки перестают соответствовать кому-то одному. Это тот случай, когда проще предотвратить при записи, чем исправить потом.
Почему нейросеть иногда путает спикеров
Дальше — основные причины ошибок. Ни одна из них не означает, что разметка обязательно испортится: каждая лишь повышает вероятность того, что система объединит двух человек или разделит одного.
Похожие голоса
Если у участников близкие голосовые характеристики — схожий тембр, похожая манера речи, один пол и возраст, — описания их фрагментов оказываются рядом, и алгоритм может собрать их в одну группу. Чаще всего это встречается у коллег из одной среды: они говорят в похожем темпе и с похожей интонацией.
Одновременная речь и перебивания
Разобранный выше случай. Смешанные фрагменты не соответствуют ни одному участнику, поэтому распределяются условно. На записях, где принято дополнять друг друга и заканчивать чужие фразы, таких участков много.
Очень короткие реплики
«Да», «нет», «понятно», «хорошо», «угу» — вся информация о голосе умещается в доли секунды. Для сравнения этого мало, поэтому короткие ответы часто уходят к соседнему спикеру. На диалоге, где один участник в основном поддакивает, это заметно сильнее всего.
Плохое качество записи
Шум, эхо и большое расстояние до микрофона размывают именно те тонкие акустические детали, по которым голоса и различаются. В отражённом звуке к голосу примешивается помещение, а на далёком микрофоне все участники становятся похожи друг на друга. Заодно страдает и текст: на плохом звуке модель распознавания иногда дописывает фразы, которых не было, — это отдельное явление, галлюцинации при транскрибации.
Один общий микрофон на всех
Классика переговорной: телефон в центре стола. Участники находятся на разных расстояниях, кто-то повёрнут в сторону, кто-то говорит тише. Голос одного и того же человека при этом звучит по-разному в зависимости от того, повернулся он к устройству или отклонился, — и разделять становится сложнее.
Изменившееся звучание одного человека
Участник пересел, отошёл от микрофона, переключился с гарнитуры на громкую связь, перезвонил с другого устройства — звук меняется настолько, что новые фрагменты плохо сопоставляются со старыми. Типичный результат: один человек разделён на двух спикеров, причём ровно с того момента, когда изменились условия записи.
Большое количество участников
Чем больше голосов, тем выше шанс, что хотя бы два из них окажутся похожими, и тем сложнее структура разговора: больше переходов, больше коротких реплик, больше наложений. Речь идёт именно о росте сложности, а не о запрете: отдельного лимита на число спикеров в интерфейсе нет — но чем больше участников, тем внимательнее стоит просматривать готовую разметку.
Две типичные ошибки разделения
Что было в записи
Двое коллег с похожими голосами по очереди обсуждают сроки
Что получилось в разметке
Все реплики отнесены к Спикеру 1
Причина: Описания голосов оказались слишком близкими, и алгоритм счёл их одним человеком.
Что делать: Разнести микрофоны или писать участников на отдельные дорожки; в готовом тексте разделить реплики вручную.
Что было в записи
Руководитель начал встречу за столом, потом отошёл к доске и продолжил оттуда
Что получилось в разметке
Спикер 1 в начале и Спикер 4 во второй половине встречи — это один человек
Причина: Расстояние и акустика изменились, звучание голоса перестало совпадать с прежними фрагментами.
Что делать: Держать микрофон ближе и стабильно; после расшифровки объединить двух спикеров в одного.
Что было в записи
Интервьюер коротко поддакивает во время длинного ответа героя
Что получилось в разметке
Реплики «да» и «конечно» приписаны герою
Причина: В коротком отрезке слишком мало информации о голосе, а звучит он поверх чужой речи.
Что делать: Держать паузу перед своей репликой; в расшифровке такие вставки правятся быстрее всего.
Два самых частых сбоя противоположны друг другу: похожие голоса склеиваются в одного спикера, а один человек с изменившимся звучанием распадается на двух. Обе ошибки легко заметить при беглой вычитке.
От чего зависит точность диаризации
Факторы почти те же, что и у распознавания речи, но вес у них другой: диаризацию сильнее всего ломает не шум сам по себе, а всё, что делает голоса менее различимыми между собой.
| Фактор | Как влияет |
|---|---|
| Качество аудио | Чистая запись упрощает анализ голосов |
| Количество участников | Большое число голосов усложняет разделение |
| Перекрывающаяся речь | Один из наиболее сложных случаев |
| Продолжительность реплик | Очень короткие ответы сложнее классифицировать |
| Расстояние до микрофона | Может менять характеристики записанного голоса |
| Фоновый шум и эхо | Снижают качество акустической информации |
Процентов вроде «шум снижает точность разделения на 20%» вы здесь не увидите намеренно. Такие цифры имеют смысл только вместе с описанием набора записей, на которых их измеряли: на студийном подкасте и на записи из переговорной один и тот же фактор ведёт себя совершенно по-разному.
У разделения спикеров своя метрика — DER: она считает не слова, а время, размеченное неверно. Как устроена метрика для текста и что она умеет показывать, разобрано в статье о WER.
Точность разделения определяется тем, насколько различимы голоса в конкретном файле. Один и тот же алгоритм на записи с петличками и на телефоне в центре стола даёт заметно разный результат.
Где особенно полезно разделение спикеров
Диаризация нужна везде, где в записи больше одного человека и важна не только суть, но и авторство реплик.
- Интервью. Вопросы отделяются от ответов, и цитату героя можно взять в материал, не перепроверяя, кто именно её произнёс — расшифровка интервью.
- Совещания. Видно последовательность реплик и то, кто предложил решение, а кто взял задачу — расшифровка совещаний.
- Звонки. Реплики собеседников разводятся по сторонам разговора, даже если запись велась одним каналом — расшифровка звонков.
- Исследования и фокус-группы. В обсуждении важно не потерять, какое мнение кому принадлежит: без этого распадается сама структура дискуссии — транскрибация для маркетинга и исследований.
- Судебные и юридические записи. Многосторонний разговор структурируется по участникам — расшифровка судебных заседаний.
- Подкасты. Выпуски с несколькими ведущими или гостями проще монтировать и превращать в текстовые версии — расшифровка подкастов.
Список не исчерпывающий: разделение спикеров одинаково полезно на лекциях с вопросами из зала, на вебинарах, на приёмах и консультациях — везде, где реплики принадлежат разным людям.
Как улучшить качество разделения спикеров
Почти всё, что помогает диаризации, делается до загрузки файла. Рекомендации ниже относятся именно к разделению голосов, а не к распознаванию текста вообще.
Что сделать ради точной разметки по спикерам
При записи
По возможности использовать отдельные микрофоны или отдельные дорожки для участников
Договориться не перебивать друг друга и дослушивать фразу до конца
Стараться не менять положение относительно микрофона в течение встречи: пересел или отошёл — и голос звучит иначе
При подготовке файла
Не сводить многодорожечную запись в моно: разделение по каналам ценнее, чем удобство одного файла
Не применять агрессивное шумоподавление: вместе с шумом оно стирает признаки голоса
Главный рычаг — сама запись. Отдельные дорожки решают задачу разделения ещё до алгоритма, а близкий и стабильно расположенный микрофон помогает больше любой постобработки.
Общие требования к звуку — тихое помещение без эха, близкий микрофон, оригинал файла вместо пересланной копии — помогают и разметке по спикерам; они собраны в статье «Как повысить точность распознавания речи: 12 проверенных способов».
Можно ли определить реальные имена участников автоматически
Прямой ответ: сама диаризация имён не определяет. Она различает голоса и присваивает им условные идентификаторы. Утверждение «Спикер 2 — это Иван Петров» — уже другая задача, и для неё нужна дополнительная информация.
Источников такой информации три, и все они внешние по отношению к анализу голоса. Первый — содержание самого разговора: если участники представились или обращаются друг к другу по имени, роль спикера можно вывести из смысла реплик. Второй — ручная подпись: человек знает, кто есть кто, и переименовывает спикеров в расшифровке. Третий — полноценная идентификация по заранее собранным образцам голоса, с согласием участников и отдельной процедурой.
В Speech Recognition работают первые два. После разделения по голосам отдельная модель предлагает роли участников по смыслу разговора — «Интервьюер», «Клиент», «Ведущий», — а поправить подпись или заменить её настоящим именем можно вручную в редакторе. Автоматическая роль остаётся предположением, сделанным по тексту, а не установлением личности по голосу: относиться к ней стоит как к любой другой части расшифровки — полезно, но проверяется.
Голос сам по себе не даёт имени. Имя появляется либо из содержания разговора, либо от человека, либо из отдельной системы идентификации с заранее собранными образцами.
Миф или правда
При диаризации — нет. Алгоритм сравнивает фрагменты одной записи между собой и группирует похожие. Он не знает, кому принадлежит голос, и не сопоставляет его ни с какой базой.
Не обязательно. Современные конвейеры диаризации оценивают число участников сами по структуре записи; в Speech Recognition указывать его заранее не нужно.
Хорошая запись сильно повышает шансы, но не гарантирует результат. Похожие голоса, короткие поддакивания и перебивания остаются сложными даже на чистом звуке.
Да. Когда каждый участник записан в свой канал, разделение по говорящим следует из самой записи, а не из оценки алгоритма.
Да. В доли секунды помещается слишком мало информации о голосе, поэтому такие вставки чаще всего и уходят не тому спикеру.
Разделение спикеров при автоматической транскрибации
При работе с интервью, встречами, звонками и другими записями нескольких участников транскрибация с диаризацией экономит самый неприятный этап: текст сразу разделён по спикерам, и не приходится вручную определять автора каждой реплики.
В Speech Recognition разделение спикеров выполняется автоматически: выбирать режим обработки не нужно, каждая запись обрабатывается полностью, а на странице задачи результат подписан как «По ролям + саммари». В готовой расшифровке реплики разных участников отображаются отдельно и связаны с соответствующими фрагментами аудио и тайм-кодами. Указывать число участников заранее не нужно: система оценивает его сама по записи. Отдельного лимита на количество спикеров в интерфейсе нет, но с ростом числа голосов разметку стоит просматривать внимательнее.
- Воспроизведение записи с переходом к нужному фрагменту прямо из текста.
- Тайм-коды у каждой реплики — спорное место можно переслушать за пару секунд.
- Поиск по расшифровке и редактор, в котором правятся и текст, и подписи спикеров.
- AI-саммари по итогам разговора и вопросы к содержимому записи в чате.
- Экспорт готового текста в PDF, DOCX, TXT и SRT.
Обработка идёт на собственных серверах в России: записи не передаются третьим лицам и не используются для обучения моделей, а исходные файлы удаляются через семь дней. Для голосовых записей это существенно: голос — такие же персональные данные, как и содержание разговора.
Что в итоге
Диаризация — это ответ на вопрос «кто и когда говорил». Она не распознаёт слова и не устанавливает личность: система сравнивает голоса внутри записи, группирует похожие фрагменты и присваивает группам условные метки. Совмещение этой разметки с распознанным текстом и даёт привычный протокол «кто что сказал».
Ошибается разделение предсказуемо. Похожие голоса склеиваются, короткие реплики уходят к соседу, перекрывающаяся речь распределяется приблизительно, а человек, сменивший место или устройство, может превратиться в двух спикеров. Всё это не поломка, а следствие того, что алгоритм работает только с тем звуком, который попал в файл.
Отсюда и практический вывод: большая часть качества разметки закладывается на записи — отдельными микрофонами, близким расположением и договорённостью не перебивать. Остальное решается быстрой вычиткой в редакторе, а как устроена работа с готовой расшифровкой, описано в руководстве пользователя.
Диаризация отвечает «здесь говорит другой человек», а не «здесь говорит конкретный человек». Понимание этой границы избавляет и от завышенных ожиданий, и от разочарования в технологии.
Частые вопросы
Это автоматическое разделение записи по говорящим: система определяет, в какие моменты звучит один человек, а в какие — другой, и размечает фрагменты как Спикер 1, Спикер 2 и так далее. Слова при этом распознаёт другая технология, а имена участников диаризация не устанавливает.
Транскрибация отвечает на вопрос «что было сказано» и превращает речь в текст. Диаризация отвечает на вопрос «кто и когда говорил» и размечает запись по участникам, не анализируя смысл реплик. Привычная расшифровка с подписями спикеров — результат совместной работы обеих технологий.
Обычная диаризация — нет: она различает голоса и присваивает им условные идентификаторы. Сопоставление голоса с конкретным человеком — отдельная задача, идентификация, и для неё нужны заранее собранные образцы голоса и согласие участников. Имя в расшифровке появляется либо от человека, либо из содержания самого разговора.
Голоса складываются в один сигнал, и голосовые признаки такого фрагмента не соответствуют ни одному из участников. Системе нужно дополнительно определить сам факт наложения, что удаётся не всегда. На таких участках реплики могут склеиваться, приписываться не тому спикеру, а более тихий участник — пропадать из разметки.
Чаще всего из-за похожих голосов: близкий тембр, схожая манера речи, одинаковые условия записи. Способствуют этому и общий микрофон, на котором все звучат одинаково приглушённо, шум и эхо, стирающие тонкие различия, а также короткие реплики, по которым сравнивать почти нечего.
Потому что изменилось звучание его голоса в записи: человек отошёл от микрофона, пересел, переключился с гарнитуры на громкую связь или перезвонил с другого устройства. Новые фрагменты плохо сопоставляются с прежними, и алгоритм заводит вторую группу. Такое разделение обычно начинается ровно с того момента, когда изменились условия записи.
Указывать число участников заранее не требуется — система оценивает его сама, а отдельного лимита на количество спикеров в интерфейсе Speech Recognition нет. Практический предел задаёт качество записи: чем больше голосов, коротких реплик и наложений, тем выше вероятность ошибок. Поэтому многолюдную встречу разделить можно, но разметку в таком файле стоит просматривать внимательнее, чем в диалоге двух человек.
Полезное по теме
Страницы сервиса, где разделение спикеров нужно чаще всего:
Попробуйте расшифровку с разделением спикеров
Реплики в расшифровке сразу разведены по участникам: видно, кто задал вопрос, кто ответил и на какой секунде это прозвучало. Каждую реплику можно переслушать по тайм-коду, найти поиском и поправить в редакторе вместе с подписью спикера, а число участников система оценивает сама. Первые 45 минут бесплатно.