Голосовой человек¶
Голосовой человек — термин, обозначающий человека, чья речь воспроизводится синтезом голоса на основе машинного обучения, либо, в более широком смысле, человека, общающегося с компьютером голосом. В русскоязычном интернет-дискурсе выражение «голосовой человек» чаще всего используется как калька с англ. voice human — так называют оператора контакт-центра, который разговаривает с клиентом голосом (в отличие от чат-оператора или бота). В техническом контексте термин связан с технологиями синтеза речи (TTS) и распознавания речи (ASR).
¶Определение и контексты употребления
Термин не имеет единого нормативного определения и употребляется в нескольких значениях:
- Контакт-центры. «Голосовой человек» — оператор, ведущий голосовые переговоры с клиентом по телефону или через интернет-телефонию. В индустрии контакт-центров его противопоставляют «текстовому» оператору (чату) и автоматическим голосовым роботам (IVR, виртуальным ассистентам).
- Синтез речи. Человек, чей голос оцифрован и используется для обучения нейросетевой модели синтеза речи. В частности, так называют дикторов, чьи записи легли в базы голосовых моделей (например, нейросети «Сбер», «Яндекса», «Тинькофф» и других российских компаний).
- Распознавание речи. Человек, чья речь служит обучающим материалом для систем распознавания голоса.
¶Голосовой оператор в контакт-центрах
В России рынок контакт-центров сформировался в 2000-е годы и к 2020-м оценивался в сотни миллиардов рублей. Крупнейшие операторы — «МТС», «Ростелеком», «Сбер», «Тинькофф», «Альфа-Банк», «ВТБ», а также специализированные аутсорсинговые компании. Голосовой оператор выполняет функции, которые автоматизация пока не закрывает полностью: консультации, продажи, работа с претензиями, выявление эмоционального состояния собеседника.
Ключевые характеристики профессии:
- Работа в режиме телефонного разговора, часто с использованием скриптов (сценариев диалога).
- Контроль качества: разговоры записываются и оцениваются по чек-листам.
- Психологическая нагрузка: конфликтные обращения, высокий темп, обязательные паузы и нормативы по времени разговора.
С развитием нейросетевых технологий в 2023—2024 годах ряд российских компаний начал внедрять голосовых роботов, способных вести диалог естественным голосом. Это изменило роль оператора: часть рутинных обращений (уточнение баланса, запись на приём) переходит к автоматическим системам, а человек остаётся на сложных и конфликтных сценариях.
¶Голосовой человек и синтез речи
В нейросетевом синтезе речи «голосовым человеком» называют диктора-источник. Технология строится так:
- Специалист записывает несколько часов речи (обычно 10—30 часов) в студийных условиях.
- Записи размечаются: текст привязывается к аудио с точностью до фонемы.
- На размеченных данных обучается модель (Tacotron 2, VITS, нейросети на основе трансформеров), которая затем синтезирует новую речь голосом диктора.
В России подобные технологии развивают «Сбер» (голоса для виртуального ассистента «Салют»), «Яндекс» (голоса Алисы), «Тинькофф», «Нетология» и ряд стартапов. Правовой статус голоса в России пока не урегулирован отдельным законом: голос не признаётся объектом авторского права, но его использование без согласия человека может квалифицироваться как нарушение смежных прав или как мошенничество (например, при «краже голоса» для телефонного обмана родственников).
¶Распознавание речи
В системах ASR «голосовой человек» — источник обучающих данных. Для русского языка крупнейшие корпуса — «Сбербанк-Спич» (SberSpeech), «Яндекс.Речь», а также открытые датасеты Common Voice. Качество распознавания оценивается метрикой WER (Word Error Rate); для современных русскоязычных моделей WER на чистой речи достигает 5—7 %.
¶Правовые и этические вопросы
Использование голоса человека без его согласия вызывает ряд правовых проблем:
- Кража голоса (voice cloning). В России зафиксированы случаи мошенничества, когда с помощью нескольких секунд аудио из соцсетей синтезировали голос родственника и требовали денег. МВД и ЦБ РФ неоднократно предупреждали граждан об этом виде мошенничества.
- Трудовое право. Диктор, чей голос используется для обучения модели, фактически отчуждает «голосовой материал» на длительный срок; типовые договоры часто не предусматривают роялти за повторное использование.
- Персональные данные. Голос является биометрическим персональным данными; его обработка в России подпадает под 152-ФЗ «О персональных данных».
¶Интересные факты
- В 2023 году в России обсуждалась инициатива обязательной маркировки синтезированной речи — аналог европейского AI Act и китайских правил для deepfake.
- Некоторые российские библиотеки и архивы оцифровывают голоса известных дикторов (например, дикторов Центрального телевидения) для восстановления исторических записей.
Источники:
- «Сбербанк-Спич»: русскоязычный корпус речи
- Common Voice (Mozilla Foundation)
- Публичные материалы о нейросетевом синтезе речи (Сбер, Яндекс)
- Материалы МВД РФ и ЦБ РФ о телефонном мошенничестве
- 152-ФЗ «О персональных данных»