Термин

Синтез речи (TTS)

Технология text-to-speech: превращает написанный текст в звучащую речь — синтетическим голосом или клонированным голосом конкретного человека. Экономит время на озвучку уроков и роликов без студии и диктора.

Что это

TTS, от английского text-to-speech, — обратная сторона транскрибации: не речь в текст, а текст в речь. Бывает в двух вариантах: обобщённый синтетический голос без привязки к конкретному человеку и клонированный голос — обученный на записях реального человека так, чтобы звучать похоже на него.

Где это используют в производстве контента

Озвучка уроков без записи в студии, аудиоверсии статей для тех, кто предпочитает слушать, быстрая локализация ролика на другой язык без найма диктора. Правки в тексте не требуют новой записи голоса — достаточно перегенерировать озвучку.

Почему это важно вам

Клонирование голоса конкретного эксперта — мощный инструмент, но требует его явного согласия на использование именно так, а не иначе: чей голос это на самом деле, аудитория должна понимать. Технология синтеза речи та же самая, что лежит в основе поддельных голосовых сообщений мошенников (дипфейк) — граница между легитимной озвучкой и подделкой проходит не через технологию, а через согласие и раскрытие того, что голос синтетический.