Синтез речи, или text-to-speech, занимает среди задач машинного обучения особое место. Автоматическое распознавание речи можно проверить объективно: слово либо угадано, либо нет. С синтезом всё иначе, потому что судья здесь человеческое ухо, один из самых чувствительных измерительных приборов, созданных природой. Инженер, который десятилетиями строил рекомендательные системы или классификаторы изображений, при первом контакте с TTS испытывает лёгкое недоумение: модель выдаёт спектрограмму с аккуратной функцией потерь, а слушатель морщится и говорит, что голос "мёртвый". Пройти путь от металлического бормотания восьмидесятых до систем, которые сегодня клонируют любой голос по нескольким секундам записи, - значит пережить четыре- пять полных смен парадигмы. Эта статья проходит их все последовательно: формантный синтез, конкатенативная склейка, статистическое параметрическое моделирование, авторегрессионные нейросети и, наконец, диффузионные и энкодер-декодерные архитектуры современности.

Формантная эпоха и голос, ставший подписью учёного

Первый практически работоспособный подход был не записью и не статистикой, а физикой. Человеческий голосовой тракт представляет собой систему резонаторов: источник возбуждения - это либо периодические колебания голосовых связок (основной тон), либо турбулентный шум при смыкании артикуляционных органов, а полости глотки, рта и носа формируют спектральные пики, которые называются формантами. Гласный различается от гласного почти целиком положением первых двух-трёх формант. Формантный синтезатор воспроизводит эту физику напрямую: генератор импульсов с частотой основного тона, шумовой генератор, батарея полосовых фильтров и правила, по которым параметры фильтров меняются во времени, чтобы произнести нужные фонемы.

Изобилие правил и стало слабым местом метода. Каждую фонему и, что важнее, каждый переход между фонемами приходилось описывать вручную экспертами-фонетистами. Коартикуляция, взаимное влияние соседних звуков, не сводится к линейной интерполяции целей; правил требовались тысячи, и поведение системы на редких сочетаниях оказывалось непредсказуемым. Тем не менее коммерческие реализации добились замечательного успеха в своих рамках. Чипы Votrax в начале восьмидесятых оживили аркадные автоматы и детские игрушки, а система DECtalk, построенная на формантной модели Денниса Клатта, стала индустриальным стандартом читающих машин для незрячих.

Именно DECtalk получил, пожалуй, самый известный персональный голос в истории техники. Выдающийся физик-теоретик, почти всю профессиональную жизнь работавший с тяжёлым нейромышечным заболеванием, общался с миром через синтезатор, и когда производители предлагали ему перейти на современный естественный голос, он отказывался: механический тембр давно стал частью его личности, его визитной карточкой, которую узнавали слушатели по всему миру. Этот случай до сих пор остаётся лучшей иллюстрацией того, что голос - не обёртка содержания, а элемент идентичности. Характерное "роботизированное" звучание формантных систем, смонотонная интонация, жёсткая артикуляция шумовых согласных и характерные свисты на стыках правил сегодня воспринимаются как эстетика эпохи, но тогда это был предел доступной науки.

Конкатенативный синтез и проблема швов

Следующий большой шаг родился из простой мысли: раз людям не удаётся формализовать речь правилами, нужно взять саму речь и склеивать её из готовых кусочков. Конкатенативный синтез использует записи живого диктора, нарезанные на единицы - чаще всего дифоны, фрагменты от середины одной фонемы до середины следующей. Дифон удачно выбран потому, что в середине фонемы спектр относительно стабилен, а вся сложная коартикуляционная динамика попадает внутрь записанного фрагмента. Для полного покрытия языка достаточно конечного набора дифонов, и синтез сводится к поиску: для данной цепочки фонем найти в базе последовательность единиц, которая минимизирует две цены - цену склейки на каждом стыке и цену отличия длительности и высоты тона записанного куска от требуемых.

На практике быстро выяснилось, что дифонов одного на фонемную пару мало: одна и та же пара звучит по-разному в начале слова, под ударением, в быстрой и в медленной речи. Базы выросли до многих часов студийных записей, единицы стали выбираться жадным поиском по огромному каталогу, появились полуслоговые и полнословные варианты. Но коренной дефект остался неизлечимым: на стыке двух записей спектральные огибающие и фазы не совпадают никогда. Алгоритмы выравнивания тона и энергии, такие как PSOLA и его потомки, сглаживают проблему, однако ухо безошибочно ловит микроскопические скачки тембра - слышны стыки. Синтез при этом звучит очень естественно фрагментами, но "дыхание швов" разрушает ощущение цельного человека, особенно на длинных фразах и эмоциональном материале. Дополнительная цена скрывалась в коммуникативной вероятности: базу записывал один диктор, и каждый новый голос означал месяцы студийной работы.

Прозодия как отдельная наука внутри синтеза

Параллельно с выбором звукового материала зрело понимание, что естественность речи наполовину определяется не тембром, а прозодией: ритмом, паузами и мелодией фразы. Любая TTS-система классического устройства решает две задачи помимо генерации тембра - предсказание длительности каждой фонемы и предсказание контура основной тона, траектории высоты голоса. Ранние реализации опирались на деревья решений и правила: длительность зависит от позиции в слове, ударности, соседних фонем, границ интонационных фраз; тон следует акцентным моделям, где утверждение, вопрос и перечисление имеют характерные мелодические шаблоны.

Заманчиво считать прозодию второстепенной надстройкой, но эксперименты показывают обратное. Если взять идеально записанный голос диктора и насильно подставить длительности и высоту тона из другой фразы, результат звучит чуждо даже при безупречной артикуляции. Напротив, грубо синтезированная волна с правильной мелодией и ритмом воспринимается как внятная речь. Именно поэтому статистические модели длительностей и интонаций долгое время были главным источником улучшений качества, и именно поэтому современные нейросетевые системы либо моделируют прозодию неявно в скрытых представлениях, либо оставляют отдельные предикторы длительности, тона и энергии, как это сделано в семействе FastSpeech: явное управление длительностью даёт прозрачный рычаг скорости речи без искажения тембра.

Статистическое параметрическое синтезе и эра скрытых марковских моделей

Между конкатенативной эпохой и нейросетевой лежит период, который часто недооценивают, - statistical parametric speech synthesis, обычно на базе скрытых марковских моделей. Идея радикальна: отказаться от хранения аудио вообще. Корпус записей диктора преобразуется в поток параметров - спектральные огибающие, апериодичность, основной тон с динамическими признаками первой и второй производных - а HMM обучается предсказывать распределение параметров для каждой фонемы в контексте. На этапе синтеза деревья контекстных решений выбирают распределения, генератор параметров строит траекторию с учётом ограничений гладкости, и вокодер превращает параметры обратно в звук.

Плюсы подхода впечатляли даже скептиков. Модель занимала мегабайты вместо гигабайт конкатенативной базы, работала на встраиваемых платформах, позволяла усреднять голоса, адаптироваться к новому диктору на десятках минут записей, плавно менять пол, возраст и степень выразительности. Но был и характерный, ни с чем не сравнимый дефект: усреднённое статистическое предсказание сглаживает микродетали спектра, и речь приобретает глухое, "ворчанное" качество - оно внятно, но явно синтетично. Эпоха HMM выдала ценнейший урок: метрика средней квадратичной ошибки на параметрах не совпадает с тем, что слышит человек. Именно этот разрыв подготовил почву для перехода к генеративным моделям, оптимизируемым непосредственно на правдоподобие звука.

WaveNet и поворот к нейросетевой генерации волны

Публикация WaveNet в 2016 году стала водоразделом, потому что впервые нейросеть генерировала не параметры для вокодера, а саму звуковую волну, сэмпл за сэмплом. Архитектура строится на разрежённых причинных свёртках с экспоненциально растущей дилатацией, что даёт рецептивное поле в тысячи сэмплов, и на категориальном предсказании следующего квантованного сэмпла по всей предыстории. Авторегрессионная природа модели оказалась одновременно её силой и её ценой: слышимое качество подскочило до уровня, который слушатели уверенно путали с записью человека, но генерация 16 000 сэмплов в секунду последовательно делала вывод эталонной модели непрактично медленным.

Индустрия ответила волной инженерных работ по ускорению. Parallel WaveNet перенесла генерацию в схему дистилляции "учитель-ученик": большая авторегрессионная сеть обучала быстрого студента с параллельным потоком сэмплирования, ускоряя вывод на три порядка при сохранении качества. Параллельно выросли невокодерные линейки - WaveRNN с суррогатной структурой грубого и тонкого уровней, а затем целое созвездие нейросетевых вокодеров на генеративно-состязательном обучении, где дискриминаторы смотрят на волну на разных масштабах. Практический итог знаменателен: задача "превратить спектрограмму в звук" перестала быть узким местом, и центр сложности сместился обратно в акустическую модель, предсказывающую спектр из текста.

Энкодер-декодерные архитектуры, диффузия и клонирование голоса

Современный стек TTS обычно устроен в два этапа. Сначала акустическая модель отображает фонемы в мел-спектрограмму, затем нейровокодер синтезирует волну. Энкодер-декодерные модели с механизмом внимания, начиная с Tacotron, научились самостоятельно выравнивать текст и речь, но внимание иногда "спотыкается" - повторяет фразы или пропускает слова. Неавторегрессионные системы заменили мягкое внимание жёсткими длительностями: предиктор говорит, сколько кадров держать каждую фонему, и декодер выдаёт всю спектрограмму параллельно, что даёт стабильность и скорость, критичные для продакшена.

Последний поворот связан с диффузионными и поточными генеративными моделями. Вместо авторегрессии по времени диффузионный декодер постепенно очищает шум до спектрограммы или прямо до волны, а вероятностные потоки учат отображение из простого распределения в распределение человеческой речи; оба семейства лучше захватывают многомодальность - одна и та же фраза правомерно звучит десятком способов, и модель это распределение хранит, а не усредняет. Вершина современной ветки - нулевое и малопримерное клонирование голоса: системы, обученные на сотнях тысяч часов чужих голосов, переносят тембр, манеру и акцент говорящего, услышав его референс длиной в несколько секунд, без единого шага дообучения. То, что в эпоху конкатенации требовало месяцев студии, теперь умещается в короткую запись и секунды вычислений.

Лингвистический фронтенд, где текст становится произношением

Ни одна нейросеть не спасёт систему, которая не понимает, что именно ей прочитать. Лингвистический фронтенд - незаметная, но ответственная половина любого TTS, и начинается он с нормализации текста. Строка "1990 г." должна стать "тысяча девятьсот девяностый год", а не "один девять девять ноль"; даты, валюты, аббревиатуры, ординалы, диапазоны и web-адреса подчиняются собственным наборам правил, по-разному склоняющимся в зависимости от контекста: "годишны" в одном месте и "годом" в другом. Дальше фонемизация переводит орфографию в последовательность звуков, что для английского требует словарей и графемно-фонемных моделей, а для русского - точной расстановки ударения, от которой зависит редукция гласных и смысл.

Особый камень преткновения - омографы: "замок" с ударением на первом слоге и "замок" с ударением на последнем, "мука" и "мука", "атлас" и "атлас". Разрешаются они только контекстом - синтаксическим разбором, именованными сущностями, смысловыми эмбеддингами, и ошибка здесь слышна мгновенно, потому что слушатель прощает шумовой артефакт, но не прощает неправильное слово. Современные фронтенды всё чаще сращиваются с нейросетевой частью: большая языковая модель подсказывает тонкие чтения, а межъязыковые фонетические алфавиты унифицируют конвейер для многоязычных систем. Тем ценнее сохранённая классическая структура расчёта: нормализация, сегментация на фразы, фонемы, ударения, прозодические границы - каждый шаг сам по себе невелик, а совокупная цена ошибки растёт по цепочке.

Слух, метрики и социальное измерение синтеза

Почему речь оказалась самым сложным сигналом для синтеза из всего, с чем работали инженеры машинного обучения? Ответ лежит в биологии восприятия. Человеческий слух эволюционно заточен именно под анализ голоса: он улавливает фазовые и временные микроошибки порядка миллисекунд, различает сотни микровариантов тембра, чуток к дыханию, паузам, влажности звучания, крошечным дрожаниям основного тона. Картинку с артефактом сжатия зритель проглядит, звонкий голос робота с гладкой спектрограммой слушатель распознает мгновенно. Плюс речь несёт двухуровневую нагрузку: одновременно лингвистическое содержание и паралингвистику - настроение, уверенность, иронию, вовлечение.

Из-за этого объективные метрики в TTS исторически слабы. Промышленным стандартом остаётся субъективная оценка MOS, mean opinion score: слушатели ставят баллы от одного до пяти, результаты усредняются с доверительными интервалами, параллельно проводятся сравнительные тесты смарт-пар и тесты внятности на семантически непредсказуемых предложениях. MOS дорог, медленен, но только он честно отвечает на главный вопрос.

  1. Наконец, у синтеза речи есть измерение, которое нельзя измерить баллами. Для незрячих и слабовидящих пользователей TTS - буквально глаза: экранный диктор озвучивает интерфейсы, документы и письма, и от скорости, внятности на высоких темпах чтения и цены голоса зависит доступ к образованию и работе. История с формантным голосом физика показывает обратную связь: голос синтезатора становится частью человека, и качество этой техники - вопрос не косметики, а достоинства и независимости миллионов людей. Именно поэтому каждая смена парадигмы, описанная выше, была не только научным событием, но и шагом к тому, чтобы машинный голос перестал быть преградой и окончательно стал инструментом.

Что дальше для синтезатора, который звучит как человек

Сегодняшние системы решают задачи, которые десять лет назад казались фантастикой: перенос эмоции с аудиореференса, многоязычный один голос, управление стилем текстовой инструкцией, диалоговая речь с естественными паузами и вдохами. Нерешённым остаётся длинная дистанция - согласованная эмоциональная арка на часе аудиокниги, тонкая ирония, сценическое многоголосие. Но вектор ясен: синтез речи идёт к тому, чтобы стать рядовой утилитой, как сегодня рядовой стало распознавание речи, - и тогда вклад формантных правил, дифонных баз и скрытых марковских моделей будет выглядеть так же, как выглядят фундаменты под небоскрёбом: невидимые, но несущие всё здание.