Генератор голосов на базе ИИ для персонажей: практическое руководство

Создайте полный набор различных и последовательных голосов на базе ИИ для персонажей, используя TTS, формирование высоты и форманты, а также цепочки эффектов. Практическое руководство для создателей.

Генератор голосов на базе ИИ для персонажей: практическое руководство

Генератор голосов на базе ИИ для персонажей - это самый быстрый способ для одного создателя дать целому ансамблю различные и согласованные голоса без найма комнаты полной актеров. Независимо от того, разрабатываете ли вы игру, анимируете короткий фильм, озвучиваете аудиокнигу, ведете кампанию настольной ролевой игры или управляете ансамблем VTuber, задача одна и та же: каждый персонаж должен звучать как конкретный человек, и должен звучать как этот же самый человек каждый раз. Это руководство охватывает то, что на самом деле делает генератор голосов персонажа, как разработать достоверный ансамбль и как пошагово создавать переиспользуемые предустановки персонажей.


TL;DR

  • Генератор голосов персонажа создает различные и повторяемые голоса для каждого члена актерского состава, используя text-to-speech, формирование высоты и форманты, цепочки эффектов или преобразование собственного голоса.
  • Различные персонажи создаются путем варьирования высоты, форманты, ритма, нейтрального акцента тембра и эффектов, а не перемещением одного ползунка.
  • Сохранение каждого персонажа как именованной предустановки - это то, что сохраняет голос согласованным в сеансах, эпизодах и месяцах.
  • Нечеловеческие персонажи (роботы, монстры, привидения) создаются путем наслоения эффектов, таких как кольцевая модуляция, ревербераци и дисторшн, на базовый голос.
  • VoxBooster запускает локальную модель на устройстве на Windows 10/11, поэтому вы можете генерировать в автономном режиме, маршрутизировать голоса на виртуальный микрофон в реальном времени или экспортировать аудио для постобработки.
  • Создавайте только оригинальные или согласованные голоса; никогда не клонируйте реального человека или защищенного персонажа, чтобы выдать себя за него.

Что делает генератор голосов персонажа?

Генератор голосов персонажа - это программное обеспечение, которое создает один или несколько различных и согласованных голосов, предназначенных для представления отдельных членов вымышленного ансамбля, либо путем синтеза речи из текста, либо путем преобразования существующего голоса, а затем формирования результата с помощью высоты, форманты, ритма и эффектов. Вместо одного голоса рассказчика он позволяет вам определить героя, злодея, помощника и рассказчика как отдельные предустановки, каждая со своим тембром. Генератор обрабатывает аудио; вы обрабатываете решения о кастинге.

Это различие важно, потому что две сложные части работы персонажа - это разнообразие и согласованность. Разнообразие означает, что каждый персонаж сразу различим на слух, даже в быстрой сцене диалога туда-сюда. Согласованность означает, что злодей в эпизоде один звучит идентично злодею в эпизоде двенадцать, записанному месяцами позже. Хороший генератор голосов персонажа решает оба, предоставляя вам независимый контроль над параметрами, которые определяют голос, и позволяя вам сохранять каждую комбинацию как восстанавливаемую предустановку.

TTS, преобразование голоса и эффекты: три способа построения голоса

Существует три основных метода, которые использует генератор голосов персонажа, и лучшие рабочие процессы сочетают все три.

Первый - text-to-speech. Вы вводите строку, выбираете базовый голос, и инструмент синтезирует говорящее аудио. Это идеально, когда вы не выступаете вживую, например, пишете диалоги для игры или повествование для анимации. Масштабируется без усилий на сотни строк.

Второй - преобразование голоса, управляемое клонированием голоса на базе ИИ с локальной моделью на устройстве. Здесь вы говорите или записываете строку, и инструмент переренерирует ее в тембре целевого голоса, сохраняя вашу игру, тайминг и эмоцию. Поскольку ваша игра сохраняется, преобразованные строки часто ощущаются более живыми, чем чистый синтез, поэтому исполнители предпочитают преобразование для главных персонажей.

Третий - формирование эффектов. Сдвиг высоты, регулировка форманты, EQ, ревербераци, дисторшн и модуляция преобразуют любую базу, с которой вы начинаете. Эффекты - это то, что превращает обычный голос в робота, гиганта или привидение, и это то, что разделяет двух персонажей, которые имеют одинаковый базовый голос.

Как разработать ансамбль, который звучит отчетливо

Разработка набора голосов персонажа на базе ИИ - это проблема дизайна, а не случайная. Если вы просто перемещаете высоту каждого персонажа вверх или вниз, они все будут звучать как один голос на разных скоростях. Цель состоит в том, чтобы переместить несколько независимых размеров одновременно, чтобы ни два персонажа не перекрывались на каждой оси.

Начните с высоты, фундаментальной частоты. Это ваша самая грубая контроль: глубокий антагонист против нервного помощника. Но только высота слаба, потому что слушатель быстро слышит, что это один голос, ускоренный или замедленный.

Добавьте форманты, резонанс вокального тракта, который указывает размер тела и форму головы независимо от высоты. Сдвиг форманты вверх предполагает меньшего говорящего; смещение вниз предполагает большего. Два персонажа с одинаковой высотой, но противоположными формантами читаются как совершенно разные люди. Форманта - это наиболее недостаточно используемая отдельная контроль в работе персонажа.

Варьируйте ритм и кадансию. Нервный персонаж говорит короткими быстрыми взрывами; мудрый старейшина говорит медленно с длинными паузами. В синтезе это параметр скорости и паузы; при преобразовании это происходит из вашей собственной игры. Кадансия часто более узнаваема, чем тембр.

Предпочитайте нейтральные акцентом тембры в качестве базы, когда вы планируете позднее перевести или локализовать, затем добавьте характер через другие размеры. Нейтральная база путешествует между языками намного лучше, чем сильный региональный акцент, который может конфликтовать, когда строка дублируется.

Наконец, зарезервируйте эффекты для персонажей, которые их нужны. Не каждый персонаж должен иметь ревербераци или дисторшн; когда у всех есть эффект, никто не выделяется. Сохраняйте эффекты для нечеловеческих членов вашего ансамбля и позвольте человеческим персонажам определяться только высотой, формантой и ритмом.

От архетипа персонажа к рецепту голоса

Таблица ниже отображает общие архетипы персонажей на начальный рецепт. Рассматривайте их как направления, а не фиксированные предустановки, и регулируйте по вкусу, когда вы их слышите в контексте.

Архетип персонажаОснованиеВысотаФормантаРитмЭффекты
Героический лидерВаш голос, преобразованныйНейтральныйНемного вышеТвердый, уверенныйЛегкий прирост присутствия EQ
Угрожающий злодейГлубокий голос TTSВниз 3-5 stВнизМедленно, намеренноТонкая низкая ревербераци
Комический помощникЯркий голос TTSВверх 3-4 stВверхБыстро, отрывистыйЛегкое сжатие
Мудрый старейшинаТеплый базовый голосВниз 1-2 stНейтральныйМедленно, длинные паузыНежное тепло EQ
Детский персонажЯркий базовый голосВверх 4-6 stВверх сильноПрыгучийНикакой
Робот / ИИЛюбая основаНейтральныйНейтральныйЧетный, метрономКольцевая модуляция, EQ
Монстр / гигантГлубокий базовый голосВниз 6-8 stВниз сильноМедленно, рычаниеТяжелая ревербераци, дисторшн
Привидение / духМягкий базовый голосВниз 1-2 stНемного внизПарящий, дыханиеДлинная ревербераци, тонкая задержка

Варианты использования для голосов персонажей

Один и тот же набор инструментов служит удивительно широкому кругу создателей.

В разработке игр независимые команды озвучивают целые колоды NPC без бюджета на кастинг. Один разработчик может генерировать лаи, деревья диалогов и дразнилки босса, давая каждой фракции последовательную вокальную идентичность через сохраненные предустановки.

В анимации голоса персонажей могут быть созданы из сценария во время раскадровки и уточнены позже, позволяя небольшой студии услышать тайминг и игру перед фиксацией окончательной записи.

Для аудиокниг рассказчик может озвучить полный ансамбль персонажей отчетливо, так что слушатель всегда знает, кто говорит, без метки диалога, и каждый персонаж остается последовательным во всей длинной книге.

В настольных ролевых играх мастер игры может назначить предустановку каждому повторяющемуся NPC и чередовать их в реальном времени во время сеанса, перенаправляя прямо в канал голоса Discord, чтобы игроки слышали злодея своим собственным голосом злодея.

Для ансамблей VTuber один оператор может управлять несколькими персонажами на экране, каждый со своей предустановкой, и чередовать их в реальном времени, позволяя одному потоковому каналу ставить целый ансамбль.

Как построить несколько предустановок персонажей в VoxBooster

Вот практический, повторяемый рабочий процесс для создания ансамбля голосов персонажа в VoxBooster на Windows 10 или 11.

  1. Установите VoxBooster и начните пробную версию. Загрузите приложение и запустите полную 3-дневную пробную версию. Все работает локально на вашем ПК через локальную модель на устройстве, поэтому интернет-соединение не требуется для создания или преобразования голосов.

  2. Выберите основание для каждого персонажа. Для персонажей, которых вы будете исполнять вживую, планируйте использовать преобразование голоса, чтобы ваша игра прошла. Для персонажей с фиксированными сценарными строками выберите базовый голос text-to-speech. Вы можете смешивать оба подхода внутри одного проекта.

  3. Создайте первую предустановку персонажа. Выберите или преобразуйте в выбранный базовый голос, затем установите его высоту и форманты в соответствии с вашим рецептом. Начните консервативно; экстремальные значения сложнее сохранить понятным. Слушайте тестовую строку перед продолжением.

  4. Добавьте цепочку эффектов, если персонаж нуждается в ней. Для нечеловеческих персонажей наслоите эффекты, такие как ревербераци, дисторшн или кольцевая модуляция, на параметры высоты и форманты. Для человеческих персонажей обычно оставляйте эффекты выключенными и позволяйте высоте, формантам и ритму определять их.

  5. Сохраните предустановку с четким названием. Назовите его в честь персонажа, а не параметров, например Злодей-Каэль вместо Глубокий-Ревербераци-1. Описательное название - это то, что делает голос восстанавливаемым и последовательным месяцами позже.

  6. Повторите для остальной части ансамбля. Постройте каждого оставшегося персонажа как его собственную предустановку, намеренно варьируя по меньшей мере два измерения от каждого другого персонажа, так чтобы никакие два не перекрывались. Прослушайте новых персонажей в сравнении с существующими в короткой смешанной диалоговой сцене, чтобы подтвердить, что они различимы.

  7. Маршрутизируйте на виртуальный микрофон для использования в реальном времени. Чтобы исполнять персонажей в реальном времени в Discord, OBS или игре, установите виртуальный микрофон VoxBooster как устройство ввода в этом приложении. Переключение предустановок переключает персонажа, которого слышит ваша аудитория в реальном времени.

  8. Экспортируйте аудио для постобработки. Для игр, анимации или аудиокниг генерируйте или преобразовывайте свои строки и экспортируйте аудиофайлы. Поскольку каждый персонаж является сохраненной предустановкой, вы можете позже отрисовать новые строки, которые точно совпадают с предыдущими записями.

Сохранение согласованности голосов на протяжении проекта

Согласованность - это тихая суперсила предустановленной генерации персонажей. Актер озвучивания, исполняющий повторяющуюся роль, должен помнить и воспроизводить персонажа на слух, который уходит в течение долгого проекта. Сохраненная предустановка не уходит. Восстановление ее воспроизводит идентичный голос, что именно требует эпизодическое содержание.

Чтобы защитить согласованность, ведите краткий документ проекта, в котором перечислены каждый персонаж, название его предустановки и описание его предполагаемого звучания в одну строку. Когда вы вернетесь к проекту после перерыва, этот документ позволит вам перезагрузить правильную предустановку сразу же, чтобы не пытаться восстановить голос из памяти. Для персонажей преобразования голоса попытайтесь записать последующие строки в подобной окружающей среде и на подобном расстоянии от микрофона, чтобы вход в модель оставался сравнимым.

Заметка об этике и согласии

Генерация голоса персонажа мощна, и с этим приходит ответственность. Ясный и безопасный путь - создавать оригинальные, выдуманные голоса персонажей или использовать собственный голос в качестве источника для преобразования. Оба полностью законны и это то, что построено это руководство вокруг.

То, что вы не должны делать - это клонировать голос реального человека или воспроизводить защищенного авторским правом узнаваемого персонажа, чтобы выдать себя за него без согласия. Выдача синтетического голоса за конкретного реального человека или защищенного персонажа, на который у вас нет прав, может нанести реальный ущерб и пересечь правовые границы вокруг подобия и авторских прав. Разрабатывайте оригинальные тембры, используйте согласованные исходные голоса и держите своих персонажей своими. Делая это, вы защищаете людей вокруг вас и держите свои проекты на безопасной почве.

FAQ

Что такое генератор голосов на базе ИИ для персонажей? Это программное обеспечение, которое создает различные и повторяемые голоса для каждого члена актерского состава. Вы генерируете речь из текста или преобразуете собственный голос, затем формируете высоту, форманты, ритм и эффекты, чтобы каждый персонаж имел узнаваемый тембр. Сохранение предустановок позволяет воспроизводить каждый голос последовательно на протяжении всего проекта.

Как сделать каждого персонажа звучащим по-разному? Варьируйте базовые параметры, а не только высоту. Комбинируйте базовый голос TTS или преобразованный тембр с определенным смещением высоты, сдвигом форманты, ритмом и легкими эффектами. Два персонажа могут обладать одним базовым голосом, но звучать совершенно иначе, когда отличаются форманты и кадансия. Сохраняйте каждую комбинацию как именованную предустановку.

Могу ли я сохранять голос персонажа последовательным в течение многих сеансов? Да. Ключ заключается в сохранении каждого персонажа как именованной предустановки, которая хранит его голос, высоту, форманты и цепочку эффектов. Восстановление этой предустановки воспроизводит точно такой же тембр неделями позже, что важно для эпизодических игр, сериалов и аудиокниг, где персонаж должен звучать одинаково каждый раз.

Как я создаю голоса для нечеловеческих или чудовищных персонажей? Начните с базового голоса, затем примените более крупные сдвиги форманты, добавьте эффекты, такие как ревербераци, дисторшн, кольцевая модуляция или многоуровневая высота, и более медленный или прерывистый ритм. Роботы подходят для металлической кольцевой модуляции и точного тайминга, в то время как монстры подходят для глубокой высоты, нисходящей форманты и тяжелой реверберации для размера.

Законно ли создавать голоса для моих персонажей? Создание оригинальных, выдуманных голосов персонажей - это нормально, и использование собственного голоса в качестве основы - тоже нормально. Проблемы возникают только тогда, когда вы клонируете голос реального человека или защищенного авторским правом узнаваемого персонажа, чтобы выдать себя за него без согласия. Разрабатывайте оригинальные тембры или используйте согласованные исходные голоса, и вы останетесь на безопасном уровне.

Нужна ли мне интернет-соединение для создания голосов персонажей? Нет с VoxBooster. Он запускает локальную модель на устройстве и обрабатывает аудио непосредственно на вашем компьютере Windows 10 или 11, поэтому создание голосов и преобразование в реальном времени работают в автономном режиме. Это также сохраняет ваши скрипты и записи в приватности, так как ничто не загружается на удаленный сервер для обработки.

Могу ли я использовать эти голоса персонажей в прямом эфире и в записях? Оба. Вы можете маршрутизировать предустановку персонажа на виртуальный микрофон, чтобы он питал Discord, OBS или игру в реальном времени для сеансов настольной ролевой игры и ансамблей VTuber. Вы также можете генерировать или преобразовывать строки из текста и экспортировать аудиофайлы для анимации, игр и производства аудиокниг.

Дайте Своему Целому Ансамблю Голос

Достоверный ансамбль находится в пределах досягаемости одного создателя, когда ваши инструменты обрабатывают разнообразие и согласованность. Разработайте каждого персонажа путем независимого перемещения высоты, форманты, ритма и эффектов, сохраняйте каждый голос как именованную предустановку и маршрутизируйте их на виртуальный микрофон для работы в реальном времени или экспортируйте их для постобработки. VoxBooster делает все это локально на Windows 10 и 11, без драйвера ядра и с полной 3-дневной пробной версией. Загрузите VoxBooster, чтобы начать создавать своих персонажей, или ознакомьтесь с опциями цена для пожизненной лицензии и просмотра дополнительных руководств в блоге.

Попробуй VoxBooster — 3 дня бесплатно.

Клонирование голоса в реальном времени, саундборд и эффекты — везде, где ты говоришь.

  • Без карты
  • ~30 мс задержки
  • Discord · Teams · OBS
Попробовать 3 дня бесплатно