Шумоподавление на основе ИИ обещает то, чего старые инструменты никогда не могли: снизить фоновый шум даже во время разговора, а не только в тишине. В течение десятилетий очистка аудио означала либо отключение тихих частей, либо вычитание фиксированного отпечатка шума, и оба подхода провалились в тот момент, когда ваша комната стала непредсказуемой. В этом руководстве объясняется простым языком, как на самом деле работает шумоподавление на основе ИИ, почему оно превосходит классические методы, где оно все еще не работает, и как выбрать правильный подход для записи, редактирования, вызовов или прямой трансляции. Без ажиотажа, без черного ящика, только механика.
TL;DR
- Старые методы: noise gate отключает аудио ниже порога громкости; спектральное вычитание делает выборку шума и вычитает его отпечаток. Оба оставляют артефакты.
- Шумоподавление на основе ИИ обучается разделять речь от всего остального, поэтому снижает шум даже во время разговора и обобщает на звуки, которые никогда не пробовала.
- Это обобщение дает вам щелчки клавиш, сирены и другие голоса, подавляемые, а не только постоянный гул.
- Живое против автономного - это ключевое разделение: шумоподавление ИИ в реальном времени работает с жестким бюджетом задержки и мягче; автономная очистка может быть тяжелее.
- Реальные ограничения: окрашивание голоса, подводный артефакт при чрезмерном сжатии и полный отказ при удалении музыки (это другая задача).
- Для чистого аудио, выходящего в прямом эфире, подавление шума в реальном времени VoxBooster - это опция; выбирайте инструмент по сценарию, а не по ажиотажу.
Что такое шумоподавление на основе ИИ?
Шумоподавление на основе ИИ - это очистка аудио, выполняемая моделью, обученной отличать человеческую речь от всех остальных звуков. Вместо отключения тихих участков или вычитания фиксированного профиля шума, она выучила форму самого голоса, поэтому может снижать фоновый шум даже во время разговора, а не только в паузах между словами.
Этого одного различия, разделения по содержанию вместо по громкости, достаточно для всей истории. Все остальное в этой статье - следствие этого. Как только инструмент понимает, как выглядит голос, ему больше не важно, громкий ли шум или тихий, стабильный или внезапный, проверенный или совершенно новый. Он просто пытается сохранить голос и избавиться от остального. Чтобы понять, почему это важно, нужно знать, что было раньше.
Как работало традиционное шумоподавление до ИИ
На протяжении большей части истории аудио две техники выполняли почти всю работу по удалению шума, и обе все еще используются, потому что они дешевы и предсказуемы. Стоит их понимать, потому что шумоподавление на основе ИИ в основном определяется исправлением их недостатков.
Noise gates: порог громкости
Noise gate - самый старый трюк в книге. Он следит за громкостью вашего сигнала и отключает все ниже установленного вами порога. Установите gate на -40 дБ, и все, что тише, будет отключено. Когда вы говорите, вы пересекаете порог, gate открывается, и ваш голос проходит. Когда вы останавливаетесь, вы падаете ниже него, gate закрывается, и комната становится тихой. Математика тривиальна: сравните уровень с порогом, затем откройте или закройте.
Проблема в том, что gate знает только громкость, никогда не содержание. Он не может отличить голос от шума. Поэтому, пока вы говорите и gate открыт, каждый кусочек фонового шума проходит вместе с вашими словами. Вентилятор, клавиатура, уличный шум - все проходит в тот момент, когда говорит ваш голос. Вы также слышите, как работает gate: звук переключается с полной тишины на полную громкость при открытии и закрытии, создавая эффект колебания или чириканья на дыхании и в конце предложений. Gate - это охранник, проверяющий громкость у входа и пропускающий все громкое.
Спектральное вычитание: отпечаток шума
Следующий шаг - спектральное вычитание. Вы берете короткий образец только шума, обычно одну секунду “тишины”, когда присутствует только комната, и программное обеспечение создает профиль частоты, отпечаток шума, того, как этот шум выглядит в спектре. Затем он вычитает этот отпечаток из всей записи, полоса за полосой частот. Гул на частоте сетевого питания, свист на высоких частотах, гул кондиционера: поскольку они постоянны и предсказуемы, вычитание их отпечатка снижает их намного. Это основание классического эффекта подавления шума Audacity, который использовали многие люди.
Спектральное вычитание намного умнее gate, потому что работает даже во время разговора. Но оно предполагает, что шум остается на месте. В момент, когда шум меняется - проезжает машина, кто-то кашляет, скребется стул - сохраненный отпечаток больше не соответствует действительности, и вычитание оставляет волнистый, бульканий остаток, который инженеры называют музыкальным шумом: маленькие тональные артефакты, мигающие вокруг вашего голоса. Увеличьте силу для удаления большего шума, и эти артефакты ухудшатся. Это умный метод, привязанный к плохому предположению, что шум остается неподвижным. Реальные комнаты не остаются. Вы можете прочитать больше о семействе классических техник в общем обзоре подавления шума.
Как на самом деле работает шумоподавление на основе ИИ
Вот сдвиг. Вместо фиксированного порога громкости или фиксированного отпечатка шума, машинное обучение шумоподавления обучается на огромных объемах чистой речи, намеренно смешанной с тысячами видов шума. Во время этого обучения модель узнает, в общем смысле, как выглядит человеческая речь в спектре и как выглядит все, что не является речью. Затем, в вашем аудио, она оценивает кадр за кадром, какая энергия - это голос, а какая - шум, сохраняет голос и подавляет остальное.
Заметьте, что ей не нужно. Ей не нужно, чтобы вы сначала делали выборку шума, потому что она уже выучила общее понимание шума из обучения. Она не предполагает, что шум стабилен, потому что переоценивает на каждом коротком кадре аудио. И критически, поскольку она выучила форму самого голоса, а не запомнила конкретный шум, она может подавить звуки, которые эффективно никогда не слышала раньше. Вот что вам дает обобщение. Щелчки клавиш, проезжающая сирена, хлопающая дверь, лающая собака, даже другие люди, говорящие на фоне - все подавляется, пока ваш голос остается на переднем плане, потому что ничто из этого не совпадает с внутренним представлением модели о вашей речи.
С технической точки зрения это проблема разделения источников: модель пытается разложить смешанный сигнал на его части и дать вам только ту, которая вам нужна. Эта формулировка также объясняет ограничения позже, потому что разделение становится труднее, чем больше перекрываются два источника.
Почему “выучила голос” побеждает “выбрала шум”
Старые методы реагируют на шум. Шумоподавление на основе ИИ распознает голос. Это обращение - вот почему тот же инструмент справляется с вентилятором, механической клавиатурой и воздуходувкой для листьев без каких-либо изменений в настройках. Вы больше не описываете ему шум. Вы полагаетесь на то, что он знает, как должен звучать ваш голос, и относится ко всему остальному как к удаляемому. Когда люди говорят, что denoiser звучит “умно”, это то, что они слышат: очистка, которая следует за вашим голосом, вместо того чтобы следовать фиксированному правилу.
Это также та же семья технологии, на которую многие создатели уже полагаются для других работ, от аудио-энхансера, который удаляет фоновый шум как часть двухшагового рабочего процесса до более специализированных задач. Этот пост - это “как”; тот - это рабочий процесс, поэтому нет необходимости его повторять.
Живое против автономного: бюджет задержки, который формирует шумоподавление ИИ
Два инструмента шумоподавления на основе ИИ могут использовать одну и ту же основную идею и все же вести себя совершенно по-разному, из-за одного ограничения: сколько времени им разрешено думать. Это самая полезная вещь для понимания при выборе инструмента.
Автономная очистка может быть тяжелой
Когда вы очищаете готовый файл, задержка не имеет значения. Инструмент может смотреть вперед на аудио, которое приходит позже, смотреть назад на то, что было раньше, запускать большую модель и делать несколько проходов. Видение контекста с обеих сторон момента делает разделение намного более точным, потому что модель может использовать то, что произойдет дальше, чтобы решить, что это за звук сейчас. Вот почему автономная очистка аудио на основе ИИ на записи звучит более чистой и естественной, чем та же идея в прямом эфире. Вы обменяли скорость на качество, и нечего терять, потому что аудио уже существует.
Шумоподавление в реальном времени работает против часов
Живое аудио, вызов, канал Discord, поток - это противоположность. Модель должна обрабатывать каждый крошечный кадр звука за несколько миллисекунд, и она не может видеть будущее аудио, потому что это аудио еще не произошло. Она должна быть причинной и быстрой. Чтобы попасть в этот бюджет, шумоподавление ИИ в реальном времени работает на меньшей, более легкой модели и намеренно мягче. Он все еще чисто удаляет устойчивый фоновый шум, но не будет так агрессивно преследовать самые сложные случаи, как автономный проход, потому что опоздание хуже, чем оставить немного шума. Если ваш голос приходит на четверть секунды позже вашего рта, вызов неиспользуем, независимо от того, насколько чист.
| Традиционный (gate / спектральный) | Шумоподавление ИИ | |
|---|---|---|
| Решает по | Громкость или фиксированный отпечаток шума | Выученная модель голоса против шума |
| Работает во время разговора | Gate: нет. Спектральный: частично | Да |
| Обрабатывает новый, невыбранный шум | Нет | Да, обобщает |
| Типичный артефакт | Колебание, музыкальный шум | Подводный голос если переусложнено |
| Нуждается в выборке вами | Спектральный: да | Нет |
| Лучше всего для | Простой, предсказуемый гул | Грязные, меняющиеся реальные комнаты |
Что может и не может делать очистка аудио на основе ИИ
Шумоподавление на основе ИИ - это подлинный скачок, не магия. Знание его режимов отказа заранее спасает вас от поиска идеально тихой записи, которой не существует, и портит хорошую запись при попытке.
Она немного окрашивает ваш голос
Каждый denoiser идет по линии между удалением шума и сохранением вашего сигнала, потому что голос и шум делят некоторые из одних и тех же частот. Снизьте шум, и вы почти всегда снизьте маленький кусочек вашего голоса с ним. При разумных настройках это тонко, слабое истончение или опустошение. Это стоимость разделения, и это обычно справедливый обмен на чистый фон.
Давайте слишком сильно, и вы получите подводный артефакт
Увеличьте силу на всю катушку, и модель начнет удалять частоты, которые действительно принадлежат вашему голосу. Результат - классический подводный или водянистый звук: приглушенный, вихревой, робот, как если бы вы говорили через аквариум. Это ошибка номер один, которую люди совершают с шумоподавлением ИИ. Исправление простое и контринтуитивное: используйте меньше. Снизьте силу, пока шум не станет тише, но не исчезнет. Небольшой остаточный свист, который вы почти не замечаете, лучше, чем голос, который звучит сломанным.
Она разрушает музыку
Наведите шумоподавление ИИ на песню, и оно будет пытаться подавить музыку как будто это шум, портя и инструменты, и любые вокалы. Это неправильный инструмент. Разделение голоса от сопровождающей дорожки - это другая задача, называемая разделением стемов, и использует модель, построенную специально для разделения вокалов от инструментов, а не голоса от шума. Если это ваша цель, возьмитесь за надлежащий вокальный сепаратор, а не denoiser. Использование программы подавления шума на музыке - все равно что использование валика для ворса на мокрой картине.
Она борется с перекрывающимися голосами
Самый сложный случай для любого удаления шума на основе ИИ - это другой говорящий человек. Вентилятор живет в другой части спектра, чем ваш голос, поэтому его легко разделить. Второй человеческий голос занимает те же частоты, что и ваш, поэтому модель не может чисто решить, какой сохранить. Хорошие инструменты отодвигают фоновый шум и могут сделать его намного менее отвлекающим, но не ожидайте, что переполненное кафе исчезнет позади вас.
Выбор шумоподавления ИИ по сценарию
Правильный инструмент полностью зависит от того, что вы делаете. Нет единого лучшего denoiser, только лучшего для вашей ситуации. Вот как выбирать, соответствующее двум ограничениям выше, живое против автономного, и типу шума.
| Сценарий | Лучший подход | Почему |
|---|---|---|
| Вызов Discord или голосовой чат | Подавление шума в реальном времени на основе ИИ | Низкая задержка, убивает устойчивый комнатный шум в реальном времени |
| Прямой поток или геймплей | Подавление в реальном времени на микрофоне | Чистый звук без пост-обработки |
| Файл подкаста или озвучивание | Автономная очистка аудио на основе ИИ | Более тяжелая модель, предварительный просмотр, более чистый результат |
| Быстрый гул на записи | Спектральное вычитание (Audacity) | Бесплатно, быстро, хорошо для устойчивого гула |
| Голос, закопанный в песне | Разделение стемов, не denoise | Другая задача, другая модель |
| Внезапные звуки, хлопанье двери | Отключите микрофон, если возможно | Переходные процессы побеждают большинство подавлений |
Простой путь принятия решения
- У вас уже есть файл или аудио выходит в прямом эфире?
- Если в прямом эфире, вам нужно подавление шума в реальном времени на основе ИИ, мягко настроенное для защиты задержки.
- Если это файл, используйте автономную очистку и дайте ей работать тяжелее для более чистого прохода.
- Если шум - это другая песня под голосом, остановитесь, это разделение стемов.
- Если это громкий переходный процесс, такой как удар, отключение микрофона во время сбоя побеждает любой фильтр.
Честно ответьте на первый вопрос, и остальные четыре встанут на место. Большинство разочарований с инструментами шума происходит от использования автономного очистителя файлов для проблемы в прямом эфире или подавителя в реальном времени для работы, которая требовала тяжелого автономного прохода.
Шумоподавление на основе ИИ в реальном времени для вызовов и потоков
Если ваша проблема в прямом эфире, вызов, поток, сеанс Discord, тогда подавление шума на основе ИИ в реальном времени - это категория, которая вам нужна, и это где встроенное подавление шума VoxBooster подходит. Он работает на вашем ПК Windows как локальный процесс на устройстве, очищая устойчивый фоновый шум с вашего микрофона, прежде чем он когда-либо достигнет приложения, в которое вы говорите. Поскольку он использует виртуальный микрофон для направления уже обработанного аудио в любую программу, одна и та же чистая подача достигает того, куда вы ее направляете.
Эта маршрутизация - практическая часть, которую люди упускают. Подавленный звук становится обычным микрофоном, который может выбрать любое приложение, поэтому он идет прямо в установку Discord Voice Changer или поток OBS без специальных плагинов в каждом. Вы очищаете микрофон один раз, и каждое нисходящее приложение слышит чистую версию. Все остается на вашей машине, что важно, если вы предпочитаете, чтобы ваш сырой микрофонный сигнал никогда не покидал ваш ПК. VoxBooster - это одна опция в переполненном поле, и для конкретного сценария в реальном времени его дизайн на устройстве и маршрутизируемый везде - это его основное преимущество. Цены находятся на странице цен вместо здесь.
Для автономной половины разделения, очистки файла, который вы уже записали, вам не нужна никакая из этой машинерии в реальном времени. Более тяжелый автономный проход, будь то бесплатный редактор или выделенный очиститель, всегда будет побеждать инструмент в реальном времени на готовой записи по причинам задержки выше.
Часто задаваемые вопросы
Что такое шумоподавление на основе ИИ?
Шумоподавление на основе ИИ - это очистка аудио, выполняемая моделью, обученной отличать человеческую речь от всего остального. Вместо отключения тихих частей или вычитания фиксированного отпечатка шума, она выучила форму голоса, поэтому может снижать шум даже во время активного разговора, а не только в тишине.
Как работает шумоподавление на основе ИИ?
Модель обучается на огромных объемах чистой речи, смешанной с множеством видов шума, пока не научится разделять эти два компонента. Во время выполнения она оценивает, какие части входящего аудио являются речью, а какие - шумом, затем сохраняет речь и подавляет остальное, работая кадр за кадром в коротких блоках.
Лучше ли шумоподавление на основе ИИ, чем noise gate?
Для большинства голосовых работ да. Noise gate только отключает аудио ниже порога громкости, поэтому шум все еще слышен под вашим голосом во время разговора. Шумоподавление на основе ИИ разделяет речь и шум по содержанию, поэтому снижает шум даже во время разговора, а не только во время пауз между словами.
Может ли шумоподавление на основе ИИ удалять фоновые голоса?
Иногда, частично. Поскольку модель выучила, как выглядит речь в целом, удалить другого говорящего человека намного сложнее, чем вентилятор, так как второй голос занимает те же частоты, что и ваш. Хорошие инструменты замечательно снижают фоновый шум, но редко удаляют его полностью без воздействия на ваш собственный голос.
Почему мой голос звучит как под водой после шумоподавления ИИ?
Это чрезмерная обработка. Когда сила установлена слишком высоко, модель удаляет частоты, которые действительно принадлежат вашему голосу, оставляя водянистый, приглушенный, подводный тон. Уменьшите силу, пока шум не станет тише, но не исчезнет; небольшой остаточный свист почти всегда лучше, чем поврежденный, робот-голос.
Работает ли шумоподавление на основе ИИ в реальном времени?
Да, но с более жестким бюджетом. Модели реального времени должны обрабатывать каждый кадр за несколько миллисекунд без видения будущего аудио, поэтому они работают меньшими и более мягкими, чем автономные инструменты. Этот компромисс поддерживает вызовы и потоки с низкой задержкой, одновременно чисто удаляя устойчивый фоновый шум из вашего живого микрофонного сигнала.
Может ли шумоподавление на основе ИИ удалять музыку из голосовой записи?
Не очень хорошо. Программа подавления шума относится к музыке как к шуму и пытается ее подавить, что портит и музыку, и голос под ней. Разделение голоса и инструментов - это другая задача, называемая разделением стемов, и использует другую модель, созданную специально для этого.
Заключение
Шумоподавление на основе ИИ заслужило свою репутацию по конкретной причине: оно перестало реагировать на шум и начало распознавать голос. Это единственное обращение - вот почему оно справляется с грязными, меняющимися реальными комнатами, которые сломали noise gates и спектральное вычитание, и почему оно обобщает на звуки, которые никогда не пробовала. Это не магия, однако. Она немного окрашивает ваш голос, она превращает ваше аудио в подводное, когда вы слишком его напрягаете, и она не может вытащить голос из песни. Подберите инструмент к задаче: автономная очистка для готовых файлов, подавление в реальном времени для всего, что выходит в прямом эфире, и разделение стемов, когда музыка вовлечена.
Если ваша проблема в прямом эфире, чистое аудио для вызовов, Discord или потока, подавление шума в реальном времени VoxBooster - это опция на устройстве, которую стоит попробовать, с полным трехдневным пробным периодом и без кредитной карты. Загрузите VoxBooster.