Zmieniacze głosu: porównanie przechwytywania audio o niskim opóźnieniu vs MME vs DirectSound

Porównaj przechwytywanie audio o niskim opóźnieniu, MME i DirectSound dla zmieniacza głosu. Porównaj opóźnienie, obciążenie CPU i kompatybilność, aby wybrać prawidłowy tryb audio Windows dla efektów głosowych w czasie rzeczywistym.

Zmieniacze głosu: porównanie przechwytywania audio o niskim opóźnieniu vs MME vs DirectSound

Przechwytywanie audio o niskim opóźnieniu, MME i DirectSound dla zmieniacza głosu nie są wymiennymi ustawieniami - reprezentują całkowicie różne podsystemy audio, dzielące je dziesiątki lat historii, a wybranie złego to jeden z najczęstszych powodów, dla których efekty głosowe w czasie rzeczywistym wydają się opóźnione lub niestabilne. Ten przewodnik obejmuje każdy tryb audio Windows, wyjaśnia, co każdy z nich rzeczywiście robi pod spodem, i daje ci jasne zalecenie, którego użyć ze zmieniaczu głosu w 2024.


Streszczenie

  • MME (1991) i DirectSound (1995) to starsze warstwy - obie dodają zbędne opóźnienie do zmiany głosu i powinny być unikane na nowoczesnym sprzęcie.
  • Przechwytywanie audio o niskim opóźnieniu Shared (Windows Vista, 2007) to zalecany tryb domyślny: niskie opóźnienie, kompatybilne ze wszystkimi aplikacjami audio działającymi jednocześnie.
  • Przechwytywanie audio o niskim opóźnieniu Exclusive zmniejsza opóźnienie do poziomów zbliżonych do ASIO, ale blokuje cały inny dźwięk na urządzeniu.
  • ASIO jest dla profesjonalnych studiów nagraniowych; omija całą sieć audio Windows i powoduje przerwanie wirtualnego routingu mikrofonów, na którym polegają większość zmieniaczy głosu.
  • VoxBooster domyślnie używa przechwytywania audio o niskim opóźnieniu Shared i osiąga opóźnienie potoku 10-25 ms na typowych urządzeniach - dobrze w niewykrywalnym zakresie dla transmisji i gier.

Stos audio Windows: krótka historia

Aby zrozumieć, dlaczego tryby audio mają znaczenie dla zmieniaczy głosu, musisz zrozumieć, co się faktycznie dzieje, gdy Windows przetwarza dźwięk. Podstawową koncepcją jest to, że dźwięk nie przechodzi bezpośrednio z aplikacji do głośnika lub mikrofonu. Przechodzi przez warstwowy stos oprogramowania, a każda warstwa dodaje czas przetwarzania.

Windows gromadził podsystemy audio przez trzy dekady, a każde pokolenie dodawało nowe warstwy zamiast zamieniać stare. Rezultatem jest hierarchia opcji z zakresu od szuntów kompatybilności z 1991 roku do nowoczesnego interfejsu API sesji, który może działać blisko prędkości samych urządzeń.

MME — Multimedia Extensions (1991)

MME było odpowiedzią Windows 3.1 na konsumencki dźwięk. Przedstawiło interfejsy API waveIn i waveOut, które umożliwiły aplikacjom nagrywanie i odtwarzanie dźwięku za pośrednictwem ujednoliconego interfejsu niezależnie od podstawowego sprzętu. To był przełom w tamtych czasach.

Problem polega na tym, że MME trasuje dźwięk przez Windows Kernel Mixer (KMixer) - warstwę oprogramowania, która obsługuje konwersję formatu, mieszanie i kompatybilność między aplikacjami. KMixer został zaprojektowany dla stabilności i kompatybilności, a nie prędkości. Używa stałych dużych rozmiarów buforów, które gwarantują odtwarzanie bez zacinań na sprzęcie z lat 90., a ten projekt jest fundamentalnie niezgodny z wymaganiami niskiego opóźnienia.

Co MME oznacza dla zmieniacza głosu: Twój głos wchodzi przez mikrofon, przechodzi ścieżką waveIn z MME, przecina Kernel Mixer, jest przetwarzany przez zmieniaczu głosu, wychodzi przez ścieżką waveOut z MME, ponownie przecina KMixer i dociera do wirtualnego wyjścia mikrofonu. Każde przekroczenie KMixer dodaje 50-100 ms opóźnienia. Całkowita pętla zwrotna może osiągnąć 150-200 ms na nowoczesnym sprzęcie - wystarczające opóźnienie, aby być rozpraszające na Discord lub wyraźnie zsynchronizowane z dźwiękiem gry.

DirectSound — DirectX Audio (1995)

DirectSound była odpowiedzią firmy Microsoft dla deweloperów gier, którzy uznali MME za zbyt wolne. Przedstawiło przyspieszenie sprzętu za pośrednictwem buforów DirectSound, mieszanie przeniesione do sprzętu audio i ścieżkę, która omijała część komplikacji KMixer.

W praktyce nowoczesny sprzęt nie obsługuje już prawdziwego przyspieszenia sprzętu DirectSound. Od Windows Vista (2007) DirectSound działa w warstwie emulacji na wierzchu przechwytywania audio o niskim opóźnieniu. Wezwania przyspieszenia sprzętu są tłumaczone na operacje oprogramowania, a “przyspieszenie”, które uczyniło DirectSound konkurencyjnym w 1995 roku, po prostu nie istnieje. Microsoft oficjalnie wycofał DirectSound w modelu audio Windows Vista.

Co DirectSound oznacza dla zmieniacza głosu dzisiaj: Dostajesz fałdę opóźnienia z warstwy emulacji na wierzchu fałdy opóźnienia z trybu kompatybilności przechwytywania audio o niskim opóźnieniu. Jest to zdecydowanie gorsze niż bezpośrednie użycie przechwytywania audio o niskim opóźnieniu, bez żadnej wyrównania. Aplikacje, które wciąż ujawniają DirectSound jako opcję (głównie edytory DAW i starsze zmieniacze głosu), robią to ze względu na kompatybilność starszą, a nie wydajność.

Przechwytywanie audio o niskim opóźnieniu Shared — Windows Audio Session API (2007)

Przechwytywanie audio o niskim opóźnieniu było jądrem całkowitego przepisania stosu audio w Windows Vista. Przedstawiło nową architekturę opartą na sesjach audio - każda aplikacja otrzymuje własną sesję audio, którą mixer obsługuje na poziomie silnika.

W trybie Shared silnik Windows Audio Engine (Audiodg.exe) miesza wszystkie sesje audio razem i wysyła wynik do urządzenia sprzętu w jednym ustalonym okresie. Kluczowa różnica od MME: okres buforu jest konfigurowalny i może być tak niski jak 3 ms (100 ramek przy 48 kHz), w porównaniu z typowymi buforami KMixer 100+ ms.

Co przechwytywanie audio o niskim opóźnieniu Shared oznacza dla zmieniacza głosu: Twój dźwięk przechodzi bezpośrednio z aplikacji do silnika Windows Audio Engine z minimalnym przetwarzaniem pośrednim. Wiele aplikacji nadal może używać tego samego urządzenia jednocześnie - zmieniaczu głosu, dźwięku gry, Discord, odtwarzacz muzyki - ponieważ silnik Windows Audio Engine je miesza. Opóźnienie w przechwytywaniu audio o niskim opóźnieniu Shared jest typowo 10-30 ms end-to-end w zależności od jakości sterownika i ustawień rozmiaru buforu.

To jest słodki punkt dla większości przypadków użycia zmieniaczą głosu.

Przechwytywanie audio o niskim opóźnieniu Exclusive — Direct Hardware Access (2007)

Przechwytywanie audio o niskim opóźnieniu Exclusive idzie o krok dalej: aplikacja omija całkowicie silnik Windows Audio Engine i komunikuje się bezpośrednio ze sterownikiem audio. Urządzenie jest zablokowane dla tej pojedynczej aplikacji na czas trwania sesji.

Z dostępem wyłącznym, potok audio jest: mikrofon → sterownik audio → aplikacja → sterownik audio → wyjście. Brak mieszania, brak konwersji formatu, żadne inne aplikacje konkurujące o czas buforu. Opóźnienie może paść do 2-5 ms w zależności od sterownika i sprzętu, co jest porównywalne z ASIO na sprzęcie konsumenta.

Kompromis jest wyłączność. Podczas gdy VoxBooster utrzymuje wyłączny dostęp przechwytywania audio o niskim opóźnieniu na twoim urządzeniu wejściowym, nic innego nie może nagrać z tego mikrofonu. Podobnie dla wyjścia - żadne dźwięki systemowe, brak dźwięku innej aplikacji na tym urządzeniu.

Praktyczne wskazówki dla zmieniaczy głosu: Używaj przechwytywania audio o niskim opóźnieniu Exclusive tylko wtedy, gdy transmitujesz lub grasz ze sprzętem audio dedykowanym, masz oddzielne urządzenia fizyczne dla wejścia głosowego i głośników / słuchawek, i zmierzyłeś problem opóźnienia przechwytywaniem audio o niskim opóźnieniu Shared, który jest rzeczywiście słyszalny. Dla większości użytkowników nie jest to konieczne.

ASIO — Audio Stream Input/Output (Steinberg, 1997)

ASIO to w ogóle nie Windows audio API - to protokół innych firm opracowany przez Steinberg (twórców Cubase), który pozwala aplikacjom audio mówić bezpośrednio do sprzętu audio za pomocą sterowników specyficznych dla dostawcy. Poprzedza przechwytywanie audio o niskim opóźnieniu i został zaprojektowany dla profesjonalnych studiów nagraniowych, które potrzebowały opóźnienia poniżej 5 ms do monitorowania śledź na żywo w czasie rzeczywistym.

ASIO omija całą sieć audio Windows. Nie ma Kernel Mixer, nie ma Windows Audio Engine, nie ma routingu urządzenia wirtualnego. Sterownik ASIO pisze bezpośrednio do buforów sprzętu.

Problem dla zmieniaczy głosu: Wirtualne wyjścia mikrofonu - czyli jak zmieniacze głosu wtryskują przetworzony dźwięk do Discord, gier lub oprogramowania przesyłającego - zależą od wykresu audio Windows. Kiedy pracujesz w trybie ASIO, jesteś poza tym wykresem. Wirtualny mikrofon VoxBooster to urządzenie audio Windows, a ASIO nie może go zobaczyć.

Aby uzyskać szczegółowe wskazówki dotyczące konfiguracji ASIO i kiedy jest naprawdę przydatny, zobacz nasz przewodnik sterownika ASIO dla zmieniaczy głosu.


Tabela porównania wydajności

Tryb audioTypowe opóźnienieObciążenie CPURównoczesne aplikacjeKompatybilność mikrofonu wirtualnegoRok
MME100-200 msŚrednieTakTak1991
DirectSound50-150 msŚrednie-WysokieTak (emulowane)Tak1995
Przechwytywanie audio o niskim opóźnieniu Shared10-30 msNiskieTakTak2007
Przechwytywanie audio o niskim opóźnieniu Exclusive2-10 msNajniższeNie - urządzenie zablokowaneTak (ostrożnie)2007
ASIO1-5 msBardzo niskieNie - pełny bypassNie - omija wykres Windows1997

Liczby powyżej zakładają nowoczesny system Windows 10 lub 11 ze współczesnymi sterownikami audio. Starszy sprzęt lub źle obsługiwane sterowniki mogą pchnąć opóźnienie przechwytywania audio o niskim opóźnieniu Shared wyżej i uczynić różnicę między Shared a Exclusive bardziej wyraźną.


Dlaczego przechwytywanie audio o niskim opóźnieniu Shared jest właściwym domyślnym dla zmieniaczy głosu

Większość przypadków użycia zmieniaczą głosu - rozmowy Discord, komunikacja głosowa w grze, transmisja Twitch, nagrywanie YouTube - to nie sesje profesjonalnego studia. Nie potrzebujesz opóźnienia poniżej 5 ms. To, czego potrzebujesz, to:

  1. Opóźnienie wystarczająco niskie, aby nie słyszeć opóźnienia podczas monitorowania własnego głosu (poniżej 30 ms).
  2. Kompatybilność z grą, oprogramowaniem przesyłającym i aplikacją do komunikacji, wszystko działające jednocześnie.
  3. Stabilność - brak przerw w dźwięku, konfliktów urządzeń lub awarii sterownika podczas 4-godzinnej sesji.
  4. Brak instalacji sterownika - brak oprogramowania na poziomie jądra, które może kolidować z systemami anty-cheatu lub wymagać uprawnień administratora.

Przechwytywanie audio o niskim opóźnieniu Shared spełnia wszystkie cztery wymagania. Przechwytywanie audio o niskim opóźnieniu Exclusive spełnia pierwsze trzy, ale zawodzi na czwartej w niektórych konfiguracjach. MME i DirectSound spełniają drugie, ale zawodzą na pierwszej bardzo źle.

Aby uzyskać więcej kontekstu na temat tego, jak opóźnienie wpływa na jakość zmieniaczą głosu w praktyce, zobacz nasz przewodnik dostrajania opóźnienia zmieniaczą głosu.


Jak sprawdzić, który tryb audio używa zmieniaczu głosu

Większość zmieniaczy głosu ujawnia to ustawienie w panelu konfiguracji audio. Oto, na co zwrócić uwagę:

W VoxBooster: Ustawienia → Audio → Urządzenie wejściowe → Lista rozwijana trybu audio. Bieżący tryb jest wyświetlany obok nazwy urządzenia. Pasek stanu u dołu głównego okna pokazuje zmierzone opóźnienie buforu w czasie rzeczywistym.

W Voicemod: Tryb silnika audio nie jest bezpośrednio ujawniony w standardowym interfejsie użytkownika - Voicemod zarządza routingiem przechwytywania audio o niskim opóźnieniu wewnętrznie i nie pozwala na ręczne przełączanie trybów.

W MorphVOX: Domyślnie używa DirectSound w starszych wersjach; nowsze kompilacje domyślnie do przechwytywania audio o niskim opóźnieniu. Sprawdź Preferences → Audio → Audio Output Mode.

W Clownfish Voice Changer: Działa jako hook audio na poziomie systemu; podstawowy tryb to zazwyczaj przechwytywanie audio o niskim opóźnieniu Shared za pośrednictwem silnika Windows Audio Engine.

Jeśli zmieniaczu głosu nie ujawnia trybu audio, sprawdź dokumentację dewelopera lub załóż przechwytywanie audio o niskim opóźnieniu Shared (Windows domyślnie od Vista).


Diagnozowanie problemów opóźnienia według trybu audio

Jeśli zmieniaczu głosu wydaje się powolny, tryb zwykle jest pierwszym miejscem do sprawdzenia. Oto systematyczne podejście:

Krok 1 — Zidentyfikuj bieżący tryb

Otwórz ustawienia zmieniaczą głosu i sprawdź, jakie API audio używa. Jeśli pokazuje MME lub DirectSound, przejście na przechwytywanie audio o niskim opóźnieniu Shared prawie na pewno rozwiąże problem.

Krok 2 — Zmierz rzeczywiste opóźnienie

W VoxBooster miernik opóźnienia w czasie rzeczywistym na pasku stanu pokazuje opóźnienie potoku w milisekundach. Jeśli jesteś na przechwytywaniu audio o niskim opóźnieniu Shared i widzisz ponad 50 ms, problem to prawdopodobnie rozmiar buforu, a nie wybór API.

Krok 3 — Zmniejsz rozmiar buforu

W trybie przechwytywania audio o niskim opóźnieniu Shared rozmiar buforu jest konfigurowalny. Większość zmieniaczy głosu domyślnie do buforów 20-30 ms ze względów bezpieczeństwa. Zmniejszenie do 10 ms zwykle jest stabilne na nowoczesnym sprzęcie. Poniżej 10 ms grozi przerwami w dźwięku, chyba że procesor nie jest obciążony.

Ustawienia → Audio → Rozmiar buforu w VoxBooster. Zacznij na 20 ms i zmniejszaj w krokach 5 ms, aż usłyszysz przerwy, a następnie wróć do góry o jeden krok.

Krok 4 — Sprawdź, czy nie ma ingerencji KMixer

Niektóre interfejsy audio i sterowniki wirtualnych kabli audio wciąż używają ścieżki KMixer, nawet gdy wybierzesz przechwytywanie audio o niskim opóźnieniu. W Device Manager → Sound, Video and Game Controllers, kliknij prawym przyciskiem myszy na urządzeniu audio → Properties → Advanced tab. Upewnij się, że zaznaczono “Allow applications to take exclusive control of this device”. To umożliwia dostępność przechwytywania audio o niskim opóźnieniu Exclusive, nawet jeśli go nie używasz - sygnalizuje sterownikowi, że nowoczesne przechwytywanie audio o niskim opóźnieniu jest obsługiwane.

Krok 5 — Rozważ przechwytywanie audio o niskim opóźnieniu Exclusive dla konfiguracji tylko głosu

Jeśli ukończyłeś kroki 1-4 i wciąż zauważasz opóźnienie, a konfiguracja używa oddzielnych urządzeń fizycznych dla wejścia mikrofonu i głośników / słuchawek, spróbuj przechwytywania audio o niskim opóźnieniu Exclusive po stronie wejścia. VoxBooster może utrzymać wyłączny dostęp mikrofonu, podczas gdy wyjście (wirtualny mikrofon) pozostaje w trybie Shared, co utrzymuje kompatybilność z Discord i grą.

Aby uzyskać głębsze wyjaśnienie tych technik, zobacz nasz kompletny przewodnik dostrajania opóźnienia zmieniaczą głosu.


Kompatybilność trybu audio z systemami anty-cheatu

To prawdziwy problem dla graczy konkurencyjnych. Gry korzystające z Easy Anti-Cheat, BattlEye, Vanguard (Riot) lub nProtect GameGuard mogą oznakować lub zablokować oprogramowanie, które instaluje sterowniki na poziomie jądra.

MME i DirectSound: Używaj komponentów KMixer na poziomie jądra, które są w Windows od Windows 95. Są uniwersalnie kompatybilne z anty-cheatem, ponieważ są komponentami Windows, a nie sterownikami innych firm.

Przechwytywanie audio o niskim opóźnieniu Shared: Uruchamianie w trybie użytkownika za pośrednictwem silnika Windows Audio Engine (Audiodg.exe). Brak zaangażowania sterownika jądra ze strony zmieniaczą głosu. Uniwersalnie kompatybilne ze wszystkimi systemami anty-cheatu.

Przechwytywanie audio o niskim opóźnieniu Exclusive: Nadal tryb użytkownika ze strony aplikacji. Sam sterownik audio jest komponentem jądra, ale to sterownik karty dźwiękowej - ten sam sterownik, którego już używałeś. Brak dodatkowego oprogramowania jądra. Kompatybilne z anty-cheatem.

ASIO: Wymaga instalacji sterownika ASIO innych firm (takiego jak ASIO4ALL lub sterownik ASIO producenta). ASIO4ALL instaluje komponent sterownika w trybie jądra (wrapper portcls.sys). Niektóre systemy anty-cheatu to oznaczają. Sterowniki ASIO producentów różnią się - sterownik ASIO Focusrite Scarlett na przykład nie powodował zgłoszonych problemów, ale ryzyko jest wyższe niż przechwytywanie audio o niskim opóźnieniu.

VoxBooster celowo używa przechwytywania audio o niskim opóźnieniu (nie ASIO, nie niestandardowych sterowników jądra) z tego powodu. Możesz przeczytać więcej o naszym podejściu w naszym przewodniku zmieniaczą głosu dla Windows 10 i 11.


Użycie CPU w różnych trybach audio

Tryb audio wpływa na użycie CPU na sposoby, które mają znaczenie podczas długich sesji gier lub transmisji.

MME/DirectSound mają średnie obciążenie CPU, ponieważ Kernel Mixer działa stale, próbkując i mieszając wszystkie strumienie audio niezależnie od tego, czy zmieniaczu głosu jest aktywny. Zarządzanie buforem starszej wersji również budzi CPU częściej niż konieczne.

Przechwytywanie audio o niskim opóźnieniu Shared znacznie to zmniejsza. Silnik Windows Audio Engine działa w ustalonym okresie, budząc CPU zgodnie z harmonogramem przewidywalnym w linii z okresem buforu. Na buforach 20 ms silnik audio budzi się 50 razy na sekundę - efektywnie i przewidywalnie dla harmonogramów CPU.

Przechwytywanie audio o niskim opóźnieniu Exclusive ma najniższe obciążenie z dowolnej ścieżki audio Windows. Aplikacja pisze bezpośrednio do buforu sterownika, silnik audio jest pomijany, a budzi się CPU minimalizowane do dokładnie tego, czego wymaga sprzęt.

Aby uzyskać pełny przegląd tego, jak zmieniacze głosu wpływają na obciążenie CPU w różnych konfiguracjach, w tym porównania z Voicemod i Voice.ai, zobacz naszą porównanie użycia CPU zmieniaczą głosu.


Interakcja między zmieniaczu głosu a tłumieniem szumu

Tryb audio ma szczególne znaczenie, gdy uruchamiasz tłumienie szumu obok zmieniaczą głosu - jak robią to większość streamerów.

W MME: Tłumienie szumu dodaje kolejny przejściu KMixer na wierzchu już wysokiego opóźnienia MME. Ułożenie zmieniaczą głosu + tłumienie szumu w MME może pchnąć całkowite opóźnienie ponad 300 ms, czyniąc rozmowę na żywo zasadniczo niemożliwą.

W przechwytywaniu audio o niskim opóźnieniu Shared: Tłumienie szumu działa na tym samym wykresie przetwarzania silnika Windows Audio Engine co zmieniaczu głosu. Wewnętrzny potok VoxBooster obsługuje oba efekty w jednym przejściu, więc nie ma problemu z opóźnieniem. Przetwarzanie odbywa się szeregowo na tym samym buforze audio.

W przechwytywaniu audio o niskim opóźnieniu Exclusive: Ta sama wydajność co Shared do połączonego przetwarzania, z niższym opóźnieniem podstawowym. Kompromis wyłączności urządzenia ma zastosowanie.

Aby uzyskać wskazówki dotyczące uruchamiania tłumienia szumu i zmieniaczy głosu razem bez problemów opóźnienia, zobacz naszą porównanie zmieniaczą głosu vs tłumienie szumu.


Wybór trybu audio dla konkretnych scenariuszy

Różne przypadki użycia rzeczywiście czerpią korzyści z różnych konfiguracji. Oto praktyczny przewodnik decyzyjny:

Sesje gier Discord

Zalecane: Przechwytywanie audio o niskim opóźnieniu Shared, bufor 20 ms.

Discord wewnętrznie używa przechwytywania audio o niskim opóźnieniu Shared. Uruchamianie zmieniaczą głosu w przechwytywaniu audio o niskim opóźnieniu Shared utrzymuje obie aplikacje na tym samym wykresie audio, co minimalizuje opóźnienie i unika konfliktów urządzeń. Nie ma scenariusza, w którym przechwytywanie audio o niskim opóźnieniu Exclusive lub ASIO poprawiłoby doświadczenie Discord, ponieważ sam Discord nie może używać trybu Exclusive.

Transmisja na żywo Twitch lub YouTube

Zalecane: Przechwytywanie audio o niskim opóźnieniu Shared, bufor 10-15 ms (jeśli obsługuje to sprzęt).

OBS Studio domyślnie do przechwytywania audio o niskim opóźnieniu do przechwytywania audio. Dopasowanie zmieniaczą głosu do tego samego trybu i rozmiaru buforu utrzymuje wszystko zsynchronizowane w silniku mieszania OBS. Jeśli zauważysz dryf audio w nagraniach OBS, sprawdź, czy zmieniaczu głosu i OBS używają tej samej częstotliwości próbkowania (niezgodność 44,1 kHz vs 48 kHz to częsta przyczyna).

Profesjonalny zapis głosu

Zalecane: Przechwytywanie audio o niskim opóźnieniu Exclusive lub ASIO, dedykowany interfejs audio.

Jeśli nagrywasz voiceover ze efektem zmieniaczą głosu na scenę gry lub animację, i potrzebujesz opóźnienia monitoringu poniżej 10 ms, to scenariusz, w którym przechwytywanie audio o niskim opóźnieniu Exclusive lub sterownik ASIO producenta jest warty złożoności. Ograniczenie routingu wirtualnego mikrofonu ASIO oznacza, że nagrywałbyś przetworzony wynik bezpośrednio z VoxBooster do DAW zamiast routingu przez urządzenie wirtualne.

Spotkania online (Zoom, Teams, Google Meet)

Zalecane: Przechwytywanie audio o niskim opóźnieniu Shared, domyślny bufor.

Wszystkie główne platformy spotkań używają przechwytywania audio o niskim opóźnieniu Shared. Tryb Exclusive zablokuje mikrofon poza platformą spotkań. Pozostań z Shared.

Starszy sprzęt (zestawy dźwiękowe sprzed 2010)

Rezerwowe: MME lub DirectSound.

Niektóre bardzo stare zestawy audio - zintegrowana Realtek AC’97, karty VIA Envy24 era - mają niestabilne lub brakujące sterowniki przechwytywania audio o niskim opóźnieniu. Jeśli VoxBooster pokazuje trwałe błędy niedowystarczenia buforu w trybie przechwytywania audio o niskim opóźnieniu, przejdź na DirectSound jako rezerwę. Udar opóźnienia jest realny, ale lepszy niż przerwy.


Częstotliwość próbkowania i głębia bitowa w różnych trybach audio

Jedno niedoceniane źródło opóźnienia i utraty jakości to niezgodność częstotliwości próbkowania między trybami audio.

Tryb przechwytywania audio o niskim opóźnieniu Shared Windows resampluje wszystko do jednego “wspólnego formatu” - częstotliwości próbkowania i głębi bitowej ustawionej dla urządzenia w ustawieniach Dźwięk Windows. Jeśli zmieniaczu głosu wysyła dźwięk 44,1 kHz, ale urządzenie jest ustawione na 48 kHz, resampller przechwytywania audio o niskim opóźnieniu uruchamia się i dodaje czas przetwarzania plus potencjalną utratę jakości.

Najlepsza praktyka: Ustaw urządzenie audio Windows na 48 kHz, 24-bit w Sound → Properties → Advanced. Skonfiguruj VoxBooster na tę samą częstotliwość 48 kHz w Settings → Audio. To eliminuje resampller i zmniejsza opóźnienie potoku o kilka milisekund.

Przechwytywanie audio o niskim opóźnieniu Exclusive omija to całkowicie - aplikacja negocjuje format sprzętu bezpośrednio, więc nie ma resampingu. To jedna z prawdziwych zalet opóźnienia trybu Exclusive poza zmniejszeniem rozmiaru buforu.

MME zawsze przechodzi przez resampller KMixer niezależnie od pasujących stawek, co jest innym powodem, dla którego jego opóźnienie jest strukturalnie wyższe.


Często zadawane pytania

Jaki jest najlepszy tryb audio dla zmieniacza głosu w Windows?

Przechwytywanie audio o niskim opóźnieniu Shared to najlepszy wybór dla większości użytkowników. Oferuje niskie opóźnienie (około 10-30 ms), współpracuje z innymi aplikacjami audio i nie wymaga specjalnych sterowników ani uprawnień administratora. Przechwytywanie audio o niskim opóźnieniu Exclusive zmniejsza opóźnienie jeszcze bardziej, ale blokuje cały inny dźwięk. MME i DirectSound to starsze opcje z znacznie wyższym opóźnieniem i nie są zalecane do zmiany głosu w czasie rzeczywistym.

Dlaczego MME powoduje wysokie opóźnienie w zmieniczu głosu?

MME (Multimedia Extensions) zostało zaprojektowane w 1991 roku dla Windows 3.1. Trasuje audio przez wiele warstw oprogramowania - Kernel Mixer, starsze szunty kompatybilności i przestarzały system zarządzania buforami - każda z nich dodaje opóźnienie. Całkowite opóźnienie w pętli zwrotnej w MME może osiągnąć 100-200 ms, co jest zbyt wysokie dla efektów głosowych w czasie rzeczywistym na Discord lub w grach.

Czy bezpieczne jest używanie trybu Exclusive przechwytywania audio o niskim opóźnieniu ze zmieniaczu głosu?

Przechwytywanie audio o niskim opóźnieniu w trybie Exclusive zapewnia najniższe możliwe opóźnienie bez ASIO, ale przejmuje pełną kontrolę nad urządzeniem audio. Podczas gdy zmieniaczu głosu jest aktywny, inne aplikacje - dźwięki systemowe, odtwarzacze muzyki, dźwięk gry - nie mogą używać tego samego urządzenia wyjściowego. Przełącz się na niego tylko wtedy, gdy potrzebujesz absolutnie minimalnego opóźnienia i nie potrzebujesz jednoczesnego dźwięku z innych źródeł.

Czy DirectSound wciąż działa do zmiany głosu w Windows 11?

DirectSound wciąż działa w Windows 11, ale Microsoft wyznaczył go na rzecz przechwytywania audio o niskim opóźnieniu. Nowoczesne sterowniki emulują go przez warstwę kompatybilności, która dodaje dodatkowe opóźnienie na wierzchu ścieżki Kernel Mixer. Korzystanie z DirectSound ze zmieniaczu głosu w 2024+ oznacza zaakceptowanie gorszego opóźnienia niż przechwytywanie audio o niskim opóźnieniu Shared bez żadnych praktycznych korzyści.

Jakie opóźnienie mogę oczekiwać od przechwytywania audio o niskim opóźnieniu Shared w VoxBooster?

Na procesie średniej klasy z nowoczesnym sterownikiem audio VoxBooster korzystający z przechwytywania audio o niskim opóźnieniu Shared osiąga całkowite opóźnienie potoku audio 10-25 ms. Ludzkie postrzeganie opóźnienia dźwięku staje się zauważalne około 20-30 ms dla samomonitoringu i około 150 ms w rozmowie, dlatego przechwytywanie audio o niskim opóźnieniu Shared jest dobrze w wygodnym zakresie zarówno dla transmisji, jak i gier.

Czy potrzebuję ASIO do zmieniacza głosu na Discord lub w grach?

Nie. ASIO jest przeznaczony do profesjonalnych studiów nagraniowych, które potrzebują opóźnienia poniżej 5 ms do monitorowania wielościeżkowego. Discord, komunikacja głosowa w grze i platformy przesyłające są idealnie obsługiwane przez przechwytywanie audio o niskim opóźnieniu Shared na poziomie 10-25 ms. ASIO omija również całą sieć audio Windows, co może przerwać wirtualny routing mikrofonów, na którym polegają zmieniacze głosu.

Jaki tryb audio Windows domyślnie wykorzystuje VoxBooster?

VoxBooster domyślnie korzysta z przechwytywania audio o niskim opóźnieniu Shared, który stanowi równowagę między opóźnieniem, kompatybilnością i stabilnością dla najszerszego zakresu sprzętu. Zaawansowani użytkownicy mogą przejść na przechwytywanie audio o niskim opóźnieniu Exclusive w ustawieniach, aby zmniejszyć opóźnienie, ale powoduje to wyłączenie równoczesnego dźwięku z innych urządzeń. MME i DirectSound są dostępne jako opcje rezerwowe dla starszego sprzętu.


Wnioski

Pytanie o zmieniaczu głosu MME sprowadza się do tego: przechwytywanie audio o niskim opóźnieniu Shared to właściwy tryb audio dla prawie każdego kto używa zmieniaczą głosu w czasie rzeczywistym w 2024. Zastąpiło MME i DirectSound z powodu - niskie opóźnienie, lepsza wydajność zasobów i czystsza architektura audio, która nie wymaga starszych szuntów kompatybilności.

MME miało sens w 1991. DirectSound miało sens w 1995, gdy mieszanie sprzętu było prawdziwe. Przechwytywanie audio o niskim opóźnieniu Exclusive i ASIO mają sens w studiu nagraniowym. Do gier, transmisji, Discord i spotkań online ze zmieniaczu głosu aktywnym, przechwytywanie audio o niskim opóźnieniu Shared trafia właściwy balans za każdym razem.

Jeśli uruchomiłeś zmieniaczu głosu na MME i zastanawiałeś się, dlaczego to czuje się powolnie, ta jedna zmiana ustawienia będzie miała natychmiast zauważalną różnicę. Jeśli szukasz zmieniaczą głosu, który domyślnie prawidłowo zmienia przechwytywanie audio o niskim opóźnieniu i pozwala na dostrojenie rozmiarów buforów z interfejsu głównego, VoxBooster jest warte spojrzenia - 3-dniowa bezpłatna próba, bez karty kredytowej, bez instalacji sterownika jądra.

Pobierz VoxBooster - Windows 10/11, bezpłatna wersja próbna dołączona.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo