Tekst na mowę robotyczną: 6 przepisów na głosy

Uczyń tekst na mowę robotyczną dzięki 6 gotowym przepisom. Dokładne ustawienia kwantyzacji rozstrojów, modulacji pierścieniowej, kompresji bitowej i korekcji dla każdego stylu głosu TTS.

Robienie tekstu na mowę robotyczną to mniej o jednym magicznym przycisku, a więcej o warstwowaniu kilku dobrze dobranych efektów na syntetyczny głos, aż przestanie brzmieć humanoidalnie. Jeśli kiedykolwiek próbowałeś zamienić zwykłego narratora komputerowego na właściwy głos maszyny i skończyłeś z czymś mętnym, buzującym lub dziwnym, problem prawie zawsze dotyczy przepisu: którego efektu, w jakim porządku, w jakim stopniu. Ten przewodnik omija teorię i daje ci sześć kompletnych, nazwanych przepisów na głos robotyczny, które możesz skopiować dzisiaj, każdy z dokładnymi ustawieniami dla rozstrojów, modulacji pierścieniowej, kompresji bitowej i korekcji.


Streszczenie

  • Robotyczny głos TTS to syntetyczny narrator plus cztery efekty: kwantyzacja rozstrojów, modulacja pierścieniowa, kompresja bitowa i korekcja kształtowana.
  • Sześć nazwanych przepisów poniżej: Klasyczny komputer lat 80., Nowoczesny asystent poszedł źle, Glitch Bot, AI zwiastuna science fiction, Deadpan Meme Robot i Radio Mecha Pilot.
  • Kwantyzacja rozstrojów kontroluje sztywność monotonii; ring mod dodaje metaliczny buzz; kompresja bitowa dodaje błęd; korekcja decyduje o ciepłe kontra cienkie.
  • Charakter metaliczny żyje w górach pośrodku, a nie w baskach, więc obetnij nisko, jeśli brzmi mętnie.
  • Eksportuj offline dla filmów lub kieruj przez wirtualny mikrofon, aby używać głosu robotycznego na żywo na Discord i OBS.
  • Aby zapoznać się z pełnym wyjaśnieniem dotyczącym tego, kiedy używać TTS-first w stosunku do voice-changer-first, zobacz połączony głębokie zagłębienie.

Co to jest robotyczny głos TTS?

Robotyczny głos TTS to narrator tekstu na mowę, który został przetworzony tak, aby brzmiał mechanicznie niż naturalnie. Zaczyna się z syntetyczną mową wygenerowaną z wpisanych słów, a następnie dodaje efekty, które usuwają naturalny ciepło i ekspresję, zastępując je metalicznym, monotonnym lub błędnym artefaktami. Rezultatem jest głos, który brzmi jak maszyna, a nie osoba.

Rozróżnienie ma znaczenie, ponieważ tutaj łączą się dwie rzeczy. Po pierwsze, tekst staje się dźwiękiem poprzez syntezę mowy. Po drugie, ten dźwięk otrzymuje robotyczne opracowanie. Prawie każdy głos można uczynić robotycznym, ale począwszy od płaskiego, niewyraźnego syntetycznego głosu efekty wylądują czystsze, ponieważ jest mniej naturalnej intonacji walczącej z charakterem maszyny.

Jeśli chcesz pełnego wyjaśnienia dwóch sposobów, w które ludzie podchodzą do tego, podział podwójnego zamiaru w tekście na mowę robotyczną obejmuje przepływy pracy TTS-first w porównaniu z voice-changer-first w głębi. Ten post zakłada, że już wiesz, że chcesz rezultat robotyczny i po prostu potrzebujesz działających przepisów.

Co sprawia, że tekst na mowę brzmi robotycznie?

Cztery składniki robią prawie całą pracę. Zrozumienie tego, co zmienia każdy z nich, pozwala Ci zbudować dowolny styl, nie tylko poniżej sześć. Pomyśl o nich jako o pokrętłach, na które buduje się każdy robotyczny głos z tekstu.

Kwantyzacja rozstrojów

Kwantyzacja rozstrojów przyciąga rozstrojem głosu do stałej siatki nut lub kroków zamiast pozwalać jej naturalnie ślizgać się. Mowa człowieka ma stały ruch mikro-rozstrojów; roboty nie. Twarde kwantowanie do pojedynczej nuty daje martwą monotonną dostawę. Luźniejsza siatka utrzymuje ruch, ale sprawia, że brzmi podstopniowo i sztywnie, jak maszyna przybliżająca mowę.

Modulacja pierścieniowa

Modulacja pierścieniowa mnoży głos stałym tonem, wytwarzając metaliczne pasma boczne, które nie występują w naturalnej mowie. Niskie częstotliwości nośne (około 5 do 80 Hz) dodają subtelny buzz lub drżenie. Wyższe częstotliwości (200 Hz i wyżej) wytwarzają klasyczny dźwięk robota w dżwięku z starych filmów science fiction. To najłatwiej rozpoznawalny efekt robotyczny.

Kompresja bitowa

Kompresja bitowa celowo obniża wierność audio. Obniża głębię bitową (dodając szum kwantowania i błędy) i obniża częstotliwość próbkowania (dodając ostre aliasing). Trochę daje vintage cyfrowy crunch; dużo daje zepsuty, niskofi teksturę maszyny. To efekt TTS robotyczny, który sprawia, że głos wydaje się przychodzący z taniej sprzętu z lat 80.

Korekcja

Korekcja decyduje, czy Twój robot brzmi ciepło czy cienki, pełny zakres czy ograniczony pasmo. Cięcie niskich częstotliwości usuwa rezonans w klatce piersiowej człowieka. Wzmacnianie górnych pośrodków około 2 do 4 kHz dodaje cienką, metaliczną jakość. Filtrowanie pasma do wąskiego zakresu naśladuje radio lub interfon. Korekcja to gdzie robot przechodzi od ogólnego do konkretnego.

Przepisy robotyczne tekstu na mowę: 6 nazwanych stylów

Oto sześć przepisów. Ustawienia są opisywane jasno, ponieważ każde narzędzie oznacza swoje pokrętła inaczej. Używaj ich jako celów i dostosowuj do smaku. Każdy przepis wymienia głos do uruchomienia, cztery główne ustawienia i gdzie świeci.

1. Klasyczny komputer lat 80.

Sztywny, monotonny narrator z wczesnych komputerów domowych i intromów w Arcade.

  • Wybór głosu: Płaski, neutralny syntetyczny głos w średnim rozstroju i nieco wolniejszym tempie. Unikaj ekspresyjnych lub emocjonalnych narratorów; chcesz od początku zero ciepła.
  • Kwantyzacja rozstrojów: Twarda. Przymocuj do jednej nuty lub ścisłej siatki semitonów, aby dostarczenie było całkowicie monotonne i schodowe.
  • Modulacja pierścieniowa: Niska lub wyłączona. Jeśli z niej korzystasz, trzymaj nośnik około 30 do 60 Hz, aby uzyskać słaby buzz zamiast dzwięku.
  • Kompresja bitowa: Umiarkowana. Celuj w 8-bitowy feel i pociągnij częstotliwość próbkowania w dół do około 11 kHz, aby brzmiało, jakby wyszło z małego wewnętrznego głośnika.
  • Korekcja: Utnij wszystko poniżej 200 Hz. Wzmacniaj od 2 do 4 kHz, aby uzyskać ten cienki, metaliczny charakter.
  • Gdzie świeci: Retro game intros, fałszywe sekwencje startowe, vaporwave edits i każda nostalgiczna gra głosu komputera.

2. Nowoczesny asystent poszedł źle

Czysty głos inteligentnego głośnika, który jest subtelnie, przerażająco zepsuty.

  • Wybór głosu: Czysty, naturalnie brzmiący syntetyczny głos, taki, jaki spodziewałbyś się od nowoczesnego asystenta. Horror pochodzi z łamania czegoś, co zaczęło się wypolerowane.
  • Kwantyzacja rozstrojów: Lekka. Wystarczająco dużo stopniowania, aby czuć się trochę nie tak, a nie pełna monotonia.
  • Modulacja pierścieniowa: Bardzo subtelna, nośnik około 5 do 15 Hz, aby dodać powolny wobble lub drżenie, jak głos naprężu.
  • Kompresja bitowa: Lekka. Utrzymaj większość wierności, aby usterki wyróżniały się na tle czystego dźwięku.
  • Korekcja: Utrzymuj to całkiem pełne, ale dodaj mały metaliczny bump blisko 3 kHz. Przeglądaj okazjonalne jąkanie lub powtarzające się usterki na pojedynczych słowach.
  • Gdzie świeci: Horror shorts, creepypasta narration i skity, w których przyjazny asystent wyraźnie się usuwa.

3. Glitch Bot

Chaotyczny, niskofi i rozsypujący się w najlepszy sposób.

  • Wybór głosu: Prawie wszystko działa; efekty dominują. Syntetyczny głos w środku rozstrojów daje efektom miejsce do żucia.
  • Kwantyzacja rozstrojów: Chaotyczna. Użyj agresywnej lub losowej siatki, aby rozstrojem skoczyła wokół nienaturalnie.
  • Modulacja pierścieniowa: Mid range, nośnik przesuwający się między około 100 i 400 Hz, aby uzyskać przesuwającą się metaliczną krawędź.
  • Kompresja bitowa: Ciężka. Pchnij częstotliwość próbkowania w dół do 6 do 8 kHz, aby aliasing i błędy były oczywiste.
  • Korekcja: Chropowate pośrodki. Wzmacniaj od 1,5 do 3 kHz i pozwól mu brzmieć agresywnie.
  • Gdzie świeci: Memes, fałszywe komunikaty błędów, edycje w stylu datamosh i glitchcore audio.

4. AI zwiastuna science fiction

Głębokie, powolne i kinematyczne, wszechwiedzącą maszynę opowiadającą coś epickiego.

  • Wybór głosu: Głębokie, powolne, autorytatywne syntetyczne głosu. Niżej lub rezonans trochę dla dodatkowych wagi.
  • Kwantyzacja rozstrojów: Wyłączona lub bardzo delikatna. Chcesz wagi, a nie sztywności, więc pozwól rozstrojowi oddychać.
  • Modulacja pierścieniowa: Subtelny niski nośnik, poniżej 40 Hz, aby uzyskać słaby syntetyczny podtekst, który sugeruje, że to nie jest człowiek.
  • Kompresja bitowa: Minimalna. Klarowność jest ważna tutaj; ciężki crush zabija dramaturgię.
  • Korekcja: Wzmacniaj nisko kończy przy 80 do 150 Hz na głębię, dodaj obecność około 4 kHz i umieść ją w dużym pogłosie lub przestrzeni.
  • Gdzie świeci: Zwiastun voiceovers, dramatyczne intros, kinematyczne narracje i momenty ujawnienia szefa.

5. Deadpan Meme Robot

Płaski, nieinteresowany narrator za tysiące krótkich filmów.

  • Wybór głosu: Monotonny, beznamiętny syntetyczny głos ze stałym tempem. Komedia polega na całkowitym braku intonacji.
  • Kwantyzacja rozstrojów: Twarda monotonia, zablokowana do pojedynczej nuty.
  • Modulacja pierścieniowa: Wyłączona. Ten styl pozostaje suchy i prosty.
  • Kompresja bitowa: Lekka do umiarkowanej, wystarczająca do sygnalizacji, że to maszyna czyta.
  • Korekcja: Cienka i trochę nosowa. Utnij nisko poniżej 180 Hz i dodaj łagodny bump 3 kHz.
  • Gdzie świeci: Krótkie memy tekstu na mowę, deadpan narration i komiczny timing, gdzie dostarczenie pokerface sprzedaje żart.

6. Radio Mecha Pilot

Metaliczny głos trzeszczący przez kanał komunikacji z wnętrza gigantycznego robota.

  • Wybór głosu: Syntetyczny głos średniego zakresu, energiczny. Chcesz trochę jazdy, aby radioterapia miała życie do kompresji.
  • Kwantyzacja rozstrojów: Lekka. Dotyk stopniowania czyta jako komunikacja wspierana maszyną.
  • Modulacja pierścieniowa: Umiarkowana, nośnik około 80 do 200 Hz, na metaliczną krawędź bez pełnego obcego dzwięku.
  • Kompresja bitowa: Umiarkowana, aby sprzedać niskopasmowe odczucie radiowe.
  • Korekcja: Filtr pasma do około 300 Hz do 3 kHz na dźwięk walkie-talkie. Dodaj lekki odruch i dotyk statyki lub szumu komunikacji na ogonach.
  • Gdzie świeci: Postacie Mecha Anime, militarna gra rolek komunikacyjna i osoby VTuber.

Tabela porównawcza 6 stylów robotycznych

Użyj tego, aby wybrać przepis startowy na pierwszy rzut oka, a następnie dostosuj stamtąd.

StylKwantyzacja rozstrojówModulacja pierścieniowaKompresja bitowaCharakter korekcjiNajlepsze dla
Klasyczny komputer lat 80.Twarda monotoniaNiska lub wyłączonaUmiarkowana (8-bit, ~11 kHz)Cienka, brak niskoRetro intros, vaporwave
Nowoczesny asystent poszedł źleLekkaBardzo subtelna (5-15 Hz)LekkaPełna z bumem 3 kHzHorror, creepypasta
Glitch BotChaotycznaMid (100-400 Hz)Ciężka (6-8 kHz)Chropowate pośrodkiMemes, błędy żart
AI zwiastuna science fictionWyłączona lub delikatnaSubtelny niski (<40 Hz)MinimalnaGłębokie nisko + obecnośćZwiastuny, intros
Deadpan Meme RobotTwarda monotoniaWyłączonaLekka-umiarkowanaCienka, nosowaKrótkie memy
Radio Mecha PilotLekkaUmiarkowana (80-200 Hz)UmiarkowanaPasmo 300 Hz-3 kHzMecha, larp komunikacji

Jak uczynić tekst na mowę robotyczną krok po kroku

Jeśli nigdy nie zbudowałeś jednego od zera, oto kolejność operacji, która utrzymuje rzeczy w czystości. Wykonywanie kroków w tej sekwencji uniemożliwia efektom walczenie ze sobą.

  1. Napisz i wygeneruj głos bazowy. Wpisz scenariusz i wygeneruj go syntetycznym głosem. Dla większości stylów robotycznych wybierz płaskigo, niewyraźnego narratora, aby efekty nie konkurowały z intonacją człowieka.
  2. Ustaw kwantyzację rozstrojów pierwszą. Zdecyduj się między monotonią, stopniowaniem i naturalnością przed dodaniem koloru. To jest kręgosłup tego, jak mechaniczny wydaje się dostarczenie.
  3. Dodaj modulację pierścieniową następnie. Zacznij nisko i subtelnie, a następnie podnieś częstotliwość nośnika dopiero, aż pojawi się metaliczny charakter. Przesada i słowa przestają być zrozumiałe.
  4. Stosuj kompresję bitową, a następnie korekcję ostatnią. Crush na teksturę, następnie użyj korekcji, aby naprawić wszystko, co niewyraźna crush, obetnij ciepło i wybierz ostateczny podpis tonalny.

Powodem, dla którego korekcja przychodzi ostatnia, jest proste: zarówno kompresja bitowa, jak i modulacja pierścieniowa dodają energię w nieprzewidywalnych miejscach, a chcesz ostatecznego przejścia korekcji, aby wyczyścić rzeczywisty przetworzony sygnał, a nie surowy głos.

Zastosowanie głosu robotycznego: offline export vs live virtual mic

Gdy przepis brzmi poprawnie, istnieją dwa sposoby na rzeczywiste jego użycie, a pasują różne zadania.

Offline export

Dla filmów, narracji, memes i wszystkiego wstępnie nagranego, wyrenderuj głos robotyczny do pliku audio i upuść go w edytor. Daje to nieograniczone przetakty, możliwość precyzyjnego dostrojenia każdego efektu po fakcie i najwyższą możliwą jakość, ponieważ nic nie wyściga zegarem w czasie rzeczywistym. Darmowy edytor taki jak Audacity może hostować większość tych efektów i możesz odbić skończony klip bezpośrednio na osi czasu. Offline jest właściwym wezwaniem, gdy timing i połysk mają znaczenie więcej niż natychmiastowość.

Live poprzez wirtualny mikrofon

Do streamingu, rozmowy głosowej Discord lub gry ról, w której mówisz w czasie rzeczywistym, kieruj przetworzony dźwięk przez wirtualny mikrofon. Narzędzia komputerowe takie jak VoxBooster uwidoczniają wirtualny mikrofon, który inne aplikacje widzą jako normalne wejście, więc wybierasz go w Discord lub OBS i efekt robotyczny jest stosowany na bieżąco. Oznacza to, że możesz mówić (lub wyzwolić TTS) i słuchacze słyszą głos maszyny natychmiast, bez kroku renderowania. VoxBooster robi to w Windows 10 i 11 bez sterownika kernel, a całe przetwarzanie pozostaje na Twoim komputerze.

Jeśli chcesz głębszej mechaniki łańcuchowania tych efektów dla persona robota na żywo, robot voice maker walkthrough przechodzi przez pełny łańcuch efektów szczegółowo. Do brata przyjmę skupiony na stronie tekstu na mowę, robot voice tts przewodnik to kawałek towarzysza do tego.

Do użytku na żywo, strona OBS routingu jest warta szybkiego przeczytania także; baza wiedzy OBS obejmuje jak wybrać i mieszać urządzenia wejścia audio, tak aby wirtualny mikrofon wylądował na właściwym kanale.

Powszechne błędy, gdy uczynić tekst na mowę robotyczną

Kilka powtarzających się przestępców oddzieli czysty robot od mudy.

  • Zbyt dużo nisko na końcu. Najczęstszy mętny problem z robotem. Charakter metaliczny żyje w górach pośrodku. Jeśli brzmi jak osoba mamrocząca pod wodą, agresywnie obetnij poniżej 200 Hz.
  • Modulacja pierścieniowa zbyt głośna. Pchnij nośnik lub miksy zbyt wilgotne i słowa przestają być zrozumiałymi dzwiękami. Wycofaj go, aż będziesz mógł czytać zdanie, a następnie zatrzymaj się.
  • Oklejanie zmiażdżenie na zmiażdżenie. Ciężka kompresja bitowa plus niska częstotliwość próbkowania plus odruch mogą zamienić wszystko w syk. Dodaj błąd w jednym miejscu, a nie trzech.
  • Pominięcie płaskiego głosu bazowego. Począwszy od ekspresyjnego, emocjonalnego narratora sprawia, że efekty monotonii walczą ze źródłem. Najpierw wybierz zwykły głos; jest znacznie łatwiej uczynić tekst na mowę robotyczną, gdy nie ma ciepła człowieka do walki.

Najczęściej zadawane pytania

Co to jest tekst na mowę robotyczną?

Tekst na mowę robotyczną to synteza mowy przetwarzana tak, aby brzmiała mechanicznie zamiast naturalnie. Zaczynasz od głosu komputera czytającego Twój tekst, a następnie dodajesz efekty takie jak kwantyzacja rozstroju, modulacja pierścieniowa, kompresja bitowa i korekcja kształtowana, aby nadać mu charakter metaliczny i maszyny.

Jak uczynić tekst na mowę robotyczną?

Wybierz płaski syntetyczny głos, a następnie nałóż cztery efekty: prześlij rozstrój do stałej siatki, aby uzyskać monotonną dostawę, dodaj modulację pierścieniową, aby uzyskać metaliczny buzz, zastosuj kompresję bitową, aby zmniejszyć wierność, i użyj korekcji, aby zacieniować lub ograniczyć zakres tonalny. Dostosuj każdy element, aż będzie pasować do docelowego stylu.

Jakie ustawienia sprawiają, że głos TTS brzmi robotycznie?

Cztery główne to kwantyzacja rozstrojów (przyciąga rozstrojem do kroków dla monotonii), modulacja pierścieniowa (dodaje metaliczne pasma boczne), kompresja bitowa (obniża głębię bitową i częstotliwość próbkowania dla błędu) i korekcja (obcina ciepło, wzmacnia cienkie góry pośrodku). Zacznij subtelnie na każdym i warstwie, aż postać się pojawi.

Co to jest modulacja pierścieniowa w głosie robota?

Modulacja pierścieniowa mnoży sygnał głosu przez stały ton, tworząc metaliczne pasma boczne, które brzmią sztuczenie i nieharmonicznie. Niskie częstotliwości dodają subtelny buzz lub drżenie, podczas gdy wyższe częstotliwości wytwarzają klasyczny, obcy dźwięk robota używany w starych programach science fiction i grach.

Czy mogę używać robotyczne TTS na żywo na Discord lub OBS?

Tak. Kieruj przetworzony dźwięk przez wirtualny mikrofon, a następnie wybierz ten wirtualny mikrofon jako wejście w Discord, OBS lub dowolnej aplikacji głosowej. Efekt robotyczny jest stosowany w czasie rzeczywistym, więc słuchacze słyszą głos mechaniczny zamiast nieprzetworzonych danych wejściowych.

Czy tekst na mowę robotyczną jest darmowy?

Wiele głosów TTS w przeglądarce i narzędzi open-source nic nie kosztuje, a efekty robotyczne można dodać w darmowych edytorach takich jak Audacity. Aplikacje komputerowe takie jak VoxBooster oferują trzymiesięczną pełną wersję próbną bez karty kredytowej, abyś mógł przetestować żywe głosy robotyczne przed podjęciem decyzji.

Dlaczego mój głos robotyczny brzmi mętnie zamiast metalicznie?

Zwykle w sygnale pozostaje zbyt dużo ciepła niskotonowego. Utnij wszystko poniżej 200 Hz, zmniejsz kompresję bitową, jeśli rozmywa szczegóły, i naciśnij mały skok obecności około 3 kHz. Charakter metaliczny żyje w górach pośrodku, a nie w baskach, więc go przerzedź.

Wniosek

Robienie tekstu na mowę robotyczną sprowadza się do powtarzanego przepisu: wybierz płaski głos, ustaw kwantyzację rozstrojów, dodaj modulację pierścieniową, zmiażdż wierność i ukształtuj korekcję. Sześć stylów powyżej daje Ci przetestowane punkty startowe dla wszystkiego, od retro komputerowych żartów do kinematycznej narracji zwiastuna i żywych komunikacji Mecha. Skopiuj przepis, dostosuj ustawienia do smaku, a wylądujesz czysty robotyczny głos TTS znacznie szybciej niż zgadywanie.

Gdy będziesz gotów uruchomić je na żywo, VoxBooster jest jedną z opcji, która stosuje cały łańcuch efektów w czasie rzeczywistym w Windows i kieruje go przez wirtualny mikrofon do Discord, OBS lub dowolnej aplikacji, ze wszystkim przetwarzanym lokalnie na Twoim komputerze. Możesz spróbować pełny zestaw funkcji w trzymiesięcznej wersji próbnej i ceny znajdują się na stronie ceny, jeśli zdecydujesz się to zachować. Pobierz VoxBooster.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo