Zmiana głosu + Runway Act-One: Pełny przepływ pracy

Dowiedz się, jak łączyć zmieniacz głosu w czasie rzeczywistym z Runway ML Act-One, aby produkować filmiki AI z postaciami o dopasowanym głosie i wydajności.

Zmiana głosu + Runway Act-One: Pełny przepływ pracy do filmów krótkometrażowych AI

Funkcja Act-One w Runway ML zmieniła to, co mogą osiągnąć soloowi twórcy. Nagraj siebie grającego scenę — tylko kamera telefonu i naturalne światło — a Act-One mapuje Twoją wydajność twarzy na każdą postać w wygenerowanym wideo. Brakującą częścią dla większości niezależnych filmowców jest dźwięk: Act-One obsługuje twarz, ale głos, który wychodzi z Twoich ust, wciąż brzmi jak Ty.

Zmienacz głosu w czasie rzeczywistym zamyka tę lukę. Nagraj wideo referencyjne ze zmienionym już głosem, a klip wyjściowy zawiera wbudowany głos postaci — bez post-produkcji, bez sesji dubingu.

Ten przewodnik przeprowadza Cię przez pełny przepływ pracy: wybór ustawień według archetypu postaci, skonfigurowanie łańcucha dźwięku tak, aby Runway przechwycił czystość, i zmontowanie wszystkiego w edytorze wideo do dystrybucji.


TL;DR

  • Runway Act-One odczytuje ruch twarzy z wideo referencyjnego i mapuje go na wygenerowaną postać.
  • Zmienacz głosu w czasie rzeczywistym uruchomiony przez wirtualny mikrofon pozwala nagrać wideo referencyjne ze stosowanym już dźwiękiem postaci.
  • Ścieżka dźwięku z Twojego nagrania referencyjnego staje się ostatecznym dialogiem — Act-One nie dotyka dźwięku.
  • Dopasuj ustawienie głosu do archetypu postaci przed nagrywaniem.
  • Wirtualny mikrofon przechwytywania audio o niskim opóźnieniu VoxBooster jest rozpoznawany przez OBS, oprogramowanie kamer internetowych i programy nagrywające ekran bez instalacji sterownika.
  • Montaż końcowy jest prosty: zaimportuj wyjście wideo Act-One, zsynchronizuj przetworzony tor dźwięku, grade’uj kolory i eksportuj.

Co to jest Runway Act-One?

Runway ML to platforma generacyjna AI używana przez filmowców, studia VFX i twórców treści do generowania wideo i zadań edycji. Act-One to konkretna funkcja, która wykonuje transfer ruchu twarzy: analizuje wideo referencyjne rzeczywistego performera i napędza animację twarzy postaci w wygenerowanym klipie wyjściowym.

Przepływ pracy różni się od czystego tekstu na wideo. Zamiast opisywać ruch w wysłaniku, uosabiasz go. Podniesienie brwi, synchronizacja warg i pochylenie głowy stają się wyrazami postaci. Daje to znacznie bardziej naturalną i emocjonalnie spójną animację niż samo generowanie na podstawie wysłannika, ponieważ źródłem prawdy są rzeczywiste dane wydajności człowieka.

Act-One dołącza do szerszego zestawu narzędzi — w tym Runway Gen-4, narzędzi zielonego ekranu i malowania — które razem funkcjonują jako kompletny potok produkcji dla kina wspieranego AI.


Dlaczego audio jest zaniedbywana warstwa

Kiedy twórcy po raz pierwszy wypróbowują Act-One, zwykły wynik jest wizualnie imponujący, ale akustycznie nieprzyjemny. Twarz postaci porusza się z wyrazistością aktora, ale głos jest nagrywany surowo — naturalna ludzka barwa, bez transformacji — i wklejony pod wygenerowany materiał filmowy. Rozłączenie jest natychmiastowe.

Konwencjonalnym poprawikiem jest przetwarzanie głosu w post-produkcji: nagraj czystość, a następnie uruchom dźwięk przez efekty później. Działa, ale stwarza problem synchronizacji. Synchronizacja warg w Act-One zależy od wideo referencyjnego. Jeśli nagrasz subtelną wydajność, a następnie dodasz dużą przetwarzanie wokalne później — wydłużając samogłoski, dodając zmianę formantu — ruch ust postaci nie odpowiada już przetworzonym dźwiękom.

Nagrywanie ze zmieniachem głosu stosowanym w czasie rzeczywistym rozwiązuje to. Słyszysz zmieniony głos w słuchawkach podczas wykonywania, co naturalnie kształtuje ruchy ust i tempo, aby pasowały do przetwozonego dźwięku. Act-One przechwytuje te dostosowane ruchy. Wynikiem jest bardziej ciasna synchronizacja warg w wygenerowanym wyjściu.


Jak Runway Act-One odczytuje wideo referencyjne

Zrozumienie formatu wejścia pomaga nagrywać lepsze nagrania referencyjne.

Act-One wykonuje śledzenie twarzy na klipu referencyjnym. Oczekuje:

  • Kąt czołowy lub prawie czołowy — profile znacznie zmniejszają dokładność. Celuj na Twoją twarz wyśrodkowaną w kadrze, kamera na poziomie oczu.
  • Spójna oświetlenie — ostre cienie na nosie lub oczach zakłócają wykrywanie punktów orientacyjnych. Miękkie światło czołowe (pierścień światła, światło z okna) jest idealne.
  • Minimalna ruch tła — ludzie przechodzący za Tobą lub poruszające się przedmioty mogą zdezorientować tracker.
  • Wyraźna widoczność warg — brody i mikrofony przed ustami zmniejszają wierność synchronizacji warg.
  • 720p lub wyższe, 24fps lub 30fps — niższa rozdzielczość zmniejsza dokładność śledzenia.
  • Kontener MP4 — najnowocześniejszy dla potoku przesyłania. MOV również działa.
  • Poniżej 30 sekund na ujęcie — Act-One przetwarza sprawnie przy tej długości; dłuższe klipy są możliwe, ale zwiększają czas kolejki generowania.

Ścieżka dźwiękowa w wideo referencyjnym nie jest analizowana przez samo Act-One. Generacja jest sterowana czystymi danymi wizualnymi. Oznacza to, że wyjście zmieniacza głosu w Twojej ścieżce dźwięku nie ma żadnego wpływu na jakość animacji twarzy — dwie warstwy są całkowicie niezależne.


Archetypy postaci i kojarzenie ustawień głosu

Najsilniejsze filmy Act-One mają spójność soniczną: głos pasuje do postaci zanim pojedynczy wiersz dialogu zostanie napisany. Oto praktyczny poradnik parowania.

Archetyp postaciZalecane przetwarzanie głosuNotatki
Opancerzony wojownik / rycerzObniżenie tonu 3-5 półtonów + lekkie pogłos pokojuDodaje ciężar; pogłos symuluje rezonans hełmu
Istota nadprzyrodzona / nieziemskaPowolna modulacja tonu + formantu w góręTworzy niespokojną, nieziemską teksturę
Robot / konstrukt AITwardy vokoder lub ustawienie bitcrushuDziała najlepiej z ostrym, celowym dostarczaniem
Starożytne zło / czarownikMocne obniżenie tonu + subtelny chorusChorus dodaje poczucie wielu głosów
Młody bohater / wybranyLekkie podniesienie tonu + minimalne przetwarzanieZachowaj zasięg emocjonalny; nie przetwarzaj zbyt dużo
Dyplomata obcyZmiana formantu + lekka szerokość stereoUtrzymuje inteligencję mowy podczas sounding non-human
Narrator / wyroczniaObniżenie tonu 2 półtony + długi ogon pogłosuEpicki energia dokumentalna

Tabela to punkt wyjścia, a nie reguła. Mieszaj ustawienia i ufaj swoim uszom podczas wydajności. Jeśli głos czuje się dobrze przez słuchawki podczas gry, będzie się czuł dobrze w ostatecznym filmie.


Konfiguracja łańcucha dźwięku

Celem jest kierowanie przetworzonym dźwiękiem zarówno do oprogramowania nagrywającego (dla ścieżki dźwięku wideo referencyjnego), jak i do słuchawek monitoringowych (abyś słyszał siebie w charakterze podczas wydajności).

Krok 1 — Instalacja i konfiguracja zmieniacza głosu

Zainstaluj VoxBooster na Windows 10 lub 11. Sterownik jądra nie jest wymagany — wirtualny mikrofon przechwytywania audio o niskim opóźnieniu pojawia się w ustawieniach dźwięku Windows jako standardowe urządzenie wejściowe w ciągu sekund od pierwszego uruchomienia.

Otwórz VoxBooster, wybierz fizyczny mikrofon jako źródło wejścia i wybierz ustawienie z tabeli archetypu powyżej. Zweryfikuj, że wyjście jest kierowane do VoxBooster Virtual Mic w selektorze wyjścia.

Krok 2 — Ustawianie monitorowania

W ustawieniach VoxBooster włącz monitorowanie słuchawek. Powinieneś teraz słyszeć swój zmieniony głos w czasie rzeczywistym przez słuchawki. Opóźnienie dla ustawień DSP wynosi poniżej 20 ms — nie do zauważenia podczas wydajności. Tryb klonowania głosu AI dodaje krótkie okno przetwarzania (mniej niż 300 ms od końca do końca), które niektórzy artyści mogą początkowo uznać za nieco dezorientujące; przećwicz kilka linii przed ujęciem.

Krok 3 — Konfiguracja oprogramowania nagrywającego

Otwórz program nagrywający ekran lub aplikację przechwytywania kamer internetowych (OBS, Windows Camera, Loom lub podobne). W ustawieniach wejścia dźwięku wybierz VoxBooster Virtual Mic zamiast swojego fizycznego mikrofonu. Gwarantuje to, że nagranie przechwytuje przetworzony głos, a nie surowe wejście.

Jeśli używasz OBS:

  1. W Źródłach dodaj źródło przechwytywania dźwięku wejściowego.
  2. We właściwościach źródła wybierz VoxBooster Virtual Mic z rozwijanego menu urządzenia.
  3. Dodaj źródło urządzenia przechwytywania wideo skierowane na kamerę internetową.
  4. Rozpocznij nagrywanie. Oba strumienie zapisują się do tego samego pliku wyjściowego.

Krok 4 — Nagrywanie ujęcia referencyjnego

Utrzymuj ujęcie krótkie — 10 do 25 sekund to słodki punkt dla Act-One. Wykonuj naturalnie, utrzymując kontakt wzrokowy z obiektywem kamery. Mów dialog na głos z pełnym zaangażowaniem do postaci; Act-One odczytuje intensywność emocjonalną poprzez ruch mięśni twarzy.

Po nagraniu sprawdź plik wyjściowy: ścieżka dźwięku powinna zawierać przetworzony głos, a nie surowy kanał mikrofonu. Odtwórz plik w odtwarzaczu multimediów przed przesłaniem do Runway.


Przesyłanie do Runway Act-One i generowanie wyjścia

Zaloguj się na konto Runway i przejdź do funkcji Act-One. Interfejs prosi o dwa wejścia:

  1. Wideo referencyjne — nagranie wydajności z przetworzonym dźwiękiem.
  2. Źródło postaci — albo wygenerowany obraz z Gen-4, albo przesłany render postaci, albo wcześniejsze wygenerowane wyjście.

Przeslij wideo referencyjne. Act-One wydobywa dane ruchu twarzy podczas przejścia analizy. Następnie wybierz lub wygeneruj swoją postać. Skonfiguruj ustawienia generowania (współczynnik proporcji, przewodnik stylu, wszelkie wskazówki monitora dla środowiska sceny).

Prześlij generację. Czasy kolejki różnią się w zależności od planu i obciążenia platformy. Czekając, możesz przygotować zasoby post-produkcji: wszystkie elementy tła sceny, karty tytułowe lub ścieżki muzyczne.

Gdy klip wyjściowy się pobiera, zawiera wideo postaci napędzane Twoją wydajnością. Ścieżka dźwięku w pobranym pliku może być cicha lub może przenosić Twój dźwięk referencyjny w zależności od wersji potoku Runway. W każdym przypadku Twoim następnym krokiem jest edytor wideo, gdzie zmontowasz ostateczną kompozycję.


Montaż po produkcji

Otwórz edytor wideo (DaVinci Resolve, Premiere Pro, CapCut lub dowolny NLE). Utwórz nowy projekt pasujący do docelowych specyfikacji wyjścia (zwykle 1920×1080 lub 1080×1920 w pionie, 24fps).

Układ ścieżki:

ŚcieżkaZawartość
V1Wideo postaci Act-One wygenerowanej
V2Talerze tła lub materiał nagrany na żywo
A1Przetworzony dźwięk z nagrania referencyjnego
A2Muzyka / dźwięk otoczenia
A3Opcjonalne warstwy efektów dźwiękowych

Zsynchronizuj przetworzony dźwięk z Twojego nagrania referencyjnego do wideo postaci na V1. Ponieważ nagrałeś dźwięk i wideo jednocześnie w ujęciu referencyjnym, synchronizacja jest już wbudowana — nie powinieneś potrzebować ręcznego dostosowania, chyba że potok przesyłu przyczynił kilka klatek.

Dodaj talerze tła, poddaj klasę postaci, aby pasowała, i mieszaj dźwięk. Eksportuj w H.264 lub H.265 do przesłania na YouTube, TikTok lub Instagram.


Typowe problemy i poprawki

Act-One wyjście ma sztywny lub niesamowity ruch twarzy Zwykle powoduje problemy śledzenia w wideo referencyjnym. Sprawdź równomierność oświetlenia i upewnij się, że na twarz nie pada silny cień. Ponownie nagraj ze źródłem bardziej miękkiego światła.

Synchronizacja warg dryfuje w wygenerowanym wideo Potwierdź, że Twoje nagrania dźwięku i wideo referencyjnego zostały nagrany jednocześnie i zsynchronizowane przed przesłaniem. Dryfowanie w pliku źródłowym będzie się amplifikować w wyjściu. Jeśli nagrałeś dźwięk osobno i scalałeś go, upewnij się, że scalanie było dokładne do klatki.

Zmienacz głosu dodaje zauważalne opóźnienie podczas wydajności Ustawienia DSP działają poniżej 20 ms i są zasadniczo niezauważalne. Jeśli zauważysz opóźnienie, sprawdź, czy rozmiar buforu interfejsu dźwięku nie jest ustawiony zbyt wysoko — zmniejsz bufor przechwytywania audio o niskim opóźnieniu w oprogramowaniu nagrywającym do 128 lub 256 próbek.

Przetworzony głos brzmi nadmiernie skompresowany lub zniekształcony w ostatecznym klipu Ustawienie wzmocnienia zmieniacza głosu może być zbyt gorące. Zmniejsz poziom wyjścia w VoxBooster, aż sygnał osiągnie około -6 dBFS. To pozostawia miejsce na przetwarzanie dźwięku edytora wideo.

Act-One nie akceptuje przesłanego wideo referencyjnego Upewnij się, że plik to MP4 (H.264), rozdzielczość wynosi co najmniej 720p, a czas trwania znajduje się poniżej udokumentowanego limitu dla Twojego planu Runway. Ponownie koduj za pomocą HandBrake, jeśli oryginalne oprogramowanie przechwytywania wytworzyło niezwykły kontener.


Pełna lista kontrolna produkcji

Użyj tej listy kontrolnej dla sceny przed przesłaniem do Runway.

  • Ustawienie wybrane i przećwiczone w charakterze
  • Monitorowanie słuchawek potwierdzone (słyszysz zmieniony głos)
  • Oprogramowanie nagrywające ustawione na wejście VoxBooster Virtual Mic
  • Oświetlenie sprawdzane — równomierne, czołowe, bez silnych cieni na twarzy
  • Tło czyste — brak poruszających się przedmiotów
  • Ujęcie testowe nagrywane i odtwarzane — dźwięk jest przetworzony, nie surowy
  • Czas ujęcia poniżej 30 sekund
  • Plik eksportowany jako MP4 H.264, 720p minimum
  • Plik odtwarzany poprawnie w odtwarzaczu multimediów przed przesłaniem do Runway

Skalowanie do krótkometrażowego filmu wieloscenowego

Niezależni twórcy filmów AI często trafiają na tę samą ścianę: pierwszy klip testowy wygląda świetnie, ale produkcja spójnego 3-do-5 minutowego krótkometrażu wymaga spójności we wszystkich klipach. Kilka praktyk pomaga.

Spójność głosu postaci — zapisz konfigurację ustawienia przed rozpoczęciem produkcji. Każde ujęcie tej samej postaci używa identycznego ustawienia i ustawień wzmocnienia. Nawet małe zmiany kwoty przesunięcia tonu będą zauważalne w cięciach.

Spójność wideo referencyjnego — użyj tej samej pozycji kamery, obiektywu i zestawu oświetlenia dla każdego ujęcia zawierającego tę samą postać. Act-One będzie produkować bardziej spójny styl twarzy we wszystkich wygenerowanych klipach.

Przetwarzanie wsadowe — jeśli to możliwe, nagraj wszystkie ujęcia w jednej sesji. Spójne środowisko akustyczne (ten sam pokój, ta sama pozycja mikrofonu) utrzymuje przetworzony dźwięk tonalnie jednorodnym.

Mieszanie dźwięku — ponieważ cały dialog był przetwarzany za pomocą tego samego ustawienia, ustawienia EQ i kompresji trzeba ustawić tylko raz na magistrali A1 i zastosować równomiernie do wszystkich scen.

Własna dokumentacja Runway i prezentacja społeczności (runwayml.com) zawierają przykłady rozszerzonych projektów Act-One do referencji. Runway jako firma jest również szczegółowo omówiona na Wikipedii, w tym historia jej rozwoju i kontekst badawczy stojący za technikami transferu ruchu używanymi w Act-One.


Dlaczego jakość zmieniacza głosu ma znaczenie dla pracy z Act-One

Act-One podnosi produkcję filmów niezależnych do poziomu, gdzie jakość audio staje się wąskim gardłem. Wygenerowane wideo postaci przy tej wierności zasługuje na ścieżkę dźwięku, która się wyrównuje. Podstawowe wtyczki zmiany tonu produkują artefakty metaliczne, które zderzają się z wysokiej jakości wyjściem wizualnym. Nagranie referencyjne jest również ostateczną ścieżką dźwiękową — nie ma sesji ponownego nagrania — więc jakość przechwycenia jest stała.

VoxBooster przetwarza dźwięk przy mniej niż 300 ms od końca do końca dla klonowania głosu AI i poniżej 20 ms dla ustawień DSP, co jest wystarczająco szybkie dla naturalnej wydajności. Wirtualny mikrofon przechwytywania audio o niskim opóźnieniu jest rozpoznawany przez Windows bez instalacji sterownika i pojawia się czysto w OBS, oprogramowaniu kamer internetowych i programach nagrywających ekran. Wynikiem jest ścieżka głosu, która trzyma się obok wyjścia wizualnego, a nie podkopując ją.

Ceny zaczynają się od 6,99 zł / miesiąc. Bezpłatny okres próbny obejmuje pełny test produkcji przed zaangażowaniem.


Pytania i odpowiedzi

Co to jest Runway Act-One i jak używa wideo referencyjnego? Act-One to funkcja w Runway ML, która przenosi wyraz twarzy i ruchy głowy rzeczywistego aktora na wygenerowaną postać. Dostarczasz krótkie wideo swojej gry — Act-One odczytuje ruch Twojej twarzy i mapuje go na postać. Im lepsza wydajność, tym bardziej ekspresyjny wynik.

Czy mogę używać zmieniacza głosu podczas nagrywania wideo referencyjnego dla Act-One? Tak. Ponieważ Act-One analizuje tylko geometrię twarzy i ruch, a nie wysokość dźwięku, możesz uruchomić zmianę głosu w czasie rzeczywistym przez wirtualny mikrofon i nagrywać wideo i przetworzony dźwięk jednocześnie. Nagrany dźwięk staje się ostateczną ścieżką dialogu; Act-One obsługuje stronę wizualną niezależnie.

Jakie ustawienia głosu najlepiej działają dla fantazyjnych lub science-fiction postaci w Act-One? Dla opancerzonych bohaterów lub wojowników ustawienie obniżenia tonu z lekkim pogłosem dodaje wagi postaci. Dla postaci nadprzyrodzonych lub nieziemskich, powolna modulacja tonu lub zmiana formantu tworzy nieziemską teksturę. Ustawienia robotyczne działają dla mechów lub postaci AI. Kluczem jest dopasowanie energii ustawienia do archetypu postaci, którą wykonujesz w nagraniu wideo.

Czy Runway Act-One wymaga określonego formatu wideo referencyjnego? Act-One działa najlepiej z dobrze oświetlonym ujęciem czołowym, wyraźnie widocznym twarzą, minimalnym zamieszaniem tła. Zalecana jest rozdzielczość 720p lub wyższa. MP4 to najbardziej niezawodny kontener. Utrzymuj klipy poniżej 30 sekund na początkowe nagranie — możesz łączyć wiele ujęć na dłuższe sceny.

Czym jest przechwytywanie audio o niskim opóźnieniu i dlaczego jest ważne dla nagrywania wyjścia zmieniacza głosu? Przechwytywanie audio o niskim opóźnieniu (interfejs sesji audio Windows) to interfejs audio o niskim opóźnieniu wbudowany w Windows 10/11. Zmienacz głosu, który udostępnia wirtualny mikrofon przechwytywania audio o niskim opóźnieniu, pozwala dowolnej aplikacji nagrywającej — w tym programom nagrywającym ekran i oprogramowaniu kamer internetowych — przechwytywać przetworzony głos przy niemal zerowym opóźnieniu bez wymaganej instalacji sterownika.

Czy potrzebuję potężnego komputera do nagrywania wideo referencyjnego Act-One ze zmieniaczer głosu w czasie rzeczywistym? Średniej klasy CPU obsługuje efekty DSP w czasie rzeczywistym przy opóźnieniu poniżej 20 ms bez zauważalnego obciążenia. Wnioskowanie klonowania głosu AI dodaje obciążenie GPU; dedykowana karta graficzna pomaga, ale nie jest obowiązkowa. Krok nagrywania referencyjnego jest zwykle krótki (poniżej 30 sekund), więc nawet na skromnym sprzęcie koszt wydajności jest krótki.

Czy ten przepływ pracy może być używany do długoformatowych filmów AI, czy tylko krótkich klipów? Act-One jest zoptymalizowany dla klipów krótkich do średnich, a kolejka generowania Runway faworyzuje klipy poniżej jednej minuty. W przypadku dłuższych filmów standardowym podejściem jest produkcja scena po scenie: nagraj ujęcie referencyjne na scenę, wygeneruj każdy klip wyjściowy, a następnie zmontuj w edytorze wideo. Zmienacz głosu uruchamia się raz na ujęcie, a przetworzony dźwięk jest eksportowany z każdym klipem.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo