음성 변조기 + Runway Act-One: AI 단편 영화의 완전한 워크플로우
Runway ML의 Act-One 기능은 독립 제작자들이 달성할 수 있는 것을 변화시켰습니다. 장면을 연기하는 자신을 녹화하면 됩니다. 단지 휴대폰 카메라와 자연광만 있으면 되고, Act-One이 당신의 얼굴 연기를 생성된 비디오의 모든 캐릭터에 매핑합니다. 대부분의 독립 영화인들이 놓친 부분은 오디오입니다. Act-One은 얼굴을 처리하지만, 당신의 입에서 나오는 음성은 여전히 당신처럼 들립니다.
실시간 음성 변조기가 그 격차를 메웁니다. 이미 변환된 음성으로 참조 비디오를 녹화하면, 출력 클립은 캐릭터 음성이 내장되어 제공됩니다. 후처리나 더빙 세션 없이.
이 가이드는 완전한 워크플로우를 안내합니다. 캐릭터 원형에 따라 프리셋을 선택하고, Runway가 깔끔하게 캡처하도록 오디오 체인을 설정하며, 배포를 위해 비디오 편집기에서 모든 것을 조립하는 방법을 다룹니다.
TL;DR
- Runway Act-One은 참조 비디오에서 얼굴 움직임을 읽고 생성된 캐릭터에 매핑합니다.
- 가상 마이크를 통해 실행되는 실시간 음성 변조기를 사용하면 이미 적용된 캐릭터 오디오로 참조 비디오를 녹화할 수 있습니다.
- 참조 녹화의 오디오 트랙이 최종 대사가 됩니다. Act-One은 오디오에 손대지 않습니다.
- 녹화 버튼을 누르기 전에 음성 프리셋을 캐릭터 원형과 일치시키세요.
- VoxBooster의 낮은 지연 오디오 캡처 가상 마이크는 OBS, 웹 카메라 소프트웨어 및 화면 녹화 프로그램에서 드라이버 설치 없이 인식됩니다.
- 최종 조립은 간단합니다. Act-One 비디오 출력을 가져오고, 처리된 오디오 트랙을 동기화하고, 컬러 그레이드하고, 내보냅니다.
Runway Act-One이란 무엇인가요?
Runway ML은 영화제작자, VFX 스튜디오 및 콘텐츠 제작자가 비디오 생성 및 편집 작업에 사용하는 생성 AI 플랫폼입니다. Act-One은 얼굴 모션 전달을 수행하는 특정 기능입니다. 즉, 실제 연기자의 참조 비디오를 분석하고 생성된 출력 클립에서 캐릭터의 얼굴 애니메이션을 구동합니다.
워크플로우는 순수한 텍스트-투-비디오와는 다릅니다. 프롬프트에서 움직임을 설명하는 대신, 당신이 그것을 구현합니다. 눈썹을 올리고, 립싱크를 맞추고, 머리를 기울이는 것이 캐릭터의 표정이 됩니다. 이는 프롬프트 전용 생성보다 훨씬 더 자연스럽고 감정적으로 일관된 애니메이션을 생성합니다. 왜냐하면 사실의 소스가 실제 인간 성능 데이터이기 때문입니다.
Act-One은 Runway Gen-4, 그린 스크린 도구 및 인페인팅을 포함한 더 광범위한 도구 세트에 결합되며, 함께 AI 지원 영화 제작을 위한 완전한 프로덕션 파이프라인으로 기능합니다.
왜 오디오가 간과된 계층인가?
제작자들이 처음 Act-One을 시도할 때, 일반적인 결과는 시각적으로는 인상적이지만 음향적으로는 어색합니다. 캐릭터의 얼굴은 배우의 표현력으로 움직이지만, 음성은 생(raw)으로 녹화됩니다. 자연스러운 인간의 음색, 변환 없이. 생성된 영상 아래에 붙여집니다. 단절이 즉시 느껴집니다.
기존 해결책은 후처리 음성 처리입니다. 깨끗하게 녹화한 다음, 나중에 오디오를 효과로 실행합니다. 이것은 작동하지만 동기화 문제를 만듭니다. Act-One의 립싱크는 참조 비디오에 따라 다릅니다. 미묘한 성능을 녹화한 다음 나중에 무거운 음성 처리를 추가하면(모음 연장, 포먼트 시프트 추가), 캐릭터의 입 움직임이 더 이상 처리된 오디오와 일치하지 않습니다.
실시간으로 적용된 음성 변조기로 녹화하면 이 문제가 해결됩니다. 성능 중에 헤드폰에서 변환된 음성을 들으므로 자연스럽게 입 움직임과 속도를 처리된 오디오와 일치시킵니다. Act-One은 이러한 조정된 움직임을 캡처합니다. 결과는 생성된 출력에서 더 단단한 립싱크입니다.
Runway Act-One이 참조 비디오를 어떻게 읽는가
입력 형식을 이해하면 더 나은 참조 영상을 녹화하는 데 도움이 됩니다.
Act-One은 참조 클립에서 얼굴 추적을 수행합니다. 다음을 예상합니다:
- 정면 또는 거의 정면 각도 — 프로필은 정확도를 크게 감소시킵니다. 얼굴이 프레임 중앙에 있고 카메라가 눈 높이에 있도록 합니다.
- 일관된 조명 — 코나 눈 전체의 심한 그림자는 랜드마크 감지에 방해가 됩니다. 부드러운 정면 조명(링 라이트, 창 조명)이 이상적입니다.
- 최소 배경 움직임 — 뒤에서 사람들이 걷거나 물체가 움직이면 추적기가 혼동할 수 있습니다.
- 명확한 입술 가시성 — 수염과 입 앞의 마이크는 립싱크 충실도를 감소시킵니다.
- 720p 이상, 24fps 또는 30fps — 낮은 해상도는 추적 정밀도를 감소시킵니다.
- MP4 컨테이너 — 업로드 파이프라인에 가장 안정적입니다. MOV도 작동합니다.
- 테이크당 30초 이하 — Act-One은 이 길이에서 효율적으로 처리합니다. 더 긴 클립도 가능하지만 생성 대기열 시간을 증가시킵니다.
참조 비디오의 오디오 트랙은 Act-One 자체에 의해 분석되지 않습니다. 생성은 순수한 시각적 데이터로 구동됩니다. 이는 오디오 트랙의 음성 변조기 출력이 얼굴 애니메이션 품질에 영향을 주지 않는다는 의미입니다. 두 계층은 완전히 독립적입니다.
캐릭터 원형 및 음성 프리셋 짝짓기
가장 강력한 Act-One 영화는 음성적 일관성을 가집니다. 음성이 대사의 한 줄이 쓰이기 전에 캐릭터에 맞습니다. 다음은 실용적인 짝짓기 가이드입니다.
| 캐릭터 원형 | 권장 음성 처리 | 노트 |
|---|---|---|
| 갑옷을 입은 전사 / 기사 | 음역 내림 3-5 반음 + 가벼운 룸 리버브 | 무게감을 더함; 리버브는 헬멧 공명을 시뮬레이션함 |
| 초자연적 / 신비로운 존재 | 느린 음역 변조 + 포먼트 상승 | 불안정하고 초자연적인 질감을 만듭니다 |
| 로봇 / AI 구성물 | 하드 보코더 또는 비트크러시 프리셋 | 명확하고 의도적인 발성에 가장 적합함 |
| 고대의 악 / 악당 | 무거운 음역 내림 + 미묘한 코러스 | 코러스는 여러 음성의 느낌을 더함 |
| 어린 영웅 / 선택된 자 | 약간의 음역 상승 + 최소 처리 | 감정적 범위를 보존; 과도하게 처리하지 마세요 |
| 외계인 외교관 | 포먼트 시프트 + 가벼운 스테레오 폭 | 비인간적인 소리를 유지하면서 음성 명확성 유지 |
| 나레이터 / 신탁 | 음역 내림 2 반음 + 긴 리버브 테일 | 서사시적 다큐멘터리 에너지 |
테이블은 출발점이지 규칙이 아닙니다. 성능 중에 프리셋을 섞고 귀를 믿으세요. 헤드폰을 통해 연기하는 동안 음성이 맞으면 최종 영화에서도 맞을 것입니다.
오디오 체인 설정
목표는 처리된 오디오를 녹화 소프트웨어(참조 비디오 오디오 트랙)와 모니터링 헤드폰(성능 중에 캐릭터로 자신을 들을 수 있도록)에 모두 라우팅하는 것입니다.
단계 1 — 음성 변조기 설치 및 구성
Windows 10 또는 11에 VoxBooster를 설치합니다. 커널 드라이버가 필요하지 않습니다. 낮은 지연 오디오 캡처 가상 마이크는 첫 실행 후 몇 초 내에 Windows 사운드 설정에 표준 입력 장치로 나타납니다.
VoxBooster를 열고, 물리적 마이크를 입력 소스로 선택하고, 위의 원형 표에서 프리셋을 선택합니다. 출력이 출력 선택기에서 VoxBooster Virtual Mic로 라우팅되고 있는지 확인합니다.
단계 2 — 모니터링 설정
VoxBooster 설정에서 헤드폰 모니터링을 활성화합니다. 이제 헤드폰을 통해 실시간으로 변환된 음성을 들어야 합니다. DSP 프리셋의 지연은 20ms 미만입니다. 성능 중에는 무시할 수 있습니다. AI 음성 클로닝 모드는 짧은 처리 윈도우를 추가합니다(처음부터 끝까지 300ms 미만). 일부 연기자는 처음에 약간 당황할 수 있습니다. 테이크 전에 몇 줄을 연습하세요.
단계 3 — 녹화 소프트웨어 구성
화면 녹화 또는 웹 카메라 캡처 앱(OBS, Windows Camera, Loom 등)을 엽니다. 오디오 입력 설정에서 물리적 마이크 대신 VoxBooster Virtual Mic를 선택합니다. 이렇게 하면 녹화가 원본 입력이 아닌 처리된 음성을 캡처합니다.
OBS를 사용하는 경우:
- Sources에서 오디오 입력 캡처 소스를 추가합니다.
- 소스 속성에서 장치 드롭다운에서 VoxBooster Virtual Mic을 선택합니다.
- 웹 카메라를 가리키는 비디오 캡처 장치 소스를 추가합니다.
- 녹화를 시작합니다. 두 스트림 모두 동일한 출력 파일에 쓰입니다.
단계 4 — 참조 테이크 녹화
테이크를 짧게 유지하세요. Act-One의 경우 10~25초가 최적입니다. 자연스럽게 연기하면서 카메라 렌즈와 눈을 맞추세요. 캐릭터에 완전히 헌신하면서 대사를 크게 말하세요. Act-One은 얼굴 근육의 움직임을 통해 감정적 강도를 읽습니다.
녹화 후 출력 파일을 확인합니다. 오디오 트랙에는 처리된 음성이 포함되어야 하며 생 마이크 피드는 포함되지 않습니다. Runway에 업로드하기 전에 미디어 플레이어에서 파일을 재생합니다.
Runway Act-One에 업로드 및 출력 생성
Runway 계정에 로그인하고 Act-One 기능으로 이동합니다. 인터페이스는 두 개의 입력을 요청합니다:
- 참조 비디오 — 처리된 오디오가 있는 녹화된 성능 클립.
- 캐릭터 소스 — Gen-4에서 생성된 이미지, 업로드된 캐릭터 렌더 또는 이전 생성 출력.
참조 비디오를 업로드합니다. Act-One은 분석 패스 중에 얼굴 모션 데이터를 추출합니다. 그런 다음 캐릭터를 선택하거나 생성합니다. 생성 설정을 구성합니다(종횡비, 스타일 가이드, 장면 환경에 대한 프롬프트 지침).
생성을 제출합니다. 대기열 시간은 계획과 플랫폼 부하에 따라 다릅니다. 기다리는 동안 후처리 자산을 준비할 수 있습니다. 모든 장면 배경 요소, 제목 카드 또는 음악 트랙.
출력 클립이 다운로드되면 당신의 성능으로 구동되는 캐릭터 비디오가 포함됩니다. 다운로드된 파일의 오디오 트랙은 Runway의 파이프라인 버전에 따라 무음이거나 참조 오디오를 전달할 수 있습니다. 어느 경우든, 다음 단계는 최종 합성물을 조립할 비디오 편집기입니다.
후처리 조립
비디오 편집기(DaVinci Resolve, Premiere Pro, CapCut 또는 모든 NLE)를 엽니다. 목표 출력 사양과 일치하는 새 프로젝트를 생성합니다(일반적으로 1920×1080 또는 세로로 1080×1920, 24fps).
트랙 레이아웃:
| 트랙 | 콘텐츠 |
|---|---|
| V1 | Act-One 생성 캐릭터 비디오 |
| V2 | 배경 플레이트 또는 환경 영상 |
| A1 | 참조 녹화의 처리된 오디오 |
| A2 | 음악 / 주변 사운드 |
| A3 | 선택적 SFX 계층 |
참조 녹화의 처리된 오디오를 V1의 캐릭터 비디오와 동기화합니다. 참조 테이크에서 오디오와 비디오를 동시에 녹화했으므로, 동기화는 이미 베이크됩니다. 업로드 파이프라인이 몇 프레임을 자르지 않는 한 수동으로 조정할 필요가 없습니다.
배경 플레이트를 추가하고, 캐릭터 클립을 일치하도록 컬러 그레이드하고, 오디오를 혼합합니다. YouTube, TikTok 또는 Instagram에 업로드하기 위해 H.264 또는 H.265로 내보냅니다.
일반적인 문제 및 해결책
Act-One 출력의 얼굴 움직임이 경직되거나 어색함 일반적으로 참조 비디오의 추적 문제로 인해 발생합니다. 조명 균일성을 확인하고 얼굴 전체에 강한 그림자가 없는지 확인합니다. 더 부드러운 광원으로 다시 녹화합니다.
생성된 비디오에서 립싱크가 드리프트됨 업로드 전에 참조 오디오와 비디오가 동시에 녹화되었고 동기화되었는지 확인합니다. 소스 파일의 드리프트는 출력에서 증폭됩니다. 오디오를 별도로 녹화하고 병합한 경우, 병합이 프레임 정확도였는지 확인합니다.
음성 변조기가 성능 중에 눈에 띄는 지연을 추가함 DSP 프리셋은 20ms 이하로 실행되며 본질적으로 인식할 수 없습니다. 지연을 알아챘다면, 오디오 인터페이스의 버퍼 크기가 너무 높게 설정되지 않았는지 확인합니다. 녹화 소프트웨어의 낮은 지연 오디오 캡처 버퍼를 128 또는 256 샘플로 줄입니다.
처리된 음성이 최종 클립에서 과도하게 압축되거나 왜곡됨 음성 변조기 게인 스테이징이 너무 높을 수 있습니다. VoxBooster의 출력 레벨을 낮추어 신호가 약 -6 dBFS에서 피크되도록 합니다. 이렇게 하면 비디오 편집기의 오디오 처리를 위한 헤드룸이 남습니다.
Act-One이 업로드된 참조 비디오를 허용하지 않음 파일이 MP4(H.264)이고, 해상도가 최소 720p이며, 지속 시간이 Runway 계획의 문서화된 한계 미만인지 확인합니다. 원본 캡처 소프트웨어가 비정상적인 컨테이너를 생성한 경우 HandBrake로 다시 인코딩합니다.
전체 프로덕션 체크리스트
Runway에 업로드하기 전에 장면별로 이 체크리스트를 사용합니다.
- 프리셋을 선택하고 캐릭터로 연습함
- 헤드폰 모니터링 확인됨(변환된 음성이 들림)
- VoxBooster Virtual Mic 입력으로 설정된 녹화 소프트웨어
- 조명 확인됨 — 균등하고, 정면, 얼굴에 강한 그림자 없음
- 배경 명확함 — 움직이는 물체 없음
- 테스트 테이크가 녹화되고 재생됨 — 오디오가 처리됨, 생 상태 아님
- 테이크 지속 시간이 30초 미만
- 파일이 MP4 H.264, 최소 720p로 내보내짐
- 파일이 Runway 업로드 전에 미디어 플레이어에서 올바르게 재생됨
다중 장면 단편 영화로 확장
독립 AI 영화인들은 종종 같은 벽에 부딪힙니다. 첫 번째 테스트 클립은 좋아 보이지만, 일관된 3-5분 단편을 제작하려면 많은 클립 전체에서 일관성이 필요합니다. 몇 가지 관행이 도움이 됩니다.
캐릭터 음성 일관성 — 제작을 시작하기 전에 프리셋 구성을 저장합니다. 동일한 캐릭터에 대한 모든 테이크는 동일한 프리셋 및 게인 설정을 사용합니다. 음역 시프트량의 작은 변화도 컷 전체에서 눈에 띌 것입니다.
참조 비디오 일관성 — 동일한 캐릭터를 특징으로 하는 모든 테이크에 동일한 카메라 위치, 렌즈 및 조명 설정을 사용합니다. Act-One은 생성된 클립 전체에서 더 일관된 얼굴 스타일을 생성합니다.
배치 처리 — 가능하면 한 세션에서 모든 테이크를 녹화합니다. 일관된 음향 환경(동일한 방, 동일한 마이크 위치)은 처리된 오디오를 음색으로 균일하게 유지합니다.
오디오 믹싱 — 모든 대사가 동일한 프리셋으로 처리되었으므로, EQ 및 압축 설정을 A1 버스에서 한 번만 설정하고 모든 장면에 균일하게 적용하면 됩니다.
Runway의 자체 문서 및 커뮤니티 쇼케이스(runwayml.com)에는 참조용 확장된 Act-One 프로젝트의 예가 포함되어 있습니다. Runway는 회사로서 Wikipedia에서도 상세히 다뤄지며, 개발 역사와 Act-One에 사용되는 모션 전달 기술 뒤의 연구 맥락이 포함됩니다.
왜 Act-One 작업에 음성 변조기 품질이 중요한가
Act-One은 독립 영화 제작을 음질이 병목이 되는 수준으로 끌어올립니다. 이 충실도의 생성 캐릭터 비디오는 일치하는 오디오 트랙을 받을 가치가 있습니다. 기본 피치 시프트 플러그인은 고품질 시각적 출력과 충돌하는 금속 아티팩트를 생성합니다. 참조 녹화도 최종 오디오 트랙입니다. 재녹화 세션이 없으므로 캡처 품질은 영구적입니다.
VoxBooster는 AI 음성 클로닝의 경우 300ms 미만 처음부터 끝까지, DSP 프리셋의 경우 20ms 미만으로 오디오를 처리합니다. 자연스러운 성능에 충분히 빠릅니다. 낮은 지연 오디오 캡처 가상 마이크는 드라이버 설치 없이 Windows에서 인식되고 OBS, 웹 카메라 소프트웨어 및 화면 녹화 프로그램에서 깨끗하게 나타납니다. 결과는 시각적 출력을 약화시키는 대신 이를 따라가는 음성 트랙입니다.
가격은 월 6.99달러부터 시작합니다. 무료 평가판은 약정 전 전체 제작 테스트를 포함합니다.
자주 묻는 질문
Runway Act-One이란 무엇이며 참조 비디오를 어떻게 사용하나요? Act-One은 Runway ML 내의 기능으로 실제 배우의 얼굴 표정과 머리 움직임을 생성된 캐릭터로 전달합니다. 연기하는 짧은 비디오를 제공하면 Act-One이 당신의 얼굴 움직임을 읽고 캐릭터에 매핑합니다. 성능이 좋을수록 출력이 더 표현력 있게 됩니다.
Act-One 참조 비디오를 녹화할 때 음성 변조기를 사용할 수 있나요? 예. Act-One은 음성 높이가 아닌 얼굴 기하학 및 움직임만 분석하므로 가상 마이크를 통해 실시간 음성 변조기를 실행하고 동시에 비디오와 처리된 오디오를 녹화할 수 있습니다. 캡처한 오디오는 최종 대사 트랙이 됩니다. Act-One은 시각적 측면을 독립적으로 처리합니다.
Act-One에서 판타지나 공상과학 캐릭터에 가장 적합한 음성 프리셋은 무엇인가요? 갑옷을 입은 영웅이나 전사의 경우, 가벼운 리버브를 곁들인 음역 내림 프리셋이 캐릭터에 무게감을 더합니다. 초자연적이거나 신비로운 캐릭터의 경우, 느린 음역 변조 또는 포먼트 변화가 초자연적인 질감을 만듭니다. 로봇 프리셋은 메카나 AI 캐릭터에 작동합니다. 핵심은 참조 영상에서 당신이 연기하는 캐릭터 유형과 프리셋의 에너지를 일치시키는 것입니다.
Runway Act-One은 특정 참조 비디오 형식이 필요한가요? Act-One은 잘 조명된 정면 샷에서 가장 잘 작동하며, 얼굴이 명확하게 보이고 배경 혼란이 최소화됩니다. 720p 이상의 해상도가 권장됩니다. MP4가 가장 안정적인 컨테이너입니다. 초기 참조 테이크는 30초 미만으로 유지하세요. 더 긴 장면의 경우 여러 테이크를 연결할 수 있습니다.
낮은 지연 오디오 캡처란 무엇이며 음성 변조기 출력 녹화에 중요한 이유는 무엇인가요? 낮은 지연 오디오 캡처(Windows 오디오 세션 API)는 Windows 10/11에 내장된 낮은 지연 오디오 인터페이스입니다. 낮은 지연 오디오 캡처 가상 마이크를 노출하는 음성 변조기를 사용하면 화면 녹화 및 웹 카메라 소프트웨어를 포함한 모든 녹화 앱이 드라이버 설치 없이 거의 0에 가까운 지연으로 처리된 음성을 캡처할 수 있습니다.
실시간 음성 변조기로 Act-One 참조 비디오를 녹화하려면 강력한 PC가 필요한가요? 중급 CPU는 눈에 띄는 부하 없이 20ms 이하의 지연으로 실시간 DSP 효과를 처리합니다. AI 음성 클로닝 추론은 GPU 부하를 추가합니다. 전용 GPU가 도움이 되지만 필수는 아닙니다. 참조 녹화 단계는 일반적으로 짧고(30초 미만), 따라서 겸손한 하드웨어에서도 성능 비용은 짧습니다.
이 워크플로우를 장편 AI 영화에 사용할 수 있나요, 아니면 짧은 클립만 가능한가요? Act-One은 짧음에서 중간 길이의 클립에 최적화되며, Runway의 생성 대기열은 1분 미만의 클립을 선호합니다. 더 긴 영화의 경우, 표준 접근 방식은 장면별 제작입니다. 각 장면마다 참조 테이크를 녹화하고, 각 출력 클립을 생성하고, 비디오 편집기에서 조립합니다. 음성 변조기는 테이크당 한 번 실행되고 처리된 오디오는 각 클립과 함께 내보내집니다.