VTubing은 음성이 동시에 두 가지 작업을 수행해야 하는 몇 가지 콘텐츠 형식 중 하나입니다. 자신의 성격을 수행하고 화면에만 존재하는 캐릭터의 정체성을 강화합니다. 마이크와 좋은 아바타 모델이 당신을 반쯤 데려갑니다. 다른 절반은 오디오 체인입니다. 대부분의 VTuber는 잘못 처리합니다.
이 가이드는 전체 설정을 다룹니다. 음성 성격을 선택하고 훈련하고, VTube Studio 및 OBS를 통해 신호를 저지연 오디오 캡처로 배선하고, 지연을 제거하고, 4시간을 진행할 때 캐릭터 일관성을 유지하고 피곤합니다.
성격 일관성이 실제 목표인 이유
대부분의 VTuber 음성 변조기 가이드는 이를 신기로 취급합니다. 재미있는 피치 설정을 선택하고 계속 진행하세요. 이것은 요점을 놓칩니다. 당신의 청중은 수십 개의 스트림에 걸쳐 캐릭터의 정신적 모델을 구축합니다. 음성이 모델을 깨뜨립니다. 로어 드롭, 얼굴 공개, 캐주얼 논평. 모든 것은 음성이 설정한 기대를 통해 필터링됩니다.
이는 다음을 의미합니다.
- 하나의 주요 음성, 효과 랙이 아님. 효과는 순간입니다. 당신의 성격은 인프라입니다.
- 화요일 오후 8시와 토요일 오후 3시의 동일한 음성. 피로는 음성 변조기가 무거운 리프팅을 하지 않으면 캐릭터에서 벗어날 것입니다.
- 플랫폼 가장자리 전체에서 일관성. 클립, 단기 콘텐츠, Discord 통화 및 YouTube VOD는 모두 같은 사람처럼 들려야 합니다.
먼저 성격을 선택하세요. 그런 다음 오디오를 구성하세요.
신호 체인 이해
소프트웨어를 건드리기 전에 음성이 이동하는 위치를 알아야 합니다.
마이크로폰
→ 음성 변조기 (저지연 오디오 캡처 처리)
→ 가상 오디오 기기 (또는 저지연 오디오 캡처 루프백)
→ VTube Studio (립싱크)
→ OBS (스트림 + 기록)
이 체인의 모든 중단은 지연, 아티팩트 또는 불일치를 도입합니다. 목표는 체인을 최대한 짧게 만들고 VTube Studio와 OBS에 동일한 처리된 신호를 제공하는 것입니다.
1단계 — 처리 접근 방식 선택
Windows에서 음성 변조기를 라우팅하기 위한 두 가지 주요 옵션이 있습니다.
가상 오디오 기기 (기존 접근 방식) VB-CABLE과 같은 소프트웨어는 앱이 읽는 두 번째 마이크를 만듭니다. 음성을 처리한 다음 VTube Studio와 OBS를 가상 기기로 지정합니다. 이는 작동하지만 기기 홉을 추가하고 Windows가 오디오 우선순위를 재정렬할 때마다 기기를 다시 선택해야 합니다.
저지연 오디오 캡처 원본 처리 (현대적 접근 방식) 일부 음성 변조기는 신호가 기기로 노출되기 전에 저지연 오디오 캡처 레이어(Windows 오디오 세션 API)에서 오디오를 차단합니다. 실제 마이크로폰은 여전히 마이크로폰으로 나열되지만 모든 것이 읽으면 처리된 오디오를 얻습니다. 관리할 가상 기기 없음, 설치할 드라이버 없음, Windows 업데이트 후 다시 라우팅할 수 없습니다.
VoxBooster는 저지연 오디오 캡처 처리를 사용합니다. 실행되면 VTube Studio와 OBS는 응용 프로그램에서 입력을 변경하지 않고도 원본 마이크 기기에서 처리된 음성을 봅니다. 이것이이 가이드에서 사용하는 설정입니다.
2단계 — 음성 성격 빌드 및 잠금
VoxBooster를 열고 AI 복제 엔진을 사용하여 대상 음성을 캡처합니다. 과정:
- 의도한 캐릭터 음성으로 자신을 말하는 3-5분을 녹음하세요. 속도를 늦추고, 레지스터를 낮추고(캐릭터인 경우) 리듬을 찾으세요.
- 복제본을 실행합니다. 라이브 입력을 해당 대상에 매핑하는 모델을 얻게 됩니다.
- 스트레스 테스트. 10분 동안 큰 소리로 뭔가 읽고 다시 들어보세요. 주요 실패 모드는 빠른 음성의 피치 드리프트와 조용한 구절의 과도한 압축입니다. 감도 슬라이더를 조정하여 둘 다 깨끗하게 만드세요.
모델이 안정적이면 명명된 사전 설정으로 저장합니다 — “주요 성격” 또는 로어에 맞는 것. 기본 슬롯을 사용하지 마세요. 다른 효과를 시험한 후에도 이 정확한 구성을 회상할 수 있기를 원합니다.
3단계 — OBS 라우팅
OBS를 엽니다. 설정 → 오디오로 이동합니다.
마이크/보조 오디오 아래에서 물리적 마이크로폰이 선택되었는지 확인합니다. 가상 기기가 아닙니다. 저지연 오디오 캡처 처리가 활성화되면 OBS는 이 입력에서 처리된 오디오를 수신합니다.
오디오 모니터를 추가하여 확인합니다.
- 오디오 믹서에서 마이크 소스의 톱니 아이콘을 클릭합니다.
- 고급 오디오 속성을 선택합니다.
- 오디오 모니터링을 임시로 **모니터 전용 (출력 음소거)**으로 설정합니다.
- 헤드폰을 착용하고 말하세요. 300ms 미만의 지연으로 처리된 음성을 들어야 합니다.
원시 미처리 음성을 들으면 VoxBooster가 아직 실행 중이 아니거나 저지연 오디오 캡처 가로채기가 꺼져 있습니다. 먼저 VoxBooster를 시작한 다음 OBS를 다시 열기. 주문은 여기서 중요합니다.
헤드폰 구성에 따라 모니터링을 모니터 및 출력 또는 모니터 해제로 다시 설정하세요. 라이브 전에 말입니다.
4단계 — VTube Studio 라우팅
VTube Studio는 립싱크를 위해 마이크로폰 입력을 사용합니다 (입 애니메이션). 신호 수준이 올바르는 한 오디오 진폭을 읽습니다. 콘텐츠가 아니므로 음성 변조기 출력이 애니메이션을 구동합니다.
VTube Studio에서:
- 설정 → 마이크로폰으로 이동합니다.
- 물리적 마이크로폰을 선택합니다 (OBS가 사용하는 동일한 기기).
- 게인 및 스무딩 슬라이더를 조정합니다.
음성 변조기로 게인 보정: 처리된 음성은 종종 원시 음성과 다른 진폭 프로필을 가집니다. 정상 음성이 입 매개변수를 최대값의 약 60-70%로 이동하도록 게인을 설정합니다. 입이 항상 100% 열려 있으면 게인을 줄입니다. 거의 움직이지 않으면 늘리세요.
스무딩: 스무딩을 30-50% 사이로 유지합니다. 너무 낮으면 입이 발작을 일으키는 것처럼 보입니다. 너무 높으면 음성 뒤로 시각적으로 지연되어 오디오가 좋아도 시청자가 동기화되지 않은 것으로 읽습니다.
전체 동기화 루프 테스트: OBS와 VTube Studio가 구성되면 라이브 스트림 전에 빠른 합리성 검사를 실행합니다. 자신이 정상적으로 말하는 60초를 녹음한 다음 녹음을 봅니다. 입이 올바른 음절에서 움직이는지, 녹음된 음성이 처리된 버전인지 확인합니다. 한 테스트라도 실패하면 신호 체인의 뭔가가 깨졌습니다. VoxBooster에서 바깥쪽으로 역할을 하세요.
5단계 — 얼굴 추적 및 음성 동기화
얼굴 추적 (웹캠 또는 iPhone ARKit)은 물리적 표현을 캡처합니다. 아바타의 눈은 눈을 깜빡일 때 깜빡이고, 눈썹은 눈썹이 올라갈 때 올라갑니다. 하지만 귀에 들리는 입은 처리된 음성이며 원시 음성이 아닙니다.
이는 잠재적 불일치를 만듭니다. 당신의 얼굴은 당신의 캐릭터가 정확히 말하지 않는 단어로 움직입니다. 실제로 음성 변화가 극단적이지 않으면 시청자에게는 인식할 수 없습니다. 대부분의 음성 변조기 설정(대부분의 AI 복제 매핑 포함)은 음소 시간이 아닌 톤을 변경하므로 립싱크는 충분히 가깝게 유지됩니다.
분열되는 곳. 매우 큰 피치 시프트 (옥타브 이상) 또는 모음 모양을 변경하는 포맨트 시프트. 극단적인 음성 처리로 비인간적인 캐릭터를 구축하면 불일치로 싸우기보다는 립싱크 감도를 낮추세요.
6단계 — 장기 스트림 지구력
4시간 스트림은 대부분의 VTuber가 성격을 잃는 곳입니다. 음성이 피로합니다. 당신은 프로젝션을 멈춥니다. 캐릭터가 자연스러운 음성으로 다시 표류하고 입력이 너무 많이 변경되었기 때문에 AI 복제본은 보상할 수 없습니다.
실질적인 수정:
수분 규율. 책상에 물을 보관하세요. 최소 30-45분마다 마시세요. 건조한 성대는 스트림 중간 음성 드리프트의 주요 원인입니다.
라이브 전에 워밍업하세요. 캐릭터 음성으로 5분. 스크립트를 읽고, 무엇을 하는지 서술합니다. 음성 변조기는 워밍업된 입력 신호로 더 잘 수행될 것입니다.
출력을 모니터링하세요. 스트림 중에 처리된 음성을 헤드폰으로 낮은 음량으로 다시 라우팅하세요. 캐릭터에서 드리프트할 때 알 수 있고 자연스럽게 자체 수정할 수 있습니다.
장면 전환을 리셋 신호로 사용합니다. 게임 장면을 변경하거나 바로 돌아올 화면으로 이동할 때 10초 동안 캐릭터 음성으로 몇 구절을 말하고 다시 잠그세요.
CPU 헤드룸을 절약합니다. 음성 처리는 실시간 DSP입니다. 스트림 PC가 까다로운 게임의 부하를 받으면 오디오 버퍼가 더듬일 수 있습니다. VoxBooster는 자체 스레드에서 실행되고 300ms 미만의 처리를 유지하지만 시스템이 90%+ CPU인 경우 오디오 품질을 낮추기 전에 게임 내 설정을 낮추십시오.
7단계 — 일반적인 문제 및 수정
OBS가 처리된 음성이 아닌 원시 음성을 녹음하고 있습니다. VoxBooster는 OBS가 마이크로폰에서 읽기 전에 실행 중이어야 합니다. OBS를 닫고, VoxBooster를 시작하고, 성격 사전 설정을 활성화한 다음 OBS를 다시 열고 오디오 소스를 확인하세요.
VTube Studio 입 애니메이션이 움직이지 않습니다. VTube Studio가 동일한 마이크로폰 기기에서 읽는지 확인하세요. VoxBooster의 저지연 오디오 캡처 처리가 활성화되어 있는지 확인하세요 (앱이 열려 있지 않습니다. 토글이 켜져야 함). 큰 소리로 말하고 VTube Studio 설정에서 원시 마이크로폰 수준을 관찰하여 테스트합니다.
헤드폰에서 에코가 들립니다. OBS와 VoxBooster 모두에서 동시에 모니터링이 활성화되어 있습니다. 하나를 선택하세요. VoxBooster를 통한 모니터링은 더 낮은 지연을 제공합니다. OBS를 통한 모니터링을 통해 스트림으로 가는 정확한 신호를 들을 수 있습니다.
음성 변조기가 높은 피치에서 기계음처럼 들립니다. AI 복제 모델은 너무 좁은 음성 범위로 훈련되었을 가능성이 높습니다. 더 많은 피치 변동으로 훈련 샘플을 다시 녹음합니다. 의도한 캐릭터 범위의 높은 끝으로 이동하여 거기에서 추가 시간을 소비합니다.
채팅은 클립 대 라이브 음성이 다르게 들린다고 말합니다. 녹음 및 스트리밍 비트레이트 차이는 인식된 음성 품질에 영향을 미칠 수 있습니다. OBS에서 녹음 및 스트리밍에 동일한 오디오 인코더 설정을 사용하거나 스트림으로 가는 동일한 소스 트랙에서 녹음합니다.
모든 것을 함께 넣기: 스트림 전 체크리스트
모든 스트림 전에:
- VoxBooster 실행 중, 성격 사전 설정 로드됨
- 헤드폰에서 처리된 음성 확인 (300ms 미만, 아티팩트 없음)
- OBS 마이크 소스가 물리적 마이크로폰 기기에 활동 표시
- VTube Studio 입 애니메이션이 정상적으로 응답합니다
- 얼굴 추적 보정됨 (눈 깜빡임 테스트, 눈썹 테스트)
- 책상에 물
- 5분 음성 워밍업 완료됨
스트림 중:
- 헤드폰에서 처리된 출력을 낮은 음량으로 모니터링합니다
- 장면 전환에서 음성 재설정
- 45분마다 물 마시세요