오디오북 내레이션을 위한 음성 클로닝: 개인 저자 워크플로우

개인 저자가 AI로 자신의 음성을 클로닝해 오디오북을 내레이션하는 방법을 설명합니다: 3~5분 샘플 녹음, ACX RMS -23~-18 dBFS 요구사항, 음정 이동으로 다중 캐릭터 만들기, 마스터링 체인, 내레이터 고용 시 $200~$400 시급 대비 비용까지 다룹니다.

오디오북 내레이션을 위한 음성 클로닝: 개인 저자 워크플로우

오디오북 음성 클로닝 제작은 더 이상 내레이터를 고용할 수 없는 저자들의 임시방편이 아닙니다 - 이제 정당한 출판 경로가 되었습니다. AI 음성 클로닝을 통해 개인 저자는 깨끗한 3-5분 샘플을 녹음하고 해당 샘플에서 음성 모델을 구축한 후 90,000단어 소설을 전통적인 녹음에 필요한 시간의 일부로 내레이션할 수 있습니다. 이 가이드는 전체 워크플로우를 다룹니다: 샘플 녹음, 모델 훈련, 다중 캐릭터 내레이션 처리, ACX 요구사항 충족, 그리고 Audible의 기술 사양에 맞게 마스터링. 또한 음성 클로닝 대 전문 내레이터 고용이 당신의 책에 더 의미가 있는지 판단할 수 있도록 정직한 비용 비교를 제공합니다.


요약

  • 사용 가능한 AI 음성 클론을 훈련하기 위해 3-5분의 깨끗하고 다양한 내레이션을 녹음합니다.
  • ACX는 RMS -23 ~ -18 dBFS, 피크 -3 dBFS, 노이즈 플로어 -60 dBFS를 요구합니다 - 모든 장 파일이 이를 충족해야 합니다.
  • 다중 캐릭터 음성은 단일 기본 클론에 음성 이동(여성의 경우 +3 ~ +4 반음, 남성의 경우 -2 ~ -3)을 적용하여 작동합니다.
  • Audible은 제출 시 AI 내레이션 공개를 요구합니다; AI로 표시되지 않은 제목은 제거될 수 있습니다.
  • 전문 내레이터는 완성된 시간당 $200-$400을 청구합니다; AI 클로닝 비용은 규모에서 훨씬 작습니다.
  • VoxBooster는 라이브 사용을 위해 Windows에서 실시간 음성 클로닝을 처리합니다; 배치 오디오북 TTS의 경우 전용 TTS 플랫폼이 합성 도구이며 마스터링 체인은 모든 DAW에서 수행됩니다.

오디오북 음성 클로닝이 실제로 의미하는 것

오디오북 내레이션의 음성 클로닝은 특정 사람의 음성에서 훈련된 신경 합성 모델을 사용하여 그 사람처럼 들리는 새로운 오디오를 생성합니다 - 각 문장을 개별적으로 녹음할 필요 없이. 모델은 훈련 샘플에서 음성 음색, 박자 경향, 공명, 음역대를 학습한 다음 입력된 텍스트를 해당 음성의 오디오로 매핑합니다.

이는 일반 TTS와 다릅니다. 일반 TTS 시스템은 많은 화자에서 훈련되고 복합 “일반 AI” 음성을 생성합니다. 자신의 녹음에서 훈련된 개인 음성 클론은 당신처럼 들리는 출력을 생성합니다 - 당신의 음성을 아는 사람들이 인식할 수 있습니다.

개인 저자에게 매력은 직접적입니다: 청취자가 책 전체에서 당신의 음성을 듣기를 원하지만 적절한 스튜디오에서 8-12시간의 내레이션을 녹음하는 것은 지치고, 비싸고, 올바르게 얻기 위해 시간이 많이 걸립니다. 음성 클로닝을 사용하면 샘플을 한 번 녹음하고 모델을 올바르게 만든 다음 합성이 읽기를 처리하는 동안 품질 검토 및 마스터링에 집중할 수 있습니다.

AI 음성 생성이 더 광범위한 오디오북 제작에 어떻게 맞는지에 대한 컨텍스트는 오디오북용 AI 음성 생성기 가이드를 참조하십시오.

단계 1 - 깨끗한 훈련 샘플 녹음

클론의 품질은 거의 전적으로 훈련 샘플의 품질로 결정됩니다. 흐릿하고 울리는 또는 시끄러운 녹음은 흐릿하고 울리는 클론을 생성합니다. 올바른 샘플 얻기는 이 워크플로우의 다른 모든 것보다 더 많은 시간을 가치 있게 합니다.

마이크 및 방 설정

전문 녹음 스튜디오가 필요하지 않습니다. 최소한의 반향과 괜찮은 마이크가 있는 조용한 방이 필요합니다. 영향 순서:

  1. 먼저 방의 소음을 줄이십시오. 창문을 닫고, 팬과 HVAC를 끕니다, 알림을 음소거합니다. 시끄러운 건물에 있으면 아침 일찍 또는 늦은 밤에 녹음합니다. 목표는 -60 dBFS 이하의 잔여 주변 소음입니다; 더 큰 것은 ACX 노이즈 플로어 규정 준수를 제한합니다.

  2. 반향을 처리합니다. 반향이 많은 방은 클론이 욕실에서 녹음된 것처럼 들리게 합니다. 걸린 옷으로 둘러싸인 옷장 내부에서 녹음하면 잘 작동합니다. 마이크 뒤에 벽에 음향 폼도 도움이 됩니다. 목표는 죽은, 가까운 소리의 녹음입니다 - 라이브, 울리는 것이 아닙니다.

  3. 마이크 위치. 심음 콘덴서 마이크에서 6-8인치, 폭발음 히트를 줄이기 위해 약간 축에서 벗어남. 팝 필터(직물 또는 폼)는 필수입니다. 폭발음은 클론 품질을 저하시키는 과도를 생성합니다.

  4. 게인 스테이징. 녹음 미터에서 피크를 -12 ~ -6 dBFS 주변을 목표로 합니다. 이는 클리핑 없이 처리를 위한 헤드룸을 남깁니다.

샘플에서 녹음할 것

5분의 단조로운 읽기는 평평한 클론을 생성합니다. 내레이터로서 전체 동적 범위를 캡처하는 샘플을 원합니다. 포함:

  • 중립 내레이션: 정상 읽기 속도의 표준 산문
  • 감정이 있는 대화: 흥분된 캐릭터, 분노로운 교환, 속삭인 비밀
  • 수사적 문장: 질문, 감탄사, 일시 중지
  • 느리고 신중한: 무거운 순간, 설명, 내부 독백 박자
  • 빠르고 리드미컬한: 액션, 긴장, 것들의 목록

이 다양성은 모델에 하나의 레지스터에서만 어떻게 들리는지가 아니라 다양한 감정 및 박자 맥락에서 음성이 어떻게 작동하는지에 대한 충분한 정보를 제공합니다.

녹음 형식

44.1kHz / 24비트 WAV로 녹음합니다. 이는 ACX의 선호 형식과 일치하며 처리 체인에 헤드룸을 제공합니다. 아무것도 하기 전에 원본의 처리되지 않은 샘플의 백업을 저장합니다.

단계 2 - 음성 모델 훈련

깨끗한 샘플이 있으면 음성 모델을 훈련합니다. 세부 사항은 사용하는 AI 음성 플랫폼에 따라 다릅니다 - 개인 클로닝을 위한 업로드된 음성 샘플을 허용하는 여러 플랫폼이 있습니다. 이 단계에서 중요한 것:

  • 처리되지 않은 또는 가벼운 처리된 샘플(노이즈 감소, 정규화, 하지만 무겁게 압축되지 않음) 업로드
  • 대부분의 플랫폼은 샘플 길이와 큐에 따라 분 단위에서 몇 시간 단위로 훈련 처리
  • 몇 문장의 짧은 테스트 합성을 실행하고 자연스러움을 비판적으로 듣기
  • 클론이 로봇처럼 들리거나 특유의 톤을 잃으면 추가 훈련 데이터(더 길거나 더 다양한 샘플)가 보통 수정합니다.

테스트 합성에서 찾을 것:

문제가능한 원인해결책
로봇식, 평면 전달샘플 너무 단조더 많은 감정 범위로 재녹음
잘못된 음성 또는 너무 비성샘플의 방 공명더 죽은 공간에서 녹음
빠른 음성의 아티팩트샘플이 박자 변화 부족훈련 데이터에 더 빠른 구절 추가
불일치 볼륨샘플의 게인 스테이징 문제안정적인 게인으로 재녹음
숨소리 또는 소음샘플의 노이즈 플로어 너무 높음더 나은 방 처리 또는 마이크 위치

단계 3 - 클론을 사용한 원고 내레이션

작동하는 클론이 있으면 소설의 합성 워크플로우는 간단합니다:

  1. 원고를 장 파일로 나눕니다. 각 ACX 파일은 하나의 장 또는 대략 20-30분의 오디오 아래의 장 섹션이어야 합니다. 체계적으로 파일 이름을 지정하십시오: chapter-01.txt, chapter-02.txt 등.

  2. 각 장을 합성 엔진에 공급합니다. 대부분의 플랫폼은 일반 텍스트 또는 포맷된 원고를 허용합니다. 합성 전에 각주, 머리글 및 기타 음성 텍스트를 제거합니다.

  3. 출력 오디오를 검토합니다. 합성 오류를 위해 각 장을 듣습니다 - 잘못 발음된 고유명사, 잘못된 강조, 어색한 일시 중지. 대부분의 플랫폼은 문제 문장에 주석을 달고 개별 줄을 재합성할 수 있습니다.

  4. 고유명사를 처리합니다. 책 특정 이름 - 캐릭터 이름, 장소 이름, 만든 단어 - 올바른 합성을 얻기 위해 입력 텍스트에 음성 철자가 필요할 수 있습니다. 캐릭터의 이름이 “Kaelith”이면 “Kay-lith”를 작성하거나 플랫폼에 따라 IPA 주석을 사용해야 할 수 있습니다.

  5. 각 장을 WAV 파일로 내보냅니다 마스터링을 위해.

더 긴 작품을 가진 저자의 경우 이 프로세스는 잘 확장합니다. 100,000단어 소설은 대략 10시간의 완성된 오디오를 생성합니다; 클로닝으로 합성 자체는 장 당 분 단위로 실행됩니다. 병목은 녹음 시간이 아닌 품질 검토입니다.

단계 4 - 단일 클론에서 다중 캐릭터 내레이션

클론된 오디오북 내레이션에 대한 가장 일반적인 질문 중 하나는 모든 캐릭터가 동일하게 들리지 않으면서 캐릭터 대화를 처리하는 방법입니다. 답은 기본 클론 출력에 적용되는 계층화된 후처리입니다.

내레이터로 기본 클론

클론된 음성은 내레이터로 기능합니다 - 장면을 설정하고 액션을 설명하며 3인칭 산문을 전달하는 저자 음성. 모든 캐릭터의 대화는 해당 기반의 변형입니다.

캐릭터 음성 차별화

장을 합성한 후 오디오를 DAW(Audacity, Adobe Audition, Reaper 등)로 가져오고 캐릭터 대화 섹션에 다른 처리를 적용합니다:

캐릭터 유형음성 이동EQ 조정노트
내레이터(기본)없음없음있는 그대로 클론
남성 캐릭터(더 깊음)-2 ~ -3 반음80-150Hz를 +3dB 부스트가슴 무게 추가
여성 캐릭터+3 ~ +4 반음120Hz 이하 컷, 2-4kHz 부스트더 높은 레지스터
나이 많은 캐릭터-1 반음가벼운 포화/그릿 추가텍스처 노화
아이 캐릭터+4 ~ +5 반음200Hz 이하 컷밝고 가벼움
악당 / 위협-1 ~ -2 반음약간의 리버브, 3-5kHz 컷어두운 톤

핵심은 전체 책에서 각 캐릭터 내에서의 일관성입니다. 해당 캐릭터가 말할 때마다 동일한 처리 사전 설정을 적용합니다. 청취자는 이동이 미묘하더라도 이러한 일관된 음향 마커로 캐릭터를 추적합니다.

이 접근 방식은 클론된 음성의 기본 음색이 일정하게 유지되기 때문에 작동합니다. 음성을 바꾸는 것이 아닙니다 - 조절하는 것이며 여러 다른 음성 모델을 함께 붙여넣는 것보다 더 일관되게 들립니다.

콘텐츠 생성을 위한 실시간 음성 변경에 대해 음성 클로닝을 비교하는 방법에 대해 깊이 있게 알아보려면 voiceover용 음성 클로닝팟캐스트용 음성 클로닝을 참조하십시오.

단계 5 - ACX 요구사항에 맞게 마스터링

ACX(Audiobook Creation Exchange), Audible에 전력을 공급하는 플랫폼에는 책을 게시하기 전에 모든 파일이 통과해야 하는 특정 기술 요구사항이 있습니다. 이를 잘못하면 거부 및 수정 주기가 발생합니다.

ACX 기술 사양

사양요구사항중요한 이유
RMS 음량-23 ~ -18 dBFS청취자를 위한 일관된 인식 음량
피크 레벨-3 dBFS보다 높지 않음재생 중 클리핑 방지를 위한 헤드룸
노이즈 플로어-60 dBFS 이하주변 소음은 들을 수 없어야 함
파일 형식192kbps MP3 또는 WAV허용되는 제출 형식
샘플 속도44.1kHz표준 오디오
채널모노 또는 스테레오(ACX가 모노 선호)장치 간 일관된 재생
열기/닫기 룸 톤0.5 ~ 1초 무음각 파일의 시작과 끝에 필요함

마스터링 체인

이 순서로 각 장 파일을 처리합니다:

  1. 노이즈 감소. 룸 톤 섹션에 적용하여 남은 히스를 정리합니다. 과도하게 적용하지 마십시오 - 무거운 노이즈 감소는 아티팩트를 생성합니다.

  2. 고주파 필터. 80Hz에서 high-pass(low-cut)를 설정합니다. 이는 바닥, HVAC 및 스피커에서는 들을 수 없지만 ACX의 노이즈 플로어 검사에 실패하는 전기 간섭의 저주파 럼블을 제거합니다.

  3. De-esser. 합성된 음성은 때때로 sibilant ‘s’ 음을 과도하게 생성할 수 있습니다. 5-8kHz로 조정된 de-esser는 이들을 잡고 부드럽게 합니다.

  4. 압축. 3:1 ~ 4:1의 표준 비율, 약 -18dB의 임계값, 빠른 공격(5-10ms), 중간 릴리스(80-150ms). 이는 동적 범위를 고르게 만들고 조용한 부분을 더 크게 하고 큰 피크를 더 제어합니다.

  5. 리미터. -3dBFS의 천장이 있는 벽돌 벽 리미터를 설정합니다. 이는 체인 위의 무엇이 일어나든 관계없이 ACX 최대를 초과하지 않도록 보장합니다.

  6. 음량 정규화. 통합 음량을 -18 ~ -23 LUFS로 정규화합니다. 대부분의 DAW에는 음량 정규화 기능이 있습니다; 안전한 마진을 제공하기 위해 ACX 범위의 중간값(-19 ~ -20 LUFS)을 목표로 합니다.

  7. ACX AutoCheck 또는 음량 미터로 확인합니다. 제출 전에 각 파일을 ACX AutoCheck(ACX 웹사이트에서 사용 가능)를 통해 실행하거나 DAW의 음량 미터에서 RMS 및 피크를 확인합니다. 세 가지 메트릭을 모두 통과하는 파일만 제출합니다.

일반적인 마스터링 실수

  • 압축 전 정규화: 이는 리미터가 보기 전에 신호와 함께 노이즈를 푸시합니다. 항상 먼저 압축, 두 번째 리미터, 마지막 정규화합니다.
  • 전체 파일에 무거운 de-noise 적용: 문제 섹션에만 노이즈 감소를 적용하거나 매우 부드러운 전역 설정을 사용합니다. 명백한 노이즈 감소 처리는 부자연스럽게 들리고 인간 검토를 플래그할 수 있습니다.
  • 룸 톤 꼬리 잊음: 모든 파일은 0.5-1초의 무음으로 끝나야 합니다. 합성된 오디오는 종종 갑자기 자릅니다 - 디지털 무음이 아닌 실제 룸 톤(자신의 실제 룸 톤 녹음)을 끝에 추가합니다.

Audible의 AI 내레이션 정책(2024년부터)

Audible은 2024년에 콘텐츠 가이드라인을 업데이트하여 ACX 제출 시 AI가 생성한 내레이션의 공개를 요구했습니다. 핵심 포인트:

  • 공개는 필수입니다. ACX를 통해 제목을 제출하는 시점에 내레이션이 AI로 생성되었음을 나타내야 합니다. 공개 없이 AI 내레이션을 제출하는 것은 정책 위반입니다.
  • 제목이 표시됩니다. Audible은 제품 목록에서 AI 내레이션 제목을 표시합니다. 이는 구매자에게 표시됩니다.
  • ACX는 AI 내레이션을 절대 금지하지 않습니다. 플랫폼은 AI 내레이션 제목을 허용하므로 책을 게시하고 표준 ACX 경로를 통해 Audible에서 판매할 수 있습니다.
  • 인간 검토는 여전히 발생합니다. AI 플래그가 있더라도 제목은 ACX 품질 검토를 진행합니다. 기술 사양 규정 준수가 여전히 필요합니다.

이것이 실제로 의미하는 것: 자신의 책을 위해 클론된 음성을 사용하는 경우 제출 중에 AI 내레이션을 공개합니다. 책은 여전히 정상적으로 게시, 구매 및 배포될 수 있습니다. AI 내레이션을 인간 녹음으로 전달하려는 시도가 위험입니다 - AI 내레이션 자체를 사용하는 것이 아닙니다.

콘텐츠 제작을 위한 음성 클로닝의 윤리 및 법적 풍경에 대한 더 넓은 보기를 위해 음성 클로닝 윤리 2026을 참조하십시오.

집에서 책 녹음: 설정 고려사항

집에서 녹음 설정이 아직 없으면 깨끗한 오디오북 내레이션 샘플 녹음을 위한 최소 실행 가능한 설정입니다. 전체 장비 가이드는 집에서 오디오북을 녹음하는 방법을 참조하십시오.

항목예산 옵션더 나은 옵션중요한 이유
마이크USB 카디오이드 콘덴서($50-80)XLR 카디오이드 콘덴서 + 오디오 인터페이스($150-250)XLR은 더 나은 게인 스테이징 및 더 낮은 노이즈 플로어를 제공
팝 필터마이크의 폼 바람막이($10)gooseneck 상의 직물 팝 필터($15-25)음성 이동 처리를 파괴하는 폭발음 스파이크를 제거
방 처리옷장에서 녹음4-6개의 음향 폼 패널($30-60)클론을 흐릿하게 만드는 반향을 제거
마스터링용 DAWAudacity(무료)Reaper($60) 또는 Adobe Audition($55/월)음량 미터 및 멀티밴드 도구 필요
검증 도구ACX AutoCheck(무료 웹 도구)Izotope RX(정기 확인)제출 전 ACX 규정 준수 확인

최고의 투자 수익은 방 처리 및 마이크 배치이며 마이크 자체가 아닙니다. 죽은 방에 있는 $60 USB 마이크는 라이브, 울리는 침실에서 $300 콘덴서를 능가합니다.

비용 비교: 음성 클로닝 vs 내레이터 고용

이것은 대부분의 독립 저자에게 실용적인 질문입니다. 정직한 분석:

전문 ACX 내레이터 비용

  • 표준 시장 요금: 완성된 시간당 $200-$400(PFH)
  • 전형적인 소설: 8-12시간 완성됨
  • 총 비용: $1,600 ~ $4,800 책당
  • 얻는 것: 전문 내레이션, 즉각적인 ACX 규정 준수, 당신의 부분에 기술 작업 없음

음성 클로닝 비용

  • 훈련 샘플 녹음 시간: 1-2시간(설정, 녹음, 필요에 따라 재녹음)
  • AI 플랫폼 구독: 플랫폼 및 사용 양에 따라 다름, 일반적으로 월 $10-$100
  • 품질 검토 시간: 완성된 각 시간당 1-2시간
  • 마스터링 시간: 수동으로 장당 30-60분; 템플릿으로 더 빠름
  • 책당 총 현금 비용: $100-200 미만 대부분의 경우

내레이터 고용이 더 의미 있는 경우

  • 책이 내레이션 품질에 대한 청취자 기대가 매우 높은 시장을 대상으로 함(문학 픽션, 프리미엄 논픽션)
  • 기술 워크플로우를 위한 시간이 없음
  • 책이 일회이고 학습 곡선이 가치가 없음
  • 저자 음성과 다른 음성(다른 성별, 억양 또는 나이)을 원함

음성 클로닝이 더 의미 있는 경우

  • 많은 책에 걸쳐 워크플로우 투자를 상각하는 제목 카탈로그를 구축 중
  • 시리즈 간에 음성 일관성을 원함 - 10개 책 전체에서 동일한 음성
  • 예산 제약이 전문 내레이션을 비현실적으로 만듦
  • 새로운 스튜디오 세션 예약 없이 속도, 발음 및 재내레이션에 대한 제어를 원함

시리즈 저자의 경우 수학이 크게 변합니다. 워크플로우를 설정하고 모델을 훈련한 후 동일한 시리즈의 각 후속 책은 검토 및 마스터링 시간만 비용입니다 - 클론과 프로세스는 수행됩니다.

자주 묻는 질문

오디오북을 위해 자신의 음성을 클로닝할 수 있습니까?

네. 조용한 방에서 3-5분간의 깨끗하고 중립적인 내레이션을 녹음하고 그 샘플에서 AI 음성 모델을 훈련한 후 클론을 사용하여 음성 텍스트 변환을 통해 전체 원고를 합성합니다. 그런 다음 ACX 사양(RMS -23 ~ -18 dBFS, 피크 -3 dBFS, 노이즈 플로어 -60 dBFS)에 맞게 마스터링하고 ACX에 직접 업로드하여 Audible에서 배포합니다.

Audible은 오디오북에 AI 음성을 허용합니까?

2024년부터 Audible은 제출 시점에 AI가 생성한 내레이션의 공개를 권리 소유자에게 요구합니다. ACX는 AI 음성을 완전히 금지하지 않지만 제목은 AI로 생성된 것으로 표시되어야 합니다. Audible은 내레이션 유형을 잘못 나타내는 제출을 거부할 권리를 보유합니다. 제출하기 전에 항상 현재 ACX 콘텐츠 지침을 확인하십시오.

음성을 클로닝하려면 음성 샘플이 얼마나 길어야 합니까?

사용 가능한 클론은 단 1-2분의 오디오로 훈련할 수 있지만 3-5분의 다양하고 깨끗한 내레이션으로 품질이 크게 향상됩니다. 오디오북 작업의 경우 특히 여러 유형의 문장을 녹음하십시오 - 서술적, 수사적, 감정적 - 모델이 단일 레지스터가 아닌 전체 동적 범위를 학습하도록 합니다.

오디오북에 대한 ACX 오디오 요구사항은 무엇입니까?

ACX는 각 파일을 RMS -23 ~ -18 dBFS로 측정하고 피크가 -3 dBFS보다 높지 않으며 노이즈 플로어가 -60 dBFS 이하여야 합니다. 파일은 192kbps MP3 또는 44.1kHz WAV 모노 또는 스테레오여야 합니다. 각 장은 자체 파일입니다. 룸 톤(0.5-1초의 무음)은 각 파일을 열고 닫아야 합니다.

AI 오디오북 내레이션이 내레이터 고용 대비 비용은 얼마입니까?

전문 ACX 내레이터는 완성된 시간당(PFH) $200-$400을 청구합니다. 표준 소설은 8-12시간 완성되므로 전문 내레이션 비용은 $1,600-$4,800입니다. AI 음성 클로닝은 샘플 녹음 및 품질 검토 시간만 필요합니다 - 소프트웨어 비용은 그보다 훨씬 적으며 일반적으로 프로덕션급 도구의 경우 월 $100 미만입니다.

단일 음성 클론으로 여러 캐릭터의 목소리를 낼 수 있습니까?

네. 가장 실용적인 접근 방식은 모델을 중립적인 내레이션 음성에서 훈련한 다음 각 캐릭터 유형에 대해 음성 이동 및 EQ의 후처리를 적용하는 것입니다. -2 ~ -3 반음 이동과 저중음 EQ 부스트는 남성 캐릭터에 효과적입니다. +3 ~ +4 반음과 고주파 부스트는 여성스러운 톤을 만듭니다. 내레이터 음성은 일관성 있는 통로로 남아 있습니다.

ACX 품질 확인을 통과하려면 어떤 마스터링 체인이 필요합니까?

표준 체인은: 노이즈 감소 → 80Hz에서의 고주파 필터 → de-esser → 압축(4:1, 빠른 공격) → 리미터(천장 -3 dBFS) → 통합 -18 ~ -23 LUFS 음량 정규화입니다. 내보낸 후 Auphonic 또는 Adobe Audition의 음량 미터와 같은 무료 도구로 확인합니다. ACX AutoCheck는 또한 인간 검토 전에 즉시 피드백을 제공합니다.

결론

오디오북 음성 클로닝 제작은 전문 내레이터 고용의 예산이나 시간 약정 없이 책에 음성을 원하는 개인 저자를 위한 실행 가능하고 비용 효율적인 경로입니다. 워크플로우 - 깨끗한 샘플 녹음, 모델 훈련, 장 별 합성, ACX 사양으로 마스터링, 제출 중 공개 - 학습 가능하고 반복 가능합니다. 시리즈 저자의 경우 고정 설정 비용은 뒤따르는 모든 제목에 상각됩니다.

정직한 제약: Audible의 AI 공개 요구사항은 책이 AI 내레이션으로 표시됨을 의미하며 이는 일부 청취자가 구매 결정에 고려하는 요소입니다. 기술 마스터링 워크플로우는 학습 곡선이 있습니다. 합성된 오디오의 품질 검토는 여전히 실제 시간이 걸립니다. 이 중 어느 것도 차단기가 아닙니다 - 그저 프로세스의 일부입니다.

라이브 스트림, Discord, 콘텐츠 생성 또는 실시간 데모에서 클론된 음성을 사용하기를 원한다면 - VoxBooster는 그 면을 다룹니다: 훈련된 음성이 Windows에서 로컬로 실행되고 표준 가상 마이크로 전달되며 3일 무료 평가판 및 커널 드라이버 필요 없음.

VoxBooster 체험 — 3일 무료.

실시간 음성 클론, 사운드보드, 이펙트 — 대화하는 모든 곳에서.

  • 카드 불필요
  • ~30ms 지연
  • Discord · Teams · OBS
3일 무료 체험