청각장애인 및 난청 스트리머를 위한 음성 변경 워크플로우

청각장애인 및 난청 스트리머가 Whisper 라이브 캡션으로 자신과 Discord 오디오를 전사하고, 음성 조절로 피로해도 일관된 톤을 유지하고, 사운드보드 핫키로 무음 소통을 하며 VB-Cable 없이 접근 가능하고 매력적인 스트림을 구축하는 실용적인 워크플로우를 소개합니다.

청각장애이거나 난청이면서 스트리밍하는 것은 우회 문제가 아닙니다. 수천 명의 청각장애 및 난청 크리에이터가 Twitch, YouTube 및 Kick에서 실질적인 시청자를 구축했습니다. 많은 사람들이 ASL로 스트리밍하거나 캡션을 사용하거나 그들의 실제 의사소통 방식에 맞는 음성 조절 설정을 사용합니다. 이 게시물에서 다루는 도구는 아무것도 “고치지” 않습니다. 이미 가능한 것을 확장합니다.

이것은 특정 워크플로우에 대한 실용적인 가이드입니다. 라이브 전사를 위해 Whisper를 사용하고, 음성 피로 관리를 위해 음성 조절을 사용하며, 무음 의사소통을 위해 사운드보드를 사용합니다. 이 조합이 스트리밍 상황의 일부에 맞는다면 계속 읽으세요. 설정이 다르면 개별 섹션은 여전히 독립적입니다.


TL;DR

  • 청각장애 및 난청 스트리머가 Twitch에서 활동적인 커뮤니티를 구축했습니다. 여기의 도구는 기존 접근성 전략을 보완하지만 대체하지는 않습니다.
  • Whisper는 Windows에서 로컬로 실행되며 자신의 음성과 루프백된 Discord/게임 오디오를 모두 전사할 수 있습니다. 시끄러운 조건에서는 실제 제한이 있습니다.
  • 음성 조절은 일부 난청 스트리머가 긴 스트리밍 동안 음성 일관성을 유지하도록 도와줍니다. 보편적으로 유용하지는 않습니다.
  • 사운드보드는 채팅 및 팀원과의 빠르고 무음의 의사소통을 가능하게 합니다. 핫키는 음성보다 빠릅니다.
  • ASL(미국 수어)은 많은 청각장애인의 주요 언어입니다. 기술 도구는 보충물이지 대체물이 아닙니다.
  • 이 워크플로우의 대부분은 표준 게이밍 하드웨어에서 구독 없이 실행됩니다.

청각장애 및 난청 스트리머 커뮤니티

도구 논의 전: 청각장애 스트리머가 존재하고 가시적이며 실제 커뮤니티를 만들었습니다. Twitch에서 청각장애 스트리머는 카메라에서 수어하고, 캡션 오버레이를 사용하고, 채팅을 통해 의사소통하며, 스트리머의 의사소통 방식 때문에 구체적으로 그들을 따르는 시청자를 양성했습니다. 그럼에도 불구하고 아닙니다.

이 구분은 이 전체 게시물의 구성에 중요합니다. 질문은 “청각장애인은 청각장애임에도 불구하고 어떻게 스트리밍합니까?”가 아닙니다. “접근성 우선 스트림 설정에 맞는 도구는 무엇이며 일부 청각장애 및 난청 크리에이터는 유용하다고 생각합니까?”입니다.

Twitch의 접근성 문서는 캡션을 시청자 편의로 인정합니다. 커뮤니티에서 생성한 캡션, 타사 캡션 확장 및 화면 내 캡션 오버레이가 모두 적극적으로 사용 중입니다.

더 넓은 맥락: W3C의 WCAG 2.1 지침은 라이브 오디오 대체를 다룹니다. 이 지침은 웹사이트 및 웹 앱을 대상으로 하지만 기본 원칙(라이브 오디오 콘텐츠는 실시간 텍스트 대체를 가져야 함)은 스트리밍 맥락에 직접 적용됩니다.


라이브 캡션용 Whisper: 실제로 하는 것

Whisper는 OpenAI의 오픈소스 자동 음성 인식(ASR) 모델입니다. 클라우드 캡션 서비스와의 중요한 구분은 머신에서 로컬로 실행된다는 것입니다. 오디오는 컴퓨터를 떠나지 않습니다. 별도의 GPU(GTX 1660 이상)가 있는 중급 게이밍 PC에서 작은 Whisper 모델과 중간 모델은 1-4초 지연으로 거의 실시간으로 실행됩니다.

자신의 음성 캡션 만들기

가장 간단한 사용법: Whisper는 마이크를 듣고 OBS에 캡션 오버레이로 표시되는 롤링 트랜스크립트를 생성합니다.

obs-localvocal 플러그인(무료, 오픈소스)은 별도 앱 없이 OBS 내에서 Whisper를 실행합니다. 씬의 어느 곳이든 배치할 수 있는 텍스트 소스로 캡션을 렌더링합니다. 설정:

  1. OBS 도구 메뉴 또는 프로젝트의 GitHub 릴리스에서 obs-localvocal을 설치합니다.
  2. OBS에서 새 소스를 추가합니다: Tools → Captions (LocalVocal).
  3. 마이크를 오디오 소스로 선택합니다.
  4. Whisper 모델을 선택합니다. small.en은 대부분의 게이밍 PC에서 속도와 정확도의 올바른 균형입니다.
  5. 텍스트 소스의 스타일을 지정합니다. 높은 대비, 큰 글꼴, 반투명 배경입니다. 청중 중 청력 손실이 있는 시청자도 이 캡션의 이점을 누릴 것입니다.

조용한 방에서 명확한 음성에 대한 정확도: 88-94%. 배경 게임 오디오가 유입되는 정확도: 완전히 소음 격리에 달려 있습니다. Whisper에 도달하기 전에 마이크 입력에 VoxBooster의 노이즈 억제를 사용하면 Whisper가 게임 오디오와 경쟁하지 않기 때문에 정확도가 측정 가능하게 향상됩니다.

Discord 음성 채팅 캡션 만들기

이는 더 복잡하고 더 어려운 제한이 있습니다. 목표: 팀원 및 통화 참가자가 말하는 내용을 전사하여 난청 스트리머가 청력만으로 의존하지 않고 대화를 읽을 수 있도록 합니다.

방법: Discord의 오디오 출력을 Whisper도 모니터링하는 가상 루프백 장치로 라우팅합니다.

VB-Cable 또는 VoxBooster의 가상 출력을 사용한 실용적인 단계:

  1. Discord 설정(Voice & Video)에서 출력 장치를 가상 케이블 또는 루프백 장치로 설정합니다.
  2. Windows 오디오 믹서를 사용하여 해당 장치도 스피커/헤드폰을 통해 모니터링하여 들을 수 있는 내용을 계속 들을 수 있도록 합니다.
  3. OBS에서 루프백 장치를 대상으로 하는 두 번째 LocalVocal 소스를 추가합니다.
  4. 선택적으로 이를 두 번째 캡션 스트립(자신의 음성 캡션과 다른 색상)으로 표시합니다.

솔직한 제한: Whisper는 한 번에 한 명의 화자를 깔끔하게 전사합니다. 두 사람이 동시에 말하면 정확도가 급격히 떨어집니다. 혼란스러운 Discord 통화에서는 단어를 놓칠 것입니다. 이 설정은 읽기 보조이지 시끄러운 통화에서 실시간 청력의 완전한 대체가 아닙니다. 이를 보완적인 것으로 취급하세요. 완전히 시끄러운 무료 문화보다 중요한 순간(외침, 전략, 중요한 정보)을 더 잘 처리합니다.

또한 시청자가 이러한 캡션을 보길 원하는 스트리머의 경우 Discord 트랜스크립트 오버레이를 게임플레이를 차단하지 않는 위치에 배치합니다. 화면 하단의 반투명 막대가 잘 작동합니다.


음성 피로 및 일관성을 위한 음성 조절

이 섹션은 특히 음성을 사용하여 의사소통하는 난청 스트리머와 관련이 있습니다. 모든 청각장애 스트리머에게는 해당되지 않습니다. 주요 언어가 ASL인 많은 청각장애인은 스트리밍 중에 음성을 사용하지 않습니다. 이 섹션은 그 그룹을 대상으로 하지 않습니다.

일부 난청 스트리머, 특히 보청기나 인공 와우를 사용하는 스트리머의 경우 자신의 음성을 모니터링하는 것이 청각인보다 더 어렵습니다. 동일한 실시간 피드백 루프에 의존할 수 없습니다. 3-4시간 스트리밍 중에 음성 피치가 표류하거나 피로가 즉시 들리지 않는 방식으로 음성에 영향을 미칠 수 있습니다.

음성 조절(특히 피치 안정화 및 완만한 포먼트 보정)은 불편한 정도로 소리나는 방식을 바꾸지 않고도 이를 보정할 수 있습니다. 카메라의 이미지 안정화에 대한 음성 등가물로 생각하세요. 출력이 원시 입력보다 더 일관되며 시청자는 그것이 발생하고 있음을 알아차리지 않습니다.

음성 일관성을 위한 실용적인 설정

VoxBooster에서 관련 컨트롤은 다음과 같습니다.

  • 피치 보정(미묘함): ±1-2 반음의 자동 보정으로 긴 세션 동안에도 음성을 자연스러운 음역대에 고정합니다. 이는 음성을 캐릭터 음성으로 변환하는 것이 아닙니다. 안정화입니다.
  • 노이즈 억제: 보청기 마이크가 때때로 포착하는 배경 잡음을 제거합니다. 대부분의 설정에서 보통으로 설정하세요.
  • 포먼트 잠금: 활성화되면 피치가 약간 변해도 포먼트 서명을 안정적으로 유지합니다. 피로가 모음 소리의 변화를 일으킬 때 유용합니다.

VoxBooster의 DSP 엔진은 20ms 미만으로 실행되므로 말하기와 모니터링 헤드폰을 통해 처리된 출력을 듣는 것 사이에 감지 가능한 지연이 없습니다. 이는 실시간 음성 피드백에 중요합니다.

서로 다른 음성 캐릭터(다른 피치, 양식화된 사운드, 스트리밍 페르소나와 음성 음성 사이의 분리)를 원하는 스트리머의 경우 전체 음성 조절 컨트롤은 청각 스트리머와 동일하게 작동합니다. 접근성 각도는 별도 모드가 아닙니다. 동일한 도구는 구성에 따라 다양한 목표에 사용됩니다.

기대하지 않을 것

음성 조절은 음성대 상태, 청력 손실 자체 또는 의사소통 방식의 일부인 음성 패턴에 대한 보상이 아닙니다. 여기서의 목표는 피로 중 일관성이지 교정이 필요하지 않은 것의 교정이 아닙니다. 당신이 가진 음성으로 스트리밍하세요. 필요할 때 조절을 사용하세요.


무음 의사소통으로서의 사운드보드

사운드보드는 핫키에 매핑된 오디오 클립 세트입니다. 접근성 측면에서는 빠르고 신뢰할 수 있는 무음 통신 채널입니다. 반응을 발생시키기 위해 아무것도 말할 필요가 없습니다. 키를 누르면 됩니다.

이는 다양한 맥락에서 진정으로 유용합니다.

게임플레이 이벤트에 대한 반응: 적절한 시간의 웃음이나 하이프 사운드는 말하기가 불편하거나 피로하거나 단순히 선호되지 않는 순간 동안 말씀 반응을 대체할 수 있습니다. 많은 스트리머(청각 및 청각장애 모두)가 이를 위해 사운드보드를 사용합니다.

음성 채팅에서 청각 팀원과 의사소통: Discord 통화 중이고 채팅에 입력하지 않고도 빠르게 신호를 보내려면 사운드보드 클립이 단어를 찾는 것보다 빠르고 안정적으로 발생합니다.

청각장애 시청자와 상호 작용: 일부 청각장애 스트리머는 ASL 신호의 클립(짧은 비디오 트리거 또는 청각장애 시청자가 특정 의미와 연관시키는 오디오 신호)을 상호 작용 툴킷의 일부로 추가했습니다.

권장 사운드보드 레이아웃

스트리밍 중심의 접근성 사운드보드의 경우 5개의 핵심 핫키가 대부분의 상황을 다룹니다.

핫키클립사용 시기
F9웃음 / 히히재미있는 순간, 채팅 농담
F10하이프 크라우드큰 플레이, 기부, 습격
F11생각하는 톤일시 중지, 전략 순간
F12”잠깐” / 대기 소리순간이 필요할 때
Numpad 0승인 클릭빠른 “네/들었습니다”

VoxBooster의 사운드보드는 키 누름에서 오디오 출력까지 20ms 미만으로 발생합니다. 핫키는 전역적입니다. 전체 화면 게임 내에서 alt-탭 없이 작동합니다. 스트림 페르소나가 발전함에 따라 사운드보드를 64개 이상의 클립으로 확장할 수 있습니다.

실용적인 팁: 핵심 세트를 작게 유지하세요. 생각 없이 칠 수 있는 5개의 클립이 봐야 하는 20개의 클립을 이깁니다. 근육 기억이 목표입니다.


모든 것을 함께 라우팅: 전체 설정 다이어그램

전체 워크플로우는 다음을 연결합니다.

마이크 → VoxBooster (노이즈 억제 + 피치 안정화)
         → OBS (처리된 음성)
         → Whisper / LocalVocal (음성 캡션 오버레이)

Discord 출력 → 가상 루프백
             → 헤드폰 (들을 수 있는 것)
             → Whisper / LocalVocal (Discord 캡션 오버레이)

사운드보드 → VoxBooster → OBS (반응 클립)

Windows 사운드 설정에서 핵심은 VoxBooster의 가상 마이크 출력(처리된 음성과 사운드보드 포함)이 OBS와 Discord 모두에서 볼 수 있는 단일 입력 장치로 표시된다는 것입니다. 대부분의 구성에서 여러 라우팅 체인을 관리할 필요가 없습니다.

Discord 루프백 특히: Discord의 출력을 가상 케이블로 설정하고 Windows 사운드 제어판의 해당 케이블의 재생 속성에서 실제 헤드폰 출력을 모니터링 장치로 설정합니다. 이렇게 하면 실제 헤드폰을 통해 Discord를 계속 들을 수 있습니다. 루프백은 Whisper의 추가 사본이지 대체가 아닙니다.


비교: 청각장애/난청 스트리머를 위한 접근성 도구

도구하는 것제한
Whisper (로컬)음성을 실시간으로 텍스트로 전사1-4초 지연; 시끄러운 통화에서 정확도 감소
obs-localvocalOBS 내에서 Whisper를 실행하고 캡션 오버레이를 렌더링부드러운 성능을 위해 GPU 필요
VoxBooster 노이즈 억제Whisper 및 출력용 마이크 입력 정리Discord에서 다른 사람이 말하는 것을 개선하지 않음
사운드보드 (VoxBooster)무음 반응 핫키, <20ms 발사 시간클립은 미리 녹음됨; 자발적 음성 없음
Discord Krisp 노이즈 억제모든 통화 참가자로부터 배경 소음 제거일부 처리된 음성 입력을 간섭할 수 있음
캡션 오버레이 (텍스트 소스)스트림에 시청자 대면 캡션배치 필요; 게임플레이와 겹칠 수 있음

Twitch 및 플랫폼 접근성 기능

Twitch는 접근성 도구에 투자했지만 구현은 다양합니다. 청각장애 및 난청 스트리머와 관련:

  • VOD 자동 캡션: Twitch는 녹화된 비디오에 대한 자동 캡션을 생성합니다. 정확도는 변수입니다. 스트리머는 VOD의 캡션을 편집할 수 있습니다.
  • 라이브 캡션 확장: 타사 Twitch 확장은 스트리머의 로컬 Whisper 설정이 오버레이 API로 보내는 캡션을 표시할 수 있습니다. StreamElements 및 유사한 도구가 지원합니다.
  • 접근성 태그: Twitch의 태깅 시스템에는 “Deaf” 및 “Hard of Hearing” 태그가 포함됩니다. 사용하면 스트림이 구체적으로 접근 가능한 콘텐츠를 찾는 시청자에게 발견 가능해집니다.
  • 채팅을 기본 통신으로: 많은 청각장애 스트리머가 스트림 채팅을 기본 양방향 통신 채널로 사용합니다. OBS의 브라우저 기반 채팅 오버레이 또는 전용 두 번째 모니터 채팅 설정이 이 워크플로우를 지원합니다.

YouTube와 Kick 모두 스트림에 자동 캡션을 제공하며 YouTube의 구현이 더 성숙하고 스트림 후 편집 가능합니다.


이 워크플로우가 더 큰 그림에 맞는 곳

ASL(미국 수어)은 미국과 캐나다의 많은 청각장애인의 주요 언어이며 각 국가는 자체 국가 수어를 가지고 있습니다(프랑스 수어, 영국 수어, 브라질의 Libras, 러시아의 RSL 등). 서명 스트림은 스트리머를 위한 음성 조절이나 Whisper 캡션이 필요하지 않습니다. 청각 시청자를 위한 캡션이 필요할 수 있으며 이는 완전히 다른 방향입니다.

이 게시물의 워크플로우는 특히 유용합니다.

  • 음성을 사용하지만 피로 및 일관성을 관리하기 위해 도구를 원하는 난청 스트리머
  • 청력만으로 의존하지 않고 Discord 통화에서 청각 팀원이 말하는 내용을 이해하려는 청각장애 스트리머
  • 사운드보드를 통해 무음 반응 옵션을 원하는 모든 스트리머(청력 상태와 관계없이)

이는 청각장애 스트리밍 솔루션이 아닙니다. ASL 스트림, 혼합 통신 스트림 및 음성이 아닌 기본 설정은 모두 자신의 최고의 도구 세트를 가지고 있습니다. Deaf Twitch 커뮤니티는 이를 유기적으로 개발했습니다. 이 게시물의 도구는 훨씬 더 큰 그림의 한 계층입니다.


시작: 최소한의 생존 설정

전체 구성에 커밋하지 않고 이 워크플로우를 시도하려면:

  1. obs-localvocal 설치 — 무료, 로컬 실행, 계정 필요 없음. 혼자서 마이크에 대한 실시간 Whisper 캡션을 제공합니다.
  2. VoxBooster 다운로드 — 무료 평가판에는 노이즈 억제, 사운드보드 및 음성 조절이 포함됩니다. 가상 케이블 설치 필요 없음. Windows 10/11.
  3. 5개의 사운드보드 클립 만들기 — 5개의 짧은 오디오 클립(WAV, 3초 미만)을 내보내고 VoxBooster의 사운드보드에 로드하고 핫키를 할당합니다.
  4. 테스트 스트림 실행 — 비공개 YouTube 또는 미공개 Twitch 방송. 라이브로 진행하기 전에 캡션 정확도, 사운드보드 타이밍 및 Discord 루프백 품질을 확인하세요.

첫 세션은 조정이 필요한 것을 나타냅니다. 특히 음성에 대한 Whisper 정확도, 사운드보드 클립 선택 및 캡션 오버레이 위치 지정은 모두 라이브 청중 전에 한 번의 테스트에서 이점을 얻습니다.

VoxBooster는 평가판 후 월 $6.99 비용입니다. 한 달의 스트리밍에 대한 단일 유료 캡션 서비스보다 적습니다.


FAQ

Whisper가 Discord 음성 채팅을 실시간으로 전사할 수 있나요? 네, 오디오 라우팅 포함. 위의 Discord 루프백 섹션을 참조하세요. 깨끗한 조건에서 80-92% 정확도를 기대하세요; 시끄러운 통화에서는 더 적습니다.

음성 변경기가 청각장애 스트리머에게 도움이 되나요? 일부 난청 스트리머가 음성 피로를 관리하는 경우 예. ASL을 주요 언어로 하는 청각장애 스트리머의 경우 일반적으로 주요 도구가 아닙니다.

무음 스트리밍 순간을 위한 최고의 사운드보드 설정은 무엇입니까? 웃음, 하이프, 생각, “기다림” 및 확인을 다루는 5개의 핫키. 함수 키 또는 숫자판에 할당되고 근육 기억으로 암기됩니다.

VoxBooster가 가상 오디오 케이블 없이 작동하나요? 네. VoxBooster는 저지연 오디오 캡처를 사용하며 VB-Cable 또는 가상 드라이버 설치가 필요하지 않습니다.

OBS에서 Whisper 캡션을 사용할 수 있나요? 네. obs-localvocal 플러그인은 OBS 내에서 Whisper를 직접 실행하고 배치 가능한 텍스트 소스로 캡션을 렌더링합니다.

음성 조절이 청각 청중의 명확성을 해치나요? 미묘한 피치 안정화 및 노이즈 억제는 하지 않습니다. 무거운 포먼트 변환은 합니다. 음성 명확성 사용에서 포먼트 변환을 20% 미만으로 유지하세요.

Twitch에 청각장애 스트리머가 있나요? 네, 활동적인 커뮤니티 포함. Twitch에서 “Deaf” 태그를 검색하여 찾습니다.

VoxBooster 체험 — 3일 무료.

실시간 음성 클론, 사운드보드, 이펙트 — 대화하는 모든 곳에서.

  • 카드 불필요
  • ~30ms 지연
  • Discord · Teams · OBS
3일 무료 체험