법정 음성 인식 정확도 통계 (2026년): ASR 오류율, 법원 속기사 정확도, AI 전사 시범 사업에 관한 데이터 포인트 55개 이상

2026년 법정 음성 인식 정확도 통계: 상용 ASR의 단어 오류율은 흑인 화자 평균 35%, 백인 화자 19%였다. ASR 오류율, 법원 속기사 정확도, AI 전사 시범 사업 등 50개 이상의 데이터를 소개한다.

주요 상용 음성 인식 시스템 5종의 단어 오류율은 흑인 화자 평균 0.35, 백인 화자 평균 0.19였고, 흑인 화자 음성의 23%는 오류가 너무 많아 쓸 수 없는 전사가 되었다. 백인 화자의 경우 이 비율은 1.6%에 불과했다(Koenecke 외, PNAS 2020). 사람이 하는 전사도 깨끗한 기준이라고 할 수 없다. 인증을 받은 필라델피아 법원 속기사는 아프리카계 미국인 영어를 단어 정확도 82.9%로 전사해, 인증 기준인 95%보다 12포인트 넘게 낮았다(Jones 외, Language 2019). 한편 기록을 만드는 사람들은 사라지고 있다. 10년간 21% 감소한 뒤 속기사는 약 23,000명이 남았고(AAERT, 2025년 법원 속기 업계 동향), 캘리포니아주의 가사, 유산, 민사 심리 중 71.3%는 3년 동안 축어 기록이 전혀 없었다(캘리포니아주 사법위원회, 2026년). 저희는 PNAS, 미국 언어학회 학술지 Language, 전미 법원 속기사 협회, 캘리포니아주 사법위원회, Thomson Reuters Institute와 전미 주법원센터, 필리핀 대법원, 영국 법무부, 동료 심사를 거친 AI 감사 연구의 데이터를 종합해 2026년 법정 전사 정확도의 실상을 보여준다. 인력 전반의 상황은 저희 법원 속기 통계를 참고하세요.

요약

  • 상용 ASR의 단어 오류율은 흑인 화자 평균 0.35, 백인 화자 평균 0.19 (Koenecke 외, PNAS 2020)
  • 흑인 화자 클립의 23%, 백인 화자 클립의 1.6%가 저자들이 사용 불가로 보는 WER 0.5 기준을 넘음 (PNAS 2020)
  • 흑인 남성의 평균 WER은 0.41로, 백인 남성의 0.21의 두 배 (PNAS 2020)
  • 필라델피아 법원 속기사는 아프리카계 미국인 영어에서 단어 정확도 82.9%, 문장 정확도 59.5%를 기록 (Jones 외, Language 2019)
  • 법원 속기사 전사의 31%가 누가, 무엇을, 언제, 어디서 말했는지 또는 발언의 강도를 바꿔 놓음 (Language 2019)
  • 10년간 21% 감소한 뒤 약 23,000명의 속기사가 남았고 입학생은 74% 감소 (AAERT 2025)
  • NCRA 신규 인증 회원은 243명(2023년)에서 205명(2025년)으로 감소했고, 법원 속기사 평균 연령은 56세 (NCRA 통계, 2026년 3월)
  • 캘리포니아주의 2026년 1분기 가사, 유산, 민사 심리의 72.4%에 축어 기록이 없었음 (캘리포니아주 사법위원회 2026)
  • 주 법원 중 생성형 AI를 사용하는 곳은 17%에 불과하고, 70%는 직원의 AI 도구 사용을 막고 있음 (Thomson Reuters Institute 2025년 주 법원 조사)
  • 필리핀 법원은 AI 시범 사업에서 전사 시간을 평균 50%, 최대 80% 단축 (필리핀 대법원, 2025년)
  • Whisper 전사의 약 1%에 환각으로 만들어진 구절이 포함되었고, 그중 38%는 해로운 내용 (Koenecke 외, ACM FAccT 2024)
  • 법정 음성 텍스트 변환에 관한 15명 규모의 연방 태스크포스가 2026년 3월 19일 S. 4154에서 제안됨 (미국 상원)

1. 인종, 방언, 성별에 따른 ASR 단어 오류율

법정 음성 인식의 핵심 정확도 문제는 평균 성능이 아니라 화자 간 편차다. 테스트한 5개 시스템은 모두 흑인 화자에게서 백인 화자보다 거의 두 배에 가까운 오류를 냈다. 5~8단어의 동일한 문구에서도 마찬가지였으며, 이는 어휘가 아니라 음향 모델에 원인이 있음을 시사한다. 모든 증인에게 기록이 똑같이 신뢰할 수 있어야 하는 법정에서, 평균적으로는 정확하지만 화자에 따라 불평등한 도구는 공정성의 기본 시험에 통과하지 못한다.

입수 가능한 최신 데이터: Koenecke 외, 자동 음성 인식의 인종 간 격차, PNAS 2020. 비슷한 규모와 설계의 연구는 그 이후 발표되지 않았으며, 이것 자체가 하나의 발견이다. 법정용 ASR 조달의 근거가 되는 증거는 6년 전 것이다.

지표값출처
ASR 5개 시스템 평균 WER, 흑인 화자0.35Koenecke 외, PNAS 2020
ASR 5개 시스템 평균 WER, 백인 화자0.19Koenecke 외, PNAS 2020
Apple(최저 성능) WER, 흑인 화자 대 백인 화자0.45 대 0.23Koenecke 외, PNAS 2020
Microsoft(최고 성능) WER, 흑인 화자 대 백인 화자0.27 대 0.15Koenecke 외, PNAS 2020
평균 WER, 흑인 남성 대 흑인 여성0.41 대 0.30Koenecke 외, PNAS 2020
평균 WER, 백인 남성 대 백인 여성0.21 대 0.17Koenecke 외, PNAS 2020
WER 0.5 초과 클립(사용 불가), 흑인 화자 대 백인 화자23% 대 1.6%Koenecke 외, PNAS 2020
동일 문구에서의 WER, Microsoft, 흑인 화자 대 백인 화자0.13 대 0.07Koenecke 외, PNAS 2020

배경: 이 연구는 각 집단에서 2,141개의 음성 클립(흑인 화자 73명과 백인 화자 42명의 19.8시간 분량)을 짝지어 비교했다. WER 중앙값은 노스캐롤라이나주 Princeville에서 0.38, 워싱턴 D.C.에서 0.31이었던 반면 Sacramento에서는 0.18, Humboldt 카운티에서는 0.15였고, 오류율은 아프리카계 미국인 구어 영어의 특징이 많을수록 높아졌다. 원인은 어휘가 아니었다. Google 시스템의 어휘에는 흑인 참가자가 말한 단어의 98.7%, 백인 참가자가 말한 단어의 98.6%가 들어 있었다. Stanford Engineering의 요약이 지적하듯, 저자들은 법정 절차를 전사하는 형사 사법 기관을 이러한 격차가 해를 끼칠 수 있는 환경으로 특별히 꼽았다.

더 최근의 연구는 핵심 수치를 대체하지 않으면서 그 메커니즘을 확인해 준다. Mojarad와 Tang의 Interspeech 2025 논문은 자음군 축약과 ING 축약이 아프리카계 미국인 영어의 WER에 작지만 유의미한 영향을 준다는 것을 밝혔고, 2024년에 공개된 Fair-Speech 벤치마크는 인구통계학적 공정성을 측정하기 위해 미국 참가자 593명으로부터 약 26.5천 개의 발화를 수집했다(Veliche 외, 2024년). 도구 간 정확도를 비교하려는 독자는 저희 음성 텍스트 변환 통계에서 일반 벤치마크를 찾을 수 있다.

2. 방언 음성에 대한 사람 법원 속기사의 정확도

법정 ASR에 대한 공정한 비교 대상은 완벽한 전사가 아니라 사람의 기준선이며, 그 기준선은 인증이 시사하는 것보다 약하다. 인증을 받은 법원 속기사는 아프리카계 미국인 영어 문장의 40.5%를 어떤 식으로든 잘못 적었다. 그것도 조용한 방, 고품질 음성, 모든 발화를 두 번 재생, 무제한의 수정 시간이라는 법정보다 좋은 조건에서였다. 인증과 방언에 대한 실제 성능 사이의 이 간극은 법정 전사에서 가장 덜 알려진 수치다.

이 연구인 흑인으로서 증언하기(Jones, Kalbfeld, Hancock, Clark, Language 2019)는 필라델피아 법원에서 일하는 속기사 27명(시의 공식 속기사 풀의 약 3분의 1)을 대상으로 83개의 자연스러운 발화를 사용해 2,241건의 전사를 얻었다.

지표값출처
법원 속기사 인증 정확도 기준95% 또는 98%Jones 외, Language 2019
문장 수준 전사 정확도 평균59.5%Jones 외, Language 2019
문장 수준 정확도, 최고 대 최저77% 대 18%Jones 외, Language 2019
단어 수준 정확도 평균82.9%(기준보다 12.1포인트 낮음)Jones 외, Language 2019
단어 수준 정확도, 최고 대 최저91.2% 대 58.4%Jones 외, Language 2019
누가, 무엇을, 언제, 어디서 말했는지 또는 발언의 강도를 바꾼 전사31%(2,241건 중 701건)Jones 외, Language 2019
기록에 의미 없는 글자를 남겼을 전사11%(248건)Jones 외, Language 2019
바꿔 말하기(이해도) 정확도 평균33%Jones 외, Language 2019

이상치에 관한 참고: 예비 단계에서 아프리카계 미국인 영어 화자라고 밝힌 변호사들은 90%의 전사 정확도에 도달해, 표준 미국 영어를 쓰는 변호사들의 64.2%를 앞섰다. 흑인 법원 속기사는 발화의 52.5%를 정확히 바꿔 말한 반면 비흑인 속기사는 33.7%였으며, 참여한 전체 속기사의 70%는 아프리카계 미국인 영어라는 용어를 들어본 적이 없었다. AI 조달에 주는 교훈: 표준 영어 테스트 세트로만 성능을 측정하는 업체는 잘못된 것을 측정하고 있으며, 사람의 인증도 마찬가지다. 고용 분야의 비슷한 문제는 저희 억양 편견 통계에서 다룬다.

3. 기록 뒤에 있는 법원 속기사 인력

사람의 공급이 줄고 있기 때문에 정확도 논쟁은 더욱 중요해진다. NCRA 신규 인증은 2년 연속 감소해 2025년에 205건이 되었고, 법원 속기사의 평균 연령은 이제 56세다. 법원은 속기사와 소프트웨어 중 하나를 추상적으로 고르는 것이 아니라, 이미 비어 있는 자리를 무엇으로 채울지 결정하고 있다.

지표값출처
미국에 남아 있는 인증 속기사약 23,000명AAERT, 2025년 법원 속기 업계 동향
지난 10년간 인증 속기사 감소율21%AAERT, 2025년 법원 속기 업계 동향
속기 학교 입학생 감소율(2015년 3,083명에서 2024년 790명으로)74%AAERT, 2025년 법원 속기 업계 동향
10년간 문을 닫은 속기 과정 또는 학교약 42%AAERT, 2025년 법원 속기 업계 동향
NCRA 신규 인증 회원, 2023년 / 2024년 / 2025년243 / 211 / 205NCRA 통계, 2026년 3월
NCRA 법원 속기사 회원의 평균 연령56NCRA 통계, 2026년 3월
법원 속기사 및 실시간 자막 제작자 일자리, 2025년19,900BLS 직업 전망 핸드북
예상 고용 변화, 2025-35년0%(연간 약 1,800개 일자리)BLS 직업 전망 핸드북

AAERT의 최종 사용자 조사(응답자 550명 이상, 2024년 4분기 실시)는 그 하류 효과를 수치로 보여준다. 76%는 절차 일정 잡기가 어렵다고 답했고, 55%는 비용 상승, 39%는 지연을 보고했으며, 26%는 품질이 낮은 전사본을 받아들이고 있다고 말했다. 또 96%는 정확도를 가장 중요한 성과 지표로 꼽았다. 출처: AAERT 업계 보고서, NCRA 통계, BLS의 법원 속기사 프로필. BLS는 AI 전사 도구가 향후 고용 증가를 제한하겠지만, 디지털로 작성된 기록을 검토하고 편집하기 위해 속기사는 계속 필요하다고 명시적으로 전망한다. 유의점: AAERT는 전자 속기사와 전사 담당자를 대표하며 이 연구를 의뢰했기 때문에 그 틀은 디지털 속기에 유리하지만, 인력 수치는 NCRA와 BLS의 데이터에 기반한다.

4. 축어 기록이 전혀 없는 절차

가장 나쁜 전사 정확도는 전사가 아예 없는 것이다. 대부분의 사건 유형에서 전자 녹음을 제한하는 캘리포니아주는, 속기사를 구할 수 없을 때 어떤 일이 벌어지는지에 대해 미국에서 가장 상세한 공개 데이터를 발표한다. 3년 동안 가사, 유산, 무제한 민사 사건의 심리 3,007,651건이 축어 기록 없이 진행되었으며, 주 자체 팩트시트는 이것이 항소에 종종 치명적이라고 밝힌다.

지표값출처
축어 기록이 없는 심리, 2026년 1분기418,985건 중 303,430건(72.4%)캘리포니아주 사법위원회, 2026년
축어 기록이 없는 심리, 2023년 4월부터 2026년 3월4,214,365건 중 3,007,651건(71.3%)캘리포니아주 사법위원회, 2026년
법원 소속 속기사 대 추가로 필요한 FTE1,101명 대 458명 추가캘리포니아주 사법위원회, 2026년
채용된 속기사 FTE 대 퇴직자 FTE, 2023년 4월부터 2026년 3월381.8 대 366.3(순증 15.5)캘리포니아주 사법위원회, 2026년
신규 채용자 중 음성 속기사 비중48.1%(183.5 FTE)캘리포니아주 사법위원회, 2026년
캘리포니아주 면허 보유자 감소, 2013-14 회계연도부터 2022-23 회계연도20.9%(신규 신청은 42.9% 감소)캘리포니아주 사법위원회 팩트시트, 2025년 1월
캘리포니아주 법원의 전사 지출, 2023-24 회계연도23.7백만 달러캘리포니아주 사법위원회 팩트시트, 2025년 1월
민간 속기사 하루 비용, 증언 녹취 대 재판2,580달러 대 3,300달러캘리포니아주 사법위원회 팩트시트, 2025년 1월

배경: 인력 공급 통로는 조금씩 나아지고 있어서, 2024-25 회계연도에 신규 면허 176건이 발급되었는데 2022-23년에는 68건이었고, 최근 시험 응시자 294명의 합격률은 52.7%였다. 하지만 신규 채용자의 거의 절반이 음성 속기사인데, 이것 자체가 음성 인식 워크플로다. 속기사가 마스크에 달린 마이크에 증언을 따라 말하면 소프트웨어가 이를 텍스트로 바꾼다. 최신 데이터는 사법위원회의 인력 부족 대시보드에 있으며, 비용 수치는 2025년 1월 팩트시트에서 나왔다.

5. AI 전사 도입과 법원 시범 사업

미국 주 법원은 신중하며, 수치는 기대와 허용 사이에 큰 간극이 있음을 보여준다. 주 법원 관계자의 91%는 AI가 법원 운영에 최소한 보통 수준의 영향을 미칠 것으로 예상하지만, 70%는 자신의 법원이 직원의 AI 기반 도구 사용을 전혀 허용하지 않는다고 말한다. 가장 앞선 도입 사례는 미국 밖에 있는데, 그곳에서는 국가 사법부가 하나의 플랫폼으로 표준화할 수 있기 때문이다.

지표값출처
현재 생성형 AI를 사용하는 주 법원17%Thomson Reuters Institute, 2025년 주 법원 조사
직원의 AI 기반 도구 사용을 허용하지 않는 법원70%Thomson Reuters Institute, 2025년 주 법원 조사
AI를 가장 중요한 트렌드로 꼽은 응답자55%Thomson Reuters Institute, 2025년 주 법원 조사
AI 교육을 제공한 법원 시스템25%NCSC, 미래 인력 수요에 대한 대비 2025년
인력 부족이 계속될 것으로 예상하는 응답자61%NCSC, 미래 인력 수요에 대한 대비 2025년
필리핀 AI 전사 시범 사업 범위(2023년 7월부터 2024년 9월)Sandiganbayan + 1심 법원 41곳필리핀 대법원, 2025년
필리핀 시범 사업에서의 전사 시간 단축평균 50%, 최대 80%필리핀 대법원, 2025년
필리핀 시범 사업 기간 중 보고된 정확도70%에서 90-95%로 향상필리핀 대법원, 2025년

이 조사는 2025년 3월과 4월에 주, 카운티, 시 법원의 판사와 직원 443명을 대상으로 했다(Thomson Reuters Institute, NCSC 요약). Alexander Gesmundo 대법원장이 발표한 필리핀의 결과는 필리핀어와 타글리시용으로 맞춤화한 언어 모델을 갖춘 Scriptix 플랫폼에서 나왔고, 대법원은 2024년 11월 전국 도입을 승인했다(필리핀 대법원). 시작 시점의 정확도 70%는 어떤 공식 기록으로도 받아들일 수 없는 수준이며, 개선은 도구를 켠 것이 아니라 지속적인 사용과 사람의 편집에서 나왔다는 점에 유의해야 한다.

영국은 법정이 아니라 보호관찰 분야이긴 하지만 지금까지 가장 큰 규모의 데이터를 제시한다. 법무부는 2025년 10월 7일부터 2026년 9월 14일까지 자체 개발한 Justice Transcribe 도구로 1,600,000건이 넘는 면담이 요약되었으며, 면담당 10분으로 가정할 때 예시적인 절감 시간은 약 266,667시간이라고 밝혔다(GOV.UK의 Justice Transcribe 데이터). 이 부처의 자체 발표는 연간 18,750일의 달력일을 절약할 것으로 전망하며, 영국 법원·재판소 서비스(HMCTS)는 현재 같은 도구를 형사 법원(Crown Court) 전사본에서 계약 전사 담당자와 비교 시험하고 있다. 더 넓은 법률 분야에서 AI가 어떻게 도입되고 있는지는 저희 법률 분야 AI 통계를 참고하세요.

6. 환각, 경찰 전사본, 감독의 공백

단어 오류율은 AI 전사의 법적 위험을 과소평가한다. 전사본에는 아무도 말하지 않은 단어가 들어갈 수도 있기 때문이다. Whisper의 환각 구절 중 38%에는 폭력, 잘못된 연관, 권위의 암시와 같은 명백한 해악이 포함되어 있었으며, 이는 판사나 배심원이 증언을 읽는 방식을 바꿀 수 있는 내용이다. 법정 음성에는 긴 침묵이 가득하고, 연구자들이 환각과 연결 지은 것이 바로 이런 긴 무음 구간이다.

지표값출처
구절이나 문장 전체가 환각인 Whisper 전사약 1%(평균 1.4%)Koenecke 외, ACM FAccT 2024
명백한 해악을 하나 이상 포함한 환각38%Koenecke 외, ACM FAccT 2024
폭력을 영속화하는 환각19%Koenecke 외, ACM FAccT 2024
부정확한 연관을 만드는 환각 / 허위 권위를 암시하는 환각13% / 8%Koenecke 외, ACM FAccT 2024
Draft One AI 경찰 보고서 시험: 경찰관과 보고서경찰관 85명, 보고서 755건Adams 외, 실험범죄학 저널 2025
Draft One이 보고서 작성 시간에 미친 영향통계적으로 유의한 단축 없음Adams 외, 실험범죄학 저널 2025
Anchorage 경찰의 AI 보고서 시험 기간과 결과3개월, 유의한 시간 절감 없음Anchorage 경찰(EFF 경유), 2025년
법원 음성 텍스트 변환에 관한 연방 태스크포스 제안15명, 18개월 이내 보고S. 4154, 2026년 법원 AI 연구 및 감독법

배경: 환각 연구(ACM FAccT 2024)는 무음 휴지가 더 긴 실어증 화자에게서 환각이 불균형적으로 많이 발생했음을 발견했다. 바디캠 음성은 이미 AI가 작성하는 경찰 보고서를 통해 형사 기록에 반영되고 있다. Axon Draft One의 사전 등록된 무작위 시험(Springer)은 경찰관들이 절약한 시간을 오류를 지우고 빠진 사실을 추가하는 데 썼기 때문에 시간 절감이 없었다고 밝혔고, 업체는 50% 단축을 홍보해 왔다(EFF). 2026년 3월 19일 발의된 계류 중인 연방 법안은 태스크포스가 전사 정확도, 억양이나 방언이 있는 화자에 대한 영향, AI로 수정된 기록의 워터마크를 검토하도록 한다(S. 4154 본문, GovInfo). 법원에 던져진 질문은 더 이상 음성 인식이 평균적으로 충분히 좋은가가 아니라, 정확한 기록이 가장 절실한 화자들에 대해 누군가 측정하고 있는가이다.

숫자로 보는 법정 음성 인식 정확도

지표값출처
ASR 평균 WER, 흑인 화자 대 백인 화자0.35 대 0.19Koenecke 외, PNAS 2020
사용 불가 전사 클립(WER 0.5 초과), 흑인 대 백인23% 대 1.6%Koenecke 외, PNAS 2020
ASR WER, 흑인 남성 대 백인 남성0.41 대 0.21Koenecke 외, PNAS 2020
Apple ASR WER, 흑인 화자 대 백인 화자0.45 대 0.23Koenecke 외, PNAS 2020
아프리카계 미국인 영어에 대한 법원 속기사의 단어 수준 정확도82.9%Jones 외, Language 2019
아프리카계 미국인 영어에 대한 법원 속기사의 문장 수준 정확도59.5%Jones 외, Language 2019
의미를 바꾼 법원 속기사 전사31%Jones 외, Language 2019
법원 속기사 인증 기준95%에서 98%Jones 외, Language 2019
미국에 남은 속기사약 23,000명AAERT 2025
속기 학교 입학생 감소, 2015년부터 2024년74%AAERT 2025
NCRA 신규 인증 회원, 2025년205NCRA 통계, 2026년 3월
법원 속기사 평균 연령56NCRA 통계, 2026년 3월
캘리포니아주 축어 기록 없는 심리, 2023년 4월부터 2026년 3월71.3%(3,007,651건)캘리포니아주 사법위원회 2026
캘리포니아주가 추가로 필요로 하는 법원 속기사458 FTE캘리포니아주 사법위원회 2026
생성형 AI를 사용하는 주 법원17%Thomson Reuters Institute 2025
직원의 AI 도구 사용을 막는 법원70%Thomson Reuters Institute 2025
필리핀 AI 시범 사업의 전사 시간 단축평균 50%, 최대 80%필리핀 대법원 2025
Justice Transcribe로 요약된 영국 면담, 2025년 10월부터 2026년 9월1,600,000건 이상영국 법무부 2026
명백한 해악을 포함한 Whisper 환각38%Koenecke 외, ACM FAccT 2024

방법론과 출처

마지막 업데이트: 2026년 10월 3일. 저희는 이 정리를 분기마다 업데이트하며, 다음 갱신은 캘리포니아주 사법위원회가 2026년 2분기 법원 속기사 부족 현황을 발표하고 HMCTS가 Justice Transcribe를 이용한 형사 법원 전사본 연구 결과를 보고할 때 이루어질 것으로 예상한다.

VoxBooster 체험 — 3일 무료.

실시간 음성 클론, 사운드보드, 이펙트 — 대화하는 모든 곳에서.

  • 카드 불필요
  • ~30ms 지연
  • Discord · Teams · OBS
3일 무료 체험