Năm hệ thống nhận dạng giọng nói thương mại hàng đầu có tỷ lệ lỗi từ trung bình là 0,35 với người nói da đen so với 0,19 với người nói da trắng, và 23% âm thanh của người nói da đen cho ra bản phiên âm quá nhiều lỗi để sử dụng, so với chỉ 1,6% đối với người nói da trắng (Koenecke và cộng sự, PNAS 2020). Phiên âm bởi con người cũng không phải là chuẩn mực hoàn hảo: các tốc ký viên tòa án được chứng nhận tại Philadelphia phiên âm tiếng Anh của người Mỹ gốc Phi với độ chính xác từ 82,9%, thấp hơn hơn 12 điểm so với tiêu chuẩn 95% mà họ được chứng nhận (Jones và cộng sự, Language 2019). Trong khi đó, những người tạo ra biên bản đang dần biến mất, khi chỉ còn khoảng 23.000 tốc ký viên sau mức giảm 21% trong một thập kỷ (AAERT, 2025 Court Reporting Industry Trends), và 71,3% phiên điều trần về gia đình, thừa kế và dân sự của California trong ba năm hoàn toàn không có biên bản nguyên văn (Judicial Council of California, 2026). Chúng tôi tổng hợp dữ liệu từ PNAS, tạp chí Language của Linguistic Society of America, National Court Reporters Association, Judicial Council of California, Thomson Reuters Institute và National Center for State Courts, Tòa án Tối cao Philippines, Bộ Tư pháp Vương quốc Anh, cùng các cuộc kiểm toán AI đã qua bình duyệt để cho thấy độ chính xác phiên âm tại tòa án thực sự đang ở đâu vào năm 2026. Để có bức tranh rộng hơn về nguồn nhân lực, hãy xem thống kê tốc ký tòa án của chúng tôi.
Tóm tắt nhanh
- ASR thương mại có tỷ lệ lỗi từ trung bình là 0,35 với người nói da đen so với 0,19 với người nói da trắng (Koenecke và cộng sự, PNAS 2020).
- 23% đoạn âm thanh của người nói da đen so với 1,6% đoạn của người nói da trắng vượt ngưỡng WER 0,5 mà các tác giả coi là không dùng được (PNAS 2020).
- Nam giới da đen có WER trung bình 0,41, gấp đôi mức 0,21 của nam giới da trắng (PNAS 2020).
- Tốc ký viên tòa án Philadelphia đạt độ chính xác 82,9% ở cấp độ từ và 59,5% ở cấp độ câu với tiếng Anh của người Mỹ gốc Phi (Jones và cộng sự, Language 2019).
- 31% bản phiên âm của tốc ký viên tòa án đã làm thay đổi ai, cái gì, khi nào, ở đâu hoặc sức nặng của một phát ngôn (Language 2019).
- Còn khoảng 23.000 tốc ký viên sau mức giảm 21% trong mười năm; số học viên nhập học giảm 74% (AAERT 2025).
- Số thành viên mới được chứng nhận của NCRA giảm từ 243 (2023) xuống 205 (2025); độ tuổi trung bình của tốc ký viên tòa án là 56 (Thống kê NCRA, tháng 3 năm 2026).
- 72,4% phiên điều trần về gia đình, thừa kế và dân sự của California trong quý một năm 2026 không có biên bản nguyên văn (Judicial Council of California 2026).
- Chỉ 17% tòa án tiểu bang dùng AI tạo sinh và 70% cấm nhân viên dùng các công cụ AI (Thomson Reuters Institute 2025 State Courts Survey).
- Các tòa án Philippines giảm thời gian phiên âm trung bình 50%, lên tới 80%, trong một đợt thử nghiệm AI (Tòa án Tối cao Philippines, 2025).
- Khoảng 1% bản phiên âm của Whisper chứa các cụm từ ảo giác, và 38% trong số đó gây hại (Koenecke và cộng sự, ACM FAccT 2024).
- Một nhóm công tác liên bang gồm 15 thành viên về chuyển giọng nói thành văn bản tại tòa án đã được đề xuất trong S. 4154 vào ngày 19 tháng 3 năm 2026 (Thượng viện Hoa Kỳ).
1. Tỷ Lệ Lỗi Từ Của ASR Theo Chủng Tộc, Phương Ngữ và Giới Tính
Vấn đề cốt lõi về độ chính xác của nhận dạng giọng nói tại tòa án không phải là hiệu suất trung bình mà là sự chênh lệch giữa các người nói. Cả năm hệ thống được kiểm tra đều mắc lỗi với người nói da đen nhiều gần gấp đôi so với người nói da trắng, ngay cả trên những cụm từ giống hệt nhau dài từ năm đến tám từ, điều này chỉ ra mô hình âm học chứ không phải từ vựng. Trong phòng xử án, nơi biên bản phải đáng tin cậy như nhau với mọi nhân chứng, một công cụ chính xác ở mức trung bình nhưng bất bình đẳng theo người nói là không vượt qua được phép thử công bằng cơ bản.
Dữ liệu mới nhất hiện có: Koenecke và cộng sự, Racial disparities in automated speech recognition, PNAS 2020. Kể từ đó chưa có nghiên cứu nào có quy mô và thiết kế tương đương được công bố, và bản thân điều này đã là một phát hiện: cơ sở bằng chứng đằng sau việc mua sắm ASR cho tòa án đã sáu năm tuổi.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| WER trung bình của 5 hệ thống ASR, người nói da đen | 0,35 | Koenecke và cộng sự, PNAS 2020 |
| WER trung bình của 5 hệ thống ASR, người nói da trắng | 0,19 | Koenecke và cộng sự, PNAS 2020 |
| WER của Apple (kém nhất), người nói da đen so với da trắng | 0,45 so với 0,23 | Koenecke và cộng sự, PNAS 2020 |
| WER của Microsoft (tốt nhất), người nói da đen so với da trắng | 0,27 so với 0,15 | Koenecke và cộng sự, PNAS 2020 |
| WER trung bình, nam da đen so với nữ da đen | 0,41 so với 0,30 | Koenecke và cộng sự, PNAS 2020 |
| WER trung bình, nam da trắng so với nữ da trắng | 0,21 so với 0,17 | Koenecke và cộng sự, PNAS 2020 |
| Đoạn âm thanh có WER trên 0,5 (không dùng được), người nói da đen so với da trắng | 23% so với 1,6% | Koenecke và cộng sự, PNAS 2020 |
| WER trên các cụm từ giống hệt nhau, Microsoft, người nói da đen so với da trắng | 0,13 so với 0,07 | Koenecke và cộng sự, PNAS 2020 |
Bối cảnh: nghiên cứu đã ghép 2.141 đoạn âm thanh từ mỗi nhóm (19,8 giờ từ 73 người nói da đen và 42 người nói da trắng). WER trung vị là 0,38 ở Princeville, NC và 0,31 ở Washington, DC, so với 0,18 ở Sacramento và 0,15 ở Humboldt County, và tỷ lệ lỗi tăng theo mật độ các đặc điểm của tiếng Anh bản ngữ của người Mỹ gốc Phi. Từ vựng không phải là nguyên nhân: hệ thống của Google có 98,7% số từ do người tham gia da đen nói nằm trong từ vựng của nó, so với 98,6% đối với người tham gia da trắng. Như bản tóm tắt của Stanford Engineering nêu, các tác giả đặc biệt chỉ ra các cơ quan tư pháp hình sự phiên âm các phiên tòa là một bối cảnh mà những chênh lệch này có thể gây hại.
Các nghiên cứu mới hơn xác nhận cơ chế này mà không thay thế các con số chính. Bài báo Interspeech 2025 của Mojarad và Tang phát hiện tác động nhỏ nhưng có ý nghĩa của việc giản lược cụm phụ âm và giản lược ING lên WER đối với tiếng Anh của người Mỹ gốc Phi, và bộ chuẩn Fair-Speech phát hành năm 2024 đã thu thập khoảng 26,5 nghìn phát ngôn từ 593 người tham gia tại Hoa Kỳ chính để đo lường tính công bằng nhân khẩu học (Veliche và cộng sự, 2024). Độc giả muốn so sánh độ chính xác giữa các công cụ có thể tìm các bộ chuẩn chung trong thống kê chuyển giọng nói thành văn bản của chúng tôi.
2. Độ Chính Xác Của Tốc Ký Viên Tòa Án Với Lời Nói Phương Ngữ
Phép so sánh công bằng cho ASR tại tòa án không phải là một bản phiên âm hoàn hảo mà là mốc chuẩn của con người, và mốc chuẩn đó yếu hơn những gì chứng nhận gợi ý. Các tốc ký viên tòa án được chứng nhận đã phiên âm sai theo cách nào đó 40,5% số câu tiếng Anh của người Mỹ gốc Phi, trong điều kiện tốt hơn phòng xử án: phòng yên tĩnh, âm thanh chất lượng cao, mỗi phát ngôn được phát hai lần và thời gian chỉnh sửa không giới hạn. Khoảng cách giữa chứng nhận và hiệu suất thực tế với phương ngữ là con số ít được báo cáo nhất trong phiên âm tòa án.
Nghiên cứu này, Testifying while black (Jones, Kalbfeld, Hancock và Clark, Language 2019), đã kiểm tra 27 tốc ký viên tòa án làm việc tại các tòa án Philadelphia, xấp xỉ một phần ba đội ngũ tốc ký viên chính thức của thành phố, trên 83 phát ngôn tự nhiên, cho ra 2.241 bản phiên âm.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Tiêu chuẩn độ chính xác chứng nhận cho tốc ký viên tòa án | 95% hoặc 98% | Jones và cộng sự, Language 2019 |
| Độ chính xác phiên âm trung bình ở cấp độ câu | 59,5% | Jones và cộng sự, Language 2019 |
| Độ chính xác cấp độ câu tốt nhất so với kém nhất | 77% so với 18% | Jones và cộng sự, Language 2019 |
| Độ chính xác trung bình ở cấp độ từ | 82,9% (thấp hơn tiêu chuẩn 12,1 điểm) | Jones và cộng sự, Language 2019 |
| Độ chính xác cấp độ từ tốt nhất so với kém nhất | 91,2% so với 58,4% | Jones và cộng sự, Language 2019 |
| Bản phiên âm làm thay đổi ai, cái gì, khi nào, ở đâu hoặc sức nặng | 31% (701 trên 2.241) | Jones và cộng sự, Language 2019 |
| Bản phiên âm sẽ đưa văn bản vô nghĩa vào biên bản | 11% (248) | Jones và cộng sự, Language 2019 |
| Độ chính xác diễn giải lại (khả năng hiểu) trung bình | 33% | Jones và cộng sự, Language 2019 |
Lưu ý về giá trị ngoại lệ: trong giai đoạn thử nghiệm ban đầu, các luật sư tự nhận là người nói tiếng Anh của người Mỹ gốc Phi đạt độ chính xác phiên âm 90%, so với 64,2% của các luật sư nói tiếng Anh Mỹ chuẩn. Các tốc ký viên tòa án da đen diễn giải lại đúng 52,5% phát ngôn so với 33,7% của các tốc ký viên không phải người da đen, và 70% tất cả tốc ký viên tham gia chưa từng nghe đến thuật ngữ tiếng Anh của người Mỹ gốc Phi. Bài học cho việc mua sắm AI: một nhà cung cấp chỉ đánh giá trên các bộ dữ liệu tiếng Anh chuẩn là đang đo sai thứ cần đo, và điều tương tự cũng đúng với chứng nhận của con người. Chúng tôi đề cập vấn đề song song trong lĩnh vực việc làm trong thống kê thiên kiến giọng nói của chúng tôi.
3. Lực Lượng Tốc Ký Viên Đứng Sau Biên Bản
Các tranh luận về độ chính xác càng quan trọng hơn khi nguồn cung nhân lực đang thu hẹp. Số chứng nhận mới của NCRA giảm năm thứ hai liên tiếp, xuống 205 vào năm 2025, trong khi độ tuổi trung bình của tốc ký viên tòa án hiện là 56. Các tòa án không chọn giữa tốc ký viên và phần mềm một cách trừu tượng; họ đang quyết định điều gì sẽ lấp vào những vị trí vốn đã trống.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Số tốc ký viên được chứng nhận còn lại tại Hoa Kỳ | Khoảng 23.000 | AAERT, 2025 Court Reporting Industry Trends |
| Mức giảm số tốc ký viên được chứng nhận trong thập kỷ qua | 21% | AAERT, 2025 Court Reporting Industry Trends |
| Mức giảm số học viên các trường tốc ký (3.083 năm 2015 xuống 790 năm 2024) | 74% | AAERT, 2025 Court Reporting Industry Trends |
| Chương trình hoặc trường tốc ký đã đóng cửa trong thập kỷ | Khoảng 42% | AAERT, 2025 Court Reporting Industry Trends |
| Thành viên mới được chứng nhận của NCRA, 2023 / 2024 / 2025 | 243 / 211 / 205 | Thống kê NCRA, tháng 3 năm 2026 |
| Độ tuổi trung bình của thành viên là tốc ký viên tòa án của NCRA | 56 | Thống kê NCRA, tháng 3 năm 2026 |
| Việc làm tốc ký viên tòa án và người phụ đề đồng thời, 2025 | 19.900 | BLS Occupational Outlook Handbook |
| Dự báo thay đổi việc làm, 2025-35 | 0% (khoảng 1.800 vị trí tuyển mỗi năm) | BLS Occupational Outlook Handbook |
Khảo sát người dùng cuối của AAERT (550+ người trả lời, thực hiện vào quý 4 năm 2024) định lượng tác động ở hạ nguồn: 76% báo cáo khó khăn trong việc lên lịch các thủ tục, 55% báo cáo chi phí cao hơn, 39% báo cáo chậm trễ, và 26% cho biết đang chấp nhận các bản phiên âm chất lượng thấp hơn. Và 96% nêu độ chính xác là chỉ số hiệu suất quan trọng nhất. Nguồn: báo cáo ngành của AAERT, Thống kê NCRA và hồ sơ tốc ký viên tòa án của BLS, cơ quan này dự báo rõ ràng rằng các công cụ phiên âm AI sẽ hạn chế tăng trưởng việc làm trong tương lai trong khi các tốc ký viên vẫn cần thiết để rà soát và chỉnh sửa các biên bản được tạo bằng phương tiện số. Lưu ý: AAERT đại diện cho các tốc ký viên và người phiên âm điện tử và đã đặt hàng nghiên cứu này, do đó cách trình bày của họ nghiêng về ghi biên bản số dù các con số về lực lượng lao động dựa trên dữ liệu của NCRA và BLS.
4. Các Phiên Tòa Hoàn Toàn Không Có Biên Bản Nguyên Văn
Độ chính xác phiên âm tệ nhất là không có bản phiên âm. California, nơi hạn chế ghi âm điện tử ở hầu hết các loại vụ việc, công bố dữ liệu công khai chi tiết nhất tại Hoa Kỳ về những gì xảy ra khi không có tốc ký viên. Trong ba năm, 3.007.651 phiên điều trần về gia đình, thừa kế và dân sự không giới hạn đã diễn ra mà không có biên bản nguyên văn, điều mà chính bản thông tin của bang cho biết thường sẽ là yếu tố gây bất lợi nghiêm trọng khi kháng cáo.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Phiên điều trần không có biên bản nguyên văn, quý 1 năm 2026 | 303.430 trên 418.985 (72,4%) | Judicial Council of California, 2026 |
| Phiên điều trần không có biên bản nguyên văn, tháng 4 năm 2023 đến tháng 3 năm 2026 | 3.007.651 trên 4.214.365 (71,3%) | Judicial Council of California, 2026 |
| Tốc ký viên do tòa án thuê so với FTE bổ sung cần thiết | 1.101 so với cần thêm 458 | Judicial Council of California, 2026 |
| FTE tốc ký viên được tuyển so với nghỉ việc, tháng 4 năm 2023 đến tháng 3 năm 2026 | 381,8 so với 366,3 (tăng ròng 15,5) | Judicial Council of California, 2026 |
| Tỷ lệ người mới tuyển là voice writer | 48,1% (183,5 FTE) | Judicial Council of California, 2026 |
| Mức giảm số người có giấy phép tại California, năm tài chính 2013-14 đến năm tài chính 2022-23 | 20,9% (đơn đăng ký mới giảm 42,9%) | Judicial Council of California Fact Sheet, tháng 1 năm 2025 |
| Chi tiêu của tòa án California cho bản phiên âm, năm tài chính 2023-24 | 23,7 triệu USD | Judicial Council of California Fact Sheet, tháng 1 năm 2025 |
| Chi phí mỗi ngày của tốc ký viên tư nhân, lấy lời khai so với xét xử | 2.580 USD so với 3.300 USD | Judicial Council of California Fact Sheet, tháng 1 năm 2025 |
Bối cảnh: nguồn cung đang cải thiện ở mức biên, với 176 giấy phép mới được cấp trong năm tài chính 2024-25 so với 68 vào năm 2022-23, và tỷ lệ đạt 52,7% trong số 294 thí sinh gần đây. Nhưng gần một nửa số người mới tuyển là voice writer, vốn là một quy trình nhận dạng giọng nói: tốc ký viên nhắc lại lời khai vào micro gắn trên mặt nạ và phần mềm chuyển đổi nó. Dữ liệu trực tiếp nằm trên bảng điều khiển về tình trạng thiếu hụt của Judicial Council, và các số liệu chi phí đến từ bản thông tin tháng 1 năm 2025 của cơ quan này.
5. Việc Áp Dụng Phiên Âm Bằng AI và Các Thử Nghiệm Tại Tòa Án
Các tòa án tiểu bang Hoa Kỳ khá thận trọng, và các con số cho thấy khoảng cách lớn giữa kỳ vọng và sự cho phép. 91% chuyên gia tòa án tiểu bang kỳ vọng AI có tác động ít nhất ở mức vừa phải tới hoạt động của tòa án, nhưng 70% cho biết tòa án của họ hoàn toàn không cho phép nhân viên dùng các công cụ dựa trên AI. Các triển khai tiến xa nhất nằm ngoài Hoa Kỳ, nơi các hệ thống tư pháp quốc gia có thể chuẩn hóa trên một nền tảng duy nhất.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Tòa án tiểu bang hiện đang dùng AI tạo sinh | 17% | Thomson Reuters Institute, 2025 State Courts Survey |
| Tòa án không cho phép nhân viên dùng các công cụ dựa trên AI | 70% | Thomson Reuters Institute, 2025 State Courts Survey |
| Người trả lời đánh giá AI là xu hướng quan trọng nhất | 55% | Thomson Reuters Institute, 2025 State Courts Survey |
| Hệ thống tòa án đã cung cấp đào tạo về AI | 25% | NCSC, Preparing for Future Workforce Needs 2025 |
| Người trả lời dự kiến tình trạng thiếu nhân sự sẽ tiếp diễn | 61% | NCSC, Preparing for Future Workforce Needs 2025 |
| Phạm vi thử nghiệm phiên âm AI tại Philippines (tháng 7 năm 2023 đến tháng 9 năm 2024) | Sandiganbayan + 41 tòa sơ thẩm | Tòa án Tối cao Philippines, 2025 |
| Mức giảm thời gian phiên âm trong thử nghiệm tại Philippines | Trung bình 50%, lên tới 80% | Tòa án Tối cao Philippines, 2025 |
| Độ chính xác được báo cáo trong suốt thử nghiệm tại Philippines | Cải thiện từ 70% lên 90-95% | Tòa án Tối cao Philippines, 2025 |
Khảo sát bao gồm 443 thẩm phán và chuyên gia tòa án cấp tiểu bang, quận và thành phố vào tháng 3 và tháng 4 năm 2025 (Thomson Reuters Institute; bản tóm tắt của NCSC). Kết quả tại Philippines, do Chánh án Alexander Gesmundo trình bày, đến từ nền tảng Scriptix với mô hình ngôn ngữ tùy chỉnh cho tiếng Filipino và Taglish, và Tòa án Tối cao đã cho phép triển khai trên toàn quốc vào tháng 11 năm 2024 (Tòa án Tối cao Philippines). Lưu ý rằng độ chính xác ban đầu 70% là không thể chấp nhận được đối với bất kỳ biên bản chính thức nào; những cải thiện đến từ việc tiếp tục sử dụng và chỉnh sửa của con người, chứ không phải chỉ nhờ bật công cụ lên.
Vương quốc Anh cung cấp điểm dữ liệu có khối lượng lớn nhất cho đến nay, dù đến từ lĩnh vực quản chế chứ không phải phòng xử án: Bộ Tư pháp báo cáo rằng hơn 1.600.000 cuộc gặp đã được tóm tắt bằng công cụ nội bộ Justice Transcribe trong khoảng từ ngày 7 tháng 10 năm 2025 đến ngày 14 tháng 9 năm 2026, tiết kiệm minh họa khoảng 266.667 giờ với 10 phút mỗi cuộc gặp (dữ liệu Justice Transcribe trên GOV.UK). Thông báo của chính bộ này dự báo giải phóng 18.750 ngày theo lịch mỗi năm, và HM Courts and Tribunals Service hiện đang thử nghiệm cùng công cụ này so với những người phiên âm thuê ngoài là con người đối với các bản phiên âm của Crown Court. Để biết toàn ngành pháp lý đang áp dụng AI ra sao, hãy xem thống kê AI trong lĩnh vực pháp lý của chúng tôi.
6. Ảo Giác, Bản Phiên Âm Của Cảnh Sát và Khoảng Trống Giám Sát
Tỷ lệ lỗi từ đánh giá thấp rủi ro pháp lý của phiên âm bằng AI, vì một bản phiên âm cũng có thể chứa những từ mà không ai nói ra. 38% đoạn ảo giác của Whisper chứa các tác hại rõ ràng như bạo lực, liên tưởng sai hoặc ngụ ý thẩm quyền, loại nội dung có thể làm thay đổi cách thẩm phán hay bồi thẩm đoàn đọc lời khai. Âm thanh phòng xử án đầy những quãng ngừng dài, và những khoảng không có giọng nói kéo dài chính là điều các nhà nghiên cứu liên hệ với ảo giác.
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Bản phiên âm Whisper có cụm từ hoặc câu hoàn toàn là ảo giác | Khoảng 1% (trung bình 1,4%) | Koenecke và cộng sự, ACM FAccT 2024 |
| Ảo giác chứa ít nhất một tác hại rõ ràng | 38% | Koenecke và cộng sự, ACM FAccT 2024 |
| Ảo giác duy trì bạo lực | 19% | Koenecke và cộng sự, ACM FAccT 2024 |
| Ảo giác tạo liên tưởng không chính xác / ngụ ý thẩm quyền giả | 13% / 8% | Koenecke và cộng sự, ACM FAccT 2024 |
| Thử nghiệm báo cáo cảnh sát bằng AI Draft One: sĩ quan và báo cáo | 85 sĩ quan, 755 báo cáo | Adams và cộng sự, Journal of Experimental Criminology 2025 |
| Tác động của Draft One lên thời gian viết báo cáo | Không giảm có ý nghĩa thống kê | Adams và cộng sự, Journal of Experimental Criminology 2025 |
| Thời lượng và kết quả thử nghiệm báo cáo bằng AI của Anchorage Police Department | 3 tháng, không tiết kiệm thời gian đáng kể | Anchorage Police Department qua EFF, 2025 |
| Nhóm công tác liên bang được đề xuất về chuyển giọng nói thành văn bản tại tòa án | 15 thành viên, báo cáo trong 18 tháng | S. 4154, Research and Oversight of AI in Courts Act of 2026 |
Bối cảnh: nghiên cứu về ảo giác (ACM FAccT 2024) phát hiện ảo giác xảy ra nhiều một cách không cân xứng ở những người nói bị mất ngôn ngữ (aphasia), những người có quãng ngừng không giọng nói dài hơn. Âm thanh từ camera đeo trên người đã đi vào hồ sơ hình sự thông qua các báo cáo cảnh sát do AI soạn thảo; thử nghiệm ngẫu nhiên đã đăng ký trước đối với Axon Draft One (Springer) không thấy tiết kiệm được thời gian vì các sĩ quan dùng thời gian tiết kiệm để chỉnh sửa lỗi và bổ sung những sự việc bị bỏ sót, trong khi nhà cung cấp từng quảng bá mức giảm 50% (EFF). Dự luật liên bang đang chờ xử lý, được đệ trình ngày 19 tháng 3 năm 2026, sẽ yêu cầu nhóm công tác xem xét độ chính xác của phiên âm, tác động đối với người nói có giọng hoặc phương ngữ, và dấu thủy vân cho các hồ sơ bị AI chỉnh sửa (nội dung S. 4154, GovInfo). Câu hỏi đối với các tòa án không còn là liệu nhận dạng giọng nói có đủ tốt ở mức trung bình hay không; mà là liệu có ai đang đo lường nó cho những người nói cần một biên bản chính xác nhất hay không.
Tổng kết: Độ Chính Xác Nhận Dạng Giọng Nói Tại Tòa Án Qua Các Con Số
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| WER trung bình của ASR, người nói da đen so với da trắng | 0,35 so với 0,19 | Koenecke và cộng sự, PNAS 2020 |
| Đoạn có bản phiên âm không dùng được (WER trên 0,5), da đen so với da trắng | 23% so với 1,6% | Koenecke và cộng sự, PNAS 2020 |
| WER của ASR, nam da đen so với nam da trắng | 0,41 so với 0,21 | Koenecke và cộng sự, PNAS 2020 |
| WER của ASR Apple, người nói da đen so với da trắng | 0,45 so với 0,23 | Koenecke và cộng sự, PNAS 2020 |
| Độ chính xác cấp độ từ của tốc ký viên tòa án với tiếng Anh của người Mỹ gốc Phi | 82,9% | Jones và cộng sự, Language 2019 |
| Độ chính xác cấp độ câu của tốc ký viên tòa án với tiếng Anh của người Mỹ gốc Phi | 59,5% | Jones và cộng sự, Language 2019 |
| Bản phiên âm của tốc ký viên tòa án làm thay đổi ý nghĩa | 31% | Jones và cộng sự, Language 2019 |
| Tiêu chuẩn chứng nhận của tốc ký viên tòa án | 95% đến 98% | Jones và cộng sự, Language 2019 |
| Số tốc ký viên còn lại tại Hoa Kỳ | Khoảng 23.000 | AAERT 2025 |
| Mức giảm số học viên tốc ký, 2015 đến 2024 | 74% | AAERT 2025 |
| Thành viên mới được chứng nhận của NCRA, 2025 | 205 | Thống kê NCRA, tháng 3 năm 2026 |
| Độ tuổi trung bình của tốc ký viên tòa án | 56 | Thống kê NCRA, tháng 3 năm 2026 |
| Phiên điều trần tại California không có biên bản nguyên văn, tháng 4 năm 2023 đến tháng 3 năm 2026 | 71,3% (3.007.651) | Judicial Council of California 2026 |
| Số tốc ký viên tòa án bổ sung California cần | 458 FTE | Judicial Council of California 2026 |
| Tòa án tiểu bang dùng AI tạo sinh | 17% | Thomson Reuters Institute 2025 |
| Tòa án cấm nhân viên dùng các công cụ dựa trên AI | 70% | Thomson Reuters Institute 2025 |
| Mức giảm thời gian phiên âm trong thử nghiệm AI tại Philippines | Trung bình 50%, lên tới 80% | Tòa án Tối cao Philippines 2025 |
| Số cuộc gặp tại Vương quốc Anh được tóm tắt bằng Justice Transcribe, tháng 10 năm 2025 đến tháng 9 năm 2026 | 1.600.000+ | Bộ Tư pháp Vương quốc Anh 2026 |
| Ảo giác của Whisper chứa tác hại rõ ràng | 38% | Koenecke và cộng sự, ACM FAccT 2024 |
Phương pháp luận và Nguồn
- Koenecke và cộng sự, Racial disparities in automated speech recognition, PNAS 2020, kèm bản tóm tắt của Stanford Engineering
- Jones, Kalbfeld, Hancock và Clark, Testifying while black, Language 95(2), 2019
- Mojarad và Tang, Automatic Speech Recognition of African American English, Interspeech 2025
- Veliche và cộng sự, Fair-Speech dataset, 2024
- AAERT, 2025 Court Reporting Industry Trends (do The Brand Consultancy thực hiện; 27 cuộc phỏng vấn và 550+ phản hồi khảo sát)
- National Court Reporters Association, Thống kê NCRA (tháng 3 năm 2026)
- U.S. Bureau of Labor Statistics, Occupational Outlook Handbook: Court Reporters and Simultaneous Captioners
- Judicial Council of California, bảng điều khiển Shortage of Court Reporters in California và Fact Sheet, tháng 1 năm 2025
- Thomson Reuters Institute, Staffing, Operations and Technology: A 2025 Survey of State Courts
- National Center for State Courts, Preparing for Future Workforce Needs
- Tòa án Tối cao Philippines, kết quả phiên âm bằng AI
- Bộ Tư pháp Vương quốc Anh, dữ liệu Justice Transcribe, tháng 10 năm 2025 đến tháng 9 năm 2026 và thông báo AI tech ambition
- Koenecke và cộng sự, Careless Whisper: Speech-to-Text Hallucination Harms, ACM FAccT 2024
- Adams và cộng sự, thử nghiệm ngẫu nhiên về soạn báo cáo cảnh sát có hỗ trợ AI, Journal of Experimental Criminology 2025 và EFF về thử nghiệm của Anchorage Police Department, 2025
- S. 4154, Research and Oversight of AI in Courts Act of 2026 (GovInfo)
- Lưu ý về dữ liệu: hai nghiên cứu nền tảng về độ chính xác (PNAS 2020, Language 2019) đã hơn ba năm tuổi và kiểm tra các hệ thống thương mại cũng như các tốc ký viên như họ tồn tại vào thời điểm đó; chúng vẫn là những phép đo có kiểm soát mới nhất thuộc loại này, và các mô hình ASR mới hơn có thể cho kết quả khác. Không nghiên cứu nào kiểm tra âm thanh phòng xử án trực tiếp. Bản tóm tắt của NCSC báo cáo rằng hơn 70% người trả lời gặp tình trạng thiếu nhân sự, trong khi một bài viết của Thomson Reuters Institute về cùng khảo sát năm 2025 nêu 68%; chúng tôi dùng con số 61% thiếu hụt kéo dài mà cả hai nguồn đều thống nhất. Số lượng tốc ký viên tại Hoa Kỳ khác nhau tùy phương pháp: AAERT ước tính khoảng 23.000 tốc ký viên, trong khi BLS đếm 19.900 việc làm tốc ký viên tòa án và người phụ đề vào năm 2025. Khoảng độ chính xác của Philippines (từ 70% đến 90-95%) do chính tòa án tự báo cáo, không được kiểm toán độc lập, và con số số giờ của Justice Transcribe tại Vương quốc Anh là ước tính minh họa dựa trên giả định tiết kiệm 10 phút mỗi cuộc gặp. Nhóm công tác liên bang được đề xuất sẽ tạo ra đánh giá độ chính xác đầu tiên của chính phủ Hoa Kỳ về chuyển giọng nói thành văn bản tại tòa án nếu S. 4154 được ban hành.
Cập nhật lần cuối: ngày 3 tháng 10 năm 2026. Chúng tôi cập nhật bài tổng hợp này hàng quý, và lần làm mới tiếp theo dự kiến diễn ra khi Judicial Council of California công bố bản cập nhật quý 2 năm 2026 về tình trạng thiếu tốc ký viên tòa án và khi HMCTS báo cáo kết quả nghiên cứu của Justice Transcribe về các bản phiên âm của Crown Court.