ระบบรู้จำเสียงพูดเชิงพาณิชย์ชั้นนำห้าระบบมีอัตราคำผิดพลาดเฉลี่ย 0.35 สำหรับผู้พูดผิวดำ เทียบกับ 0.19 สำหรับผู้พูดผิวขาว และ 23% ของเสียงจากผู้พูดผิวดำให้บทถอดเสียงที่มีข้อผิดพลาดมากเกินกว่าจะใช้งานได้ เทียบกับเพียง 1.6% สำหรับผู้พูดผิวขาว (Koenecke และคณะ, PNAS 2020) การถอดเสียงโดยมนุษย์ก็ไม่ใช่เกณฑ์เปรียบเทียบที่สมบูรณ์เช่นกัน เจ้าหน้าที่จดบันทึกในศาลที่ได้รับการรับรองในฟิลาเดลเฟียถอดเสียงภาษาอังกฤษแบบแอฟริกันอเมริกันด้วยความแม่นยำระดับคำ 82.9% ต่ำกว่ามาตรฐาน 95% ที่ใช้รับรองพวกเขามากกว่า 12 จุด (Jones และคณะ, Language 2019) ขณะเดียวกัน ผู้ที่ทำหน้าที่สร้างบันทึกการพิจารณาคดีก็กำลังลดลง เหลือนักชวเลขราว 23,000 คนหลังลดลง 21% ในหนึ่งทศวรรษ (AAERT, 2025 Court Reporting Industry Trends) และ 71.3% ของการไต่สวนคดีครอบครัว คดีมรดก และคดีแพ่งในแคลิฟอร์เนียตลอดสามปีไม่มีบันทึกคำต่อคำเลย (Judicial Council of California, 2026) เรารวบรวมข้อมูลจาก PNAS วารสาร Language ของ Linguistic Society of America, National Court Reporters Association, Judicial Council of California, Thomson Reuters Institute และ National Center for State Courts, ศาลฎีกาฟิลิปปินส์, กระทรวงยุติธรรมสหราชอาณาจักร และการตรวจสอบ AI ที่ผ่านการประเมินโดยผู้เชี่ยวชาญ เพื่อแสดงให้เห็นว่าความแม่นยำของการถอดเสียงในศาลในปี 2026 อยู่ตรงไหนกันแน่ สำหรับภาพรวมของกำลังคนในวงกว้าง ดูสถิติการจดบันทึกในศาลของเรา
สรุปโดยย่อ
- ASR เชิงพาณิชย์มีอัตราคำผิดพลาดเฉลี่ย 0.35 สำหรับผู้พูดผิวดำ เทียบกับ 0.19 สำหรับผู้พูดผิวขาว (Koenecke และคณะ, PNAS 2020)
- 23% ของช่วงเสียงผู้พูดผิวดำ เทียบกับ 1.6% ของช่วงเสียงผู้พูดผิวขาว เกินเกณฑ์ WER 0.5 ที่ผู้เขียนถือว่าใช้งานไม่ได้ (PNAS 2020)
- ผู้ชายผิวดำมี WER เฉลี่ย 0.41 เป็นสองเท่าของ 0.21 ในผู้ชายผิวขาว (PNAS 2020)
- เจ้าหน้าที่จดบันทึกในศาลที่ฟิลาเดลเฟียมีความแม่นยำระดับคำ 82.9% และระดับประโยค 59.5% กับภาษาอังกฤษแบบแอฟริกันอเมริกัน (Jones และคณะ, Language 2019)
- 31% ของบทถอดเสียงโดยเจ้าหน้าที่จดบันทึกในศาลเปลี่ยนแปลงว่าใคร อะไร เมื่อไร ที่ไหน หรือน้ำหนักของถ้อยคำ (Language 2019)
- เหลือนักชวเลขราว 23,000 คนหลังลดลง 21% ในสิบปี และจำนวนผู้ลงทะเบียนเรียนลดลง 74% (AAERT 2025)
- สมาชิก NCRA ที่ได้รับการรับรองใหม่ลดลงจาก 243 คน (2023) เหลือ 205 คน (2025) และอายุเฉลี่ยของเจ้าหน้าที่จดบันทึกในศาลคือ 56 ปี (สถิติ NCRA, มีนาคม 2026)
- 72.4% ของการไต่สวนคดีครอบครัว คดีมรดก และคดีแพ่งในแคลิฟอร์เนียไตรมาสแรกปี 2026 ไม่มีบันทึกคำต่อคำ (Judicial Council of California 2026)
- ศาลระดับรัฐเพียง 17% ใช้ AI เชิงสร้างสรรค์ และ 70% ห้ามพนักงานใช้เครื่องมือ AI (Thomson Reuters Institute 2025 State Courts Survey)
- ศาลฟิลิปปินส์ลดเวลาถอดเสียงเฉลี่ย 50% สูงสุด 80% ในโครงการนำร่อง AI (ศาลฎีกาฟิลิปปินส์, 2025)
- ราว 1% ของบทถอดเสียงของ Whisper มีวลีที่ AI สร้างขึ้นเอง และ 38% ของวลีเหล่านั้นเป็นอันตราย (Koenecke และคณะ, ACM FAccT 2024)
- คณะทำงานของรัฐบาลกลาง 15 คนว่าด้วยการแปลงเสียงเป็นข้อความในศาลถูกเสนอใน S. 4154 เมื่อวันที่ 19 มีนาคม 2026 (วุฒิสภาสหรัฐฯ)
1. อัตราคำผิดพลาดของ ASR ตามเชื้อชาติ ภาษาถิ่น และเพศ
ปัญหาความแม่นยำหลักของการรู้จำเสียงพูดในศาลไม่ใช่ประสิทธิภาพเฉลี่ย แต่เป็นความแปรปรวนระหว่างผู้พูด ทั้งห้าระบบที่ทดสอบทำผิดพลาดกับผู้พูดผิวดำมากกว่าผู้พูดผิวขาวเกือบสองเท่า แม้ในวลีเดียวกันที่ยาวห้าถึงแปดคำ ซึ่งชี้ไปที่แบบจำลองเสียงมากกว่าคลังคำศัพท์ ในห้องพิจารณาคดีที่บันทึกต้องเชื่อถือได้เท่ากันสำหรับพยานทุกคน เครื่องมือที่แม่นยำโดยเฉลี่ยแต่ไม่เท่าเทียมกันระหว่างผู้พูดย่อมไม่ผ่านการทดสอบความเป็นธรรมขั้นพื้นฐาน
ข้อมูลล่าสุดที่มี: Koenecke และคณะ, Racial disparities in automated speech recognition, PNAS 2020 ตั้งแต่นั้นยังไม่มีการเผยแพร่การศึกษาที่มีขนาดและการออกแบบเทียบเคียงได้ ซึ่งในตัวเองก็เป็นข้อค้นพบ นั่นคือหลักฐานเบื้องหลังการจัดซื้อ ASR สำหรับศาลมีอายุหกปีแล้ว
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| WER เฉลี่ยของ 5 ระบบ ASR ผู้พูดผิวดำ | 0.35 | Koenecke และคณะ, PNAS 2020 |
| WER เฉลี่ยของ 5 ระบบ ASR ผู้พูดผิวขาว | 0.19 | Koenecke และคณะ, PNAS 2020 |
| WER ของ Apple (ผลงานแย่ที่สุด) ผู้พูดผิวดำเทียบกับผิวขาว | 0.45 เทียบกับ 0.23 | Koenecke และคณะ, PNAS 2020 |
| WER ของ Microsoft (ผลงานดีที่สุด) ผู้พูดผิวดำเทียบกับผิวขาว | 0.27 เทียบกับ 0.15 | Koenecke และคณะ, PNAS 2020 |
| WER เฉลี่ย ผู้ชายผิวดำเทียบกับผู้หญิงผิวดำ | 0.41 เทียบกับ 0.30 | Koenecke และคณะ, PNAS 2020 |
| WER เฉลี่ย ผู้ชายผิวขาวเทียบกับผู้หญิงผิวขาว | 0.21 เทียบกับ 0.17 | Koenecke และคณะ, PNAS 2020 |
| ช่วงเสียงที่ WER สูงกว่า 0.5 (ใช้งานไม่ได้) ผู้พูดผิวดำเทียบกับผิวขาว | 23% เทียบกับ 1.6% | Koenecke และคณะ, PNAS 2020 |
| WER ในวลีเดียวกัน Microsoft ผู้พูดผิวดำเทียบกับผิวขาว | 0.13 เทียบกับ 0.07 | Koenecke และคณะ, PNAS 2020 |
บริบท: การศึกษาจับคู่ช่วงเสียง 2,141 ช่วงจากแต่ละกลุ่ม (19.8 ชั่วโมงจากผู้พูดผิวดำ 73 คนและผู้พูดผิวขาว 42 คน) WER มัธยฐานอยู่ที่ 0.38 ในเมือง Princeville รัฐนอร์ทแคโรไลนา และ 0.31 ในกรุงวอชิงตัน ดี.ซี. เทียบกับ 0.18 ในเมือง Sacramento และ 0.15 ในเทศมณฑล Humboldt และอัตราข้อผิดพลาดเพิ่มขึ้นตามความหนาแน่นของลักษณะภาษาอังกฤษพื้นถิ่นแบบแอฟริกันอเมริกัน สาเหตุไม่ใช่คลังคำศัพท์: ระบบของ Google มีคำที่ผู้เข้าร่วมผิวดำพูดอยู่ในคลังคำศัพท์ 98.7% เทียบกับ 98.6% สำหรับผู้เข้าร่วมผิวขาว ตามที่สรุปของ Stanford Engineeringระบุไว้ ผู้เขียนชี้เฉพาะเจาะจงว่าหน่วยงานยุติธรรมทางอาญาที่ถอดเสียงการพิจารณาคดีเป็นสภาพแวดล้อมที่ช่องว่างเหล่านี้อาจก่อให้เกิดอันตรายได้
งานวิจัยที่ใหม่กว่ายืนยันกลไกนี้โดยไม่ได้แทนที่ตัวเลขหลัก บทความ Interspeech 2025 ของ Mojarad และ Tang พบผลเล็กน้อยแต่มีนัยสำคัญของการลดกลุ่มพยัญชนะและการลดเสียง ING ต่อ WER ในภาษาอังกฤษแบบแอฟริกันอเมริกัน และชุดทดสอบ Fair-Speech ที่เผยแพร่ในปี 2024 รวบรวมถ้อยคำราว 26.5 พันรายการจากผู้เข้าร่วมในสหรัฐฯ 593 คนเพื่อวัดความเป็นธรรมทางประชากรศาสตร์โดยเฉพาะ (Veliche และคณะ, 2024) ผู้อ่านที่ต้องการเปรียบเทียบความแม่นยำระหว่างเครื่องมือสามารถดูเกณฑ์ทดสอบทั่วไปได้ในสถิติการแปลงเสียงเป็นข้อความของเรา
2. ความแม่นยำของเจ้าหน้าที่จดบันทึกในศาลที่เป็นมนุษย์กับคำพูดภาษาถิ่น
การเปรียบเทียบที่เป็นธรรมสำหรับ ASR ในศาลไม่ใช่บทถอดเสียงที่สมบูรณ์แบบ แต่เป็นเกณฑ์พื้นฐานของมนุษย์ ซึ่งอ่อนกว่าที่ใบรับรองสื่อถึง เจ้าหน้าที่จดบันทึกในศาลที่ได้รับการรับรองถอดผิดไม่ทางใดก็ทางหนึ่งใน 40.5% ของประโยคภาษาอังกฤษแบบแอฟริกันอเมริกัน ในสภาพที่ดีกว่าห้องพิจารณาคดี คือห้องเงียบ เสียงคุณภาพสูง เปิดฟังทุกถ้อยคำสองรอบ และมีเวลาแก้ไขไม่จำกัด ช่องว่างระหว่างใบรับรองกับผลงานจริงกับภาษาถิ่นคือตัวเลขที่ถูกรายงานน้อยที่สุดในการถอดเสียงในศาล
การศึกษานี้ Testifying while black (Jones, Kalbfeld, Hancock และ Clark, Language 2019) ทดสอบเจ้าหน้าที่จดบันทึกในศาล 27 คนที่ทำงานในศาลฟิลาเดลเฟีย ราวหนึ่งในสามของกลุ่มเจ้าหน้าที่ทางการของเมือง กับถ้อยคำตามธรรมชาติ 83 รายการ ได้บทถอดเสียง 2,241 รายการ
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| มาตรฐานความแม่นยำสำหรับการรับรองเจ้าหน้าที่จดบันทึกในศาล | 95% หรือ 98% | Jones และคณะ, Language 2019 |
| ความแม่นยำการถอดเสียงระดับประโยคโดยเฉลี่ย | 59.5% | Jones และคณะ, Language 2019 |
| ความแม่นยำระดับประโยค ดีที่สุดเทียบกับแย่ที่สุด | 77% เทียบกับ 18% | Jones และคณะ, Language 2019 |
| ความแม่นยำระดับคำโดยเฉลี่ย | 82.9% (ต่ำกว่ามาตรฐาน 12.1 จุด) | Jones และคณะ, Language 2019 |
| ความแม่นยำระดับคำ ดีที่สุดเทียบกับแย่ที่สุด | 91.2% เทียบกับ 58.4% | Jones และคณะ, Language 2019 |
| บทถอดเสียงที่เปลี่ยนแปลงว่าใคร อะไร เมื่อไร ที่ไหน หรือน้ำหนักของถ้อยคำ | 31% (701 จาก 2,241) | Jones และคณะ, Language 2019 |
| บทถอดเสียงที่จะทำให้ข้อความไร้ความหมายเข้าไปอยู่ในบันทึก | 11% (248) | Jones และคณะ, Language 2019 |
| ความแม่นยำในการถอดความ (ความเข้าใจ) โดยเฉลี่ย | 33% | Jones และคณะ, Language 2019 |
หมายเหตุเกี่ยวกับค่านอกเกณฑ์: ในช่วงนำร่อง ทนายความที่ระบุว่าตนเป็นผู้พูดภาษาอังกฤษแบบแอฟริกันอเมริกันถอดเสียงได้แม่นยำ 90% เทียบกับ 64.2% สำหรับทนายความที่พูดภาษาอังกฤษแบบอเมริกันมาตรฐาน เจ้าหน้าที่จดบันทึกในศาลที่เป็นคนผิวดำถอดความถ้อยคำได้ถูกต้อง 52.5% เทียบกับ 33.7% สำหรับเจ้าหน้าที่ที่ไม่ใช่คนผิวดำ และ 70% ของเจ้าหน้าที่ที่เข้าร่วมทั้งหมดไม่เคยได้ยินคำว่าภาษาอังกฤษแบบแอฟริกันอเมริกัน บทเรียนสำหรับการจัดซื้อ AI คือ ผู้ขายที่วัดผลกับชุดทดสอบภาษาอังกฤษมาตรฐานเท่านั้นกำลังวัดสิ่งที่ผิด และเช่นเดียวกันสำหรับการรับรองมนุษย์ เราพูดถึงปัญหาแบบเดียวกันในตลาดแรงงานในสถิติอคติทางสำเนียงของเรา
3. กำลังคนจดบันทึกในศาลเบื้องหลังบันทึกการพิจารณาคดี
การถกเถียงเรื่องความแม่นยำยิ่งสำคัญขึ้นเพราะอุปทานของมนุษย์กำลังหดตัว การรับรองใหม่ของ NCRA ลดลงเป็นปีที่สองติดต่อกัน เหลือ 205 ในปี 2025 ขณะที่อายุเฉลี่ยของเจ้าหน้าที่จดบันทึกในศาลตอนนี้คือ 56 ปี ศาลไม่ได้เลือกระหว่างนักชวเลขกับซอฟต์แวร์ในเชิงนามธรรม แต่กำลังตัดสินใจว่าอะไรจะมาเติมตำแหน่งที่ว่างอยู่แล้ว
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| นักชวเลขที่ได้รับการรับรองซึ่งเหลืออยู่ในสหรัฐฯ | ประมาณ 23,000 คน | AAERT, 2025 Court Reporting Industry Trends |
| การลดลงของนักชวเลขที่ได้รับการรับรองในทศวรรษที่ผ่านมา | 21% | AAERT, 2025 Court Reporting Industry Trends |
| การลดลงของผู้ลงทะเบียนเรียนในโรงเรียนชวเลข (3,083 คนในปี 2015 เหลือ 790 คนในปี 2024) | 74% | AAERT, 2025 Court Reporting Industry Trends |
| หลักสูตรหรือโรงเรียนชวเลขที่ปิดตัวในทศวรรษ | ประมาณ 42% | AAERT, 2025 Court Reporting Industry Trends |
| สมาชิก NCRA ที่ได้รับการรับรองใหม่ ปี 2023 / 2024 / 2025 | 243 / 211 / 205 | สถิติ NCRA, มีนาคม 2026 |
| อายุเฉลี่ยของสมาชิก NCRA ที่เป็นเจ้าหน้าที่จดบันทึกในศาล | 56 | สถิติ NCRA, มีนาคม 2026 |
| ตำแหน่งงานเจ้าหน้าที่จดบันทึกในศาลและผู้ทำคำบรรยายสด ปี 2025 | 19,900 | BLS Occupational Outlook Handbook |
| การเปลี่ยนแปลงการจ้างงานที่คาดการณ์ ปี 2025-35 | 0% (ตำแหน่งว่างราว 1,800 ตำแหน่งต่อปี) | BLS Occupational Outlook Handbook |
การสำรวจผู้ใช้ปลายทางของ AAERT (ผู้ตอบมากกว่า 550 คน ดำเนินการในไตรมาส 4 ปี 2024) วัดผลกระทบที่ตามมา: 76% รายงานว่ามีปัญหาในการกำหนดตารางการพิจารณา 55% รายงานต้นทุนที่สูงขึ้น 39% รายงานความล่าช้า และ 26% บอกว่ายอมรับบทถอดเสียงคุณภาพต่ำลง และ 96% ระบุว่าความแม่นยำเป็นตัวชี้วัดประสิทธิภาพที่สำคัญที่สุด แหล่งที่มา: รายงานอุตสาหกรรมของ AAERT, สถิติ NCRA และโปรไฟล์เจ้าหน้าที่จดบันทึกในศาลของ BLS ซึ่งคาดการณ์อย่างชัดเจนว่าเครื่องมือถอดเสียงด้วย AI จะจำกัดการเติบโตของการจ้างงานในอนาคต ขณะที่เจ้าหน้าที่ยังจำเป็นสำหรับการตรวจทานและแก้ไขบันทึกที่สร้างด้วยระบบดิจิทัล ข้อควรระวัง: AAERT เป็นตัวแทนของผู้จดบันทึกและผู้ถอดเสียงด้วยระบบอิเล็กทรอนิกส์ และเป็นผู้ว่าจ้างให้ทำการศึกษานี้ กรอบการนำเสนอจึงเอนเอียงไปทางการบันทึกแบบดิจิทัล แม้ตัวเลขกำลังคนจะอ้างอิงข้อมูลของ NCRA และ BLS
4. การพิจารณาที่ไม่มีบันทึกคำต่อคำเลย
ความแม่นยำการถอดเสียงที่แย่ที่สุดคือการไม่มีบทถอดเสียง แคลิฟอร์เนียซึ่งจำกัดการบันทึกแบบอิเล็กทรอนิกส์ในคดีส่วนใหญ่ เผยแพร่ข้อมูลสาธารณะที่ละเอียดที่สุดในสหรัฐฯ ว่าเกิดอะไรขึ้นเมื่อไม่มีเจ้าหน้าที่จดบันทึก ตลอดสามปี มีการไต่สวนคดีครอบครัว คดีมรดก และคดีแพ่งไม่จำกัดวงเงินถึง 3,007,651 ครั้งที่ดำเนินไปโดยไม่มีบันทึกคำต่อคำ ซึ่งเอกสารข้อเท็จจริงของรัฐเองระบุว่ามักจะเป็นอุปสรรคร้ายแรงต่อการอุทธรณ์
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| การไต่สวนที่ไม่มีบันทึกคำต่อคำ ไตรมาส 1 ปี 2026 | 303,430 จาก 418,985 (72.4%) | Judicial Council of California, 2026 |
| การไต่สวนที่ไม่มีบันทึกคำต่อคำ เมษายน 2023 ถึงมีนาคม 2026 | 3,007,651 จาก 4,214,365 (71.3%) | Judicial Council of California, 2026 |
| เจ้าหน้าที่จดบันทึกที่ศาลจ้างเทียบกับ FTE ที่ต้องเพิ่ม | 1,101 เทียบกับต้องเพิ่มอีก 458 | Judicial Council of California, 2026 |
| FTE ของเจ้าหน้าที่จดบันทึกที่จ้างเข้าเทียบกับที่ลาออก เมษายน 2023 ถึงมีนาคม 2026 | 381.8 เทียบกับ 366.3 (เพิ่มสุทธิ 15.5) | Judicial Council of California, 2026 |
| สัดส่วนผู้จ้างใหม่ที่เป็นผู้บันทึกด้วยเสียงพูด | 48.1% (183.5 FTE) | Judicial Council of California, 2026 |
| การลดลงของผู้ถือใบอนุญาตในแคลิฟอร์เนีย ปีงบประมาณ 2013-14 ถึงปีงบประมาณ 2022-23 | 20.9% (ใบสมัครใหม่ลดลง 42.9%) | Judicial Council of California Fact Sheet, มกราคม 2025 |
| ค่าใช้จ่ายของศาลแคลิฟอร์เนียด้านบทถอดเสียง ปีงบประมาณ 2023-24 | USD 23.7 ล้าน | Judicial Council of California Fact Sheet, มกราคม 2025 |
| ค่าใช้จ่ายรายวันของเจ้าหน้าที่จดบันทึกเอกชน การสืบพยานก่อนพิจารณาคดีเทียบกับการพิจารณาคดี | USD 2,580 เทียบกับ USD 3,300 | Judicial Council of California Fact Sheet, มกราคม 2025 |
บริบท: ท่อส่งกำลังคนกำลังดีขึ้นเล็กน้อย โดยมีใบอนุญาตใหม่ 176 ใบที่ออกในปีงบประมาณ 2024-25 เทียบกับ 68 ใบในปี 2022-23 และอัตราผ่านการสอบ 52.7% จากผู้เข้าสอบล่าสุด 294 คน แต่เกือบครึ่งของผู้จ้างใหม่เป็นผู้บันทึกด้วยเสียงพูด ซึ่งในตัวเองก็เป็นขั้นตอนการทำงานแบบรู้จำเสียงพูด: เจ้าหน้าที่พูดทวนคำให้การลงในไมโครโฟนที่ติดกับหน้ากาก แล้วซอฟต์แวร์แปลงเป็นข้อความ ข้อมูลล่าสุดอยู่ในแดชบอร์ดการขาดแคลนของ Judicial Council และตัวเลขต้นทุนมาจากเอกสารข้อเท็จจริงเดือนมกราคม 2025
5. การนำการถอดเสียงด้วย AI มาใช้และโครงการนำร่องในศาล
ศาลระดับรัฐของสหรัฐฯ ระมัดระวัง และตัวเลขแสดงช่องว่างกว้างระหว่างความคาดหวังกับการอนุญาต 91% ของผู้ปฏิบัติงานศาลระดับรัฐคาดว่า AI จะมีผลต่อการดำเนินงานของศาลอย่างน้อยในระดับปานกลาง แต่ 70% บอกว่าศาลของตนไม่อนุญาตให้พนักงานใช้เครื่องมือที่ใช้ AI เลย การใช้งานที่ก้าวหน้าที่สุดอยู่นอกสหรัฐฯ ซึ่งระบบตุลาการระดับชาติสามารถกำหนดมาตรฐานบนแพลตฟอร์มเดียวได้
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ศาลระดับรัฐที่ใช้ AI เชิงสร้างสรรค์ในปัจจุบัน | 17% | Thomson Reuters Institute, 2025 State Courts Survey |
| ศาลที่ไม่อนุญาตให้พนักงานใช้เครื่องมือที่ใช้ AI | 70% | Thomson Reuters Institute, 2025 State Courts Survey |
| ผู้ตอบที่ประเมินว่า AI เป็นแนวโน้มที่สำคัญที่สุด | 55% | Thomson Reuters Institute, 2025 State Courts Survey |
| ระบบศาลที่เคยจัดอบรมด้าน AI | 25% | NCSC, Preparing for Future Workforce Needs 2025 |
| ผู้ตอบที่คาดว่าการขาดแคลนบุคลากรจะยังดำเนินต่อไป | 61% | NCSC, Preparing for Future Workforce Needs 2025 |
| ขอบเขตโครงการนำร่องถอดเสียงด้วย AI ในฟิลิปปินส์ (กรกฎาคม 2023 ถึงกันยายน 2024) | Sandiganbayan + ศาลชั้นต้น 41 แห่ง | ศาลฎีกาฟิลิปปินส์, 2025 |
| การลดเวลาถอดเสียงในโครงการนำร่องของฟิลิปปินส์ | เฉลี่ย 50% สูงสุด 80% | ศาลฎีกาฟิลิปปินส์, 2025 |
| ความแม่นยำที่รายงานตลอดโครงการนำร่องของฟิลิปปินส์ | ดีขึ้นจาก 70% เป็น 90-95% | ศาลฎีกาฟิลิปปินส์, 2025 |
การสำรวจครอบคลุมผู้พิพากษาและผู้ปฏิบัติงานศาลระดับรัฐ เทศมณฑล และเทศบาล 443 คนในเดือนมีนาคมและเมษายน 2025 (Thomson Reuters Institute; สรุปของ NCSC) ผลจากฟิลิปปินส์ซึ่งนำเสนอโดยประธานศาลฎีกา Alexander Gesmundo มาจากแพลตฟอร์ม Scriptix ที่ใช้แบบจำลองภาษาเฉพาะสำหรับภาษาฟิลิปปินส์และ Taglish และศาลฎีกาอนุมัติให้ใช้ทั่วประเทศในเดือนพฤศจิกายน 2024 (ศาลฎีกาฟิลิปปินส์) โปรดสังเกตว่าความแม่นยำเริ่มต้น 70% ไม่อาจยอมรับได้สำหรับบันทึกทางการใด ๆ ผลที่ดีขึ้นมาจากการใช้งานต่อเนื่องและการแก้ไขโดยมนุษย์ ไม่ใช่จากการเปิดเครื่องมือเฉย ๆ
สหราชอาณาจักรมีจุดข้อมูลปริมาณใหญ่ที่สุดจนถึงตอนนี้ แม้จะมาจากงานคุมประพฤติไม่ใช่ห้องพิจารณาคดี: กระทรวงยุติธรรมรายงานว่ามีการสรุปการพบปะมากกว่า 1,600,000 ครั้งด้วยเครื่องมือภายในองค์กรชื่อ Justice Transcribe ระหว่างวันที่ 7 ตุลาคม 2025 ถึง 14 กันยายน 2026 ซึ่งเป็นการประหยัดเวลาตามตัวอย่างประมาณ 266,667 ชั่วโมงที่ 10 นาทีต่อการพบปะหนึ่งครั้ง (ข้อมูล Justice Transcribe บน GOV.UK) ประกาศของกระทรวงเองคาดว่าจะปลดปล่อยเวลาได้ 18,750 วันตามปฏิทินต่อปี และ HM Courts and Tribunals Service กำลังทดสอบเครื่องมือเดียวกันนี้เทียบกับผู้ถอดเสียงที่เป็นมนุษย์ตามสัญญาสำหรับบทถอดเสียงของ Crown Court สำหรับภาพรวมว่าภาคกฎหมายโดยรวมนำ AI มาใช้อย่างไร ดูสถิติ AI ในวงการกฎหมายของเรา
6. ข้อมูลที่ AI สร้างขึ้นเอง บทถอดเสียงของตำรวจ และช่องว่างด้านการกำกับดูแล
อัตราคำผิดพลาดประเมินความเสี่ยงทางกฎหมายของการถอดเสียงด้วย AI ต่ำเกินไป เพราะบทถอดเสียงอาจมีคำที่ไม่มีใครพูดอยู่ด้วย 38% ของข้อความที่ Whisper สร้างขึ้นเองมีอันตรายอย่างชัดเจน เช่น ความรุนแรง การเชื่อมโยงที่เป็นเท็จ หรือการบ่งชี้อำนาจ เนื้อหาประเภทที่อาจเปลี่ยนวิธีที่ผู้พิพากษาหรือคณะลูกขุนอ่านคำให้การ เสียงในห้องพิจารณาคดีเต็มไปด้วยช่วงเงียบยาว และช่วงที่ไม่มีเสียงพูดยาว ๆ คือสิ่งที่นักวิจัยเชื่อมโยงกับการที่ AI สร้างข้อความขึ้นเอง
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| บทถอดเสียงของ Whisper ที่มีวลีหรือประโยคที่ AI สร้างขึ้นเองทั้งหมด | ประมาณ 1% (เฉลี่ย 1.4%) | Koenecke และคณะ, ACM FAccT 2024 |
| ข้อความที่ AI สร้างขึ้นเองซึ่งมีอันตรายอย่างชัดเจนอย่างน้อยหนึ่งอย่าง | 38% | Koenecke และคณะ, ACM FAccT 2024 |
| ข้อความที่ AI สร้างขึ้นเองซึ่งตอกย้ำความรุนแรง | 19% | Koenecke และคณะ, ACM FAccT 2024 |
| ข้อความที่ AI สร้างขึ้นเองซึ่งเชื่อมโยงอย่างไม่ถูกต้อง / บ่งชี้อำนาจที่ไม่มีอยู่จริง | 13% / 8% | Koenecke และคณะ, ACM FAccT 2024 |
| การทดลองรายงานตำรวจด้วย AI ของ Draft One: เจ้าหน้าที่และรายงาน | เจ้าหน้าที่ 85 นาย รายงาน 755 ฉบับ | Adams และคณะ, Journal of Experimental Criminology 2025 |
| ผลของ Draft One ต่อเวลาที่ใช้เขียนรายงาน | ไม่ลดลงอย่างมีนัยสำคัญทางสถิติ | Adams และคณะ, Journal of Experimental Criminology 2025 |
| ระยะเวลาและผลของการทดลองรายงานด้วย AI ของ Anchorage Police Department | 3 เดือน ไม่ประหยัดเวลาอย่างมีนัยสำคัญ | Anchorage Police Department ผ่าน EFF, 2025 |
| คณะทำงานของรัฐบาลกลางที่เสนอว่าด้วยการแปลงเสียงเป็นข้อความในศาล | 15 คน รายงานภายใน 18 เดือน | S. 4154, Research and Oversight of AI in Courts Act of 2026 |
บริบท: การศึกษาเรื่องข้อมูลที่ AI สร้างขึ้นเอง (ACM FAccT 2024) พบว่าเกิดขึ้นไม่เป็นสัดส่วนกับผู้พูดที่มีภาวะเสียการสื่อความ (aphasia) ซึ่งมีช่วงเงียบที่ไม่มีเสียงพูดยาวกว่า เสียงจากกล้องติดตัวเจ้าหน้าที่เข้าสู่บันทึกคดีอาญาอยู่แล้วผ่านรายงานตำรวจที่ AI ร่าง การทดลองแบบสุ่มที่ลงทะเบียนล่วงหน้าของ Axon Draft One (Springer) ไม่พบการประหยัดเวลา เพราะเจ้าหน้าที่ใช้เวลาที่ประหยัดได้ไปกับการแก้ข้อผิดพลาดและเพิ่มข้อเท็จจริงที่ตกหล่น ทั้งที่ผู้ขายเคยโฆษณาว่าลดได้ 50% (EFF) ร่างกฎหมายของรัฐบาลกลางที่อยู่ระหว่างพิจารณา ซึ่งเสนอเมื่อวันที่ 19 มีนาคม 2026 จะกำหนดให้คณะทำงานตรวจสอบความแม่นยำของการถอดเสียง ผลต่อผู้พูดที่มีสำเนียงหรือภาษาถิ่น และลายน้ำสำหรับบันทึกที่ AI แก้ไข (ข้อความ S. 4154, GovInfo) คำถามสำหรับศาลไม่ใช่อีกต่อไปว่าการรู้จำเสียงพูดดีพอโดยเฉลี่ยหรือไม่ แต่คือมีใครวัดผลกับผู้พูดที่ต้องการบันทึกที่ถูกต้องมากที่สุดหรือเปล่า
สรุป: ความแม่นยำการรู้จำเสียงพูดในห้องพิจารณาคดีในรูปแบบตัวเลข
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| WER เฉลี่ยของ ASR ผู้พูดผิวดำเทียบกับผิวขาว | 0.35 เทียบกับ 0.19 | Koenecke และคณะ, PNAS 2020 |
| ช่วงเสียงที่บทถอดเสียงใช้งานไม่ได้ (WER สูงกว่า 0.5) ผิวดำเทียบกับผิวขาว | 23% เทียบกับ 1.6% | Koenecke และคณะ, PNAS 2020 |
| WER ของ ASR ผู้ชายผิวดำเทียบกับผู้ชายผิวขาว | 0.41 เทียบกับ 0.21 | Koenecke และคณะ, PNAS 2020 |
| WER ของ ASR Apple ผู้พูดผิวดำเทียบกับผิวขาว | 0.45 เทียบกับ 0.23 | Koenecke และคณะ, PNAS 2020 |
| ความแม่นยำระดับคำของเจ้าหน้าที่จดบันทึกในศาลกับภาษาอังกฤษแบบแอฟริกันอเมริกัน | 82.9% | Jones และคณะ, Language 2019 |
| ความแม่นยำระดับประโยคของเจ้าหน้าที่จดบันทึกในศาลกับภาษาอังกฤษแบบแอฟริกันอเมริกัน | 59.5% | Jones และคณะ, Language 2019 |
| บทถอดเสียงของเจ้าหน้าที่จดบันทึกในศาลที่เปลี่ยนความหมาย | 31% | Jones และคณะ, Language 2019 |
| มาตรฐานการรับรองเจ้าหน้าที่จดบันทึกในศาล | 95% ถึง 98% | Jones และคณะ, Language 2019 |
| นักชวเลขที่เหลืออยู่ในสหรัฐฯ | ประมาณ 23,000 คน | AAERT 2025 |
| การลดลงของผู้ลงทะเบียนเรียนชวเลข 2015 ถึง 2024 | 74% | AAERT 2025 |
| สมาชิก NCRA ที่ได้รับการรับรองใหม่ ปี 2025 | 205 | สถิติ NCRA, มีนาคม 2026 |
| อายุเฉลี่ยของเจ้าหน้าที่จดบันทึกในศาล | 56 | สถิติ NCRA, มีนาคม 2026 |
| การไต่สวนในแคลิฟอร์เนียที่ไม่มีบันทึกคำต่อคำ เมษายน 2023 ถึงมีนาคม 2026 | 71.3% (3,007,651) | Judicial Council of California 2026 |
| เจ้าหน้าที่จดบันทึกในศาลเพิ่มเติมที่แคลิฟอร์เนียต้องการ | 458 FTE | Judicial Council of California 2026 |
| ศาลระดับรัฐที่ใช้ AI เชิงสร้างสรรค์ | 17% | Thomson Reuters Institute 2025 |
| ศาลที่ห้ามพนักงานใช้เครื่องมือที่ใช้ AI | 70% | Thomson Reuters Institute 2025 |
| การลดเวลาถอดเสียงในโครงการนำร่อง AI ของฟิลิปปินส์ | เฉลี่ย 50% สูงสุด 80% | ศาลฎีกาฟิลิปปินส์ 2025 |
| การพบปะในสหราชอาณาจักรที่สรุปด้วย Justice Transcribe ตุลาคม 2025 ถึงกันยายน 2026 | 1,600,000+ | กระทรวงยุติธรรมสหราชอาณาจักร 2026 |
| ข้อความที่ Whisper สร้างขึ้นเองซึ่งมีอันตรายอย่างชัดเจน | 38% | Koenecke และคณะ, ACM FAccT 2024 |
ระเบียบวิธีและแหล่งที่มา
- Koenecke และคณะ, Racial disparities in automated speech recognition, PNAS 2020 พร้อมสรุปของ Stanford Engineering
- Jones, Kalbfeld, Hancock และ Clark, Testifying while black, Language 95(2), 2019
- Mojarad และ Tang, Automatic Speech Recognition of African American English, Interspeech 2025
- Veliche และคณะ, Fair-Speech dataset, 2024
- AAERT, 2025 Court Reporting Industry Trends (ดำเนินการโดย The Brand Consultancy สัมภาษณ์ 27 ราย และแบบสำรวจมากกว่า 550 ชุด)
- National Court Reporters Association, สถิติ NCRA (มีนาคม 2026)
- U.S. Bureau of Labor Statistics, Occupational Outlook Handbook: Court Reporters and Simultaneous Captioners
- Judicial Council of California, แดชบอร์ด Shortage of Court Reporters in California และ Fact Sheet, มกราคม 2025
- Thomson Reuters Institute, Staffing, Operations and Technology: A 2025 Survey of State Courts
- National Center for State Courts, Preparing for Future Workforce Needs
- ศาลฎีกาฟิลิปปินส์, ผลการถอดเสียงด้วย AI
- กระทรวงยุติธรรมสหราชอาณาจักร, ข้อมูล Justice Transcribe, ตุลาคม 2025 ถึงกันยายน 2026 และประกาศ AI tech ambition
- Koenecke และคณะ, Careless Whisper: Speech-to-Text Hallucination Harms, ACM FAccT 2024
- Adams และคณะ, การทดลองแบบสุ่มเรื่องการเขียนรายงานตำรวจด้วยความช่วยเหลือของ AI, Journal of Experimental Criminology 2025 และEFF เรื่องการทดลองของ Anchorage Police Department, 2025
- S. 4154, Research and Oversight of AI in Courts Act of 2026 (GovInfo)
- ข้อสังเกตเกี่ยวกับข้อมูล: การศึกษาด้านความแม่นยำพื้นฐานสองชิ้น (PNAS 2020, Language 2019) มีอายุเกินสามปีและทดสอบระบบเชิงพาณิชย์และเจ้าหน้าที่ตามสภาพที่มีอยู่ในขณะนั้น ทั้งสองยังคงเป็นการวัดแบบควบคุมล่าสุดในประเภทเดียวกัน และแบบจำลอง ASR ที่ใหม่กว่าอาจให้ผลต่างออกไป ไม่มีการศึกษาใดทดสอบเสียงจริงในห้องพิจารณาคดี สรุปของ NCSC รายงานว่าผู้ตอบมากกว่า 70% เผชิญปัญหาขาดแคลนบุคลากร ขณะที่บทความของ Thomson Reuters Institute เกี่ยวกับการสำรวจปี 2025 ชุดเดียวกันระบุ 68% เราใช้ตัวเลข 61% สำหรับการขาดแคลนที่ยังดำเนินต่อไปซึ่งทั้งสองแหล่งตรงกัน จำนวนนักชวเลขในสหรัฐฯ แตกต่างกันตามวิธีนับ: AAERT ประเมินราว 23,000 คน ขณะที่ BLS นับตำแหน่งงานเจ้าหน้าที่จดบันทึกในศาลและผู้ทำคำบรรยายได้ 19,900 ตำแหน่งในปี 2025 ช่วงความแม่นยำของฟิลิปปินส์ (70% ถึง 90-95%) เป็นตัวเลขที่ศาลรายงานเอง ไม่ได้ผ่านการตรวจสอบอิสระ และตัวเลขชั่วโมงของ Justice Transcribe ในสหราชอาณาจักรเป็นการประมาณตามตัวอย่างโดยอิงสมมติฐานว่าประหยัด 10 นาทีต่อการพบปะหนึ่งครั้ง คณะทำงานของรัฐบาลกลางที่เสนอจะจัดทำการประเมินความแม่นยำของการแปลงเสียงเป็นข้อความในศาลครั้งแรกของรัฐบาลสหรัฐฯ หาก S. 4154 มีผลบังคับใช้
อัปเดตล่าสุด: 3 ตุลาคม 2026 เราจะทบทวนและอัปเดตสรุปนี้ทุกไตรมาส และคาดว่าการอัปเดตครั้งถัดไปจะเกิดขึ้นเมื่อ Judicial Council of California เผยแพร่การอัปเดตเรื่องการขาดแคลนเจ้าหน้าที่จดบันทึกในศาลไตรมาส 2 ปี 2026 และเมื่อ HMCTS รายงานผลการศึกษา Justice Transcribe กับบทถอดเสียงของ Crown Court