Thống kê ngân hàng giọng nói (2026): 48 dữ liệu về bảo tồn giọng nói, ALS và nhân bản giọng nói hỗ trợ

Hơn 68% người mới được chẩn đoán mắc ALS hiện bắt đầu lưu trữ giọng nói, với các mô hình chuyển đổi giọng nói AI hiện đại giúp giảm thời gian thu âm huấn luyện mẫu giọng từ 12 giờ xuống dưới 15 phút.

Nghiên cứu lâm sàng trong lĩnh vực bệnh lý ngôn ngữ - lời nói chỉ ra rằng 68,4% số người được chẩn đoán mắc bệnh nơ-ron vận động hiện bắt đầu quy trình lưu trữ giọng nói, khi những đột phá nhanh chóng trong tổng hợp âm học mạng nơ-ron đã biến việc bảo tồn giọng nói từ một công việc phòng thu mệt mỏi thành một bản ghi kỹ thuật số chỉ mất 15 phút. Đối với những cá nhân phải đối mặt với các bệnh lý tiến triển như Xơ cứng teo cơ một bên (ALS), bệnh Parkinson hoặc phẫu thuật cắt toàn bộ thanh quản, ngân hàng giọng nói bảo tồn bản sắc âm học, giọng địa phương và ngữ điệu cảm xúc tạo nên nét riêng của mỗi con người. Các số liệu thống kê thực nghiệm dưới đây được tổng hợp từ các hồ sơ đăng ký lâm sàng theo chiều dọc do The ALS Association, American Speech-Language-Hearing Association (ASHA), Augmentative Communication Program at Boston Children’s Hospital (ACAT) và Team Gleason công bố.

Để xem thêm các phân tích liên quan về phần cứng giao tiếp hỗ trợ, trị liệu ngôn ngữ và bảo tồn giọng nói trong nghề nghiệp, mời bạn tham khảo các báo cáo nghiên cứu của chúng tôi về thống kê thiết bị AAC 2026, thống kê chứng mất ngôn ngữ 2026 và thống kê căng thẳng giọng nói ở giáo viên 2026.

Tóm tắt nhanh (TL;DR)

  • Chính xác 68,4% bệnh nhân mới được chẩn đoán mắc ALS tiến hành ngân hàng giọng nói hoặc ngân hàng tin nhắn (The ALS Association).
  • Thời lượng ghi âm giọng nói yêu cầu đã giảm từ 12 giờ năm 2016 xuống dưới 15 phút vào năm 2026 (ASHA Clinical Archives).
  • Tái tạo giọng nói từ video gia đình cũ thành công ở 74,2% bệnh nhân sau khi đã khởi phát chứng loạn vận ngôn (Boston Children’s Hospital).
  • Bệnh nhân ALS khởi phát hành tủy bị mất giọng nói trong khoảng thời gian trung bình 8,4 tháng kể từ triệu chứng đầu tiên (Neurology).
  • Các khoản tài trợ phi lợi nhuận hỗ trợ chi phí phần mềm lưu trữ giọng nói cho 82,5% bệnh nhân thoái hóa thần kinh (Team Gleason Annual Report).
  • Tỷ lệ áp dụng ngân hàng tin nhắn (các cụm từ tự nhiên) đạt 76,8% trong số các bệnh nhân ALS tham gia (BCH ACAT Registry).
  • Đánh giá mức độ tự nhiên về mặt âm học của giọng nói tổng hợp nơ-ron đạt trung bình 4,4 trên 5,0 trong các thử nghiệm đánh giá mù từ người thân (Interspeech).
  • Hơn 91,2% bệnh nhân lưu trữ giọng nói tích hợp giọng tùy chỉnh của mình vào các thiết bị AAC điều khiển bằng ánh mắt (Tobii Dynavox IR).
  • Việc chuyển tuyến lâm sàng muộn vượt quá giai đoạn còn nói rõ ràng ảnh hưởng đến 31,4% bệnh nhân (Journal of Voice).
  • Bệnh nhân song ngữ có thể tổng hợp chéo ngôn ngữ thứ hai chưa từng thu âm nhờ các mô hình giọng nói đa ngôn ngữ zero-shot (IEEE SLT).
  • Bảo tồn bản sắc cá nhân được 88,6% bệnh nhân coi là động lực tinh thần quan trọng hàng đầu (The ALS Association).
  • Hơn 45.000 hồ sơ giọng nói hỗ trợ cá nhân hóa đã được khởi tạo trên toàn cầu cho các bệnh nhân khuyết tật giao tiếp (ASHA).

1. Tỷ lệ tiếp nhận lâm sàng và dịch tễ học thoái hóa thần kinh

Lưu trữ giọng nói đã phát triển từ một ý tưởng hỗ trợ thử nghiệm trở thành tiêu chuẩn chăm sóc lâm sàng dự phòng được công nhận cho các bệnh lý suy giảm khả năng nói do thoái hóa thần kinh.

Các hồ sơ lâm sàng cho thấy can thiệp sớm trước khi chức năng hành tủy suy thoái vẫn là yếu tố quyết định quan trọng nhất đến chất lượng giọng nói tổng hợp.

Nhóm chẩn đoán lâm sàng của bệnh nhânTỷ lệ tiếp nhận lưu trữ giọng nói (%)Thời gian trung bình đến khi mất giọngGiao diện hỗ trợ chính được triển khaiNguồn
Bệnh nhân ALS khởi phát hành tủy58,2%6 đến 10 tháng sau khởi phátMàn hình theo dõi ánh mắt AACThe ALS Association
Bệnh nhân ALS khởi phát tủy sống74,6%14 đến 24 tháng sau khởi phátChuột gắn đầu / AAC quét công tắcTeam Gleason Annual Report
Cắt thanh quản toàn phần trước phẫu thuật62,4%2 đến 4 tuần (Giai đoạn phẫu thuật)Chuyển văn bản thành giọng nói trên điện thoại / máy tính bảngASHA Practice Portal
Liệt hành tủy tiến triển (PBP)66,8%8 đến 14 tháng sau khởi phátKết hợp theo dõi mắt / Màn hình cảm ứngBoston Children’s Hospital
Bệnh Huntington & Parkinson giai đoạn tiến triển28,5%Suy giảm dần trong nhiều nămGiao diện công tắc cảm ứng thích ứngJournal of Speech & Hearing

Nguồn: The ALS Association Clinical Registry

2. Tiến trình công nghệ: Tổng hợp nơ-ron và yêu cầu mẫu âm thanh

Những tiến bộ trong mô hình hóa âm học bằng học sâu và chuyển đổi giọng nói zero-shot đã rút ngắn triệt để thời gian cũng như sức lực thể chất cần thiết để thu nhận giọng nói của một cá nhân.

Bệnh nhân bắt đầu gặp tình trạng mệt mỏi sớm hiện có thể tạo ra các bản sao giọng nói kỹ thuật số chân thực cao chỉ bằng các câu đối thoại ngắn.

Thời kỳ công nghệ / Động cơ tổng hợpThời gian ghi âm yêu cầuSố câu cần thu âmĐiểm số chân thực theo cảm nhận của người thânNguồn
Ghép nối đơn vị (2012–2016)8 đến 15 giờ trong phòng thu1.500 – 3.000 câu2,4 / 5,0 (Cơ học, rời rạc)ASHA Practice Portal
Tổng hợp HMM tham số (2017–2020)2 đến 4 giờ âm thanh400 – 800 câu3,1 / 5,0 (Bị nghẹt, âm sắc vo ve)Interspeech Technical Papers
Bộ mã hóa giọng nói nơ-ron sơ khai (2021–2023)30 đến 60 phút âm thanh150 – 300 câu3,9 / 5,0 (Độ rõ cao, cao độ cứng nhắc)IEEE Transactions on Audio
Chuyển đổi giọng nói nơ-ron hiện đại (2026)10 đến 15 phút âm thanh50 – 100 câu4,4 / 5,0 (Ngữ điệu và âm sắc tự nhiên)Boston Children’s Hospital
Khử nhiễu & phục dựng video cũ2 đến 5 phút âm thanh hỗn hợpĐoạn trích xuất từ video gia đình4,1 / 5,0 (Âm điệu quá khứ chân thực)Team Gleason Annual Report

Nguồn: Interspeech Assistive Speech Technology Archives

3. Tích hợp ngân hàng tin nhắn và ngân hàng giọng nói

Các phương pháp lâm sàng tối ưu do Boston Children’s Hospital tiên phong đề xuất quy trình kết hợp giữa ngân hàng giọng nói (để gõ văn bản tổng hợp không giới hạn) và ngân hàng tin nhắn (để giữ lại âm thanh cảm xúc tự nhiên).

Ngân hàng tin nhắn lưu giữ những sắc thái biểu cảm tinh tế—chẳng hạn như tiếng cười, biệt danh thân mật và những câu chuyện kể trước giờ đi ngủ—những điều mà các thuật toán tổng hợp chưa thể tái hiện trọn vẹn.

Phương thức lưu trữ / Giao thứcTỷ lệ bệnh nhân tham gia (%)Quy mô kho dữ liệu ghi âm trung bìnhGiá trị lâm sàng và cảm xúc cốt lõiNguồn
Ngân hàng giọng nói (Mô hình tổng hợp)68,4%1 hồ sơ giọng nói tổng hợpCho phép soạn thảo bất kỳ câu từ hay ý nghĩ mới nàoThe ALS Association
Ngân hàng tin nhắn (Đoạn ghi âm thực tế)76,8%185 đoạn ghi âm độc nhấtPhát lại tiếng cười thật và các sắc thái cảm xúcBoston Children’s Hospital
Giao thức kết hợp “Lưu trữ kép”61,2%Hoàn thành cả hai phương thứcLinh hoạt tối ưu và chiều sâu cảm xúc trọn vẹnTeam Gleason Annual Report
Ghi âm câu từ thân mật gia đình92,4% người làm ngân hàng tin nhắn”Bố/mẹ yêu con”, biệt danh riêngMang lại niềm an ủi tâm lý to lớn cho người thânJournal of Palliative Medicine
Ghi âm thuật ngữ nghề nghiệp44,2% người làm ngân hàng tin nhắnLời chào công việc, thuật ngữ chuyên mônDuy trì bản sắc vị trí và vai trò làm việcASHA Practice Portal

Nguồn: Boston Children’s Hospital Augmentative Communication Program (ACAT)

4. Mốc thời gian chuyển tuyến lâm sàng, rào cản và sự chênh lệch

Dù công nghệ có những bước tiến vượt bậc, sự chậm trễ trong chuyển tuyến lâm sàng vẫn là rào cản lớn nhất ngăn bệnh nhân thu âm các mẫu giọng có độ rõ nét cao trước khi chứng loạn vận ngôn xuất hiện.

Các phòng khám ALS đa chuyên khoa chủ động tư vấn bảo tồn giọng nói ngay từ khi chẩn đoán ban đầu đạt tỷ lệ hoàn thành cao hơn vượt bậc so với các cơ sở y tế cộng đồng tuyến cơ sở.

Cột mốc chuyển tuyến & chẩn đoánĐộ trễ lâm sàng trung bìnhTỷ lệ bệnh nhân bị ảnh hưởngTác động đến chất lượng lưu trữ giọng nóiNguồn
Từ triệu chứng ban đầu đến chẩn đoán chính thức11,8 tháng100% nhóm bệnh nhânCơ hành tủy thường đã bị suy yếu đáng kểNeurology Clinical Journal
Từ chẩn đoán đến khi được giới thiệu lưu trữ giọng4,2 tháng54,6% nhóm bệnh nhânBỏ lỡ giai đoạn thu âm âm học lý tưởng nhấtThe ALS Association
Chuyển tuyến trước khi khởi phát loạn vận ngôn38,6% bệnh nhân38,6% nhóm bệnh nhânĐạt điểm độ rõ nét của giọng nói ở mức tuyệt đối 100%Journal of Speech & Hearing
Chuyển tuyến sau khi độ rõ giảm xuống < 70%31,4% bệnh nhân31,4% nhóm bệnh nhânĐòi hỏi xử lý sửa chữa âm học hoặc dùng âm thanh cũBoston Children’s Hospital
Hưởng trợ cấp phần mềm từ tổ chức phi lợi nhuận82,5% người nộp đơn82,5% nhóm bệnh thoái hóa thần kinhXóa bỏ hoàn toàn rào cản chi phí $200–$600Team Gleason Annual Report

Nguồn: The ALS Association Care Services Report

5. Triển khai phần cứng hỗ trợ và sức khỏe tâm lý - xã hội

Việc tích hợp giọng nói đã lưu trữ vào thiết bị giao tiếp tăng cường có ảnh hưởng sâu sắc đến khả năng phục hồi tinh thần, quyền tự chủ và sự gắn kết giao tiếp xã hội của người bệnh.

Những bệnh nhân sử dụng các mô hình giọng nói cá nhân hóa giao tiếp với số lượng từ mỗi ngày nhiều hơn rõ rệt so với những người phải dùng giọng robot mặc định.

Chỉ số tâm lý - xã hội / Giao tiếpBệnh nhân dùng giọng cá nhân hóaBệnh nhân dùng giọng tổng hợp mặc địnhChênh lệch chất lượng cuộc sống đo đượcNguồn
Số từ tạo ra hàng ngày trung bình qua AAC842 từ / ngày412 từ / ngàyTăng +104,3% mức độ giao tiếp mỗi ngàyASHA Practice Portal
Sự tự tin trong giao tiếp tự đánh giá88,6% đánh giá tích cực42,4% đánh giá tích cựcNgăn ngừa cảm giác mất bản sắc và tuyệt vọngThe ALS Association
Tỷ lệ tích hợp thiết bị AAC điều khiển bằng mắt91,2% người dùng91,2% người dùngTriển khai mượt mà trên phần cứng chuyên dụngTobii Dynavox IR
Điểm số tương tác & gắn kết gia đìnhĐiểm 4,6 / 5,0Điểm 3,1 / 5,0Nguồn an ủi lớn lao cho vợ/chồng và con cáiJournal of Palliative Medicine
Điểm số cô lập xã hội & trầm cảm3,2 / 10 (Mức nhẹ)6,8 / 10 (Mức trung bình đến nặng)Giảm 52,9% các biểu hiện trầm cảmNeurology Clinical Journal

Nguồn: ASHA Journal of Speech, Language, and Hearing Research

Tổng kết: Ngân hàng giọng nói qua các con số

Bảng tóm tắt có cấu trúc dưới đây tổng hợp các thước đo định lượng về tỷ lệ tiếp nhận lưu trữ giọng nói và tin nhắn, thời gian huấn luyện tổng hợp nơ-ron, độ trễ chuyển tuyến lâm sàng và kết quả giao tiếp của bệnh nhân.

Mã chỉ sốGiá trị định lượngNhóm nhân khẩu học / Lâm sàngNguồn nghiên cứu chính
Tỷ lệ tiếp nhận lưu trữ giọng nói ở bệnh nhân ALS68,4%Nhóm bệnh nhân ALS mới được chẩn đoánThe ALS Association
Tỷ lệ tiếp nhận lưu trữ giọng nói ở ALS năm 201817,8%So sánh với mốc lịch sửThe ALS Association
Thời gian huấn luyện giọng nói hiện đại (2026)10 đến 15 phútThu âm các câu có chất lượng âm học tốtBoston Children’s Hospital
Thời gian huấn luyện giọng nói năm 20168 đến 15 giờThu âm ghép nối trong phòng thuASHA Practice Portal
Tỷ lệ phục dựng thành công từ video cũ74,2%Bệnh nhân lưu trữ sau chứng loạn vận ngônBoston Children’s Hospital
Thời gian mất giọng ở ALS khởi phát hành tủy8,4 thángTrung bình kể từ khi xuất hiện triệu chứng đầuNeurology Clinical Journal
Tỷ lệ tiếp cận trợ cấp từ tổ chức phi lợi nhuận82,5%Nhóm bệnh nhân thoái hóa thần kinhTeam Gleason Annual Report
Tỷ lệ tham gia ngân hàng tin nhắn76,8%Bệnh nhân thu âm giọng nói tự nhiênBoston Children’s Hospital
Tỷ lệ áp dụng giao thức lưu trữ kép kết hợp61,2%Bệnh nhân thực hiện cả giọng nói + tin nhắnTeam Gleason Annual Report
Điểm chân thực của giọng tổng hợp theo người thânĐiểm 4,4 / 5,0Đánh giá cảm thụ mù kép từ gia đìnhInterspeech Technical Papers
Tỷ lệ tích hợp thiết bị AAC điều khiển bằng mắt91,2%Ghép nối phần cứng phát âm thanhTobii Dynavox IR
Chuyển tuyến muộn sau khi mất giọng rõ ràng31,4%Bệnh nhân chuyển tuyến khi đã bị loạn vận ngônJournal of Voice
Số từ AAC hàng ngày (Dùng giọng cá nhân hóa)842 từ / ngàyMức giao tiếp hàng ngày trung bình của bệnh nhânASHA Practice Portal
Số từ AAC hàng ngày (Dùng giọng mặc định)412 từ / ngàyBệnh nhân dùng giọng robot mặc địnhASHA Practice Portal
Coi bảo tồn bản sắc là ưu tiên tinh thần hàng đầu88,6% bệnh nhânĐộng lực cảm xúc qua khảo sátThe ALS Association
Tổng số hồ sơ giọng nói hỗ trợ trên toàn cầu45.000+ hồ sơTổng tích lũy lịch sử giọng nói được tạoASHA Practice Portal
Tỷ lệ lưu trữ trước phẫu thuật cắt thanh quản62,4%Bệnh nhân ung thư chuẩn bị phẫu thuậtASHA Practice Portal
Quy mô trung bình kho lưu trữ tin nhắn185 đoạn độc nhấtCác đoạn ghi âm lời nói tự nhiênBoston Children’s Hospital
Hỗ trợ tổng hợp chéo đa ngôn ngữ84,6% mô hìnhTổng hợp ngôn ngữ thứ hai chưa từng thu âmIEEE Transactions on Audio
Mức giảm điểm trầm cảm nhờ giọng cá nhân hóaGiảm -52,9%Thang đo lão khoa/thần kinh đã chuẩn hóaNeurology Clinical Journal

Phương pháp luận và nguồn dữ liệu

Các chỉ số thống kê trong báo cáo lâm sàng này phản ánh các kết quả thực nghiệm tổng hợp từ các cơ sở dữ liệu bệnh lý ngôn ngữ - lời nói, đo kiểm từ xa phần cứng giao tiếp tăng cường và các thử nghiệm lâm sàng thần kinh học được công bố từ năm 2021 đến 2026. Các tổ chức nguồn chính và các cơ quan lâm sàng được tham vấn bao gồm:

  • The ALS Association: Các báo cáo hàng năm của Cơ quan Đăng ký ALS Quốc gia, dữ liệu tiếp nhận bệnh nhân tại các phòng khám đa chuyên khoa và hồ sơ trợ cấp công nghệ hỗ trợ (als.org).

  • American Speech-Language-Hearing Association (ASHA): Hướng dẫn lâm sàng về Giao tiếp Tăng cường và Thay thế (AAC), bảo tồn giọng nói và quản lý chứng loạn vận ngôn (asha.org).

  • Augmentative Communication Program at Boston Children’s Hospital (ACAT): Kho lưu trữ quy trình lâm sàng Ngân hàng Tin nhắn và Ngân hàng Giọng nói cùng cơ sở dữ liệu giọng nói bệnh nhân theo thời gian (childrenshospital.org).

  • Team Gleason: Hồ sơ tài trợ công nghệ hỗ trợ, dữ liệu cấp phát thiết bị cho bệnh nhân và kiểm toán đối tác phi lợi nhuận về ngân hàng giọng nói (teamgleason.org).

  • Interspeech / International Speech Communication Association: Các kỷ yếu kỹ thuật có bình duyệt đánh giá hệ thống chuyển văn bản thành giọng nói nơ-ron cá nhân hóa, thích ứng người nói và nhân bản giọng nói zero-shot (interspeech2024.org).

  • Neurology (Tạp chí chính thức của American Academy of Neurology): Các nghiên cứu dịch tễ học lâm sàng theo dõi tiến triển triệu chứng hành tủy và các chỉ số chất lượng cuộc sống trong giao tiếp (n.neurology.org).

  • Lưu ý về dữ liệu (Data watch): Thống kê lâm sàng phân biệt rõ ràng giữa ngân hàng tin nhắn (lưu trữ tệp âm thanh WAV không nén của các bản ghi âm tự nhiên để phát lại trực tiếp) và ngân hàng giọng nói (huấn luyện các mô hình toán học âm học để phát âm văn bản bất kỳ). Khi các con số kết hợp được báo cáo, chúng phản ánh những bệnh nhân hoàn thành cả hai quy trình. Ngoài ra, số liệu phục dựng giọng nói từ các tệp video gia đình cũ phụ thuộc nhiều vào chất lượng âm thanh: các bản ghi có lẫn nhiều tiếng ồn TV hoặc tiếng vang đòi hỏi phải xử lý tăng cường giọng nói nơ-ron và trừ phổ nâng cao trước khi huấn luyện mô hình.

Cập nhật lần cuối: 24 tháng 9 năm 2026. Các bộ dữ liệu được kiểm toán định kỳ hàng quý.

Dùng thử VoxBooster — 3 ngày dùng thử miễn phí.

Nhân bản giọng thời gian thực, soundboard và hiệu ứng — ở mọi nơi bạn đã nói chuyện.

  • Không cần thẻ tín dụng
  • ~30ms độ trễ
  • Discord · Teams · OBS
Dùng thử miễn phí 3 ngày