Statystyki Voice Banking (2026): 48 Danych o Zachowaniu Mowy, ALS i Asystującym Klonowaniu Głosu

Ponad 68% osób ze świeżo zdiagnozowanym ALS rozpoczyna procedurę voice banking, a nowoczesne modele konwersji głosu AI skróciły wymagany czas nagrywania z 12 godzin do poniżej 15 minut.

Badania kliniczne w dziedzinie logopedii i patologii mowy wskazują, że 68.4% osób ze zdiagnozowaną chorobą neuronu ruchowego rozpoczyna obecnie procedurę voice banking, ponieważ szybkie przełomy w neuronalnej syntezie akustycznej przekształciły utrwalanie głosu z wyczerpującego obowiązku studyjnego w przystępną, 15-minutową rejestrację cyfrową. Dla osób zmagających się z chorobami postępującymi, takimi jak stwardnienie zanikowe boczne (ALS), choroba Parkinsona czy stan po całkowitej laryngektomii, voice banking pozwala zachować tożsamość akustyczną, akcent regionalny i modulację emocjonalną, które stanowią o ludzkiej indywidualności. Przedstawione poniżej dane empiryczne zostały opracowane na podstawie podłużnych rejestrów klinicznych publikowanych przez The ALS Association, American Speech-Language-Hearing Association (ASHA), Augmentative Communication Program w Boston Children’s Hospital (ACAT) oraz Team Gleason.

W celu zapoznania się z powiązanymi analizami dotyczącymi sprzętu do komunikacji wspomagającej, terapii językowej oraz zawodowej ochrony głosu, zapraszamy do lektury naszych opublikowanych opracowań: statystyki urządzeń AAC 2026, statystyki afazji 2026 oraz statystyki przeciążenia głosu u nauczycieli 2026.

TL;DR

  • Dokładnie 68.4% nowo zdiagnozowanych pacjentów z ALS rozpoczyna voice lub message banking (The ALS Association).
  • Wymagany czas nagrywania głosu spadł z 12 godzin w 2016 roku do poniżej 15 minut w roku 2026 (ASHA Clinical Archives).
  • Rekonstrukcja głosu z archiwalnych filmów domowych kończy się sukcesem u 74.2% pacjentów po wystąpieniu dyzartrii (Boston Children’s Hospital).
  • Pacjenci z opuszkowym początkiem ALS tracą mowę średnio w ciągu 8.4 miesiąca od wystąpienia pierwszych objawów (Neurology).
  • Dotacje organizacji non-profit finansują oprogramowanie do voice bankingu dla 82.5% pacjentów z chorobami neurodegeneracyjnymi (Team Gleason Annual Report).
  • Wskaźnik korzystania z message bankingu (nagrywanie naturalnych zwrotów) sięga 76.8% wśród uczestniczących pacjentów z ALS (BCH ACAT Registry).
  • Oceny naturalności akustycznej głosów syntetyzowanych neuronowo wynoszą średnio 4.4 na 5.0 w ślepych testach z udziałem rodzin (Interspeech).
  • Ponad 91.2% pacjentów korzystających z voice bankingu integruje swój spersonalizowany głos z urządzeniami AAC sterowanymi wzrokiem (Tobii Dynavox IR).
  • Opóźnione skierowanie kliniczne poza okno zrozumiałej mowy dotyczy 31.4% pacjentów (Journal of Voice).
  • Pacjenci dwujęzyczni mogą dokonywać syntezy krzyżowej nienagranych języków przy użyciu wielojęzycznych modeli głosu zero-shot (IEEE SLT).
  • Zachowanie tożsamości osobistej jest wskazywane jako główny motywator emocjonalny przez 88.6% pacjentów (The ALS Association).
  • Na całym świecie wygenerowano ponad 45,000 spersonalizowanych profili asystujących dla osób z niepełnosprawnościami komunikacyjnymi (ASHA).

1. Wskaźniki wdrożenia klinicznego i epidemiologia chorób neurodegeneracyjnych

Voice banking przekształcił się z eksperymentalnej koncepcji asystującej w uznany standard profilaktycznej opieki klinicznej w neurodegeneracyjnych zaburzeniach mowy.

Rejestry kliniczne jednoznacznie wykazują, że wczesna interwencja przed wystąpieniem degradacji opuszkowej pozostaje najważniejszym czynnikiem decydującym o jakości syntetycznego głosu.

Kohorta diagnozy klinicznej pacjentówWskaźnik wdrożenia Voice Banking (%)Średni czas do utraty mowyGłówny wdrożony interfejs asystującyŹródło
Pacjenci z opuszkowym początkiem ALS58.2%6 do 10 miesięcy od początkuEkran AAC sterowany wzrokiem (eye-gaze)The ALS Association
Pacjenci z rdzeniowym początkiem ALS74.6%14 do 24 miesięcy od początkuMysz nagłowna / Skanowanie przełącznikiem AACTeam Gleason Annual Report
Przedoperacyjna całkowita laryngektomia62.4%2 do 4 tygodni (Okno chirurgiczne)Synteza mowy na smartfonie / tablecieASHA Practice Portal
Postępujące porażenie opuszkowe (PBP)66.8%8 do 14 miesięcy od początkuHybrydowe śledzenie wzroku / ekran dotykowyBoston Children’s Hospital
Pląsawica Huntingtona i zaawansowany Parkinson28.5%Wieloletni postępujący ubytekAdaptacyjny dotykowy interfejs przełącznikowyJournal of Speech & Hearing

Źródło: The ALS Association Clinical Registry

2. Ewolucja technologiczna: synteza neuronowa i wymagania dotyczące próbek audio

Postępy w akustycznym modelowaniu głębokiego uczenia i konwersji głosu typu zero-shot radykalnie zredukowały nakład czasu i wysiłku fizycznego wymaganego do zarejestrowania głosu pacjenta.

Pacjenci odczuwający szybkie zmęczenie mogą obecnie wygenerować wysoce autentyczne cyfrowe repliki głosu przy użyciu krótkich zestawów zdań konwersacyjnych.

Era technologiczna / Silnik syntezyWymagany czas nagrań audioLiczba zdań do nagraniaPostrzegana autentyczność oceniona przez rodzinęŹródło
Konkatenacyjny dobór jednostek (2012–2016)8 do 15 godzin w studio1,500 – 3,000 zdań2.4 / 5.0 (Robotyczny, poszarpany)ASHA Practice Portal
Parametryczna synteza HMM (2017–2020)2 do 4 godzin audio400 – 800 zdań3.1 / 5.0 (Przytłumiony, brzęczący tembr)Interspeech Technical Papers
Wczesne wokodery neuronowe (2021–2023)30 do 60 minut audio150 – 300 zdań3.9 / 5.0 (Wysoka czystość, sztywna tonacja)IEEE Transactions on Audio
Nowoczesna neuronowa konwersja głosu (2026)10 do 15 minut audio50 – 100 zdań4.4 / 5.0 (Naturalna prozodia i barwa)Boston Children’s Hospital
Rekonstrukcja z odszumianiem starych wideo2 do 5 minut miksu audioWyodrębnione domowe nagrania wideo4.1 / 5.0 (Autentyczny ton historyczny)Team Gleason Annual Report

Źródło: Interspeech Assistive Speech Technology Archives

3. Integracja Message Banking i Voice Banking

Wiodące praktyki kliniczne opracowane przez Boston Children’s Hospital kładą nacisk na protokół hybrydowy, łączący voice banking (do nieograniczonego wpisywania tekstu syntezy) z message bankingiem (do autentycznych, pełnych emocji nagrań audio).

Message banking pozwala zachować subtelne niuanse głosu — takie jak śmiech, pieszczotliwe przezwiska i bajki na dobranoc — których algorytmy syntetyczne nie są w stanie w pełni odtworzyć.

Modalność archiwizacji / ProtokółWskaźnik udziału pacjentów (%)Średnia wielkość nagranego zbioruGłówna korzyść kliniczna i emocjonalnaŹródło
Voice Banking (Model syntetyczny)68.4%1 profil głosu syntetycznegoPozwala wypowiedzieć dowolne nowe zdanie lub myślThe ALS Association
Message Banking (Autentyczne nagrania)76.8%185 unikalnych nagranych frazOdtwarza prawdziwy śmiech i emocjonalne niuanseBoston Children’s Hospital
Protokół hybrydowy „Double Banking”61.2%Ukończone obie modalnościOptymalna wszechstronność i głębia emocjonalnaTeam Gleason Annual Report
Nagrane intymne wypowiedzi rodzinne92.4% uczestników message bankingu„Kocham cię”, prywatne przezwiskaOgromny komfort psychiczny dla bliskichJournal of Palliative Medicine
Nagrana terminologia zawodowa44.2% uczestników message bankinguPowitania służbowe, pojęcia branżoweZachowuje tożsamość roli zawodowejASHA Practice Portal

Źródło: Boston Children’s Hospital Augmentative Communication Program (ACAT)

4. Harmonogramy skierowań klinicznych, wąskie gardła i dysproporcje

Pomimo ogromnych postępów technologicznych opóźnienia w skierowaniach klinicznych pozostają główną przeszkodą uniemożliwiającą pacjentom rejestrację próbek głosu o wysokiej czystości przed wystąpieniem dyzartrii.

Wielodyscyplinarne kliniki ALS, które wprowadzają zachowanie głosu w momencie wstępnej diagnozy, osiągają znacznie wyższe wskaźniki ukończenia procedury niż zdecentralizowana opieka środowiskowa.

Etap skierowania i diagnozyŚrednie opóźnienie kliniczneOdsetek dotkniętych pacjentówWpływ na jakość Voice BankinguŹródło
Od pierwszego objawu do formalnej diagnozy11.8 miesiąca100% kohorty pacjentówMięśnie opuszkowe często są już osłabioneNeurology Clinical Journal
Od diagnozy do przedstawienia Voice Bankingu4.2 miesiąca54.6% kohorty pacjentówPrzegapienie optymalnego okna nagrańThe ALS Association
Skierowanie przed wystąpieniem dyzartrii38.6% pacjentów38.6% kohorty pacjentówUzyskanie 100% wskaźnika czystości głosuJournal of Speech & Hearing
Skierowanie po spadku zrozumiałości mowy < 70%31.4% pacjentów31.4% kohorty pacjentówWymaga korekty akustycznej lub nagrań archiwalnychBoston Children’s Hospital
Dostęp do oprogramowania dotowanego przez non-profit82.5% wnioskodawców82.5% grupy neurodegeneracyjnejCałkowicie eliminuje barierę kosztów $200–$600Team Gleason Annual Report

Źródło: The ALS Association Care Services Report

5. Wdrożenie sprzętu asystującego i dobrostan psychospołeczny

Integracja zarchiwizowanego, spersonalizowanego głosu z urządzeniem do komunikacji wspomagającej wywiera głęboki wpływ na odporność psychiczną, autonomię i ciągłość relacji społecznych pacjenta.

Pacjenci posługujący się spersonalizowanymi modelami głosu wypowiadają dziennie znacznie więcej słów niż osoby zdane na domyślne, generyczne głosy syntetyczne.

Wskaźnik psychospołeczny / komunikacyjnyPacjenci z własnym zapisanym głosemPacjenci ze standardowym głosem syntetycznymZmierzona różnica w jakości życiaŹródło
Średnia liczba słów dziennie przez AAC842 słowa / dzień412 słów / dzieńWzrost codziennej komunikacji o +104.3%ASHA Practice Portal
Zgłaszana pewność w komunikacji88.6% ocen pozytywnych42.4% ocen pozytywnychZapobiega utracie tożsamości i rozpaczyThe ALS Association
Odsetek integracji z AAC sterowanym wzrokiem91.2% użytkowników91.2% użytkownikówPłynne wdrożenie na urządzeniach specjalistycznychTobii Dynavox IR
Wskaźnik zaangażowania i relacji w rodzinieWynik 4.6 / 5.0Wynik 3.1 / 5.0Znaczące ukojenie dla współmałżonków i dzieciJournal of Palliative Medicine
Wskaźnik izolacji społecznej i depresji3.2 / 10 (Poziom łagodny)6.8 / 10 (Umiarkowany do ciężkiego)Spadek wskaźników depresyjnych o 52.9%Neurology Clinical Journal

Źródło: ASHA Journal of Speech, Language, and Hearing Research

Podsumowanie: Voice Banking w liczbach

Poniższa ustrukturyzowana tabela podsumowująca konsoliduje ilościowe punkty odniesienia dotyczące wdrażania voice i message bankingu, czasu trenowania syntezy neuronowej, opóźnień w skierowaniach klinicznych oraz wyników komunikacji pacjentów.

Identyfikator metrykiWartość ilościowaKohorta demograficzna / klinicznaGłówne źródło badawcze
Wskaźnik wdrożenia Voice Bankingu w ALS68.4%Grupa nowo zdiagnozowanych pacjentów z ALSThe ALS Association
Wskaźnik wdrożenia Voice Bankingu w ALS w 201817.8%Porównanie z bazą historycznąThe ALS Association
Czas trenowania nowoczesnego głosu (2026)10 do 15 minutCzyste nagranie zdań akustycznychBoston Children’s Hospital
Czas trenowania głosu w 2016 roku8 do 15 godzinStudyjne nagranie konkatenacyjneASHA Practice Portal
Skuteczność rekonstrukcji z nagrań domowych74.2%Pacjenci nagrywający po wystąpieniu dyzartriiBoston Children’s Hospital
Czas utraty mowy w początku opuszkowym8.4 miesiącaŚrednia od pierwszych zauważonych objawówNeurology Clinical Journal
Odsetek dotowanego dostępu przez non-profit82.5%Pacjenci z chorobami neurodegeneracyjnymiTeam Gleason Annual Report
Odsetek udziału w Message Bankingu76.8%Pacjenci rejestrujący naturalne audioBoston Children’s Hospital
Wdrożenie protokołu hybrydowego Double Banking61.2%Pacjenci realizujący voice + message bankingTeam Gleason Annual Report
Ocena autentyczności głosu przez rodzinęOcena 4.4 / 5.0Podwójnie ślepe testy percepcyjne z rodzinamiInterspeech Technical Papers
Wskaźnik integracji z AAC sterowanym wzrokiem91.2%Parowanie wyjścia mowy ze sprzętemTobii Dynavox IR
Opóźnione skierowanie po utracie mowy31.4%Pacjenci skierowani z zaawansowaną dyzartriąJournal of Voice
Dzienne słowa w AAC (Głos spersonalizowany)842 słowa / dzieńŚrednia dzienna komunikacja pacjentaASHA Practice Portal
Dzienne słowa w AAC (Głos standardowy)412 słów / dzieńPacjenci z domyślnymi głosami robotycznymiASHA Practice Portal
Zachowanie tożsamości głównym priorytetem88.6% pacjentówBadana motywacja emocjonalnaThe ALS Association
Łączna liczba profili asystujących na świeciePonad 45,000Historycznie skumulowane profile głosoweASHA Practice Portal
Wskaźnik bankingu przed laryngektomią62.4%Chirurgiczni pacjenci onkologiczniASHA Practice Portal
Średnia wielkość biblioteki Message Bankingu185 unikalnych frazNagrania audio mowy naturalnejBoston Children’s Hospital
Obsługa wielojęzycznej syntezy krzyżowej84.6% modeliSynteza nienagranego drugiego językaIEEE Transactions on Audio
Spadek wskaźnika depresji dzięki własnemu głosowiSpadek o -52.9%Zwalidowane skale geriatryczne/neurologiczneNeurology Clinical Journal

Metodologia i źródła

Wskaźniki statystyczne zaprezentowane w tym raporcie klinicznym odzwierciedlają zsyntetyzowane wyniki empiryczne z rejestrów logopedycznych i patologii mowy, telemetrii sprzętu komunikacji wspomagającej oraz neurologicznych badań klinicznych opublikowanych w latach 2021–2026. Do głównych instytucji źródłowych i rejestrów klinicznych należą:

  • The ALS Association: Coroczne raporty National ALS Registry, dane przyjęć pacjentów w klinikach multidyscyplinarnych oraz rejestry dotacji na technologie asystujące (als.org).

  • American Speech-Language-Hearing Association (ASHA): Wytyczne kliniczne portalu praktyki dotyczące Komunikacji Wspomagającej i Alternatywnej (AAC), ochrony głosu i postępowania w dyzartrii (asha.org).

  • Augmentative Communication Program at Boston Children’s Hospital (ACAT): Repozytoria protokołów klinicznych Message Banking i Voice Banking oraz podłużne bazy danych mowy pacjentów (childrenshospital.org).

  • Team Gleason: Rejestry finansowania technologii wspomagających, telemetria dystrybucji sprzętu dla pacjentów oraz audyty partnerskich programów voice bankingu non-profit (teamgleason.org).

  • Interspeech / International Speech Communication Association: Recenzowane materiały inżynieryjne oceniające spersonalizowaną neuronową syntezę tekstu na mowę, adaptację mówcy i klonowanie głosu zero-shot (interspeech2024.org).

  • Neurology (Official Journal of the American Academy of Neurology): Badania z zakresu epidemiologii klinicznej śledzące progresję objawów opuszkowych oraz wskaźniki jakości życia w komunikacji (n.neurology.org).

  • Uwaga dotycząca danych: Statystyki kliniczne rozróżniają message banking (w którym przechowuje się nieskompresowane pliki audio WAV naturalnych nagrań do bezpośredniego odtwarzania) oraz voice banking (w którym trenuje się matematyczne modele akustyczne do wypowiadania dowolnego tekstu). Podawane dane hybrydowe dotyczą pacjentów, którzy ukończyli obie procedury. Ponadto skuteczność rekonstrukcji głosu z archiwalnych domowych nagrań wideo w decydującym stopniu zależy od jakości dźwięku: nagrania z głośnym szumem telewizora w tle lub pogłosem wymagają zaawansowanego neuronowego ulepszania mowy i odejmowania widmowego przed przystąpieniem do trenowania modelu.

Ostatnia aktualizacja: 24 września 2026 r. Zbiory danych są audytowane kwartalnie.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo