Głos po laryngektomii: klonowanie głosu przez sztuczną inteligencję i opcje zmieniające głos

Po laryngektomii klonowanie głosu przez sztuczną inteligencję i oprogramowanie zmieniające głos mogą pomóc w tym, aby wyjście laryngesu elektrycznego brzmiało bardziej naturalnie. Czułego poradnik skoncentrowany na logopedach.

Głos po laryngektomii: klonowanie głosu przez sztuczną inteligencję i opcje zmieniające głos po operacji

Utrata głosu z powodu laryngektomii to nie banalny problem. Dla wielu ludzi następuje po rozpoznaniu raka - okres strachu, leczenia i zamieszania - i sama operacja usuwa organ, który wytwarzał dźwięk, o którym większość ludzi nie myśli, dopóki nie zniknie. Głos, który używałeś do śmiechu, kłótni, pocieszania i zwykłego mówienia przez codzienne życie, zmienia się, czasami nieodwracalnie, w ciągu kilku godzin.

Ten poradnik dotyczy tego, co technologia może oferować w tej sytuacji - szczerze, bez przesady. Klonowanie głosu przez sztuczną inteligencję i oprogramowanie zmieniające głos zaawansowały wystarczająco, aby były rzeczywiście przydatne dla niektórych pacjentów po laryngektomii, szczególnie jako uzupełnienie tradycyjnych metod mowy alaryngealnej. Ale to jeden wariant spośród wielu, i działają najlepiej obok zawodowej rehabilitacji, a nie zamiast niej.


Streszczenie

  • Laryngektomia usuwa krtań; trzy ustalone metody zastępują głos: larynges elektryczny, mowa przełykowa, proteza głosu трахеоезофагеальная (TEP).
  • Archiwizacja głosu przez sztuczną inteligencję - nagranie głosu przed operacją - tworzy osobisty zasób głosu, z którego mogą korzystać narzędzia sztucznej inteligencji później.
  • Zmieniające głos narzędzia sztucznej inteligencji mogą przetwarzać audio laryngesu elektrycznego lub TEP w czasie rzeczywistym, czyniąc je brzmiącym mniej robotycznie.
  • Wyniki są znaczące, nie magiczne: poprawa jest rzeczywista, przywrócenie nie jest właściwym słowem.
  • Pracuj z logopedą (SLP). Technologia wspiera rehabilitację; nie zastępuje jej.
  • Organizacje: WebWhispers, Międzynarodowe Stowarzyszenie Pacjentów po Laryngektomii, ASHA.

Co się dzieje z głosem po laryngektomii

Krtań - pudło głosowe - zawiera struny głosowe, które wibrują, aby wytwarzać dźwięk. Podczas całkowitej laryngektomii cała krtań jest usuwana, tchawica jest przekierowywana na stałą otworę z przodu szyi (pore), i połączenie między płucami a ustami jest przerwane. Oddychanie i wytwarzanie głosu nie dzielą już tej samej ścieżki.

Bez strun głosowych, głos jakim był nie istnieje. To, co go zastępuje, zależy od anatomii, stadiowania raka, wyborów rekonstrukcji i osobistych preferencji - ale podróż zaczyna się od rehabilitacji i często trwa latami.

Ciężar emocjonalny jest znaczący. Badania jakości życia po laryngektomii konsekwentnie dokumentują smutek, wycofanie społeczne i zakłócenia tożsamości obok praktycznych wyzwań komunikacyjnych. Technologia nie jest odpowiedzią na te wymiary straty, ale może zmniejszyć niektóre codzienne tarcia.


Trzy ustalone metody mowy alaryngealnej

Przed omówieniem narzędzi sztucznej inteligencji, zrozumienie tego, z czym większość pacjentów pracuje w rehabilitacji, daje ważny kontekst.

MetodaJak to działaZaletyWady
Larynges elektrycznyPrzenośne urządzenie wibruje szyję/policzek; usta kształtują dźwiękŁatwo się uczyć, niezawodnyRobotyczne brzmienie, wymaga wolnej ręki, bliskość do szyi
Mowa przełykowaPowietrze jest zatrzymywane i uwalnianie przez przełyk w celu wytworzenia wibracjiNie wymaga urządzenia, bez rąkDługa krzywa uczenia, niska głośność, zmęczające
TEP (Proteza głosu трахеоезофагеальная)Chirurgicznie umieszczony zawór; powietrze z płuc tworzy głos przez protezęNajlepsza jakość głosu i naturalność, na ogół bez rąkWymaga operacji, konserwacja protezy, wizyty montażowe

Żadna z tych metod nie jest nieodłącznie wyższa. Prawidłowy wybór zależy od czynników, które będą oceniać Twój zespół chirurgiczny i logopeda: historia radiacyjna, anatomia, wiek, zawód, osobiste cele. Wiele osób używa więcej niż jednej metody w różnych sytuacjach.

Larynges elektryczny jest często pierwszą metodą wprowadzoną po operacji z powodu tego, jak szybko może przywrócić podstawową komunikację. Jego charakterystyczne robotyczne brzmienie jest również punktem wyjścia, gdzie przetwarzanie głosu przez sztuczną inteligencję staje się istotne.


Archiwizacja głosu: argument za nagrywaniem przed operacją

Jeśli istnieje jedna wiadomość w tym poradniku godna podzielenia się przed zaplanowaną laryngektomią, to ta: nagraj swój głos teraz, przed operacją, jeśli to w ogóle możliwe.

Archiwizacja głosu to proces nagrywania dużego zestawu próbek mowy - zdań, słów, rozmownych fraz - aby modele sztucznej inteligencji mogły nauczyć się charakterystyki Twojego głosu. Im większe i bardziej zróżnicowane nagrania, tym lepiej wynikowy model sztucznej inteligencji może uchwyć naturalny barwę Twojego głosu, tempo i intonację.

Projekty takie jak Projekt Revoice wykazały z pacjentami z ALS - w tym współzałożycielem Pat Quinn - że archiwizacja głosu przed jego utratą tworzy osobisty zasób głosu, który pozostaje użyteczny później. Zasada ta dotyczy bezpośrednio laryngektomii: głos zaarchiwizowany przed operacją może być używany jako głos docelowy w oprogramowaniu do klonowania głosu, dając przetworzonym wynikom jakość osobistą zamiast generycznej.

Co jest potrzebne do archiwizacji głosu:

  • Cicha sala i przyzwoity mikrofon (zestawu słuchawkowego USB wystarczy)
  • Minimalnie 15 minut zróżnicowanej mowy - zdania, pytania, liczenie, czytanie głośno
  • Lepiej jest więcej: 1-2 godziny nagrań znacznie poprawia jakość modelu sztucznej inteligencji
  • Różnorodność: różne tony emocjonalne, szybkości i rodzaje treści pomagają

Jeśli operacja to kilka tygodni, to jest to osiągalne. Jeśli harmonogram jest bardzo krótki, nawet kilka godzin nagranego materiału warte jest posiadania. Skontaktuj się z zespołem SLP - wiele szpitali ma teraz protokoły archiwizacji głosu, a niektóre mają partnerstwa z usługami archiwizacji głosu.


Co właściwie robią zmieniające głos narzędzia sztucznej inteligencji dla pacjentów po laryngektomii

Po operacji, oprogramowanie zmieniające głos przez sztuczną inteligencję rozwiązuje specyficzną lukę: larynges elektryczny produkuje dźwięk, który jest wyraźnie sztuczny - jego monotonalny szum jest markerem, który wielu użytkowników uważa za społecznie ograniczający. Konwersja głosu przez sztuczną inteligencję bierze to wejście i przetwarza je w czasie rzeczywistym, stosując nauczony model głosu, aby uczynić wyjście brzmiące cieplej, bardziej zmiennym w wysokości i bardziej ludzkim w charakterze.

Oto jak to wygląda w praktyce:

  1. Użytkownik mówi laryngesem elektrycznym (lub poprzez mowę produkowaną przez TEP) do mikrofonu blisko ust lub gardła.
  2. Oprogramowanie zmieniające głos przez sztuczną inteligencję uchwytuje ten audio, przetwarza go przez model konwersji głosu w czasie rzeczywistym.
  3. Przetworzone wyjście - mniej robotyczne, bliższe docelowego profilu głosu - trafia do wirtualnego mikrofonu.
  4. Dowolna aplikacja komunikacyjna, narzędzie do konferencji wideo, lub oprogramowanie komunikacyjne odbiera wyjście wirtualnego mikrofonu.

To nie jest synteza z tekstu. To konwersja akustyczna w czasie rzeczywistym rzeczywistego sygnału mowy. Artykulacja, rytm i same słowa pochodzą od użytkownika; oprogramowanie zmienia jakość tonalną i barwę.

Szczera ocena: poprawa jest rzeczywista i często znaczna, ale nie jest przywróceniem. Użytkownicy konsekwentnie mówią, że przetworzona mowa laryngesu elektrycznego jest łatwiejsza do zrozumienia przez słuchaczy i mniej emocjonalnie zaznaczona robotyczną jakością. Nie mówią, że brzmią identycznie z głosem sprzed operacji. Oczekiwania tutaj są niezwykle ważne.


Klonowanie głosu przez sztuczną inteligencję: używanie próbek sprzed operacji

Jeśli archiwizacja głosu została przeprowadzona przed operacją, klonowanie głosu przez sztuczną inteligencję przenosi koncepcję dalej. Zamiast stosowania generycznego modelu konwersji głosu, oprogramowanie jest trenowane na - lub dostosowywane do - własnych nagrań użytkownika sprzed operacji. Wynik jest spersonalizowanym modelem głosu zamiast generalizowanego.

VoxBooster obsługuje ten przepływ pracy: prześlij 15 lub więcej minut nagrań audio sprzed operacji, wytrenuj osobisty model głosu i używaj go do konwersji w czasie rzeczywistym. Wyjście odzwierciedla cechy akustyczne Twojego konkretnego głosu - jego naturalną ciepłość, rezonans i charakter - zamiast neutralnej linii bazowej. Dla osób, które archiwizowały nagrania przed operacją, to najbliżej, do czego może dojść istniejąca technologia do kontynuacji osobistego głosu.

To nie jest dostępne dla wszystkich. Wielu pacjentów otrzymuje diagnozę z ograniczonym czasem ostrzeżenia. Okno archiwizacji głosu może nie być wystarczająco długie, lub mogło nie być oferowane. W tych przypadkach ogólnego przeznaczenia model głosu może wciąż poprawiać naturalność wyjścia laryngesu elektrycznego - zysk jest po prostu mniej spersonalizowany.


Praktyczne ustawienie: uruchomienie przetwarzania głosu przez sztuczną inteligencję

Dla użytkowników Windows 10/11, ustawienie konwersji głosu w czasie rzeczywistym przez sztuczną inteligencję z laryngesem elektrycznym lub TEP jest proste:

Sprzęt, który są potrzebny:

  • Mały mikrofon umieszczony blisko szyi/ust (mikrofon klipsa lub blisko zamontowany kondensator działa dobrze)
  • Standardowy interfejs audio lub wejście mikrofonu USB
  • Komputer z Windows 10 lub 11 - nie musi być wysokiej klasy; skromny procesor jest wystarczający do większości przetwarzania głosu przez sztuczną inteligencję

Ustawienie oprogramowania z VoxBooster:

  1. Zainstaluj VoxBooster - nie jest instalowany sterownik kernela, co utrzymuje obciążenie procesora niższe i unika problemów kompatybilności ze starszymi komputerami
  2. Ustaw fizyczny mikrofon jako wejście
  3. Wybierz swój model głosu (wstępnie wytrenowany na Twoich archiwizowanych próbkach, lub model ogólny)
  4. Ustaw wirtualny mikrofon VoxBooster jako wejście w aplikacji komunikacyjnej
  5. Mów - konwersja odbywa się z wystarczająco niskim opóźnieniem dla naturalnej rozmowy

Notatka na temat opóźnienia: Konwersja głosu w czasie rzeczywistym przez sztuczną inteligencję wprowadza małe opóźnienie, zwykle 100-300ms w zależności od sprzętu i złożoności modelu. To jest zauważalne ale zarządzalne dla większości rozmów. W przypadku komunikacji osób-do-osoby, gdzie fizyczny głos jest również obecny, opóźnienie jest bardziej zauważalne; przepływ pracy jest zoptymalizowany dla rozmów telefonicznych, rozmów wideo i komunikacji online.

VoxBooster zawiera również transkrypcję opartą na Whisper jako opcję zastępczą - przydatną w sytuacjach, gdzie jasność głosu jest niepewna, pozwalając na komunikację tekstową obok lub zamiast konwersji głosu.


Porównanie: metody mowy alaryngealnej i ulepszenie przez sztuczną inteligencję

MetodaJakość głosuWysiłek naukiBez rąkMożliwe ulepszenie przez sztuczną inteligencję
Larynges elektrycznyRobotyczne ale zrozumiałeNiskie - szybko się uczyćNie (używa się jedna ręka)Tak - znacząca poprawa
Mowa przełykowaBardziej naturalna ale niska głośnośćWysoka - miesiące praktykiTakMożliwe ale rzadsze
TEPNajlepsza ogólna jakośćUmiarkowana - zarządzanie zaworamiW większości takTak - subtelne ulepszenie
Klonowanie głosu (zaarchiwizowany głos)Spersonalizowany, cieplejszyTylko ustawienieTak (poprzez wirtualny mikrofon)Nie dotyczy - jest warstwie ulepszenia

Przetwarzanie głosu przez sztuczną inteligencję jest najwpływowsze jako ulepszenie na szczycie laryngesu elektrycznego, która jest najczęściej używaną metodą. Jest również kompatybilna z mową TEP dla użytkowników, którzy chcą dalszego ulepszenia w rozmowach.


Rola Twojego logopedy

Ta sekcja istnieje, ponieważ łatwo jest czytać o technologii i wyciągnąć wniosek, że droga do przodu to oprogramowanie. Nie jest - droga do przodu to rehabilitacja, a oprogramowanie to jedno narzędzie w ramach tego.

Logopeda to profesjonalista, który:

  • Ocenia, która metoda mowy alaryngealnej jest odpowiednia do Twojej anatomii i sytuacji
  • Uczy prawidłowej techniki (nieprawidłowe użycie laryngesu elektrycznego zmniejsza zrozumienie i może spowodować dyskomfort)
  • Dostosowuje plan rehabilitacji w miarę postępów
  • Koordynuje z zespołem chirurgicznym w zarządzaniu protezą jeśli używasz TEP
  • Może poradzić, czy oprogramowanie głosu sztucznej inteligencji jest odpowiednie i jak je zintegrować
  • Zajmuje się emocjonalnymi i społecznymi wymiarami zmiany komunikacji

Amerykańskie Stowarzyszenie Patologii Mowy-Języka i Słuchu (ASHA) utrzymuje katalog certyfikowanych logopedów i zasoby dla pacjentów. Jeśli jesteś poza USA, krajowe stowarzyszenia logopedów istnieją w większości krajów z linkami do lokalnych praktyków.

Zmieniające głos i klonujące narzędzia sztucznej inteligencji nie wymagają recepty i nie zastępują logopedy - to oprogramowanie, które każdy może spróbować. Ale decyzja o tym, czy i jak je stosować, korzysta z profesjonalnego kierownictwa.


Zasoby społeczności i wsparcia

Rehabilitacja po laryngektomii nie jest podróżą solo. Społeczności wsparcia dostarczają praktyczną wiedzę - które pozycje mikrofonów działają najlepiej z laryngesem elektrycznym, które aplikacje komunikacyjne działają niezawodnie z ustawieniami wirtualnych mikrofonów, jak inni ludzie zaadaptowali narzędzia głosu sztucznej inteligencji do ich przepływu pracy - że żaden poradnik nie może w pełni przewidzieć.

WebWhispers jest największą siecią wsparcia online dla pacjentów po laryngektomii w języku angielskim. Jej fora i listy e-mailowe działają od dziesięcioleci i zawierają godną uwagi głębię praktycznego doświadczenia.

Międzynarodowe Stowarzyszenie Pacjentów po Laryngektomii (IAL) łączy kluby Lost Cord i New Voice na całym świecie, z oddziałami w dziesiątkach krajów. Wiele oddziałów organizuje spotkania wsparcia osób do osoby.

ASHA i krajowe ekwiwalenty dostarczają katalogi logopedów i materiały edukacyjne skierowane do pacjentów.

Jeśli badasz narzędzia głosu sztucznej inteligencji w imieniu członka rodziny lub pacjenta, te społeczności są pierwszym miejscem, w którym można zapytać o to, co rzeczywiście działa dla ludzi w praktyce.


Uczciwe ograniczenia

Ten poradnik nie byłby kompletny bez wyraźnego stwierdzenia, czego technologia głosu sztucznej inteligencji nie może robić:

  • Nie może całkowicie przywrócić głosu sprzed operacji. Klonowanie głosu z archiwizowanych próbek produkuje spersonalizowane przybliżenie; to nie oryginalny głos.
  • Nie działa dobrze w hałaśliwych środowiskach. Hałas w tle znacznie pogarsza jakość konwersji.
  • Opóźnienie jest rzeczywiste. Przetwarzanie w czasie rzeczywistym wprowadza opóźnienie, które niektórzy użytkownicy uważają za dezorientujące.
  • Wymaga działającego komputera z Windows i rozsądnego poziomu komfortu technicznego dla wstępnego ustawienia.
  • Emocjonalne i społeczne dostosowanie do utraty głosu nie jest rozwiązane przez oprogramowanie. Ta praca jest pracą ludzi - terapia, grupy wsparcia, czas.

Celem narzędzi głosu sztucznej inteligencji dla laryngektomii jest zmniejszenie codziennego tarcia w komunikacji, szczególnie w kontekstach telefonicznych i online, gdzie fizyczny kontekst rozmowy osób-do-osoby jest nieobecny. To jest rzeczywisty i znaczący cel. To również skromny cel.


Zaczynając

Jeśli Ty lub ktoś, o którego się troszczyłeś, przygotowujesz się do lub wracasz z laryngektomii:

  1. Przed operacją, jeśli to możliwe: Nagraj co najmniej 15-60 minut naturalnej, zróżnicowanej mowy do archiwizacji głosu. Skontaktuj się z zespołem logopedy na temat protokołów archiwizacji głosu - wiele szpitali teraz je ma.
  2. Po operacji: Pracuj z logopedą, aby ustanowić pierwotną metodę mowy alaryngealnej odpowiednią do Twojej sytuacji.
  3. Gdy ustabilizujesz się w rehabilitacji: Zbadaj oprogramowanie głosu sztucznej inteligencji jako uzupełnienie - szczególnie dla kontekstów połączeń telefonicznych i wideo, gdzie robotyczna jakość laryngesu elektrycznego jest najbardziej ograniczająca.
  4. Połącz się ze społeczością: WebWhispers i Twój lokalny oddział IAL mają użytkowników, którzy przeszli ten proces i mogą podzielić się praktycznym doświadczeniem.

VoxBooster oferuje 3-dniową bezpłatną wersję próbną (nie wymaga karty kredytowej) dla każdego, kto chce przetestować konwersję głosu w czasie rzeczywistym przez sztuczną inteligencję przed zobowiązaniem. W cenie 6,99 USD/miesiąc, koszt jest wystarczająco niski, aby serio zbadać. Działa na Windows 10 i 11, nie wymaga instalacji sterownika kernela i obsługuje trening osobistego modelu głosu z Twoich własnych nagrań.

Utrata głosu jest głęboka. Dostępne narzędzia do pomocy są niedoskonałe. Ale kombinacja dobrej rehabilitacji, profesjonalnego wsparcia i starannie wybranej technologii pomogła wielu ludziom odbudować życie komunikacyjne, które działa - inne niż poprzednio, ale znaczące.


Ten artykuł jest informacyjny i nie stanowi porady medycznej. Zawsze konsultuj się z wykwalifikowanymi profesjonalistami medycznymi i logopedycznymi w celu podejmowania decyzji dotyczących rehabilitacji po laryngektomii.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo