Zmiennik Głosu Serbski: Opanuj Akcent Belgradu
Zmiennik głosu serbskiego zbudowany wokół serbskiego standardu — belgradzkim standardem literackim — to praktyczne narzędzie dla aktorów głosowych zajmujących się pracą dubbingową w serbskim, twórców treści skierowanych do audytoriumów mówiących po serbsku i entuzjastów języka, którzy chcą uzyskać sprzężenie zwrotne akustyczne dotyczące ich wymowy. Niniejszy przewodnik obejmuje fonetykę serbskiego standardu, sposób konfiguracji ustawień DSP, przepływy pracy klonowania głosu AI, ćwiczenia treningowe i głosy referencyjne dla akcentu belgradzkim.
Język serbski to język słowiański południowy, którym posługuje się około 12-14 milionów ludzi, głównie w Serbii, Bośni i Hercegowinie, Czarnogórze oraz w serbskiej diasporze na całym świecie. Jego standard literacki oparty na nowosztokowskim dialekcie, a oficjalnie pisany zarówno w cyrylicy (Ћирилица) jak i w alfabecie łacińskim. Rejestr urbanistyczny Belgradu — akcent słyszany w serbskiej telewizji narodowej, teatrze i filmie — jest fonetycznym punktem odniesienia dla aktorstwa i profesjonalnej pracy głosowej.
TL;DR
- Serbski standard używa czterotonomowego nowosztokawskiego systemu akcentu tonalnego (krótko rosnące, długo rosnące, krótko opadające, długo opadające) — unikatowe wśród głównych języków europejskich.
- Standard belgradzki używa refleksów ekawiańskich z yat — е gdzie chorwacki/bosniaki używają ije/je.
- Ustawienia DSP: umiarkowany wzrost obecności (2-4 kHz), minimalny przesun formant, ostrożna kontur tonalny do zachowania tonalnego charakteru.
- Klonowanie głosu AI przechwytuje system akcentu tonalnego z nagrań referencyjnych — sam DSP nie może odtworzyć tonalnych rozróżnień.
- Słynne referencje: spikierzy Radia Belgrad, aktorzy Narodowego Teatru Serbii, serbscy aktorzy filmowi.
- VoxBooster działa w systemie Windows 10/11 poprzez przechwytywanie dźwięku o niskim opóźnieniu, bez sterownika jądra, opóźnienie klonowania AI poniżej 300ms.
Dlaczego Standard Belgradzki?
Język serbski ma kilka dialektów regionalnych — ekawiański w Serbii, ijekawski w Bośni/Czarnogórze/Diasporze, torlakijski na południu i wschodzie. Do aktorstwa głosowego i klonowania AI standardem referencyjnym jest belgradzki, ponieważ jest używany w audycjach krajowych, filmie, teatrze i profesjonalnej pracy dubbingowej. Jest to to, co serbska publiczność uważa za neutralną, prestiżową odmianę — równoważną z General American dla angielskiego lub moskiewskim standardem dla rosyjskiego.
Serbski standard jest unikatowy, ponieważ oficjalnie używa zarówno alfabetu cyrylicy jak i łacińskiego, co jest rzadką dwuliteracyjnością dla języka normatywnego. Wymowa fonetyczna jest taka sama, niezależnie od użytego alfabetu. Do pracy głosowej liczą się tylko właściwości akustyczne.
System Akcentu Tonalnego Nowosztokawskiego
Charakteryzującą cechę fonetyczną języka serbskiego — i najtrudniejszą do odtworzenia bez dedykowanego szkolenia — jest nowosztokawski system akcentu tonalnego, dzielący swoją podstawową strukturę z chorwackim i bośniackim (wszystkie pochodzą ze wspólnej bazy dialektu sztokawskiego). To nie jest prosty system nacisku. Język serbski używa czterech tonów:
| Nazwa Tonu | Symbol | Przykład | Opis |
|---|---|---|---|
| Rosnące krótkie | ` (krótkie) | сèло (wieś) | Krótka samogłoska, ton rośnie na sylabie |
| Rosnące długie | ´ (długie) | сéло (siodło) | Długa samogłoska, ton rośnie na sylabie |
| Opadające krótkie | “ (krótkie) | грàд (miasto) | Krótka samogłoska, ton pada na/po sylabie |
| Opadające długie | `´ (długie) | грâд (grad) | Długa samogłoska, ton pada na/po sylabie |
W standardzie belgradzkim tony opadające mogą pojawić się tylko na pierwszej sylabie słowa (nowsze innowacje sztokawskie), podczas gdy teny rosnące mogą pojawić się na dowolnej sylabie niefinałnej. To nadaje serbskiej mowie jej charakterystyczny przepływ melodyczny — głos rośnie na sylabach medialnych i często pada na początkowych sylabach słowa z naciskiem.
System ten dzieli swoją strukturę gramatyczną z chorwackim i bośniackim, ale ekawiański refleks samogłoski serbskiej i niektóre różnice leksykalne i morfologiczne czynią standard belgradzki fonetycznie odrębnym. Więcej kontekstu znajdziesz w artykule Dialekt Sztokawski na Wikipedii.
Kluczowe Cechy Fonetyczne Standardu Belgradzkim
Refleks Samogłoski Ekawiańskiej
Gdzie chorwacki i bośniaki używają ije lub je (Ijekawska), serbski standard używa e (Ekawska). Stara słowiańska samogłoska proto yat (Ě) stała się e w standardzie belgradzkim:
- Serbski: дете (dziecko) vs. Chorwacki/Bosniaki: dijete
- Serbski: млеко (mleko) vs. Chorwacki/Bosniaki: mlijeko
- Serbski: река (rzeka) vs. Chorwacki/Bosniaki: rijeka
Dla zmienników głosu oznacza to, że nagrania docelowe muszą pochodzić od mówiących ekawiańskich. Korzystanie z nagrań ijekawskich spowoduje powstanie innego akcentu, który będzie brzmieć dla słuchaczy serbskich jak chorwacki lub bosniaki.
Symetryczny System Pięciu Samogłosek
Język serbski ma czysty, symetryczny pięciogłoskowy inwentarz: /a/, /e/, /i/, /o/, /u/. Wszystkie pięć samogłosek są pełne i wyraźne zarówno w pozycjach akcentowanych, jak i nieakcentowanych. W przeciwieństwie do rosyjskiego nie ma redukcji samogłoska (brak akany). W przeciwieństwie do francuszczyzny lub portugalskiego nie ma nosowych samogłosek. Czysty system samogłosek oznacza, że regulowanie formantów DSP jest prostsze niż w przypadku języków o bardziej złożonych inwerntarzach samogłoskowych — celowaniem na jasność i równowagę, nie na redukcję lub nosowość.
Serbski /r/ jako Spółgłoska Sylabiczna
Język serbski (wraz z chorwackim i czeskim) pozwala /r/ funkcjonować jako jądro sylaby — spółgłoska sylabiczna. Słowa takie jak врт (ogród), трг (plac), прст (palec) w ogóle nie mają samogłoski — /r/ nosi sylabę. To jest typologicznie niezwykłe i akustycznie charakterystyczne. W mowie, sylabiczny /r/ produkuje kombinację tonalną-drżącą, która brzmi bardzo różnie od /r/ sąsiadującego z samogłoską.
Dla zmienników głosu, sylabiczny /r/ jest głównie kwestią artykulacji — DSP nie może tego wytworzić. Ale wzmocnienie pasma obecności 2,5-4 kHz wzmacnia energię drżenia, która definiuje serbskie /r/ we wszystkich pozycjach.
Asymilacja Dźwięku Spółgłosek
Język serbski ma silną progresywną asymilację dźwięku w zbitkach spółgłosek: dźwięczność całego zbytku jest określona przez ostatnią spółgloskę. пут (ścieżka) + ка → путка → /t/ asymiluje się z dźwięczności /k/. To nadaje serbskiej mowie jej charakterystyczne zachowanie zbytków spółgłosek i przyczynia się do profilu rytmicznego, który słuchacze rozpoznają jako charakterystycznie serbski.
Głosy Referencyjne Dla Standardu Belgradzkim
Posiadanie rzeczywistych nagrań referencyjnych do nauki i trenowania jest niezbędne przed skonfigurowaniem jakiegokolwiek oprogramowania.
Spikierzy Radia Belgrad (RTS). Radiotelewizja Serbii (RTS) nadaje w serbskim standardzie z akcentem belgradzkim. Spikierzy wiadomości i gospodarze programów kulturalnych reprezentują najwyraźniejsze przykłady formalnego standardu belgradzkim — w pełni artykulowane, konsystentne urzeczywistnienie akcentu tonalnego i przepisowy ekawiański. Są one swobodnie dostępne online.
Aktorzy Narodowego Teatru Serbii. Narodno pozorište (Teatr Narodowy w Belgradzie, założony 1869) historycznie był instytucjonalnym punktem zakotwiczenia dla serbskiego scenicznego — najformalniejszej wersji akcentu belgradzkim. Nagrania produkcji dostępne są w serbskich archiwach filmowych i niektórych platformach online.
Emir Kusturica. Wywiady reżysera filmowego serbsko-bośniaciego prowadzone w serbskim wykazują standard belgradzki w nieformalnym, rozluźnionym rejestrze — przydatne do kalibracji naturalnego serbskiego konwersacyjnego, a nie formalnego rejestru rozgłośniowego. Jego mowa pokazuje system akcentu tonalnego w szybkim, naturalnym wygłoszeniu.
Serbscy aktorzy dubbingu filmów i telewizji. Serbia ma profesjonalną branżę dubbingu — serbskie wersje dubbingowe głównych produkcji filmowych i animacyjnych zawierają aktorów głosowych pracujących zgodnie ze standardem belgradzkim z pełnym zakresem fonologicznym. Są one przydatne, ponieważ obejmują ekstremalne emocje i naturalne tempa mowy.
Slobodan Ninković i Vojin Ćetković. Obaj są wysoce uznanymi serbskimi aktorami filmowymi i teatralnymi z wyraźnym wygłoszeniem standardu belgradzkim i dużym zasobem dostępnych prac zarejestrowanych na serbskich platformach streamingowych i YouTube.
Konfiguracja DSP dla Akcentu Belgradu
Oto punkty startowe dla neutralnego głosu mężczyzny. System akcentu tonalnego wymaga świadomości prozodycznej, której sam DSP nie może w pełni odtworzyć — ale te ustawienia wspierają profil spektralny.
| Parametr | Wartość Początkowa | Uzasadnienie |
|---|---|---|
| Przesun tonalny | 0 do -1 półtonu | Serbskie głosy transmisji mężczyzny są nieco niższe niż referencja angielska; dostosuj do celu |
| Przesun formant | ±0 do +5 Hz na F1/F2 | Serbskie samogłoski są czyste i centralne — unikaj agresywnego przesunięcia formant |
| EQ: 100-200 Hz | -1 do -2 dB | Zmniejsz resonancję klatki piersiowej, która nienaturalnie wzmacnia głos |
| EQ: 2-4 kHz | +2-3 dB | Zwiększ obecność alweolarną dla drżącego /r/ i przejrzystości spółgłosek zębowych |
| EQ: 5-8 kHz | +1 dB | Powietrze i syczenie — wspiera przejrzystość w szybkich zbijach spółgłosek |
| Saturacja Harmoniczna | Wyłączone lub bardzo niska (3-5%) | Serbskie głosy transmisji są zwykle czyste; unikaj dodawania sztucznego ciepła |
| Pogłos | Minimalny (rozmiar pokoju 6-10%) | Suche bliskie mikrofono typowe dla serbskiego stylu transmisji |
Ważne: Nie używaj modulacji tonalnej ani efektów wibraty — zniszczą one informacje tonalne w systemie akcentu tonalnego, powodując, że wyjście będzie brzmieć źle dla słuchaczy serbskich, nawet jeśli wszystko inne jest prawidłowe.
Przepływ Pracy Klonowania Głosu AI
Klonowanie głosu AI uczy się pełnego profilu spektralnego, prozodycznego i tonalnego głosu docelowego — w tym konturów akcentu tonalnego, których DSP nie może odtworzyć. Dla standardu belgradzkim:
Krok 1: Zbieranie Nagrań Źródła. Zgromadź 30-60 minut czystej mowy od spójnego mówiącego serbskiego standardu (Belgrad Ekawiański). Archiwa radiowe RTS, publicznie licencjonowane serbskie audiobooki lub nagrania wykonane za zgodą mówcy są odpowiednimi źródłami. Usuń szum tła i normalizuj do -16 LUFS.
Krok 2: Segmentacja i Kuracja. Podziel na klipy 4-12 sekundowe. Usuń klipy z wahaniem, muzyką w tle lub niespójną odległością mikrofonu. Dążyć do 1500-3000 czystych segmentów. Dla języka serbskiego w szczególności, dołącz segmenty zawierające słowa ze wszystkich czterech kategorii tonalnych — model musi być narażony na pełny inwentarz akcentu tonalnego, aby dokładnie go odtworzyć.
Krok 3: Trening Modelu. Załaduj sprawdzoną kolekcję danych do interfejsu treningowego AI. Dla serbskiego akcentu tonalnego, trening zazwyczaj wymaga 35000-50000 iteracji do ustabilizowania odtworzenia konturu tonalnego — nauka prozodyczna trwa dłużej niż dla języków opartych tylko na stresie.
Krok 4: Wnioskowanie w Czasie Rzeczywistym. Po treningu model działa na wejściu głosu w czasie rzeczywistym. VoxBooster osiąga opóźnienie poniżej 300ms w systemach Windows 10/11 poprzez przechwytywanie dźwięku o niskim opóźnieniu — zdatne do rozmów na żywo w Discord, transmisji gier lub sesji nagrań bez zauważalnego opóźnienia na maszynie wyposażonej w GPU.
Krok 5: Kalibracja Tonalna. Przetestuj wyjście względem nagrań referencyjnych używając słów, które kontrastują cztery tony. Test minimalnej pary: сèло (wieś, krótko rosnące) vs. сéло (siodło, długo rosnące) vs. сêло (wiejski, krótko opadające z długością). Jeśli te tonalne różnice są zachowane w wyjściu, model działa prawidłowo.
Ćwiczenia Treningowe Dla Akcentu Belgradu
Ćwiczenie Świadomości Akcentu Tonalnego
Pracuj z minimalnymi parami, które różnią się tylko tonem. Użyj nagrania mówcy natywnego i sam powiedz pary, porównując odtworzenie:
- сèло (wieś) vs. сêло (obszar wiejski) — krótko rosnące vs. krótko opadające
- кôжа (skóra) vs. кòжа (artykuł skórzany, dialekt) — długo opadające vs. krótko rosnące
Nagraj siebie, przesyłaj obok referencji i słuchaj, czy twój kontur tonalny na sylabie akcentowanej pasuje do rosnącego czy opadającego wzorca. Wymaga to aktywnego słuchania — większość mówiących po angielsku inicjowanie niż mówiących stosuje płaski nacisk zamiast tonalnych rozróżnień.
Ćwiczenie Sylabiczne /r/
Ćwicz słowa, gdzie /r/ jest jądrem sylaby: врт (ogród), крв (krew), прст (palec), трг (plac), срп (sierp — jak w nazwie Србија, Serbia).
Powiedz każde słowo bez poprzedniego schy — /r/ musi bezpośrednio nosić sylabę. Nagraj i sprawdzaj: jeśli słyszysz samogłoskę przed lub po /r/, wstawiasz epentetyczne schy, które nie należą do serbskiej fonetyki standardu.
Ćwiczenie Asymilacji Dźwięku
Ćwicz zbytki spółgłosek, gdzie asymilacja się stosuje. Powiedz frazę хлеб (chleb) następnie са (z) → хлеб са — ostateczna /b/ zachowuje dźwięczność, ponieważ jest końcem słowa. Teraz powiedz хлеб następnie кафом (z kawą) → zbytek пк utworzy asymilację bezdźwięczną. Powiedz to powoli, sprawdzając, czy asymilacja jest kompletna, nie częściowa.
Ćwiczenie Samogłoski Ekawiańskiej
Ćwicz słownictwo charakterystyczne dla Ekawskości, które byłoby Ijekawskie w chorwackim:
дете, млеко, река, место, лепо, свет, цвет — wszystko z wyraźnym /e/ (nie /ije/ czy /je/).
Nagraj siebie i porównaj względem nagrania wiadomości RTS. /e/ powinno być pełnym, średnim niezaokrąglonym samogłosk przednim — nie dyftong, nie zredukowany dźwięk.
Konfiguracja Discord i Transmisji
VoxBooster tworzy wirtualne urządzenie mikrofonowe poprzez przechwytywanie dźwięku o niskim opóźnieniu, które pojawia się jako standardowe urządzenie wejścia audio systemu Windows. Wybierz to urządzenie jako wejście w Discord (Ustawienia → Głos i wideo → Urządzenie Wejściowe), OBS lub dowolnym innym aplikacji. Oddzielne oprogramowanie wirtualnego kabla audio nie jest potrzebne.
Do transmisji, standardowy przepływ pracy to: VoxBooster wirtualny mic → źródło audio OBS → wyjście transmisji. Dodaj drugi ścieżkę audio w OBS z surowym sygnałem mikrofonu, jeśli musisz monitorować swój oryginalny głos obok przekonwertowanego wyjścia.
Dla rozmów głosowych Discord z przyjaciółmi serbskimi lub społeczności, wirtualne urządzenie przechwytywania dźwięku o niskim opóźnieniu marszruty przezrocze — druga strona słyszy przetworzony głos bez widocznego wskazania przetwarzania ze swojej strony.
Porównanie: DSP vs. Klonowanie Głosu AI dla Akcentu Belgradu
| Funkcja | Tylko DSP | Klonowanie Głosu AI |
|---|---|---|
| Opóźnienie | < 30 ms | 200-280 ms (GPU) / 500-800 ms (CPU) |
| Teny Akcentu Tonalnego | Nie można Odtworzyć | Nauczony z Nagrań Referencyjnych |
| Przejrzystość Samogłosek | Pomoc Przesunięcia Formant | Precyzyjna Reprodukcja Dla każdego Fonemu |
| Sylabiczny /r/ | Nie Można Wytworzony | Przechwytywany Jeśli Obecny w Danych Treningowych |
| Tożsamość Mówiącego | Twój Głos, Przetworzony | Charakterystyki Głosu Celu Specyficznych |
| Wymaganie Sprzętu | Tylko CPU | GPU Zalecany |
| Czas Treningowy | Natychmiastowy | 2-6 Godzin (Trening Modelu) |
| Najlepsze Użycie | Rozmowa na Żywo, Gry | Dubbing, Profesjonalne Aktorstwo Głosu |
Praktyczne Uwagi Dla Aktorów Głosowych
Jeśli używasz serbskiego modelu głosu do pracy dubbingowej lub treści:
- Spójność tonalna We Wszystkich Ujęciach. System akcentu tonalnego oznacza, że identyczne słowa muszą mieć identyczne kontury tonalne we wszystkich ujęciach — niespójność jest natychmiast słyszalna. Przejrzyj wyjście ujęcie po ujęciu, używając narzędzia śledzenia tonalnego, przed montażem ostatecznego audio.
- Czystość Ekawiańska. Jeśli dane treningowe zawierały jakiekolwiek formy Ijekawskie, model może czasami wytwarzać ije/je refleksy w określonych słowach. Oznacz je podczas kalibracji i filtruj dane treningowe do mówiących tylko Ekawiańskich.
- Cyrylica w Notatkach Sesji. Podczas rejestrowania notatek kalibracji tonalnej, używanie cyrylicy (Ћирилица) unika niejednoznaczności między serbskim i chorwackim konwencjami ortografii łacińskiej — dwa alfabety łacińskie dzielą litery, ale przypisują różne wartości fonetyczne w niektórych kontekstach.
Dla nauczających się języka, serbska fonetyka ma logikę godną nauki. System akcentu tonalnego wydaje się skomplikowany, ale podąża przewidywalnymi regułami morfologicznych — kiedy zrozumiesz, że teny opadające pojawiają się tylko na początkowych sylabach, a rosnące tony zaznaczają niepoiętne sylaby naciśnięte, system staje się nawigacyjny. Zajrzyj do artykułu Dialekt Sztokawski, aby uzyskać tło historyczne dotyczące ewolucji nowosztokawskiego systemu.
Wnioski
Serbski Standard — belgradzki standard literacki — ma jeden z najbardziej charakterystycznych profili fonetycznych wśród języków europejskich: czterotonomowy nowosztokawski system akcentu tonalnego, czysty, pięciogłoskowy inwentarz Ekawiański, sylabiczny /r/ i silną asymilację dźwięku zbytków spółgłosek. Te cechy są nauczalne i odtwarzalne z właściwą kombinacją treningu ucha, ćwiczeń artykulacji i konfiguracji DSP lub klonowania głosu AI.
Serbski ma bogatą spuściznę kulturalną — od patronacji średniowiecznej dynastii Nemanjić na rzecz literatury prawosławnej do współczesnej sceny filmowej, teatralnej i muzycznej Belgradu. Niezależnie od tego, czy jesteś aktorem głosu zajmującym się serbskim pracą dubbingową, twórcą treści skierowanym do serbskiej audytoriumów czy nauczającym się języka, używającym sprzężenia zwrotnego akustycznego do doskonalenia wymowy, fonetyczne narzędzie jest wyraźne i materiał referencyjny jest dostępny.
Spróbuj VoxBooster za darmo — zbudowany na przechwytywaniu dźwięku o niskim opóźnieniu, bez sterownika jądra, klonowanie głosu AI poniżej 300ms w systemach Windows 10/11. Pobierz i zacznij trzydniową bezpłatną wersję próbną.
Często Zadawane Pytania
Co odróżnia akcent belgradzki (serbski) od innych odmian południowosłowiańskich? Belgradzki serbski używa nowosztokowskiego systemu akcentu tonalnego z czterema tonami (dwa rosnące, dwa opadające) plus rozróżnieniem tonalnym przez długość sylaby — cecha nieobecna w większości języków europejskich. Inwentarz samogłosek jest czysty i symetryczny, a refleks ekawiański starosłowiańskiej samogłoski yat odróżnia go fonetycznie od odmian chorwackich i bośniackich ijekawskich.
Czy zmiennik głosu serbskiego wymaga sterownika jądra w systemie Windows? Nie. Nowoczesne zmieniniki głosu korzystające z przechwytywania dźwięku o niskim opóźnieniu działają na poziomie interfejsu API dźwięku systemu Windows bez konieczności sterownika jądra. Projekty bez sterownika jądra są bardziej stabilne, mniej podatne na konflikty z oprogramowaniem antycheat i łatwiejsze do odinstalowania — istotne, jeśli używasz zmienników głosu obok gier z ochroną antycheat.
Czy klonowanie głosu AI może odtworzyć systemu akcentu tonalnego serbskiego? Klonowanie głosu AI uczy się wzorców prozodycznych z nagrań referencyjnych, w tym konturów tonalnych nowosztokawskiego systemu akcentu tonalnego. Dysponując 30-60 minutami czystej mowy od spójnego mówcy serbskiego standardu belgradzkim, model wystarczająco dobrze przechwytuje rosnące/opadające wzorce konturów dla zrozumiałego, zgodnego z akcentem wyjścia w czasie rzeczywistym.
Jaki jest typowy zakres tonalny dla serbskiego aktorstwa głosowego mężczyzn w standardzie belgradzkim? Serbscy aktorzy głosowi mężczyźni w standardzie belgradzkim zazwyczaj mówią w zakresie częstotliwości podstawowej 85-155 Hz. System akcentu tonalnego tworzy mikro-tonalne wahania w tym zakresie na poziomie słowa, nadając serbskiej mowie charakterystyczną jakość melodyczną odróżniającą się od języków opartych tylko na stresie, takich jak angielski.
Jakie słynne serbskie głosy są dobrymi odnośnikami do standardu belgradzkim? Przydatne głosy referencyjne obejmują aktorów teatrów belgradzkich z Narodowego Teatru Serbii, serbskich spikierów radiowych z Radia Belgrad (RTS) i aktorów głosowych pracujących w serbskim dubbingu międzynarodowych produkcji. Wywiady reżysera filmowego Emira Kusturicy w języku serbskim pokazują akcent w rejestrze nieformalnym.
Czy opóźnienie poniżej 300ms jest osiągalne dla serbskiego klonowania głosu AI w czasie rzeczywistym? Tak, na GPU średniej klasy (RTX 3060 lub nowszy) konwersja głosu AI działa z szybkością 200-280 ms — poniżej progu 300 ms, który większość użytkowników postrzega jako naturalne opóźnienie rozmowy. Konwersja wyłącznie CPU zwykle wynosi 500-800 ms, nadająca się do naciśnięcia-aby-mówić, ale zauważalna w swobodnej rozmowie.
Jak alfabety cyrylickie i łacińskie wpływają na dane treningowe zmieninika głosu? Wybór pisma nie wpływa na dane treningowe audio — model uczy się z nagrań akustycznych, a nie tekstu. Jednak w przypadku inicjowania tekstu na mowę lub generowania podpowiedzi, użycie serbskiego cyrylicy (Ћирилица) zapewnia poprawne mapowanie grafem-na-fonem dla serbskiej fonetyki, unikając niejednoznaczności, które pojawiają się, gdy pismo łacińskie pożycza litery wspólne z innymi językami.