Zmiana Głosu + Rabbit R1: Uczciwa Analiza

Rabbit R1 wyruszył z wielkimi obietnicami i rzeczywistymi niedociągnięciami. Ten post analizuje, co mogła by zmiana głosu i klonowanie głosu AI dodać do urządzeń opartych na LAM — i wnioski.

Rabbit R1 wyruszył w kwietnia 2024 roku z jedną z bardziej niezapomnianych propozycji produktów ostatnich lat: urządzenie kieszonkowe z obracającą się kamerą, pokrętłem przewijania i Large Action Model, który mógłby obsługiwać aplikacje w Twoim imieniu. Sprzęt był ładny. Oprogramowanie, po uruchomieniu, było szorstkowe. Recenzje wahały się od sceptycznych do potępiających. A rozłożenie, które pokazało, że była to zasadniczo aplikacja Android działająca na maszynie wirtualnej w chmurze, wpadło jak ołowiana kula.

Jednak pytania, które postawiła R1 - co dokładnie potrzebuje AI otoczenia od głosu? - nadal zasługują na ostrożną odpowiedź. Ten post nie broni wykonania R1. Używa R1 jako soczewki do zbadania, co technologia zmiany głosu i klonowanie głosu AI mogą rzeczywiście wnieść do urządzeń AI do noszenia, co R1 dostała źle w swojej warstwie audio i jak wyglądałaby lepsza wersja tej kategorii.

TL;DR

TematKrótka odpowiedź
R1 w takiej postaci, w jakiej dostarczonoPełne błędów, krytykowane, nie warte obecnej ceny
Warstwa audio R1Podstawowy mikrofon, brak osoby głosowej, brak transkrypcji lokalnej
Potencjał zmiany głosuWysoki - osoba, prywatność, odrzucanie hałasu otoczenia
Dopasowanie klonowania AIŚrednie - tworzenie osoby jest atrakcyjne, opóźnienie jest ograniczeniem
Wnioski dla urządzeń do noszeniaPrzetwarzanie lokalne, wspólny projekt sprzętu i oprogramowania, UX głosu jako pierwszy
Parowanie VoxBoosterŚcieżka towarzysząca Windows; nie natywna dla R1

Co Rabbit R1 Naprawdę Był

Dla czytelników nieznajomych: Rabbit R1 to małe, pomarańczowe, samodzielne urządzenie AI o wielkości talii kart. Ma ekran dotykowy o wielkości 2,88 cala, obracającą się kamerę 360 stopni zwaną Eye, pokrętło przewijania, głośnik i mikrofon. Łączy się za pośrednictwem Wi-Fi lub LTE i uruchamia Rabbit OS na zmodyfikowanym stosie Android.

Podstawową propozycją było LAM: model wytrenowany poprzez obserwowanie użytkowników interaktywnych z aplikacjami (Spotify, Uber, DoorDash) i naukę replikacji tych interakcji. Powiedz R1, aby zamówić twoją zwykłą kawę; LAM wykonuje kroki w interfejsie Uber Eats, niewidocznie.

W momencie uruchomienia urządzenie zostało dostarczone z kilkoma aplikacjami LAM, asystentem AI ogólnego przeznaczenia i funkcjami przechwytywania obrazu. Nie dostarczono go w pełni funkcjonalnych wersjach wielu obiecanych funkcji. Pierwsi użytkownicy zgłaszali podstawowe polecenia nie powiodły się, powolne rundy w chmurze i odkrycie, że to samo doświadczenie można było odtworzyć na telefonie za pomocą odpowiednich aplikacji. Rabbit następnie wydał aktualizacje, ale luka między marketingiem a rzeczywistością była znaczna.

Niezależni naukowcy zajmujący się bezpieczeństwem również stwierdzili, że R1 działała na maszynie wirtualnej Android w chmurze - co oznaczało, że “nowy paradygmat” sprzętu był frontendem dla telefonu w chmurze. Wpis Wikipedii o Rabbit R1 dokumentuje oś czasu, a recenzja The Verge’a była reprezentatywna dla krytycznego przyjęcia.

Warstwa Audio, Którą R1 Pominęła

Tutaj staje się to technicznie interesujące z perspektywy głosu. Architektura audio R1, w takiej postaci, w jakiej była dostarczona, była minimalna:

  • Jeden omnidirektywny mikrofon z podstawowym tłumieniem hałasu
  • Brak lokalnego przetwarzania mowy - wszystko transkrybowane w chmurze
  • Brak osoby głosowej lub możliwości modyfikacji głosu
  • Wyjście przez mały głośnik monaurralny
  • Brak ekspozycji API dla przetwarzania audio na krawędzi

To była znaczna porażka. Głos jest głównym interfejsem dla AI otoczenia. Jeśli użytkownicy będą rozmawiać z urządzeniem przez cały dzień - w kawiarniach, w transporcie, podczas spacerów - urządzenie musi obsługiwać głos niezwykle dobrze. R1 obsługiwał to na najlepiej ok.

Trzy możliwości były nieobecne, które znacznie zmieniłyby doświadczenie.

Trzy Brakujące Możliwości Głosu

1. Transkrypcja Lokalna

Transkrypcja w chmurze oznacza, że każde słowo, które mówisz, opuszcza urządzenie, trafia na serwer, wraca jako tekst. Podróż w obie strony dodaje 200-800ms w zależności od połączenia. Co bardziej krytyczne, oznacza to, że twoje rozmowy są rejestrowane na serwerze innej firmy.

Lokalne modele transkrypcji klasy Whisper (Whisper Tiny działa przy około 40MB) mogą działać na sprzęcie wbudowanym powyżej pewnego poziomu wydajności. MediaTek Helio P35 w R1 jest na granicy dla wnioskowania w czasie rzeczywistym, ale wykonalne dla transkrypcji krótkiej wypowiedzi dzięki optymalizacji. Urządzenie dostarczono bez tego.

Implikacje prywatności są znaczące. Dla urządzenia promowanego jako osobisty asystent AI, który noszę wszędzie, całkowite poleganie na transkrypcji w chmurze oznacza, że każda rozmowa, którą masz ze swoim urządzeniem, jest przechowywana w miejscu, które nie kontrolujesz.

2. Osoba Głosowa / Zmiana Głosu

R1 mówiła z powrotem płaskim, ogólnym głosem TTS. To ma znaczenie więcej, niż się wydaje (z namiarem kalamburem). Osoba głosowa jest częścią tożsamości produktu. Ten sam powód, dla którego asystenci telefoniczni mają wyraźne głosy, głośniki inteligentne mają strojoną gamę audio, a postacie gry mają obsadę aktorów - głos jest częścią postaci jednostki.

Warstwa modyfikacji głosu po stronie wyjścia pozwoliłaby R1 mówić spójną, wyróżniającą się osobę. Warstwa modyfikacji głosu po stronie wejścia pozwoliłaby użytkownikom rzutować niestandardowy głos do potoku rozumienia audio LAM - przydatne dla użytkowników z różnicami mowy, użytkowników chcących prywatności głosu lub przypadków użycia, w których ważna jest profesjonalna osoba głosowa.

Klonowanie głosu AI może tworzyć te osoby z krótkich klipów referencyjnych. R1 nie miała powierzchni API do tego.

3. Tłumienie Hałasu do Użytku w Otoczeniu

Jeden omnidirektywny mikrofon plus hałas otoczenia to wrogie środowisko dla rozpoznawania mowy. Kawiarnie, miejskie ulice, otwarte biura - wszystko generuje stały hałas w tle, który pogarsza dokładność transkrypcji. R1 dostarczono z podstawowym softwareowym tłumieniem hałasu, a nie przetwarzaniem macierzy kierunkowej.

Dobre tłumienie hałasu na urządzeniu do noszenia wymaga albo macierzy mikrofonów (dwa lub więcej mikrofonów do kształtowania wiązki) albo agresywnego filtrowania opartego na DSP. Najlepsze zmieniacze głosu dla PC rozwiązały ten problem za pomocą oprogramowania na stosie audio Windows - ale R1 działała na sprzęcie ograniczonym audio wbudowanym.

Jak Wygląda Rzeczywista Architektura Modyfikacji Głosu dla Urządzeń do Noszenia

Jeśli projektowałbyś stos audio dla urządzenia AI do noszenia, które naprawdę chciało prawidłowo obsługiwać głos, architektura wyglądałaby tak:

WarstwaCo robiDlaczego to ważne
Macierz mikrofonu sprzętuOdbór kierunkowy, kształtowanie wiązkiOdrzucanie hałasu u źródła
DSP na urządzeniuAnulowanie echa, tłumienie hałasu widmowegoCzas rzeczywisty, niskie opóźnienie, bez chmury
Lokalny model transkrypcjiMowa na tekst na urządzeniuPrywatność, opóźnienie, tryb offline
Silnik osoby głosowejSynthesize output w spójnym głosieTożsamość produktu, dostępność
Warstwa wejścia modyfikacji głosuStosuj transformacje głosowe przed transkrypcjąPrywatność, osoba, dostępność
Wnioskowanie w chmurze (opcjonalne)Złożone rozumowanie, długi kontekstFallback dla ciężkiego podnoszenia

R1 dostarczono tylko z transkrypcją w chmurze i podstawowym DSP. Reszta stosu była zaginiona.

LAM i Głos: Interesująca Interakcja

Koncept LAM jest faktycznie dobrze dostosowany do głosu - być może bardziej niż sugerował framing automatyzacji aplikacji. Oto dlaczego: LAM jest trenowany do obserwowania i odtwarzania interakcji z interfejsami. Jeśli rozszerzysz to do interakcji głosowych, LAM mógłby obserwować, jak użytkownik mówi (tempo, słownictwo, typowe polecenia) i budować model wzorców głosu tego użytkownika, który poprawia rozpoznawanie poleceń w czasie. Warstwa modyfikacji głosu podłączona do tego mogłaby pozwolić użytkownikom zdefiniować osobę - wersję ich głosu zoptymalizowaną do rozumienia maszyny - którą urządzenie nauczyłoby się jako jego kanoniczne wejście. Polecenia byłyby kierowane przez filtr osoby, poprawiając dokładność rozpoznawania i zapewniając spójny interfejs niezależnie od hałasu otoczenia lub rzeczywistego stanu głosu użytkownika (zmęczony, chory, emocjonalny).

To nie jest science fiction. Komponenty technologii istnieją. R1 nigdy ich nie złożyła.

Retrospektywa R1: Co Nauczyła się Kategoria

R1 nie była porażką w sensie bycia ślepym zaułkiem. Była porażką w sensie wysyłki wizji przed przygotowaniem wykonania. Wnioski kategorii są pouczające:

Wspólny projekt sprzętu i oprogramowania nie jest opcjonalny. Nie możesz budować sprzęt AI otoczenia i traktować oprogramowanie jako myśl dodatkową. Decyzje sprzętu R1 (jeden mikrofon, mała bateria, maszyna wirtualna Android) ograniczały oprogramowanie w sposoby, które były przewidywalne w fazie projektowania.

Zależność od chmury jest zobowiązaniem produktu. Każde urządzenie, którego główne funkcje wymagają połączenia internetowego, może zawieść, gdy to połączenie jest brak lub powolne. Urządzenia do noszenia są używane w środowiskach, w których łączność jest zawodna. Lokalny fallback nie jest opcjonalny.

UX Głosu jest Produktem. Dla urządzenia, którego interfejs jest prawie całkowicie głosowy, prawidłowe obsłużenie głosu oznacza prawidłowe obsługę produktu. Uruchomienie z płaskim ogólnym głosem TTS i transkrypcją tylko w chmurze wysyłało sygnał, że zespół nie ustalił priorytetu dla rzeczy, z której produkt został faktycznie zrobiony.

Zaufanie to Prawdziwy Fosse. Użytkownicy noszą urządzenia wszędzie. Mówią rzeczy w pobliżu urządzeń do noszenia, których nie mówiliby do mikrofonu, którzy wiedzieliby, że nagrywa. Jeśli użytkownicy nie ufają obsłudze danych urządzenia, adopcja ogranicza się do nawiasu entuzjastów.

Jak VoxBooster Pasuje do Tego Obrazu

VoxBooster nie działa na R1 - R1 działa na własnym systemie operacyjnym bez obsługi wtyczek audio innych firm. Ale ścieżka towarzysząca Windows jest rzeczywista.

Dla użytkowników pracujących na komputerze PC z systemem Windows i używających urządzenia do noszenia lub asystenta AI obok: VoxBooster przetwarza dźwięk poprzez przechwytywanie dźwięku o niskim opóźnieniu przed tym, niż jakakolwiek aplikacja otrzyma sygnał mikrofonu. Możesz uruchamiać klonowanie głosu AI dla spójnej osoby na mikrofoniu Windows, stosować tłumienie hałasu i używać transkrypcji lokalnej opartej na Whisper - wszystkie możliwości, które R1 nie dostarczył, dostępne na pulpicie.

Jeśli urządzenie w stylu R1 kiedykolwiek wyśle tryb przypięty Windows lub SDK transmisji audio, architektura VoxBooster jest dokładnie takim rodzajem warstwy przetwarzania, która by czystą się podłączyła. Do tego czasu przepływ pracy Windows obsługuje poważne przypadki użycia osoby głosowej i transkrypcji, które urządzenia do noszenia jeszcze nie pękły.

Pobierz VoxBooster i badaj funkcje zmieniacza głosu AI, aby zobaczyć, jak wygląda pełny stos przetwarzania głosu. Plany zaczynają się od 6,99 USD/miesiąc z 3-dniową bezpłatną wersją próbną.

Jak Brzmiałaby Lepsza Rabbit R1

Spekulacja jest łatwa z perspektywy, ale komponenty do lepszego audio R1 istnieją teraz:

  • Macierz mikrofonu podwójnego z kształtowaniem wiązki sprzętu (dodaje około 3 USD BOM)
  • Quantized Whisper Tiny działający na urządzeniu (40MB, około 200ms opóźnienie na Helio P35)
  • Nazwana, dostrojona osoba głosowa TTS (jednorazowy koszt modelu głosu, minimalne rady wykonawcze)
  • Opcjonalna warstwa wejścia modyfikacji głosu (wyrównanie osoby dla rozumienia maszyny)
  • Jasna polityka danych: transkrypcja lokalna domyślnie, chmura opcjonalnie

Żaden z nich nie wymaga przełomowego sprzętu. MediaTek SoC R1 obsługuje operacje DSP. Ograniczenie było priorytyzacją, a nie fizyką.

Porównanie: Audio R1 vs Hipotetyczna Lepsza Wersja

FunkcjaR1 w takiej postaci, w jakiej dostarczonoLepsza wersjaLuka
MikrofonOmni jedenMacierz podwójna + kształtowanie wiązkiSprzęt
TranskrypcjaTylko chmuraWhisper lokalny + fallback chmurySoftware/model
Tłumienie hałasuOprogramowanie podstawoweSprzęt + DSPSprzęt/oprogramowanie
Osoba głosowa (wyjście)Ogólny TTSTuned named personOprogramowanie
Zmiana głosu (wejście)BrakWarstwa wyrównania osobyOprogramowanie
PrywatnośćRejestracja w chmurzeLokalna domyślnieArchitektura
Opóźnienie (polecenie głosowe)400-800ms150-300msArchitektura

Większy Obraz: AI Otoczenia Potrzebuje Rozwiązania Głosu w Pierwszej Kolejności

R1 nie był samotny w niedocenianiu głosu. Większość fali urządzeń AI do noszenia 2023-2024 - Humane AI Pin, Frame glasses, różne urządzenia koncepcyjne - traktowały głos jako rozwiązany, ponieważ duże modele językowe mogły transkrybować i odpowiadać. Mylili problem rozumienia języka z problemem UX głosu.

Rozumienie języka jest w dużej mierze rozwiązane. UX Głosu nie. Jakość mikrofonu, niezawodność transkrypcji lokalnej, spójność osoby wyników, prywatność danych audio - to są nieglamourowe problemy infrastruktury, które określają, czy urządzenie jest użyteczne przez cały dzień w prawdziwym świecie.

Dopóki kategoria AI otoczenia nie rozwiąże UX głosu na poziomie sprzętu, narzędzia do przetwarzania głosu oparte na Windows, takie jak VoxBooster, pozostają bardziej praktyczną ścieżką dla użytkowników, którzy potrzebują kompletnego, niezawodnego stosu osoby głosowej i transkrypcji.

FAQ

Czy możesz używać zmieniacza głosu z Rabbit R1? Nie natywnie. R1 działa na własnym systemie operacyjnym i stosie chmury LAM bez obsługi wtyczek audio innych firm. Komputer PC z systemem Windows sparowany przez Bluetooth lub aplikacja towarzysząca mogłaby teoretycznie wstępnie przetwarzać głos, ale nie ma oficjalnej ścieżki modyfikacji głosu dla R1 w takiej postaci, w jakiej została dostarczona.

Co to jest LAM i dlaczego jest ważny dla głosu? LAM oznacza Large Action Model - termin Rabbit’a na model wytrenowany do obsługi interfejsów jak człowiek, poprzez obserwowanie i odtwarzanie interakcji z interfejsami. Dla głosu LAM mógłby teoretycznie kierować polecenia mówione przez niestandardową osobę głosową, ale Rabbit nigdy nie dostarczył tej funkcji.

Czy Rabbit R1 był naprawdę tylko aplikacją Android w pudełku? W dużej mierze tak, zgodnie z niezależnymi rozkładami. Sprzęt R1 działał na zmodyfikowanym stosie Android. Większość jego funkcjonalności można było odtworzyć za pomocą aplikacji na telefon. Rabbit później potwierdził, że stos oprogramowania działał na maszynie wirtualnej Android w chmurze.

Jaki przepływ pracy głosu najlepiej pasowałby do urządzenia AI do noszenia? Transkrypcja lokalna (aby rozmowy pozostały na urządzeniu), trwała osoba głosowa zastosowana do dźwięku wychodzącego i tłumienie hałasu dla mikrofonu otoczenia. Razem komponenty te dają urządzeniu spójną, prywatną, niskoopoźnieniową warstwę głosu.

Czy VoxBooster działa z urządzeniami AI do noszenia? VoxBooster działa na Windows 10/11 i przetwarza dźwięk za pośrednictwem podsystemu audio Windows. Może służyć jako warstwa przetwarzania głosu dla pulpitu lub laptopa używanego razem z urządzeniem do noszenia, stosując klonowanie AI i tłumienie hałasu przed wysłaniem dźwięku do dowolnej usługi poniżej.

Jaki sprzęt byłby potrzebny dla rzeczywistej warstwy głosu AI do noszenia? Jako minimum: dedykowany DSP lub NPU do lokalnego przetwarzania mowy, macierz mikrofonu kierunkowego do odrzucania hałasu i wystarczającą ilość pamięci RAM do przechowywania małego modelu głosu (około 300-800 MB). R1 miała MediaTek Helio P35 - zdolna do podstawowego DSP, ale nie do syntezy głosu neuronowego z przydatnym opóźnieniem.

Jakie wnioski wyciągnęła kategoria urządzeń AI do noszenia z Rabbit R1? Trzy główne: wspólny projekt sprzętu i oprogramowania jest ważniejszy niż nowość kształtu; zależność od chmury jest zobowiązaniem zaufania i opóźnienia; i warstwa UX głosu (jakość głosu, dokładność transkrypcji, spójność osoby) musi być rozwiązana przed wysyłką, a nie po niej.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo