Rabbit R1, Nisan 2024’te son yılların en hatırası ürün tasarımlarından biriyle piyasaya sürüldü: Dönen kamerası, kaydırma tekerleği ve sizin adınıza uygulamaları çalıştırabilen bir Large Action Model bulunan bir cep cihazı. Donanım sevimli. Yazılım, piyasaya sürüldüğü sırada pürüzlüydü. İncelemeler şüpheci olanlardan mahkum edici olanlara kadar değişiyordu. Ve bunun esasen bulut VM’de çalışan bir Android uygulaması olduğunu ortaya çıkaran söküm, kurşun bir balon gibi düştü.
Yine de R1’in ortaya koyduğu sorular - Ortam yapay zekaları sesten gerçekten ne istiyor? - hala dikkatli bir cevap gerektiriyor. Bu yazı R1’in yürütülmesini savunmaz. R1’i, ses değiştirme teknolojisi ve AI ses klonlamasının AI giyilebilir cihazlara gerçekten katkı verebilecekleri, R1’in ses katmanında ne yanlış yaptığı ve bu kategorinin daha iyi bir versiyonunun neye benzeyeceğini incelemek için bir lens olarak kullanır.
TL;DR
| Konu | Kısa cevap |
|---|---|
| Sevk edildiği gibi R1 | Hatalarla dolu, eleştirildi, mevcut fiyatına değer yok |
| R1 ses katmanı | Temel mikrofon, ses persona yok, yerel transkripsiyon yok |
| Ses değiştiricisi potansiyeli | Yüksek - kişilik, gizlilik, ortam gürültü reddi |
| AI klonlama uyumu | Orta - kişilik oluşturma çekici ama gecikme bir kısıtlama |
| Giyilebilir dersler | Yerel işleme, donanım yazılımı ortak tasarımı, ses UX ilk |
| VoxBooster eşleştirme | Windows yardımcı yolu; R1’e yerel değil |
Rabbit R1 Gerçekten Neydi
Tanımadığı okuyucular için: Rabbit R1, kart paketi boyutundaki küçük, turuncu, bağımsız bir yapay zeka cihazıdır. 2.88 inçlik bir dokunmatik ekran, Eye adlı 360 derece dönen kamera, kaydırma tekerleği, hoparlör ve mikrofon vardır. Wi-Fi veya LTE aracılığıyla bağlanır ve değiştirilmiş bir Android yığınının üzerinde Rabbit OS çalıştırır.
Temel önerme LAM idi: İnsan kullanıcıları uygulamalarla etkileşim kurarken (Spotify, Uber, DoorDash) gözlemleyerek eğitilmiş bir model ve bu etkileşimleri çoğaltmayı öğrenmiş. R1’e her zamanki kahveni sipariş etmesini söyleyin; LAM Uber Eats UI’da adımları çalıştırır, görünmez şekilde.
Piyasaya sürülmede, cihaz birkaç LAM uygulaması, genel bir yapay zeka asistanı ve resim yakalama özellikleriyle geldi. Vaad edilen birçok özelliğin tam işlevli sürümleriyle gelmedi. İlk kullanıcılar temel komutların başarısız olduğunu, yavaş bulut turlarını ve aynı deneyimin doğru uygulamalarla bir telefonda çoğaltılabileceğinin keşfini bildirdiler. Rabbit daha sonra güncellemeler yayınladı, ancak pazarlama ve gerçeklik arasındaki boşluk önemliydi.
Bağımsız güvenlik araştırmacıları ayrıca R1’in bulut Android VM’de çalıştığını buldular - bu, “yeni paradigma” donanımının bulut telefonu için ön uç olduğu anlamına geliyor. Wikipedia’nın Rabbit R1 girişi zaman çizelgesini belgeliyor ve The Verge incelemesi eleştirel kabulün temsilcisiydi.
R1’in Atlladığı Ses Katmanı
Burası ses perspektifinden teknik olarak ilginç hale gelir. R1’in ses mimarisi, sevk edildiği gibi, minimaldir:
- Temel gürültü bastırmalı tek yönlü mikrofon
- Yerel konuşma işleme yok - her şey buluta aktarılıyor
- Ses persona veya ses değiştirme yeteneği yok
- Küçük bir mono hoparlörden çıktı
- Kenarda ses işleme için API pozlemesi yok
Bu önemli bir hataydı. Ses, ortam yapay zekası için birincil arayüzdür. Kullanıcılar bütün gün bir cihazla konuşacaksa - kahvehane, transit, yürüyüşte - cihazın sesi son derece iyi işlemesi gerekir. R1 en iyi ihtimalde uygun şekilde işledi.
Deneyimi önemli ölçüde değiştirmiş olacak üç yetenek yoktu.
Eksik Olan Üç Ses Özelliği
1. Yerel Transkripsiyon
Bulut transkripsiyon, söylediğiniz her kelimenin cihazdan ayrılması, sunucuya gelmesi, metin olarak geri dönmesi anlamına gelir. Turur gidiş dönüş bağlantıya bağlı olarak 200-800ms ekler. Daha kritik olarak, konuşmalarınızın kontrol etmediğiniz üçüncü taraf sunucusunda kaydedildiğini anlamına gelir.
Whisper sınıfı yerel transkripsiyon modelleri (Whisper Tiny kabaca 40MB’de çalışır) belirli bir performans eşiğinin üzerinde gömülü donanımda çalışabilir. R1’deki MediaTek Helio P35, gerçek zamanlı çıkarım için sınırda ancak optimizasyonla kısa söylev transkripsiyon için uygulanabilir. Cihaz bunu olmadan gönderildi.
Gizlilik etkisi önemlidir. Her yerde taşıdığınız kişisel bir AI asistanı olarak pazarlanan bir cihaz için, bulut transkripsiyon üzerine tamamen bağlı olmak, cihazınızla yaptığınız her konuşmanın kontrol etmediğiniz bir yerde depolandığı anlamına gelir.
2. Ses Persona / Ses Değiştirme
R1 düz, genel TTS sesiyle konuştu. Bu kulağa aldığından daha önemli (amaçlanan kelime oyunu). Ses persona, ürün kimliğinin bir parçasıdır. Telefon asistanlarının belirgin seslere, akıllı hoparlörlerin ayarlanmış ses profillerine ve oyun karakterlerinin oyuncuların yayınlanan nedeni aynısıdır - ses, varlığın karakterinin bir parçasıdır.
Çıktı tarafındaki ses değiştirme katmanı, R1’in tutarlı, ayırt edici bir persona konuşmasına izin verirdi. Giriş tarafındaki ses değiştirme katmanı, kullanıcıların LAM’ın ses anlama boru hattına özelleştirilmiş bir ses projeksiyonu yapmasına izin verirdi - konuşma farklılıkları olan kullanıcılar, ses gizliliği isteyen veya profesyonel bir ses persona önemli olan kullanım durumları için yararlı.
AI ses klonlaması kısa referans kliplerinden bu personaları oluşturabilir. R1 bunun için API yüzeyi yoktu.
3. Ortam Kullanımı için Gürültü Bastırma
Tek yönlü mikrofon artı ortam gürültüsü, konuşma tanıma için düşman bir ortamdır. Kahve dükkanları, şehir sokakleri, açık ofisler - hepsi konuşma tanıma doğruluğunu azaltan sabit arka alan sesi üretir. R1 temel yazılım gürültü bastırmaya gelmişti, yönlü dizi işlemeye değil.
Giyilebilir bir cihazda iyi gürültü bastırma, mikrofon dizisi (kol şekillendirmesi için iki veya daha fazla mikrofon) veya agresif DSP tabanlı filtreleme gerektirir. PC için en iyi ses değiştiricileri Windows ses yığını üzerinde yazılım ile bu sorunu çözdü - ancak R1 donanım kısıtlamalı gömülü sesle çalıştı.
Giyilebilir Cihazlar için Gerçek Ses Değiştirme Mimarisi Neye Benziyor
Sesi doğru şekilde elde etmek isteyen bir AI giyilebilir için ses yığınını tasarlamış olsaydınız, mimari şöyle görünürdü:
| Katman | Ne yapıyor | Neden önemli |
|---|---|---|
| Donanım mikrofon dizisi | Yönlü alış, kol şekillendirmesi | Kaynakta gürültü reddi |
| Cihazda DSP | Yankı iptali, spektral gürültü bastırma | Gerçek zamanlı, düşük gecikme, bulut yok |
| Yerel transkripsiyon modeli | Cihazda konuşmadan metne | Gizlilik, gecikme, çevrimdışı geri dönüş |
| Ses persona motoru | Tutarlı seste çıktı sentezle | Ürün kimliği, erişilebilirlik |
| Ses değiştirme giriş katmanı | Transkripsiyon önce ses dönüşümleri uygula | Gizlilik, kişilik, erişilebilirlik |
| Bulut çıkarımı (isteğe bağlı) | Karmaşık akıl yürütme, uzun bağlam | Ağır kaldırma için geri dönüş |
R1 sadece bulut transkripsiyon ve temel DSP ile geldi. Yığının geri kalanı eksikti.
LAM ve Ses: İlginç Bir Etkileşim
LAM konsepti aslında sese iyi uyuyor - belki de uygulama otomasyon çerçevesinin önerdiğinden daha fazla. İşte neden: LAM, arayüz etkileşimlerini gözlemlemek ve oynatmak için eğitildi. Bunu ses etkileşimlerine genişletirseniz, LAM kullanıcının nasıl konuştuğunu (hız, sözcük dağarcığı, tipik komutlar) gözlemleyebilir ve zaman içinde komut tanımayı geliştiren o kullanıcının ses desenlerinin bir modelini oluşturabilir.
Buna bağlı ses değiştirme katmanı, kullanıcıların bir persona tanımlamasına izin verirdi - makine anlaması için optimize edilmiş sözleşmelerinin bir versiyonu - cihazın kanonik girişi olarak öğrenir. Komutlar persona filtresi aracılığıyla yönlendirilecek, tanıma doğruluğunu geliştirmek ve ortam gürültüsü veya kullanıcının gerçek ses durumu (yorgun, hasta, duygusal) ne olursa olsun tutarlı bir arayüz sağlayacaktır.
Bu bilim kurgu değildir. Teknoloji bileşenleri mevcuttur. R1 onları asla bir araya getirmedi.
R1 Geriye Doğru: Kategorinin Öğrendiği Şey
R1 çıkmaz sokak olma anlamında başarısız değildi. Yürütme hazır olmadan önce vizyonu gönderme anlamında başarısızdı. Kategori dersleri öğretici:
Donanım yazılımı ortak tasarımı isteğe bağlı değildir. Ortam yapay zeka donanımı oluşturamıyor ve yazılımı bir sonraki düşüncü olarak ele alamazsınız. R1’in donanım kararları (tek mikrofon, küçük pil, Android VM) yazılımı tasarım zamanında öngörülebilir şekillerde sınırlamıştır.
Bulut bağımlılığı bir ürün yükümlülüğüdür. Temel özelliklerinin internet bağlantısı gerektiren herhangi bir cihaz bu bağlantı olmadığında veya yavaş olduğunda başarısız olabilir. Giyilebilir cihazlar bağlantının güvenilmez olduğu ortamlarda kullanılır. Yerel geri dönüş isteğe bağlı değildir.
Ses UX Ürün Olur. Arayüzü neredeyse tamamen ses olan bir cihaz için, sesi doğru şekilde elde etmek ürünü doğru şekilde elde etmek anlamına gelir. Düz genel TTS sesi ve bulut yalnızca transkripsiyon ile başlamak, takımın ürünün gerçekten yapıldığı şeyi öncelik vermediğini işaret etti.
Güven Gerçek Hendek Olduğunu. Kullanıcılar giyilebilir cihazları her yere taşırlar. Kayıt olduğunu bildikleri bir mikrofona söylemeyecekleri şeyler giyilebilir yakınında söylerler. Kullanıcılar cihazın veri işlemeyi güvenmezse, benimseme coşkun parantezle sınırlıdır.
VoxBooster Bu Resme Nasıl Uyuyor
VoxBooster, R1’de çalışmaz - R1 üçüncü taraf ses eklentisi desteği olmayan kendi işletim sistemini çalıştırır. Ancak Windows yardımcı yolu gerçektir.
Windows PC’de çalışan ve giyilebilir veya AI asistanı yanında kullanan kullanıcılar için: VoxBooster, herhangi bir uygulama mikrofon sinyalini almadan önce düşük gecikmeli ses yakalamalar aracılığıyla sesi işler. Windows mikrofonunuzda tutarlı bir kişi için AI ses klonlaması çalıştırabilir, gürültü bastırma uygulayabilir ve Whisper tabanlı yerel transkripsiyon kullanabilirsiniz - R1’in teslim edemediği tüm yetenekler masaüstünüzde mevcuttur.
R1 stili bir cihaz Windows bağlı modunu veya ses geçiş SDK’sını hiç yayınlarsa, VoxBooster’ın mimarisi temiz bir şekilde takılacak işleme katmanının tam türüdür. O zamana kadar, Windows iş akışı giyilebilirlerin henüz kırılmadığı ciddi ses persona ve transkripsiyon kullanım durumlarını işler.
VoxBooster indir ve AI ses değiştirme özelliklerini keşfet. Tam ses işleme yığınının gerçekten neye benzediğini görün. Planlar 3 günlük ücretsiz deneme içeren $6.99/ay’dan başlıyor.
Daha İyi Bir Rabbit R1 Nasıl Ses Çıkardı
Geçmişe bakarak spekülasyon kolay, ancak daha iyi ses R1 bileşenleri şimdi var:
- Donanım kol şekillendirme ile çift mikrofon dizisi (kabaca $3 BOM ekler)
- Cihazda çalışan nicemliştirilmiş Whisper Tiny (40MB, Helio P35’te kabaca 200ms gecikme)
- Adlandırılmış, ayarlanmış TTS kişi sesi (tek seferlik ses modeli maliyeti, minimum çalışma süresi)
- İsteğe bağlı ses değiştirme giriş katmanı (makine anlaması için persona hizalama)
- Açık veri ilkesi: yerel transkripsiyon varsayılan, bulut tercih
Hiçbiri atılım donanımı gerektirmez. R1’in MediaTek SoC DSP işlemlerini destekler. Kısıtlama önceliklendirmeydi, fiziği değil.
Karşılaştırma: R1 Sesi vs Varsayılan Daha İyi Sürüm
| Özellik | Sevk edildiği gibi R1 | Daha iyi sürüm | Boşluk |
|---|---|---|---|
| Mikrofon | Tekli omni | Çift dizi + kol şekillendirmesi | Donanım |
| Transkripsiyon | Sadece bulut | Yerel Whisper + bulut geri dönüşü | Yazılım/model |
| Gürültü bastırma | Temel yazılım | Donanım + DSP | Donanım/yazılım |
| Ses persona (çıktı) | Genel TTS | Ayarlanmış adlandırılmış kişi | Yazılım |
| Ses değiştirme (giriş) | Yok | Persona hizalama katmanı | Yazılım |
| Gizlilik | Bulut günlüğü | Varsayılan yerel | Mimari |
| Gecikme (ses komutu) | 400-800ms | 150-300ms | Mimari |
Daha Büyük Resim: Ortam Yapay Zeka Sesi Önce Çözülmesi Gerekir
R1 sesi hafife almakta yalnız değildi. 2023-2024 AI giyilebilir dalgasının çoğu - Humane AI Pin, Frame gözlükleri, çeşitli kavram cihazları - büyük dil modellerinin transkripsiyonla cevap verebileceği için sesi çözüldü olarak ele alıştı. Dil anlama sorununu ses UX sorunu ile karıştırdılar.
Dil anlama büyük ölçüde çözüldü. Ses UX değildir. Mikrofonun kalitesi, yerel transkripsiyon güvenilirliği, çıktı personasının tutarlılığı, ses verilerinin gizliliği - bunlar, gerçek dünyada cihazın bütün gün kullanılabilir olup olmadığını belirleyen çekici olmayan altyapı sorunlarıdır.
Ortam yapay zeka kategorisi donanım düzeyinde ses UX’i çözemedikçe, VoxBooster gibi Windows tabanlı ses işleme araçları, tam, güvenilir ses persona ve transkripsiyon yığını gerektiren kullanıcılar için daha pratik yol olmaya devam eder.
SSS
Rabbit R1 ile ses degistirici kullanabilir misiniz? Doğal olarak hayır. R1 kendi işletim sisteminde ve LAM bulut yığınında çalışır ve üçüncü taraf ses eklentisi desteği yoktur. Bluetooth üzerinden eşleştirilmiş bir Windows PC veya beraberinde gelen bir uygulama teorik olarak sesi ön işleyebilir, ancak sevk edildiği şekliyle R1 için resmi bir ses değiştirme yolu yoktur.
LAM nedir ve ses için neden önemli? LAM, Large Action Model anlamına gelir - Rabbit’in bir insanın yaptığı gibi arayüzleri çalıştırmak için eğitilmiş bir modelin terimi. Onu arayüz etkileşimlerini gözlemleyerek ve oynatarak çalışır. Ses için LAM, teorik olarak konuşulan komutları özel bir ses persona aracılığıyla yönlendirebilir, ancak Rabbit bu özelliği hiç yayınlamadı.
Rabbit R1 gerçekten sadece bir kutu içindeki Android uygulaması mıydı? Bağımsız sökümlere göre büyük ölçüde evet. R1 donanımı değiştirilmiş bir Android yığınında çalışıyordu. İşlevselliğinin çoğu bir telefon uygulaması tarafından çoğaltılabiliyordu. Rabbit daha sonra yazılım yığınının bulut Android VM’de çalıştığını kabul etti.
Bir AI giyilebilir cihazla en iyi hangi ses iş akışı çalışır? Yerel transkripsiyonlar (konuşmaların cihazda kalması için), giden sese uygulanan kalıcı ses persona ve ortam mikrofonu için gürültü bastırma. Bu bileşenler birlikte cihaza tutarlı, özel, düşük gecikmeli bir ses katmanı verir.
VoxBooster AI giyilebilirler ile çalışır mı? VoxBooster Windows 10/11’de çalışır ve sesi Windows ses alt sistemi aracılığıyla işler. Masaüstü veya dizüstü bilgisayar için ses işleme katmanı olarak bir giyilebilir cihazın yanında kullanılabilir; ses herhangi bir aşağı akış hizmetine gönderilmeden önce AI klonlaması ve gürültü bastırma uygular.
Gerçek bir AI giyilebilir ses katmanı hangi donanıma ihtiyaç duyar? En azından: yerel konuşma işleme için adanmış DSP veya NPU, gürültü reddi için yönlü mikrofon dizisi ve küçük bir ses modelini tutacak kadar RAM (kabaca 300-800 MB). R1’de MediaTek Helio P35 vardı - temel DSP’ye kapable ama yararlı gecikme ile sinirsel ses sentezine değildi.
AI giyilebilir kategorisi Rabbit R1’den hangi dersleri aldı? Üç ana ders: donanım yazılım ortak tasarımı yeni form faktöründen daha önemlidir; bulut bağımlılığı güven ve gecikme yükümlülüğüdür; ve ses UX katmanı (ses kalitesi, transkripsiyonun doğruluğu, persona tutarlılığı) sevkiyattan sonra değil, öncesinde çözülmesi gerekir.