أطلقت Rabbit R1 في أبريل 2024 بواحدة من أكثر العروض الترويجية للمنتجات التي يمكن تذكرها في السنوات الأخيرة: جهاز جيبي بكاميرا دوارة وعجلة تمرير ونموذج Large Action Model يمكنه تشغيل التطبيقات نيابة عنك. كان الجهاز لطيفاً. كانت البرامج، عند الإطلاق، خشنة. تراوحت المراجعات بين الشكية والإدانة. والفحص الذي كشف أنها كانت أساساً تطبيق Android يعمل في آلة افتراضية سحابية، انهار مثل قنبلة ثقيلة.
ومع ذلك، الأسئلة التي طرحتها R1 - ما الذي يحتاجه الذكاء الاصطناعي المحيط فعلاً من الصوت؟ - لا تزال تستحق الإجابة بعناية. لا تدافع هذه المقالة عن تنفيذ R1. تستخدم R1 كعدسة لفحص ما يمكن لتقنية تعديل الصوت واستنساخ الذكاء الاصطناعي الصوتي أن تساهما فعلاً في أجهزة الذكاء الاصطناعي القابلة للارتداء، وما الذي أخطأت فيه R1 في طبقتها الصوتية، وكيف ستبدو نسخة أفضل من هذه الفئة.
TL;DR
| الموضوع | الإجابة المختصرة |
|---|---|
| R1 كما تم شحنه | مليء بالأخطاء، منتقد، لا يستحق السعر الحالي |
| طبقة صوت R1 | ميكروفون أساسي، لا هوية صوتية، لا نسخ كتابي محلي |
| إمكانية تعديل الصوت | عالية - الهوية الصوتية، الخصوصية، رفض ضوضاء محيطة |
| ملاءمة الاستنساخ الذكي | متوسطة - إنشاء الهوية الصوتية جذاب، لكن زمن الانتظار قيد |
| الدروس للأجهزة القابلة للارتداء | المعالجة المحلية، التصميم المشترك بين الأجهزة والبرامج، UX الصوت أولاً |
| ربط VoxBooster | مسار مرافق Windows؛ ليس أصلياً على R1 |
ما كانت Rabbit R1 فعلاً
لقارئينا غير المألوفين: Rabbit R1 هو جهاز ذكاء اصطناعي صغير برتقالي وقائم بذاته بحجم حزمة بطاقات تقريباً. يحتوي على شاشة لمس بحجم 2.88 بوصة، وكاميرا دوارة بزاوية 360 درجة تسمى Eye، وعجلة تمرير، ومكبر صوت، وميكروفون. يتصل بـ Wi-Fi أو LTE ويعمل Rabbit OS على مكدس Android معدل.
كان الاقتراح الأساسي هو LAM: نموذج مدرب من خلال مراقبة مستخدمين بشريين يتفاعلون مع التطبيقات (Spotify، Uber، DoorDash) والتعلم من نسخ تلك التفاعلات. أخبر R1 بطلب قهوتك المعتادة؛ يقوم LAM بتنفيذ الخطوات في واجهة Uber Eats، بشكل غير مرئي.
عند الإطلاق، تم شحن الجهاز مع عدد قليل من تطبيقات LAM، ومساعد ذكاء اصطناعي عام، وميزات التقاط الصور. لم يتم شحنه مع نسخ وظيفية بالكامل من العديد من الميزات المروجة. أبلغ المستخدمون الأوائل عن فشل الأوامر الأساسية، وبطء رحلات السحابة المستديرة، واكتشاف أن نفس الخبرة يمكن تكرارها على هاتف بالتطبيقات الصحيحة. أطلقت Rabbit لاحقاً تحديثات، لكن الفجوة بين التسويق والواقع كانت كبيرة.
وجد باحثو الأمان المستقلون أيضاً أن R1 كانت تعمل على آلة افتراضية Android سحابية - مما يعني أن “نموذج الهاردوير الجديد” كان واجهة أمامية لهاتف سحابي. يوثق مدخل Wikipedia لـ Rabbit R1 الجدول الزمني، وكانت مراجعة The Verge ممثلة للاستقبال النقدي.
طبقة الصوت التي تخطيها R1
هنا يصبح الأمر مثيراً للاهتمام من الناحية التقنية من منظور الصوت. كانت معمارية الصوت في R1، كما تم شحنها، قليلة جداً:
- ميكروفون omnidirectional واحد مع قمع ضوضاء أساسي
- لا معالجة كلام محلية - كل شيء يتم نسخه في السحابة
- لا هوية صوتية أو قدرة تعديل صوت
- الإخراج من خلال مكبر صوت أحادي صغير
- لا تعريض API لمعالجة الصوت على الحافة
كانت هذه مشكلة كبيرة. الصوت هو الواجهة الأساسية للذكاء الاصطناعي المحيط. إذا كان المستخدمون سيتحدثون إلى جهاز طوال اليوم - في محلات القهوة، في المواصلات، أثناء المشي - يجب أن يتعامل الجهاز مع الصوت بشكل ممتاز. تعامل R1 معه بشكل مناسب في أفضل الأحوال.
كانت ثلاث قدرات غائبة كانت ستغير بشكل جوهري الخبرة.
ثلاث قدرات صوتية مفقودة
1. النسخ الكتابي المحلي
النسخ الكتابي السحابي يعني أن كل كلمة تقولها تترك الجهاز، تصل إلى خادم، تعود كنص. إضافة الرحلة المستديرة 200-800ms اعتماداً على الاتصال. والأهم من ذلك، يعني أن محادثاتك مسجلة على خادم تابع لجهة خارجية.
يمكن لنماذج النسخ الكتابي المحلية من فئة Whisper (يعمل Whisper Tiny بحوالي 40MB) أن تعمل على أجهزة مدمجة فوق حد أداء معين. MediaTek Helio P35 في R1 على الحدود للاستدلال في الوقت الفعلي، لكن ممكن للنسخ الكتابي للنطقات القصيرة مع التحسين. تم شحن الجهاز دون هذا.
تبعات الخصوصية غير تافهة. بالنسبة إلى جهاز يتم تسويقه كمساعد ذكاء اصطناعي شخصي تحمله في كل مكان، فإن الاعتماد الكامل على النسخ الكتابي السحابي يعني أن كل محادثة لديك مع جهازك مخزنة في مكان لا تتحكم فيه.
2. الهوية الصوتية / تعديل الصوت
تحدثت R1 مجدداً بصوت تحديد نص لـ TTS عام وممل. هذا مهم أكثر مما يبدو (بقصد التورية). الهوية الصوتية هي جزء من هوية المنتج. نفس السبب في أن مساعدي الهاتف لديهم أصوات مميزة، ومكبرات الصوت الذكية لها ملفات صوتية معدلة، وشخصيات اللعبة لديها ممثلون - الصوت هو جزء من شخصية الكائن.
ستسمح طبقة تعديل صوت على جانب الإخراج لـ R1 بالتحدث بهوية صوتية متسقة وفريدة من نوعها. ستسمح طبقة تعديل صوت على جانب الإدخال للمستخدمين بإسقاط صوت مخصص في خط أنابيب فهم صوت LAM - مفيد للمستخدمين الذين لديهم اختلافات في الكلام، والمستخدمين الذين يريدون خصوصية الصوت، أو حالات الاستخدام حيث تهم هوية صوتية احترافية.
يمكن استنساخ الصوت بالذكاء الاصطناعي إنشاء هذه الهويات من مقاطع مرجعية قصيرة. لم تكن لدى R1 سطح API لهذا.
3. قمع الضوضاء للاستخدام المحيط
ميكروفون omnidirectional واحد بالإضافة إلى الضوضاء المحيطة هي بيئة معادية لتحديد الكلام. محلات القهوة، الشوارع في المدن، المكاتب المفتوحة - كل منها يولد صوتاً في الخلفية مستمراً يتدهور دقة النسخ الكتابي. تم شحن R1 مع قمع ضوضاء برنامجي أساسي، وليس معالجة مصفوفة اتجاهية.
يحتاج قمع الضوضاء الجيد على جهاز قابل للارتداء إما مصفوفة ميكروفون (اثنان أو أكثر من الميكروفونات لتشكيل الشعاع) أو تصفية DSP عدوانية. أفضل مغيرات الصوت لـ PC حلت هذه المشكلة مع برنامج على مكدس صوت Windows - لكن R1 كانت تعمل على صوت مدمج محدود بالأجهزة.
ما تبدو عليه معمارية تعديل صوت حقيقية للأجهزة القابلة للارتداء
إذا كنت تقوم بتصميم مكدس الصوت لجهاز ذكاء اصطناعي قابل للارتداء أراد فعلاً الحصول على الصوت بشكل صحيح، ستبدو المعمارية هكذا:
| الطبقة | ما تفعله | لماذا يهم |
|---|---|---|
| مصفوفة ميكروفون الأجهزة | التقاط اتجاهي، تشكيل الشعاع | رفض الضوضاء من المصدر |
| DSP على الجهاز | إلغاء الصدى، قمع الضوضاء الطيفية | الوقت الفعلي، زمن انتظار منخفض، لا سحابة |
| نموذج النسخ الكتابي المحلي | الكلام إلى نص على الجهاز | الخصوصية، الزمن الفعلي، الوضع الخارج عن الشبكة |
| محرك الهوية الصوتية | تركيب الإخراج بصوت متسق | هوية المنتج، إمكانية الوصول |
| طبقة إدخال تعديل الصوت | تطبيق تحولات صوتية قبل النسخ الكتابي | الخصوصية، الهوية الصوتية، إمكانية الوصول |
| الاستدلال السحابي (اختياري) | التفكير المعقد، السياق الطويل | الاحتياطي للرفع الثقيل |
تم شحن R1 مع نسخ كتابي سحابي فقط و DSP أساسي. كان باقي المكدس غائباً.
LAM والصوت: تفاعل مثير للاهتمام
يُعتبر مفهوم LAM مناسباً بشكل فعلي للصوت - ربما أكثر مما اقترحه إطار automation تطبيقات. إليك السبب: يتم تدريب LAM على مراقبة وإعادة تشغيل تفاعلات الواجهات. إذا قمت بتوسيع ذلك إلى التفاعلات الصوتية، يمكن لـ LAM مراقبة كيفية تحدث المستخدم (الإيقاع، المفردات، الأوامر النمطية) وبناء نموذج من أنماط صوت المستخدم يحسن تحديد الأوامر بمرور الوقت.
يمكن لطبقة تعديل صوت متصلة بهذا أن تسمح للمستخدمين بتعريف هوية صوتية - نسخة من صوتهم محسنة لفهم الآلة - والتي يتعلمها الجهاز كمدخله الأساسي. سيتم توجيه الأوامر عبر مرشح الهوية الصوتية، مما يحسن دقة التحديد ويوفر واجهة متسقة بغض النظر عن الضوضاء المحيطة أو حالة صوت المستخدم الفعلية (متعب، مريض، عاطفي).
هذا ليس خيال علمي. مكونات التكنولوجيا موجودة. لم تجمع R1 بينها أبداً.
مراجعة R1: ما تعلمته الفئة
لم تكن R1 فشلاً بمعنى أن تكون نهاية مسدودة. كانت فشلاً بمعنى شحن رؤية قبل أن يكون التنفيذ جاهزاً. دروس الفئة مفيدة:
التصميم المشترك بين الأجهزة والبرامج ليس اختيارياً. لا يمكنك بناء أجهزة ذكاء اصطناعي محيط ومعاملة البرنامج كفكرة لاحقة. قيدت قرارات أجهزة R1 (ميكروفون واحد، بطارية صغيرة، آلة افتراضية Android) البرنامج بطرق كانت يمكن التنبؤ بها في وقت التصميم.
الاعتماد على السحابة هو التزام المنتج. أي جهاز تتطلب ميزاته الأساسية اتصالاً بالإنترنت يمكن أن يفشل عندما يكون هذا الاتصال غائباً أو بطيئاً. تُستخدم الأجهزة القابلة للارتداء في بيئات حيث الاتصال غير موثوق. الاحتياطي المحلي ليس اختيارياً.
UX الصوت هو المنتج. بالنسبة إلى جهاز تكون واجهته تقريباً بالكامل صوتية، فإن الحصول على الصوت بشكل صحيح يعني الحصول على المنتج بشكل صحيح. الإطلاق بصوت TTS عام وممل ونسخ كتابي سحابي فقط أرسل إشارة بأن الفريق لم يُعطِ الأولوية للشيء الذي تم بالفعل صنع المنتج منه.
الثقة هي الخندق الحقيقي. يحمل المستخدمون الأجهزة القابلة للارتداء في كل مكان. يقولون أشياء بالقرب من الأجهزة القابلة للارتداء ما لم يقولوها في ميكروفون يعرفون أنه يسجل. إذا لم يثق المستخدمون في التعامل مع بيانات الجهاز، يكون التبني محصوراً في براكة المتحمسين.
كيف يناسب VoxBooster هذه الصورة
لا يعمل VoxBooster على R1 - R1 يعمل على نظام تشغيل خاص به دون أي دعم لمكونات صوتية تابعة لجهات خارجية. لكن مسار مرافق Windows حقيقي.
بالنسبة للمستخدمين الذين يعملون على جهاز كمبيوتر Windows ويستخدمون جهاز قابل للارتداء أو مساعد ذكاء اصطناعي جنباً إلى جنب معه: يعالج VoxBooster الصوت من خلال التقاط صوت منخفض الزمن قبل أن يستقبل أي تطبيق إشارة الميكروفون. يمكنك تشغيل استنساخ صوت ذكاء اصطناعي لهوية صوتية متسقة على ميكروفون Windows، وتطبيق قمع الضوضاء، واستخدام نسخ كتابي محلي قائم على Whisper - كل القدرات التي فشلت R1 في تقديمها، متاحة على سطح المكتب.
إذا شحنت جهاز نمط R1 في أي وقت وضع Windows مربوط أو SDK لتمرير الصوت، فإن معمارية VoxBooster هي بالضبط نوع طبقة المعالجة التي ستتصل بنظافة. حتى ذلك الحين، يتعامل سير عمل Windows مع حالات الاستخدام الجادة للهوية الصوتية والنسخ الكتابي التي لم تحلها الأجهزة القابلة للارتداء بعد.
تحميل VoxBooster واستكشف ميزات مغيّر الصوت بالذكاء الاصطناعي لترى ما يبدو عليه مكدس معالجة صوت كامل. تبدأ الخطط من 6.99 دولار/الشهر مع نسخة تجريبية مجانية لمدة 3 أيام.
كيف ستبدو Rabbit R1 أفضل
التكهن سهل بأثر رجعي، لكن المكونات لـ R1 صوتية أفضل موجودة الآن:
- مصفوفة ميكروفون ثنائية مع تشكيل شعاع أجهزة (يضيف حوالي 3 دولارات BOM)
- Whisper Tiny محسّن يعمل على الجهاز (40MB، حوالي 200ms زمن انتظار على Helio P35)
- صوت هوية صوتية مسمى ومحسّن (تكلفة نموذج صوت لمرة واحدة، الحد الأدنى من وقت التشغيل)
- طبقة إدخال تعديل صوت اختيارية (محاذاة الهوية الصوتية لفهم الآلة)
- سياسة بيانات واضحة: نسخ كتابي محلي افتراضياً، السحابة اختيارية
لا يتطلب أي من هذه أجهزة اختراق. يدعم MediaTek SoC الخاص بـ R1 عمليات DSP. كان القيد هو الأولويات، وليس الفيزياء.
المقارنة: صوت R1 مقابل نسخة أفضل افتراضية
| الميزة | R1 كما تم شحنه | نسخة أفضل | الفجوة |
|---|---|---|---|
| الميكروفون | omni واحد | مصفوفة ثنائية + تشكيل شعاع | الأجهزة |
| النسخ الكتابي | السحابة فقط | Whisper محلي + احتياطي سحابي | برنامج/نموذج |
| قمع الضوضاء | برنامج أساسي | أجهزة + DSP | أجهزة/برنامج |
| الهوية الصوتية (الإخراج) | TTS عام | هوية صوتية محسنة ومسماة | برنامج |
| تعديل الصوت (الإدخال) | لا شيء | طبقة محاذاة الهوية الصوتية | برنامج |
| الخصوصية | تسجيل سحابي | محلي افتراضياً | الهندسة المعمارية |
| زمن الانتظار (أمر صوتي) | 400-800ms | 150-300ms | الهندسة المعمارية |
الصورة الأكبر: الذكاء الاصطناعي المحيط يحتاج إلى حل الصوت أولاً
لم تكن R1 وحدها في التقليل من شأن الصوت. معظم موجة الأجهزة القابلة للارتداء بالذكاء الاصطناعي 2023-2024 - Humane AI Pin, Frame glasses, أجهزة مفهوم مختلفة - عاملت الصوت على أنه محلول لأن نماذج اللغات الكبيرة يمكنها نسخ وإجابة. خلطت بين مشكلة فهم اللغة ومشكلة UX الصوت.
فهم اللغة محلول إلى حد كبير. UX الصوت ليس. جودة الميكروفون، موثوقية النسخ الكتابي المحلي، اتساق هوية الإخراج، خصوصية بيانات الصوت - هذه هي مشاكل البنية الأساسية غير الجذابة التي تحدد ما إذا كان الجهاز قابلاً للاستخدام طوال اليوم في العالم الحقيقي.
حتى لا تحل فئة الذكاء الاصطناعي المحيط مشاكل UX الصوت على مستوى الأجهزة، تبقى أدوات معالجة الصوت المستندة إلى Windows مثل VoxBooster المسار الأكثر عملية للمستخدمين الذين يحتاجون إلى مكدس هوية صوتية ونسخ كتابي كامل وموثوق.
FAQ
هل يمكنك استخدام مغيّر صوت مع Rabbit R1؟ لا بشكل أصلي. يعمل R1 على نظام تشغيل خاص به وكومة LAM السحابية دون أي دعم لمكونات صوتية تابعة لجهات خارجية. يمكن لجهاز كمبيوتر بنظام Windows مقترن عبر Bluetooth أو تطبيق مرافق أن يقوم نظرياً بمعالجة مسبقة للصوت، لكن لا توجد مسار تعديل صوت رسمي لـ R1 كما تم شحنه.
ما هو LAM ولماذا يهم للصوت؟ LAM تعني Large Action Model - وهي مصطلح Rabbit لنموذج مدرب على تشغيل الواجهات مثل الإنسان، من خلال مراقبة وإعادة تشغيل التفاعلات مع الواجهات. بالنسبة للصوت، يمكن لـ LAM من حيث المبدأ توجيه الأوامر الكلامية من خلال هوية صوتية مخصصة، لكن Rabbit لم تطلق هذه الميزة مطلقاً.
هل كان Rabbit R1 فعلاً مجرد تطبيق Android في صندوق؟ إلى حد كبير نعم، وفقاً للفحوصات المستقلة. كان جهاز R1 يعمل على مكدس Android معدل. كان معظم وظائفه قابلاً للتكرار من خلال تطبيق الهاتف. اعترفت Rabbit لاحقاً بأن مكدس البرنامج يعمل في آلة افتراضية Android سحابية.
ما سير العمل الصوتي الذي سيتناسب بشكل أفضل مع جهاز ذكاء اصطناعي قابل للارتداء؟ النسخ الكتابي المحلي (حتى تبقى المحادثات على الجهاز)، وهوية صوتية ثابتة مطبقة على الصوت الصادر، وقمع الضوضاء للميكروفون المحيط. معاً، تعطي هذه المكونات للجهاز طبقة صوتية متسقة وخاصة وذات زمن انتظار منخفض.
هل يعمل VoxBooster مع أجهزة الذكاء الاصطناعي القابلة للارتداء؟ يعمل VoxBooster على Windows 10/11 ويعالج الصوت من خلال نظام Windows الصوتي. يمكنه أن يعمل بمثابة طبقة معالجة الصوت لجهاز كمبيوتر سطح المكتب أو جهاز كمبيوتر محمول يستخدم جنباً إلى جنب مع جهاز قابل للارتداء، مع تطبيق استنساخ الذكاء الاصطناعي وقمع الضوضاء قبل إرسال الصوت إلى أي خدمة لاحقة.
ما نوع الأجهزة الذي يحتاجه طبقة صوت ذكاء اصطناعي حقيقية قابلة للارتداء؟ على الحد الأدنى: معالج DSP مخصص أو NPU للمعالجة الكلامية المحلية، ومصفوفة ميكروفون اتجاهية لرفض الضوضاء، وذاكرة وصول عشوائي كافية لحمل نموذج صوت صغير (تقريباً 300-800 MB). كان لدى R1 معالج MediaTek Helio P35 - قادر على DSP أساسي لكن ليس على تركيب صوت عصبي بزمن انتظار مفيد.
ما الدروس التي تعلمتها فئة أجهزة الذكاء الاصطناعي القابلة للارتداء من Rabbit R1؟ ثلاثة دروس رئيسية: التصميم المشترك بين الأجهزة والبرامج أهم من عامل الشكل الجديد؛ الاعتماد على السحابة هو مسؤولية ثقة وزمن انتظار؛ وطبقة UX الصوتية (جودة الصوت، دقة النسخ الكتابي، اتساق الهوية الصوتية) يجب أن تُحل قبل الشحن، لا بعده.