استنساخ الصوت لإمكانية الوصول والنص إلى كلام: صوت شخصي للأجهزة
لقد تطورت إمكانية الوصول لاستنساخ الصوت من معمل الأبحاث إلى طاولة السرير في بضع سنوات. بالنسبة للأشخاص الذين يعانون من التصلب الجانبي الضموري أو MND أو استئصال الحنجرة أو أي حالة تدمر تدريجياً القدرة على التحدث، فإن القدرة على الحفاظ على صوتهم والاستمرار في استخدام صوتهم الخاص - وليس مركب صوتي عام روبوتي - من خلال جهاز نص إلى كلام أو هاتف ذكي لم تعد احتمالاً بعيداً. إنه متاح اليوم، وهذا الدليل يشرح كيفية عمله.
سنغطي التكنولوجيا بوضوح، ونقارن المنصات الرئيسية بما في ذلك Apple Personal Voice و Acapela My-own-voice و VocaliD و ElevenLabs و VoxBooster، ونقدم نصائح عملية حول التوقيت وجودة التسجيل وتكامل جهاز الاتصالات التعزيزية والبديلة.
النقاط الرئيسية
- يجب أن يبدأ بنك الصوت مبكراً - قبل تدهور كبير في الكلام - لالتقاط أفضل المواد المصدرية.
- يقدم Apple Personal Voice (iOS 17+) استنساخ صوت مجاني وعلى الجهاز لمستخدمي اللغات المدعومة.
- توفر منصات الاتصالات التعزيزية والبديلة الاحترافية (Acapela و VocaliD) نماذج عالية الدقة مصممة خصيصاً لأجهزة الاتصال المعززة.
- توفر منصات تركيب الصوت بالذكاء الاصطناعي (ElevenLabs و VoxBooster) وقت استجابة أسرع وخيارات توجيه أكثر مرونة.
- يمكن استخدام الصوت المستنسخ مع أجهزة الاتصالات التعزيزية والبديلة وقارئات الشاشة والميكروفونات الافتراضية وتطبيقات النص إلى كلام عبر Windows و iOS و Android.
- استنساخ الصوت للجراحة الاختيارية (مثل استئصال الحنجرة لعلاج السرطان) صحيح بالتساوي ويجب أن يتم التخطيط له قبل الجراحة.
ما هو استنساخ الصوت لإمكانية الوصول؟
استنساخ الصوت لإمكانية الوصول هو تطبيق تركيب الصوت بالذكاء الاصطناعي لإنشاء نموذج نص إلى كلام مخصص بناءً على تسجيلات صوت شخص معين. يسمح النموذج الناتج لهذا الشخص بكتابة نص وتلاوته بصوت يشبه صوتهم الخاص، بدلاً من صوت مركب عام.
هذا مهم لسبب بشري مباشر: الهوية. يحمل صوت الشخص الشخصية والهجنة الإقليمية والألوان العاطفية والعلاقات التي تستمر عقوداً بناءً على هذا الصوت. عندما تسلب الحالة القدرة الجسدية على إنتاج الكلام، فإن فقدان صفة الصوت بالإضافة إلى فقدان التواصل هو حزن مركب. يوفر الاستنساخ طريقة للحفاظ على طبقة الهوية هذه واستعادتها.
تحولت التكنولوجيا الأساسية لهذا بشكل جذري. كانت أنظمة بنك الصوت المتسلسلة السابقة تخيط معاً تسجيلات صوتية - وظيفية، لكن آلية للجمل الجديدة. تتعلم نماذج النص إلى كلام العصبية الحالية الشخصية الصوتية للصوت بشكل شامل ويمكنها تركيب نصوص عشوائية مع طبيعية صوتية وتنغيم وحتى بعض التلوين العاطفي.
من يستخدم استنساخ الصوت لإمكانية الوصول؟
مرضى التصلب الجانبي الضموري و MND
التصلب الجانبي الضموري (ALS) ومرض الخلايا العصبية الحركية (MND) هما التشخيصات الأكثر شيوعاً التي تحفز الطلب على بنك الصوت. يتقدم المرض بمعدلات مختلفة، لكن التصلب الجانبي الضموري ذو البداية البصلية يمكن أن يؤثر على الكلام في غضون أشهر من التشخيص. يوصي الأطباء والجمعيات الخيرية باستمرار ببدء تسجيل الصوت في أقرب وقت ممكن بعد التشخيص - يفضل أن يكون الكلام لا يزال 100٪ مفهوماً وبدون إرهاق أو غمغمة ملحوظة.
يوفر مركز ستيفن هوكينج للاتصالات والمنظمات مثل جمعية مرض الخلايا العصبية الحركية إرشادات وأحياناً دعماً مالياً لهذه العملية.
مرضى استئصال الحنجرة
يؤدي استئصال الحنجرة الكامل - الإزالة الجراحية للحنجرة، غالباً بسبب سرطان الحنجرة أو الغدة الدرقية - إلى فقدان كامل للصوت الطبيعي. على عكس التصلب الجانبي الضموري، تكون هذه عادة جراحة مجدولة، مما يعني أن تسجيل الصوت قبل الجراحة ممكن وموصى به بشدة. يمكن للمرضى الذين سجلوا صوتهم قبل الجراحة استخدام صوت نص إلى كلام مستنسخ فوراً بعد العملية بدلاً من البدء من الصفر مع حنجرة كهربائية أو جهاز حنك مريئي وحده.
بالنسبة لهؤلاء المرضى، فإن استنساخ الصوت ليس مشروعاً طويل الأجل بل مهمة محددة قبل الجراحة مع موعد نهائي صارم.
عسر النطق التشنجي ومرض باركنسون
يسبب عسر النطق التشنجي تشنجات لاإرادية في الحبال الصوتية، مما يجعل الكلام متعباً وغير متسق. غالباً ما يؤدي مرض باركنسون إلى فرط التنفس (كلام هادئ جداً وناعم) وعسر التلفظ. قد تصل كلا المجموعتين إلى نقطة يفضل فيها تكملة النص إلى كلام أو الاستبدال على محاولة الكلام من خلال التواصل المكثف.
التسجيل بينما لا يزال الكلام واضحاً نسبياً هو الاستراتيجية الأفضل - ينتج صوت باركنسون الضعيف نموذجاً أضعف مما كان سيكون عليه التسجيل السابق للتطور.
المواقف الاختيارية
لا يعتمد كل استنساخ صوت لاستخدام النص إلى كلام على التشخيص الطبي. قد يستخدم الأفراد المتحولون جنسياً الذين لم يخضعوا للتدريب الصوتي بعد صوتاً مستنسخاً كإخراج نص إلى كلام مفضل الجنس بينما يتطور صوتهم الطبيعي. يستخدم الشخصيات العامة الذين يريدون إنشاء نسخ كتاب صوتي أو راوي ذكي من صوتهم استنساخ الصوت لإنتاج نص إلى كلام قابل للتوسع. قد يقوم المعلمون والمتواصلون الذين يعتمدون بشكل كبير على صوتهم بحفظ صوتهم كاحتياط.
Apple Personal Voice: الاستنساخ على الجهاز للجميع
قدمت Apple صوتاً شخصياً في iOS 17 و macOS Sonoma (2023) كميزة إمكانية وصول لا تتطلب اشتراكاً وتعالج بالكامل على الجهاز. إنه متاح حالياً للغة الإنجليزية (الولايات المتحدة والمملكة المتحدة والأسترالية والهندية) والإسبانية والفرنسية والألمانية والإيطالية والكورية والماندرين والكانتونية واليابانية.
كيفية إعداد Apple Personal Voice
- انتقل إلى الإعدادات > الوصول > الصوت الشخصي.
- اضغط على إنشاء صوت شخصي واتبع مطالبات الإعداد.
- سيُطلب منك قراءة حوالي 150 عبارة عشوائية بصوت عالٍ - نفس العبارات المستخدمة في كل جلسة لتغطية نطاق صوتي واسع.
- يمكن أن تكون كل جلسة قصيرة أو طويلة كما تريد؛ يحفظ التسجيل التقدم بحيث يمكنك إكماله عبر عدة أيام.
- عند اكتمال التسجيل، يعالج جهازك النموذج طوال الليل أثناء الشحن.
- فعّل الإعدادات > الوصول > الكلام المباشر واختر صوتك الشخصي، ويمكنك الكتابة للتحدث بصوتك الشخصي المستنسخ من مركز التحكم.
يعني تكامل الكلام المباشر أن صوتك الشخصي متاح عبر مكالمات FaceTime والمكالمات الهاتفية وأي تطبيق آخر يستخدم الصوت النظامي - ليس فقط تطبيق نص إلى كلام مستقل.
المعالجة على الجهاز من Apple مهمة: لا يغادر الصوت الجهاز، لا توجد رسوم الاشتراك، والنموذج مرتبط بـ Apple ID للنسخ الاحتياطي على iCloud. الجودة مثيرة للإعجاب لنظام مستهلك على الجهاز، لكنها ليست بمستوى منصة الاتصالات التعزيزية والبديلة الاحترافية.
القيود
- اللغة الإنجليزية ومجموعة محدودة فقط من اللغات (تتسع بمرور الوقت).
- يتطلب iPhone 12 أو أحدث، أو Mac بـ Apple Silicon.
- لا توجد إمكانية وصول API - لا يمكنك توجيه الصوت إلى تطبيقات غير Apple.
- تستغرق 150 عبارة حوالي 20-30 دقيقة من التسجيل النشط؛ قد يحتاج المتحدث المرهق إلى نشر هذا على عدة أيام.
أجهزة الاتصالات التعزيزية والبديلة ومنصات بنك الصوت الاحترافية
تتراوح أجهزة الاتصالات التعزيزية والبديلة من أجهزة مخصصة (Tobii Dynavox و PRC-Saltillo) إلى برامج على iPad وأجهزة Windows اللوحية. تقبل معظم أنظمة الاتصالات التعزيزية والبديلة الحديثة أصواتاً اصطناعية مخصصة عبر طبقة البرنامج الخاصة بهم.
Acapela My-own-voice
خدمة My-own-voice من Acapela Group هي واحدة من أقدم وأكثر منصات بنك الصوت الاحترافية استخداماً على نطاق واسع. تم تصميمها بشكل خاص حول سير عمل الاتصالات التعزيزية والبديلة، مع شراكات مع الشركات المصنعة الرئيسية لأجهزة الاتصالات التعزيزية والبديلة.
العملية: يسجل المستخدمون مجموعة من العبارات (عادة 50-200) من خلال منصة الويب. يعالج فريق Acapela النموذج وينقل ملف صوتي متوافق مع تكنولوجيا Acapela Voice، الذي ينصب على Windows والمخرجات كصوت SAPI5 - متوافق تماماً مع معظم برامج الاتصالات التعزيزية والبديلة بما في ذلك Tobii Dynavox Communicator و Grid 3 وغيرها.
المزايا: دمج أجهزة وبرامج الاتصالات التعزيزية والبديلة المباشرة، دعم مخصص لحالات التصلب الجانبي الضموري / MND، مخرجات عالية الجودة، إرشادات أخصائي أمراض النطق واللغة المتاحة.
القيود: اشتراك أو تسعير لكل صوت؛ ليس مجانياً. يختلف دعم اللغة.
VocaliD
يتخذ VocaliD نهجاً مميزاً: إذا كان لدى الشخص صوت قليل جداً قابل للاستخدام، فإن VocaliD يمزج تسجيلاته الموجودة مع صوت “بديل” من بنك VocaliD HumanVoice (المتبرعون الذين يساهمون بتسجيلات صوتية لهذا الغرض). يمكن للخليط أن يحافظ على بعض الشخصية الصوتية من المريض حتى عندما يتبقى عدد قليل من الكلام الذكي فقط.
العملية: سجل ما يمكنك (حتى الكلام المتدهور مفيد). ينشئ نظام VocaliD صوتاً مخلوطاً. التسليم كصوت متوافق SAPI5 لبرامج الاتصالات التعزيزية والبديلة على Windows.
المزايا: قابلة للتطبيق حتى مع تدهور كبير في الكلام؛ مجتمع المتبرعين بالصوت كبير؛ مصممة بشكل خاص للاتصالات التعزيزية والبديلة.
القيود: نموذج اشتراك؛ النتيجة المخلوطة هي أقل “صوتك بحتة” من استنساخ نظيف من تسجيل سابق. دعم مركزي في الولايات المتحدة، على الرغم من أن تغطية لغات أوسع تنمو.
مقارنة المنصات
| المنصة | الأفضل لـ | التسجيل الأدنى | تنسيق الإخراج | التكلفة | على الجهاز؟ |
|---|---|---|---|---|---|
| Apple Personal Voice | مستخدمو iPhone/Mac و iOS Live Speech | حوالي 150 عبارة / 20 دقيقة | Apple Live Speech | مجاني | نعم |
| Acapela My-own-voice | أجهزة الاتصالات التعزيزية والبديلة ومسار عمل SLP الاحترافي | 50-200 عبارة | SAPI5 (Windows) | مدفوع | لا |
| VocaliD | الكلام محدود المتبقي، مزيج المتبرع | أي مبلغ | SAPI5 (Windows) | مدفوع/اشتراك | لا |
| ElevenLabs | وقت استجابة سريع، مطورو التطبيقات | حوالي دقيقة واحدة من الصوت | API / مشغل ويب | طبقة مجانية + مدفوعة | لا |
| VoxBooster | توجيه Windows في الوقت الفعلي، تطبيقات مرنة | دقائق من الصوت | ميكروفون افتراضي | مدفوع (تجربة 3 أيام) | لا |
ElevenLabs لإمكانية الوصول النص إلى كلام
أصبحت ElevenLabs الخيار الأول لمطوري بناء تطبيقات إمكانية الوصول، في الغالب بسبب تصميمها الأول API وسرعة استنساخ الصوت (استنساخ الصوت الاحترافي يتطلب 30 دقيقة على الأقل من الصوت النظيف؛ استنساخ الصوت الفوري يعمل من دقيقة واحدة فقط، مع جودة أقل).
حالات الاستخدام لإمكانية الوصول:
- تطبيقات نص إلى كلام مخصصة لـ iOS أو Android تستدعي API ElevenLabs للتحدث بإخراج صوت مستنسخ.
- التكامل في أدوات الإنتاجية (قارئي صوت Notion، قارئي البريد الإلكتروني).
- إنتاج الكتب الصوتية باستخدام صوت محفوظ.
- محتوى الفيديو الذي يمكن الوصول إليه حيث تغير صوت المنشئ أو فُقد.
القيود: تتم معالجة الصوت على خوادم ElevenLabs (وليس على الجهاز)، وهي اعتبار خصوصية لبعض المستخدمين. يتم الإخراج بشكل أساسي من خلال استدعاءات API أو مشغل الويب الخاص بهم - توصيل هذا ببرامج AAC على Windows يتطلب جسر مخصص أو توجيه ميكروفون افتراضي.
استخدام VoxBooster لتوجيه النص إلى كلام الذي يمكن الوصول إليه
VoxBooster لم يتم بناؤه بشكل خاص لـ AAC الطبي، لكنه يلعب دوراً محدداً وعملياً في خط أنابيب استنساخ الصوت لإمكانية الوصول: التوجيه المرن على Windows.
السيناريو: لديك صوت مستنسخ من ElevenLabs أو نموذج صوتي ذكي دقيق أو منصة تركيب صوت أخرى - لكن تحتاج إلى توجيه هذا إخراج الصوت إلى مكالمة فيديو أو واجهة إملاء Windows أو حزمة برامج AAC تتوقع إدخال ميكروفون بدلاً من صوت SAPI5.
يسجل إخراج الميكروفون الافتراضي VoxBooster كجهاز إدخال صوت Windows قياسي. أي تطبيق يقبل ميكروفوناً - Zoom و Teams و Discord و Windows Speech Recognition و OBS - يمكنه تلقي الصوت المستنسخ كما لو كان مكالمة ميكروفون حية.
سير العمل العملي:
- تدريب أو تحميل نموذج الصوت في VoxBooster (جلسة تسجيل قصيرة، دقائق من الصوت).
- كتابة أو إملاء نص؛ يصنع VoxBooster من خلال نموذج صوتك المستنسخ.
- اختر VoxBooster كإدخال ميكروفون في أي تطبيق Windows.
- يظهر صوتك المستنسخ في التطبيق المستقبل في الوقت الفعلي.
هذا مفيد بشكل خاص لمكالمات الفيديو والاتصالات في الوقت الفعلي حيث لا يتوفر تكامل SAPI5، والمستخدمون على Windows الذين يريدون أداة واحدة تتعامل مع تأثيرات الصوت والنص إلى كلام بدون أكوام برامج منفصلة.
بالنسبة للمستخدمين الذين يركزون بشكل محدد على التواصل في الوقت الفعلي مع تغيير صوت متعلق بالإعاقة، يغطي دليلنا حول إمكانية الوصول إلى مبدلات الصوت للإعاقات الصورة الأوسع لكيفية استخدام أدوات الصوت في الوقت الفعلي في السياقات المساعدة.
الحفاظ على الصوت للجراحة الاختيارية: قائمة فحص ما قبل العملية
إذا كنت تواجه استئصال الحنجرة أو إجراء آخر سيغير صوتك بشكل دائم، فإن تسجيل الصوت قبل الجراحة له أولوية واضحة. إليك إطار عمل عملي:
في أربعة أسابيع على الأقل قبل الجراحة:
- اتصل بأخصائي أمراض النطق واللغة الذي يعرف الاتصالات التعزيزية والبديلة وبنك الصوت. يمكنهم توجيه اختيار المنصة وتعيين العبارات المناسبة للغتك وأسلوب الاتصال.
- اختر منصة بناءً على أجهزتك (نظام Apple مقابل جهاز Windows AAC)، والميزانية، والغة. لدى Acapela My-own-voice و VocaliD مسارات سريرية منشأة؛ Apple Personal Voice قابلة للحياة لمستخدمي iPhone.
- سجل في غرفة هادئة مع ميكروفون USB مكثف أو هاتف ذكي بعيداً 6-8 بوصات عن الفم. تجنب التسجيل عندما تكون متعباً أو مريضاً أو بعد الكحول - جودة الصوت تتدهور بطرق سيحافظ عليها النموذج.
- سجل عبارات شخصية أولاً: اسمك وأسماء أفراد عائلتك والعبارات الشائعة وعنوان وظيفتك والعبارات الطوارئ. هذه هي الجمل التي ستريد أن تبدو وكأنك تقولها بأكثر من غيرها.
- أكمل مجموعة عبارات المنصة بالكامل - التغطية الصوتية العشوائية موجودة لسبب؛ التسجيلات الجزئية تنتج نماذج أضعف.
بعد الجراحة:
- قم بتكوين منصة الاتصالات التعزيزية والبديلة أو النص إلى كلام المختارة لاستخدام صوتك المستنسخ.
- اعمل مع SLP الخاص بك لدمجه في جهازك الاتصالات التعزيزية والبديلة أو سير عمل Windows TTS.
- احتفظ بالتسجيلات الأصلية المؤرشفة - تتحسن تكنولوجيا الاستنساخ بسرعة، وقد تكون نماذج أفضل قابلة للتدريب من نفس البيانات في 2-3 سنوات.
النص إلى كلام المخصص في قارئات الشاشة
قد يرغب مستخدمو الكمبيوتر الضعيفة والعمياء البصرية الذين لديهم تفضيل قوي لصوتهم - أو الذين يحتاجون إلى صوت مستنسخ لسبب محدد (على سبيل المثال، VTuber يحافظ على صوت شخصية، مستخدم يريد إخراج نص إلى كلام يؤكد الجنس) - في استخدام صوت مستنسخ مع قارئات الشاشة على Windows.
NVDA و SAPI5: NVDA (NonVisual Desktop Access)، واحدة من قارئات الشاشة الحرة الأكثر استخداماً، تدعم مركبات كلام SAPI5. أي صوت مستنسخ يُصدر باسم SAPI5 (Acapela و VocaliD) سيظهر كخيار في إعدادات مركب NVDA. التثبيت عادة ما يكون تثبيت MSI أو قابل للتنفيذ واحد متبوعاً باختيار الصوت من إعدادات NVDA.
JAWS: يدعم JAWS كلاً من SAPI5 وله محرك Vocalizer Expressive الخاص به. الأصوات SAPI5 من منصات بنك الصوت متوافقة.
الراوي (Windows مدمج): يدعم Windows Narrator أصوات SAPI5 عبر الإعدادات > الراوي > اختيار صوت. أقل مرونة من NVDA أو JAWS لكنها تعمل مع أي صوت SAPI5.
جسر ميكروفون افتراضي (مسار VoxBooster): بالنسبة لقارئات الشاشة أو التطبيقات التي لا تحتوي على اختيار صوت مرن لكن تسمح بإدخال ميكروفون للإملاء، يوفر إخراج الميكروفون الافتراضي VoxBooster حلاً بديلاً - يدخل الصوت المستنسخ أي تطبيق من خلال مسار إدخال الميكروفون.
أخلاقيات استنساخ الصوت لإمكانية الوصول
يستحق هذا الموضوع نقاشاً صادقاً. تكنولوجيا استنساخ الصوت قوية، وتطبيقاتها لإمكانية الوصول مفيدة بصراحة - لكن استخدام صوت شخص آخر بدون موافقة ضار، بغض النظر عن السبب المذكور. هناك نقطتان تستحقان التحديد بشكل مباشر:
الموافقة والملكية: صوت إمكانية الوصول المستنسخ مستقل من الناحية الأخلاقية عندما يتخذ الشخص المستنسخ قرارات مستنيرة حول من يمكنه استخدام النموذج وعلى أي أجهزة وتحت أي ظروف. لا يجب على أفراد العائلة أو مقدمي الرعاية أن يطلبوا نسخة من صوت شخص آخر بدون موافقة واضحة ومشاركة من هذا الشخص.
بعد الوفاة: تسأل بعض العائلات عن استخدام نموذج صوت شخص متوفى لأغراض تذكارية أو علاجية. هذا سؤال منفصل، دقيق استكشف في منشورنا حول أخلاقيات استنساخ الصوت التذكاري. السياق لإمكانية الوصول محدد تماماً حول المستخدمين الأحياء - يجب أن تكون القرارات لهم.
حدود الأجهزة الطبية: صوت الاتصالات التعزيزية والبديلة هو أداة اتصال، وليس مزيف عميق. استخدام صوت إمكانية الوصول المستنسخ لانتحال صفة الشخص في سياقات لم يأذنوا بها - معاملات مالية، تصريحات قانونية، وسائط اجتماعية - هو إساءة استخدام تضعف الثقة في هذه الأدوات بشكل عام.
للحصول على نقاش أوسع حول هذه القضايا انظر قطعتنا على أخلاقيات استنساخ الصوت 2026.
البدء: أي منصة مناسبة لك؟
| الوضع | نقطة البداية الموصى بها |
|---|---|
| مستخدم iPhone أو Mac ومتحدث اللغة الإنجليزية وميزانية محدودة | Apple Personal Voice - مجاني وعلى الجهاز وجودة جيدة |
| تشخيص التصلب الجانبي الضموري / MND باستخدام Tobii Dynavox أو Grid 3 | Acapela My-own-voice - يدعم SLP وإخراج SAPI5 |
| تدهور كبير بالفعل في الكلام الموجود | VocaliD - نهج المزيج بالمتبرع يعمل مع صوت محدود |
| مطور يبني تطبيق إمكانية وصول | ElevenLabs API - الأسرع للتكامل والتوثيق القوي |
| مستخدم Windows يحتاج إلى توجيه مرن للمكالمات والاجتماعات | VoxBooster - إخراج ميكروفون افتراضي بدون برنامج تشغيل نواة |
| قبل استئصال الحنجرة بأي منصة | ابدأ مع Apple Personal Voice أو Acapela؛ سجل 4 أسابيع قبل الجراحة |
القرار ليس حصرياً - يقوم العديد من المستخدمين بحفظ صوتهم على منصات متعددة، لأن جهد التسجيل متداخل وامتلاك نماذج زائدة هو احتياط معقول.
الموارد الداخلية
إذا كنت تأتي من خلفية الألعاب أو البث وتستكشف استنساخ الصوت لأول مرة، فإن مقدمتنا إلى كيفية استنساخ صوتك مع الذكاء الاصطناعي تغطي التكنولوجيا من الصفر. بالنسبة للسياق الطبي المحدد لبنك الصوت لحالات التصلب الجانبي الضموري وما شابهها، فإن قطعتنا المتعمقة حول بنك الصوت للمرضى الطبيين تذهب أبعد على سير العمل السريري واختيار المنصة وتنسيق SLP.
الأسئلة الشائعة
ما هو استنساخ الصوت لإمكانية الوصول؟
يستخدم استنساخ الصوت لإمكانية الوصول الذكاء الاصطناعي لإنشاء نسخة اصطناعية من صوت الشخص من تسجيلات صوتية. يستخدم الأشخاص الذين يعانون من التصلب الجانبي الضموري أو استئصال الحنجرة أو حالات أخرى تؤثر على الكلام صوتهم المستنسخ من خلال أجهزة الاتصالات التعزيزية والبديلة أو القارئات الصوتية أو تطبيقات النص إلى كلام حتى يتمكنوا من الاستمرار في التواصل بصوت يشبه صوتهم.
كم عدد عينات الصوت التي يتطلبها Apple Personal Voice؟
يتطلب Apple Personal Voice (iOS 17 و macOS Sonoma أو الإصدارات الأحدث) قراءة حوالي 150 عبارة بصوت عالٍ. تستغرق العملية 15-30 دقيقة إجمالاً ويتم تدريب النموذج على الجهاز، مما يعني أن بيانات صوتك لن تغادر iPhone أو Mac.
هل يمكن لاستنساخ الصوت أن يعمل لشخص فقد صوته بالفعل؟
فقط إذا كانت هناك تسجيلات لصوت الشخص قبل فقدان الصوت. هذا هو السبب في أن بنك الصوت يُوصى به بشدة في أقرب وقت ممكن بعد تشخيص التصلب الجانبي الضموري أو MND أو أي حالة تقدمية. يمكن لخدمات مثل VocaliD و Acapela My-own-voice وغيرها بناء نموذج من 20 دقيقة إلى عدة ساعات من الكلام المسجل مسبقاً.
هل يغطي التأمين استنساخ الصوت لإمكانية الوصول؟
تندرج بعض أجهزة الاتصالات التعزيزية والبديلة والبرامج المرتبطة بها ضمن التمويل من خلال Medicare أو Medicaid أو التأمين الخاص في الولايات المتحدة، وعبر خطط تكنولوجيا مساعدة NHS في المملكة المتحدة. غالباً ما تكون خدمة الاستنساخ نفسها بتكلفة منفصلة. تقدم منظمات مثل جمعية التصلب الجانبي الضموري وجمعية MND في بعض الأحيان منح. تحقق دائماً مع أخصائي أمراض النطق واللغة الذي يتخصص في الاتصالات التعزيزية والبديلة.
ما الفرق بين بنك الصوت واستنساخ الصوت؟
يشير بنك الصوت عادة إلى تسجيل مكتبة من العبارات التي يتم دمجها معاً بشكل صوتي لإنتاج جمل جديدة - نهج متسلسل. يبني استنساخ الصوت (أو تركيب الصوت) نموذجاً عصبياً من التسجيلات ويمكنه إنشاء أي نص بنسخة طبيعية من الصوت الأصلي. تطمس المنصات الحديثة هذا الخط، لكن الاستنساخ بشكل عام يبدو أكثر طبيعية للجمل الجديدة.
هل يمكنني استخدام صوتي المستنسخ مع قارئ الشاشة أو Windows؟
تكشف بعض المنصات صوتاً مستنسخاً باعتباره SAPI5 (Windows) أو موحد مع NVDA لمركب كلام، مما يسمح له بالعمل مع أي قارئ شاشة أو تطبيق يدعم النص إلى كلام. يختلف التوافق حسب المزود. يمكن لـ VoxBooster توجيه صوت مستنسخ إلى أي تطبيق من خلال ميكروفون افتراضي، وهو حل مرن عندما يكون التكامل المباشر SAPI5 غير متاح.
كم من الوقت يستغرق استنساخ صوت لاستخدام إمكانية الوصول؟
مع تركيب الصوت بالذكاء الاصطناعي الحديث، يمكن أن يكون النموذج القابل للاستخدام جاهزاً في دقائق إلى ساعات قليلة من 20-30 دقيقة من الصوت المصدري النظيف. يستغرق Apple Personal Voice وقت معالجة طوال الليل على الجهاز. غالباً ما تستغرق منصات المؤسسات للاتصالات التعزيزية والبديلة 1-3 أيام عمل لمراجعة الجودة. كلما توفرت أصوات نظيفة أكثر، كانت النتيجة أكثر طبيعية.
الخلاصة
أصبح استنساخ الصوت لإمكانية الوصول أحد أوضح الحالات التي توفر فيها تكنولوجيا الذكاء الاصطناعي قيمة معنوية وإنسانية الصنع. سواء كنت شخصاً يعاني من التصلب الجانبي الضموري يقوم بحفظ صوتك قبل تغييره، أو شخصاً يستعد لاستئصال الحنجرة، أو مقدم رعاية يساعد أحد أفراد العائلة على إعداد برامج الاتصالات التعزيزية والبديلة - الأدوات هنا، وتم توثيق العملية، والنتيجة تحافظ على جزء أساسي من الهوية البشرية.
النصيحة العملية: ابدأ مبكراً، وسجل صوتاً نظيفاً، واختر منصة تتطابق مع نظام الأجهزة الخاص بك، واعمل مع أخصائي أمراض النطق واللغة عندما يكون ذلك ممكناً. Apple Personal Voice هي الإجابة الصحيحة لمستخدمي iPhone و Mac الذين يحتاجون إلى نقطة بداية مجانية. Acapela و VocaliD هي الخيارات الاحترافية لتكامل أجهزة الاتصالات التعزيزية والبديلة. يغطي ElevenLabs حالات استخدام المطور وبناء التطبيقات. يملأ VoxBooster فجوة توجيه Windows عندما لا تتصل الأدوات الأخرى مباشرة بتطبيقاتك.
إذا كنت تريد استكشاف ما يبدو عليه النص إلى كلام الصوت الشخصي في بيئة Windows - بما في ذلك كيف يغذي صوت مستنسخ المكالمات والبث وبرامج إمكانية الوصول من خلال ميكروفون افتراضي - VoxBooster يوفر تجربة مجانية لمدة 3 أيام بدون بطاقة ائتمان. نموذج الصوت الذي تنشئه هو لك، والمعالجة تعمل محلياً، ولا يلزم تثبيت برنامج تشغيل النواة.
للجانب السريري للحفاظ على الصوت، اقرأ دليلنا التفصيلي حول بنك الصوت للمرضى الطبيين بعد ذلك.