إن جعل نص إلى كلام روبوتياً ليس عن زر سحري واحد بقدر ما يتعلق بتصفيف عدد قليل من التأثيرات المختارة بعناية على صوت اصطناعي حتى يتوقف عن بدو البشري. إذا حاولت من قبل تحويل راوٍ حاسوبي عادي إلى صوت آلة مناسب وانتهى بك الحال بشيء غير واضح أو طنين أو غريب فقط، فالمشكلة تقريباً دائماً هي الوصفة: أي تأثير، في أي ترتيب، وبأي كمية. يتجاوز هذا الدليل النظرية ويمنحك ستة وصفات صوتية روبوتية كاملة وذات أسماء يمكنك نسخها اليوم، لكل منها إعدادات دقيقة تقريباً للملعب والمعالجة الحلقية والضغط والمعادل.
ملخص سريع
- صوت TTS روبوتي هو راوٍ اصطناعي بالإضافة إلى أربع تأثيرات: تحديد الملعب الكمي، المعالجة الحلقية، الضغط، والمعادل المشكّل.
- ستة وصفات مسماة أدناه: كمبيوتر كلاسيكي من الثمانينات، مساعد حديث حدث خطأ به، Glitch Bot، ذكاء اصطناعي لمقطورة الخيال العلمي، روبوت Deadpan Meme، وطيار Mecha الراديو.
- يتحكم تحديد الملعب الكمي في صلابة الرتابة؛ تضيف المعالجة الحلقية طنيناً معدنياً؛ يضيف الضغط التصاق؛ يقرر المعادل بين الدفء والرقة.
- الطابع المعدني يعيش في المدرجات العليا، وليس الجهير، لذا قطّع الترددات المنخفضة إذا بدت غير واضحة.
- قم بالتصدير دون اتصال بالإنترنت للفيديوهات، أو وجّه عبر ميكروفون افتراضي لاستخدام الصوت الروبوتي مباشرة على Discord و OBS.
- للحصول على شرح كامل حول متى يتم استخدام TTS أولاً مقابل voice-changer أولاً، انظر الغطس العميق المرتبط.
ما هو صوت TTS روبوتي؟
صوت TTS روبوتي هو راوٍ نص إلى كلام تمت معالجته ليبدو ميكانيكياً بدلاً من أن يكون طبيعياً. يبدأ بكلام اصطناعي تم إنشاؤه من كلمات مكتوبة، ثم يضيف تأثيرات تزيل الدفء والتعبير البشري، مما يحل محلها بالآثار المعدنية والرتيبة أو الخللة. والنتيجة هي صوت يقرأ مثل آلة، وليس شخص.
التمييز مهم لأن شيئين يتم تصفيفهما هنا. أولاً، يصبح النص صوتاً من خلال تركيب الكلام. ثانياً، يحصل هذا الصوت على معالجة روبوتية في الأعلى. يمكنك جعل أي صوت روبوتياً تقريباً، لكن البدء من صوت اصطناعي مسطح وغير معبّر يجعل التأثيرات أنظف لأنه هناك نبرات طبيعية أقل تحارب الطابع الآلي.
إذا كنت تريد الشرح الكامل للطريقتين التي يتعامل بها الناس مع هذا، فإن تحطيم المقصد المزدوج في نص إلى كلام روبوتي يغطي سير عمل TTS أولاً مقابل voice-changer أولاً بعمق. يفترض هذا المنشور أنك تعرف بالفعل أنك تريد نتيجة روبوتية وتحتاج فقط إلى وصفات عملية.
ما الذي يجعل نص إلى كلام روبوتياً؟
أربع مكونات تقوم بمعظم العمل. فهم ما يغيره كل واحد يسمح لك بناء أي نمط، وليس فقط الستة أدناه. فكر في هذه كالأزرار التي يتم بناء كل صوت روبوتي من نص عليها.
تحديد الملعب الكمي
يشد تحديد الملعب الكمي ملعب الصوت إلى شبكة ثابتة من الملاحظات أو الخطوات بدلاً من السماح له بالانزلاق بشكل طبيعي. يحتوي الكلام البشري على حركة ملعب دقيقة مستمرة؛ الروبوتات لا. يعطي التحديد الصعب إلى ملاحظة واحدة إيصالاً رتيباً ميتاً. تحافظ الشبكة الأضعف على بعض الحركة لكنها تجعلها تبدو متدرجة وصلبة، مثل آلة تقرب الكلام.
المعالجة الحلقية
المعالجة الحلقية تضرب صوتك بنبرة ثابتة، مما ينتج عنه نطاقات جانبية معدنية لا تحدث في الكلام الطبيعي. ترددات الناقل المنخفضة (تقريباً 5 إلى 80 هرتز) تضيف طنيناً خفيفاً أو رجفة. الترددات الأعلى (200 هرتز وما فوق) تخلق صوت الروبوت الكلاسيكي المرنِن وغير المتناسق من الخيال العلمي القديم. إنه التأثير الروبوتي الأكثر تعرفاً.
الضغط
يقلل الضغط جودة الصوت عن قصد. إنه يقلل عمق البت (إضافة ضوضاء التكميم والالتصاق) وينخفض معدل العينة (إضافة التصاق قاس). القليل يعطي أزمة رقمية قديمة؛ الكثير يعطي نسيجاً آلياً منخفض الولاء ومكسوراً. هذا هو تأثير TTS الروبوتي الذي يجعل الصوت يبدو وكأنه خرج من أجهزة الثمانينات الرخيصة.
المعادل
يقرر المعادل ما إذا كان روبوتك يبدو دافئاً أم رقيقاً، ونطاقاً كاملاً أم محدوداً. قطع الترددات المنخفضة يزيل الرنين في الصدر البشري. رفع المدرجات العليا حول 2 إلى 4 كيلوهرتز يضيف جودة مكبر صوت رقيقة وخاصة. تمرير النطاق إلى نطاق ضيق يحاكي راديو أو بدالة. المعادل هو حيث يذهب الروبوت من عام إلى محدد.
وصفات TTS روبوتية: 6 أنماط مسماة
فيما يلي الوصفات الستة. يتم وصف الإعدادات بوضوح لأن كل أداة تسمي أزرارها بشكل مختلف. استخدم هذه كأهداف واضبط حسب الذوق. تسرد كل وصفة الصوت للبدء منه، والإعدادات الأربعة الأساسية، وحيث يتألق.
1. كمبيوتر كلاسيكي من الثمانينات
الراوي الصارم والرتيب من أجهزة الكمبيوتر المنزلية المبكرة ومقدمات الأركيد.
- اختيار الصوت: صوت اصطناعي مسطح وحيادي بملعب متوسط وخطى أبطأ قليلاً. تجنب الرواة المعبّرين أو العاطفيين؛ تريد عدم وجود دفء على الإطلاق للبدء.
- تحديد الملعب: صعب. شد إلى ملاحظة واحدة أو شبكة سيمي تون ضيقة بحيث يكون الإيصال رتيباً تماماً ومتدرجاً.
- المعالجة الحلقية: منخفضة أو معطلة. إذا استخدمتها، احتفظ بالناقل حول 30 إلى 60 هرتز للحصول على طنين طفيف بدلاً من رنين.
- الضغط: معتدل. اهدف إلى شعور 8 بت واسحب معدل العينة لأسفل نحو 11 كيلوهرتز بحيث يبدو وكأنه خرج من مكبر صوت داخلي صغير.
- المعادل: قطّع كل شيء أقل من 200 هرتز. رفع 2 إلى 4 كيلوهرتز لهذا الطابع الرقيق والخاص.
- حيث يتألق: مقدمات الألعاب الكلاسيكية، والتسلسلات الإقلاع المزيفة، وتعديلات البخار، وأي مزحة صوتية كمبيوتر حنين.
2. مساعد حديث حدث خطأ به
صوت مكبر صوت ذكي نظيف يعاني من أعطال خفية ومثيرة للقلق.
- اختيار الصوت: صوت اصطناعي نظيف وطبيعي المظهر، من نوع ما تتوقعه من مساعد حديث. يأتي الرعب من كسر شيء بدأ مصقول.
- تحديد الملعط: خفيف. فقط ما يكفي من الخطوات للشعور بالقلق قليلاً، وليس الرتابة الكاملة.
- المعالجة الحلقية: دقيقة جداً، ناقل حول 5 إلى 15 هرتز، لإضافة اهتزاز بطيء أو رجفة مثل الصوت يجهد.
- الضغط: خفيف. احتفظ بمعظم الولاء بحيث تبرز الأعطال مقابل الصوت النظيف.
- المعادل: احتفظ به مكتملاً تماماً لكن أضف دفعة معدنية صغيرة بالقرب من 3 كيلوهرتز. أضف بشكل عرضي تلعثم أو كرر الأعطال على كلمات واحدة.
- حيث يتألق: الأفلام القصيرة للرعب، وسرد creepypasta، والحفلات حيث يكون المساعد الودود بوضوح عطل.
3. Glitch Bot
الفوضوي، المنخفض، والانهيار بأفضل طريقة.
- اختيار الصوت: يعمل أي شيء تقريباً؛ التأثيرات تهيمن. يعطي صوت اصطناعي بملعط متوسط التأثيرات مجالاً للمضغ.
- تحديد الملعط: متقطع. استخدم شبكة عدوانية أو عشوائية بحيث ينتقل الملعط حول بشكل غير طبيعي.
- المعالجة الحلقية: نطاق متوسط، ناقل يكسح بين تقريباً 100 و 400 هرتز، للحصول على حافة معدنية متغيرة.
- الضغط: ثقيل. ادفع معدل العينة لأسفل إلى 6 إلى 8 كيلوهرتز بحيث يكون التصاق وخشخشة واضح.
- المعادل: ألحان قاسية. رفع 1.5 إلى 3 كيلوهرتز ودعه يبدو وحشياً.
- حيث يتألق: Memes، والرسائل الخطأ المزيفة، وتعديلات أسلوب datamosh، والصوت glitchcore.
4. ذكاء اصطناعي لمقطورة الخيال العلمي
عميق، بطيء، وسينمائي، الآلة العارفة التي تروي شيئاً ملحميًا.
- اختيار الصوت: صوت اصطناعي عميق، بطيء وسلطوي. انخفض الصيغة أو الرنين قليلاً للحصول على وزن إضافي.
- تحديد الملعط: معطل أو لطيف جداً. تريد الوقار، وليس الصلابة، بحيث يتنفس الملعط.
- المعالجة الحلقية: ناقل منخفض دقيق، أقل من 40 هرتز، للحصول على نبرة اصطناعية ضعيفة تلميح أنها ليست بشرية.
- الضغط: أدنى حد. الوضوح مهم هنا؛ السحق الثقيل يقتل الدراما.
- المعادل: رفع الطرف المنخفض عند 80 إلى 150 هرتز بعمق، أضف الحضور حول 4 كيلوهرتز، وضعه في انعكاس أو مساحة كبيرة.
- حيث يتألق: تعليقات المقطورة، والمقدمات الدرامية، والسرد السينمائي، ولحظات كشف الزعيم.
5. روبوت Deadpan Meme
الراوي المسطح غير المهتم خلف آلاف مقاطع الفيديو قصيرة الشكل.
- اختيار الصوت: صوت اصطناعي رتيب وغير عاطفي بخطى ثابتة. الكوميديا موجودة في الافتقار الكامل للنبر.
- تحديد الملعط: رتابة صعبة، مقفلة لملاحظة واحدة.
- المعالجة الحلقية: معطل. هذا النمط يبقى جافاً وعاديًا.
- الضغط: خفيف إلى معتدل، فقط ما يكفي للإشارة إلى أنها آلة تقرأ.
- المعادل: رقيق وأنفي قليلاً. قطّع الترددات المنخفضة أقل من 180 هرتز وأضف دفعة 3 كيلوهرتز لطيفة.
- حيث يتألق: memes نص إلى كلام قصيرة الشكل، سرد deadpan، والتوقيت الفكاهي حيث يبيع التسليم الجاد الفكاهة.
6. طيار Mecha الراديو
صوت معدني يصفر عبر قناة اتصالات من داخل روبوت عملاق.
- اختيار الصوت: صوت اصطناعي متوسط النطاق، نشيط. تريد بعض القيادة حتى معالجة الراديو لديها الحياة للضغط.
- تحديد الملعط: خفيف. لمسة من الخطوات تقرأ كاتصالات بمساعدة الآلة.
- المعالجة الحلقية: معتدل، ناقل حول 80 إلى 200 هرتز، لحافة معدنية بدون رنين غريب كامل.
- الضغط: معتدل، لبيع شعور نطاق منخفض للراديو.
- المعادل: تمرير النطاق إلى تقريباً 300 هرتز إلى 3 كيلوهرتز لصوت walkie-talkie. أضف تشويه خفيف وقليل من الضوضاء الثابتة أو الاتصالات على الذيول.
- حيث يتألق: شخصيات Mecha Anime، لعب أدوار الاتصالات العسكرية، وشخصيات روبوت VTuber.
جدول المقارنة بين 6 أنماط روبوتية
استخدم هذا لاختيار وصفة بدء في لمحة، ثم اضبط من هناك.
| النمط | تحديد الملعط | المعالجة الحلقية | الضغط | طابع المعادل | الأفضل لـ |
|---|---|---|---|---|---|
| كمبيوتر كلاسيكي من الثمانينات | رتابة صعبة | منخفضة أو معطلة | معتدلة (8-بت، ~11 كيلوهرتز) | رقيقة، لا ترددات منخفضة | مقدمات كلاسيكية، بخار |
| مساعد حديث حدث خطأ به | خفيفة | دقيقة جداً (5-15 هرتز) | خفيفة | كاملة مع دفعة 3 كيلوهرتز | رعب، creepypasta |
| Glitch Bot | متقطع | متوسط (100-400 هرتز) | ثقيل (6-8 كيلوهرتز) | ألحان قاسية | Memes، أخطاء فكاهية |
| ذكاء اصطناعي لمقطورة الخيال العلمي | معطل أو لطيف | ناقل منخفض دقيق (<40 هرتز) | أدنى حد | ترددات منخفضة عميقة + حضور | مقطورات، مقدمات |
| روبوت Deadpan Meme | رتابة صعبة | معطل | خفيف-معتدل | رقيق، أنفي | memes قصيرة الشكل |
| طيار Mecha الراديو | خفيفة | معتدل (80-200 هرتز) | معتدل | تمرير النطاق 300 هرتز-3 كيلوهرتز | Mecha، لعب أدوار الاتصالات |
كيفية جعل نص إلى كلام روبوتياً خطوة بخطوة
إذا لم تقم ببناء أحدهما من الصفر، فإليك ترتيب العمليات الذي يحافظ على الأشياء نظيفة. يمنع تنفيذ الخطوات في هذا التسلسل التأثيرات من محاربة بعضها البعض.
- اكتب وأنشئ الصوت الأساسي. اكتب نصك وأنشئه بصوت اصطناعي. اختر راوياً مسطحاً وغير معبّر لمعظم الأنماط الروبوتية بحيث لا تتنافس التأثيرات مع النبر البشري.
- اضبط تحديد الملعط أولاً. اقرر ما بين الرتابة مقابل الخطوات مقابل الطبيعي قبل إضافة اللون. هذا هو العمود الفقري لشعور الآلية.
- أضف معالجة حلقية بعد ذلك. ابدأ منخفضاً وخفيفاً، ثم رفع تردد الناقل فقط حتى يظهر الطابع المعدني. الإفراط فيه وتتوقف الكلمات عن كونها قابلة للفهم.
- طبّق الضغط، ثم المعادل أخيراً. سحق للنسيج، ثم استخدم المعادل لإصلاح ما الضغط والمعالجة الحلقية أفسدته، قطع الدفء، واستدعِ التوقيع النبري النهائي.
والسبب في أن المعادل يأتي أخيراً هو بسيط: يضيف الضغط والمعالجة الحلقية كلاهما الطاقة في أماكن غير متوقعة، وتريد أن تستخدم تمرير المعادل النهائي لتنظيف الإشارة المعالجة الفعلية، وليس الصوت الخام.
تطبيق صوتك الروبوتي: التصدير دون اتصال بالإنترنت مقابل ميكروفون افتراضي مباشر
بمجرد أن تبدو وصفتك صحيحة، هناك طريقتان للاستخدام الفعلي، وهما يناسبان وظائف مختلفة.
التصدير دون اتصال بالإنترنت
بالنسبة للفيديوهات والسرد وmemes وأي شيء مسجل مسبقاً، عرّض الصوت الروبوتي إلى ملف صوتي وأسقطه في محررك. يعطيك هذا عدداً غير محدود من المحاولات الثانية، والقدرة على ضبط كل تأثير بعد الحقيقة، وأعلى جودة ممكنة منذ أن لا شيء يتسابق بساعة في الوقت الفعلي. يمكن لمحرر مجاني مثل Audacity أن يستضيف معظم هذه التأثيرات، ويمكنك فقط ارتداد المقطع المنتهي مباشرة في الخط الزمني. دون اتصال بالإنترنت هو الاستدعاء الصحيح متى كان التوقيت والبريق أكثر أهمية من الفورية.
مباشر عبر ميكروفون افتراضي
بالنسبة للبث والدردشة الصوتية Discord أو لعب الأدوار حيث تتحدث في الوقت الفعلي، وجّه الصوت المعالج عبر ميكروفون افتراضي. أدوات سطح المكتب مثل VoxBooster تعرض ميكروفوناً افتراضياً تراه التطبيقات الأخرى كمدخل عادي، بحيث تختاره في Discord أو OBS ويتم تطبيق التأثير الروبوتي على الذباب. هذا يعني أنه يمكنك التحدث (أو تشغيل TTS) وجعل المستمعين يسمعون صوت الآلة على الفور، بدون خطوة عرض. VoxBooster يفعل هذا على Windows 10 و 11 بدون سائق kernel، وكل المعالجة تبقى على جهاز الكمبيوتر الخاص بك.
إذا كنت تريد ميكانيكا أعمق للتسلسل هذه التأثيرات لشخصية روبوت مباشرة، فإن صانع صوت روبوت يشرح سلسلة التأثيرات الكاملة بالتفصيل. بالنسبة لأخذ شقيق يركز بشكل خاص على جانب نص إلى كلام، دليل روبوت صوت tts هو القطعة المصاحبة لهذا.
بالنسبة للاستخدام المباشر، جانب OBS من التوجيه يستحق قراءة سريعة أيضاً؛ قاعدة معارف OBS يغطي كيفية اختيار ومزج أجهزة إدخال صوتية بحيث يستقر ميكروفون افتراضي على القناة الصحيحة.
الأخطاء الشائعة عندما تجعل نص إلى كلام روبوتياً
عدد قليل من المخالفين المتكررين يفصلون بين روبوت نظيف ومتضخم.
- الكثير من النهاية المنخفضة. مشكلة الروبوت الغير واضح الأكثر شيوعاً. الطابع المعدني يعيش في المدرجات العليا. إذا بدا وكأنه شخص يتمتم تحت الماء، قطّع أقل من 200 هرتز بعدوانية.
- المعالجة الحلقية عالية جداً. ادفع الناقل أو المزيج الرطب وتتوقف الكلمات عن كونها تنقيراً غير قابل للفهم. أعده حتى تتمكن من قراءة الجملة، ثم توقف.
- تكديس سحق على سحق. يمكن أن يؤدي الضغط الثقيل بالإضافة إلى معدل عينة منخفض بالإضافة إلى التشويه إلى تحويل كل شيء إلى همسة. أضف الالتصاق في مكان واحد، لا ثلاثة.
- تخطي صوت القاعدة المسطح. قد يؤدي البدء من راوٍ عاطفي ومعبّر إلى تأثيرات الرتابة محاربة المصدر. اختر صوتاً عاديًا أولاً؛ من الأسهل كثيراً جعل نص إلى كلام روبوتياً عندما لا يكون هناك دفء بشري للمحاربة.
الأسئلة الشائعة
ما هو نص إلى كلام روبوتي؟
نص إلى كلام روبوتي هو رواية اصطناعية تمت معالجتها لتبدو ميكانيكية بدلاً من كونها بشرية. تبدأ بصوت الكمبيوتر الذي يقرأ نصك، ثم تضيف تأثيرات مثل تحديد الملعب الكمي والمعالجة الحلقية والضغط والمعادل المشكّل لإضفاء طابع معادن وآلي عليه.
كيف أجعل نص إلى كلام روبوتياً؟
اختر صوتاً اصطناعياً مسطحاً، ثم قم بتكديس أربع تأثيرات: حدد الملعب على شبكة ثابتة للإيصال الرتيب، أضف معالجة حلقية للطنين المعدني، طبق الضغط لتقليل الجودة، واستخدم المعادل لتنحيف أو تحديد النطاق من حيث النبرة. اضبط كل واحد حتى يطابق نمطك المستهدف.
ما الإعدادات التي تجعل صوت TTS يبدو روبوتياً؟
الأربع الأساسية هي تحديد الملعط الكمي (يشد الملعط إلى درجات للرتابة)، والمعالجة الحلقية (تضيف نطاقات جانبية معدنية)، والضغط (يقلل عمق البت ومعدل العينة للالتصاق)، والمعادل (يقطع الدفء، ويعزز المدرجات العليا الرقيقة). ابدأ بحذر مع كل واحد وقم بتصفيفها حتى تحط الشخصية.
ما هي المعالجة الحلقية في صوت روبوت؟
تضرب المعالجة الحلقية إشارة صوتك بنبرة ثابتة، مما ينتج عنه نطاقات جانبية معدنية تبدو صناعية وغير متناسقة. الترددات المنخفضة تضيف طنيناً خفيفاً أو رجفة، في حين أن الترددات الأعلى تنتج الرنين الروبوتي الكلاسيكي الغريب المستخدم في عروض الخيال العلمي والألعاب القديمة.
هل يمكنني استخدام TTS روبوتي مباشرة على Discord أو OBS؟
نعم. وجّه الصوت المعالج عبر ميكروفون افتراضي، ثم اختر هذا الميكروفون الافتراضي كمدخل في Discord أو OBS أو أي تطبيق صوتي. يتم تطبيق التأثير الروبوتي في الوقت الفعلي، لذا يسمع المستمعون الصوت الميكانيكي بدلاً من مدخلك الخام.
هل نص إلى كلام روبوتي مجاني؟
العديد من أصوات TTS في المتصفح والأدوات المفتوحة لا تكلف شيئاً، ويمكنك إضافة تأثيرات روبوتية في محررات مجانية مثل Audacity. تطبيقات سطح المكتب مثل VoxBooster توفر تجربة مجانية كاملة لمدة ثلاثة أيام بدون بطاقة ائتمان حتى تتمكن من اختبار الأصوات الروبوتية المباشرة قبل اتخاذ أي قرار.
لماذا يبدو صوتي الروبوتي غير واضح بدلاً من كونه معدنياً؟
عادة ما يكون هناك الكثير من دفء الترددات المنخفضة المتبقية في الإشارة. قطّع كل شيء أقل من 200 هرتز، قلل الضغط إذا كان يشوه التفاصيل، وادفع دفعة حضور صغيرة حول 3 كيلوهرتز. الطابع المعدني يعيش في المدرجات العليا، وليس الجهير، لذا قم بتنحيفه.
الخلاصة
يأتي جعل نص إلى كلام روبوتياً إلى وصفة قابلة للتكرار: اختر صوتاً مسطحاً، اضبط تحديد الملعط، أضف معالجة حلقية، اسحق الولاء، وشكّل المعادل. توفر الأنماط الستة أعلاه نقاط بداية مختبرة لكل شيء من مزح الكمبيوتر الكلاسيكية إلى سرد مقطورة سينمائية واتصالات mecha مباشرة. انسخ وصفة، اضبط الإعدادات حسب الذوق، وستحط بصوت TTS روبوتي نظيف بسرعة أكبر بكثير من التخمين.
عندما تكون جاهزاً لتشغيل هذه مباشرة، VoxBooster هو أحد الخيارات التي تطبق سلسلة التأثيرات كاملة في الوقت الفعلي على Windows وتوجهها عبر ميكروفون افتراضي في Discord أو OBS أو أي تطبيق، مع معالجة كل شيء محلياً على جهاز الكمبيوتر الخاص بك. يمكنك تجربة مجموعة الميزات الكاملة في تجربة مجانية لمدة ثلاثة أيام، وتعيش الأسعار على صفحة التسعير إذا قررت الاحتفاظ بها. تنزيل VoxBooster.