การสังเคราะห์เสียงพูดแบบหุ่นยนต์: 6 สูตรเสียง

ทำให้การสังเคราะห์เสียงพูดแบบหุ่นยนต์ด้วย 6 สูตรที่พร้อมใช้งาน การตั้งค่าการหาปริมาณระดับเสียงที่แน่นอน ring mod, bitcrush และ EQ สำหรับแต่ละสไตล์เสียง TTS แบบหุ่นยนต์

การทำให้การสังเคราะห์เสียงพูดแบบหุ่นยนต์นั้นมีความสัมพันธ์น้อยกับปุ่มวิเศษเพียงปุ่มเดียว และเกี่ยวข้องมากขึ้นกับการซ้อนกันของเอฟเฟกต์ที่เลือกอย่างดีบนเสียงสังเคราะห์จนกว่าจะไม่ฟังดูเหมือนมนุษย์ หากคุณเคยพยายามเปลี่ยนผู้บรรยายคอมพิวเตอร์ธรรมดาเป็นเสียงเครื่องจักรที่เหมาะสมและลงเอยด้วยสิ่งที่วุ่นวาย ดังดังหรือแค่แปลก ปัญหาเกือบจะเป็นสูตร: เอฟเฟกต์ใด ในลำดับใด ในปริมาณเท่าใด คู่มือนี้ข้ามทฤษฎีและมอบสูตรเสียงหุ่นยนต์ชื่อเต็มรูปแบบหกอย่างที่คุณสามารถคัดลอกได้วันนี้ แต่ละสูตรมีการตั้งค่าที่เกือบจะแน่นอนสำหรับระดับเสียง การมอดูเลตแหวน bitcrush และ EQ


TL;DR

  • เสียง tts แบบหุ่นยนต์คือผู้บรรยายแบบสังเคราะห์บวกกับสี่เอฟเฟกต์: การหาปริมาณระดับเสียง การมอดูเลตแหวน bitcrush และ EQ ที่มีรูปร่าง
  • สูตรชื่อหกอย่างด้านล่าง: คอมพิวเตอร์คลาสสิก 80 ปี ผู้ช่วยสมัยใหม่ที่หลง Glitch Bot AI เบี้ยงอทัย ร็อบอต Meme เฉยชาและ Radio Mecha Pilot
  • การหาปริมาณระดับเสียงควบคุมความแข็งแบบโมโนโทน; ring mod เพิ่มบัซโลหะ; bitcrush เพิ่มกรรม; EQ ตัดสินใจร้อนหรือบาง
  • ลักษณะโลหะอาศัยอยู่ใน mids บน ไม่ใช่ bass ดังนั้นตัด lows หากฟังดูเหมือนโคลน
  • ส่งออกออฟไลน์สำหรับวิดีโอ หรือกำหนดเส้นทางผ่านไมโครโฟนเสมือนเพื่อใช้เสียงหุ่นยนต์สดบน Discord และ OBS
  • สำหรับคำอธิบายที่สมบูรณ์เกี่ยวกับเวลาที่จะใช้ TTS-first เทียบกับ voice-changer-first โปรดดูการดำนำสำคัญที่เชื่อมโยง

เสียง tts แบบหุ่นยนต์คืออะไร?

เสียง tts แบบหุ่นยนต์คือผู้บรรยายการสังเคราะห์เสียงพูดที่ได้รับการประมวลผลให้ฟังดูเป็นกลไกแทนที่จะเป็นธรรมชาติ มันเริ่มต้นด้วยเสียงพูดสังเคราะห์ที่สร้างขึ้นจากคำที่พิมพ์ จากนั้นเพิ่มเอฟเฟกต์ที่ขจัดความอบอุ่นและการแสดงออกของมนุษย์ โดยแทนที่ด้วยแอบริศน์โลหะ โมโนโทน หรือ glitchy ผลลัพธ์คืออ่านเหมือนเครื่องจักร ไม่ใช่บุคคล

ความแตกต่างมีความสำคัญเพราะสองสิ่งถูกซ้อนกันที่นี่ อันดับแรก ข้อความกลายเป็นเสียงผ่าน การสังเคราะห์เสียง ประการที่สอง เสียงนั้นจะได้รับการรักษาหุ่นยนต์ที่ด้านบน คุณสามารถทำให้เสียงเกือบทั้งหมดเป็นหุ่นยนต์ได้ แต่เริ่มต้นจากเสียงสังเคราะห์ที่เรียบ ไม่มีการแสดงออก ทำให้เอฟเฟกต์ลงจอดที่สะอาดขึ้นเพราะมีการลดลงน้อยลงของเสียงธรรมชาติที่ต่อสู้กับตัวละครของเครื่องจักร

หากคุณต้องการคำอธิบายเต็มรูปแบบเกี่ยวกับสองวิธีที่มีคนเข้าถึงเรื่องนี้ รายละเอียดวัตถุประสงค์คู่ใน การสังเคราะห์เสียงพูดแบบหุ่นยนต์ ครอบคลุมลำดับการทำงาน TTS-first เทียบกับ voice-changer-first อย่างลึกซึ้ง โพสต์นี้ถือว่าคุณรู้แล้วว่าคุณต้องการผลลัพธ์ที่เป็นหุ่นยนต์และเพียงแค่ต้องการสูตรที่ใช้ได้

อะไรทำให้การสังเคราะห์เสียงพูดแบบหุ่นยนต์?

ส่วนประกอบสี่อย่างทำงานเกือบทั้งหมด การทำความเข้าใจว่าแต่ละอย่างเปลี่ยนแปลงอะไรช่วยให้คุณสร้างสไตล์ใดก็ได้ ไม่ใช่เพียงหกอย่างด้านล่าง คิดถึงสิ่งเหล่านี้เป็นปุ่มที่อยู่ด้านบนซึ่งเสียงหุ่นยนต์ทั้งหมดถูกสร้างขึ้น

การหาปริมาณระดับเสียง

การหาปริมาณระดับเสียงจับระดับเสียงของเสียงเข้าไปในตารางคงที่ของโน้ตหรือขั้นตอน แทนที่จะปล่อยให้มันเลื่อนไปตามธรรมชาติ เสียงพูดของมนุษย์มีการเคลื่อนไหวระดับเสียงจุลภาคที่ต่อเนื่องตลอดเวลา; หุ่นยนต์ไม่ได้ การหาปริมาณแบบแข็งเป็นโน้ตเดียวช่วยให้การส่งมอบเสียงโมโนโทนตาย ตารางที่หลวมขึ้นรักษาการเคลื่อนไหวบางส่วน แต่ทำให้ฟังดูเหมือนบันไดและแข็ง เหมือนเครื่องจักรที่ประมาณเสียงพูด

การมอดูเลตแหวน

การมอดูเลตแหวน ทำให้เสียงของคุณคูณด้วยโทนคงที่ สร้างแถบข้างโลหะที่ไม่เกิดขึ้นในการพูดตามธรรมชาติ ความถี่ผู้บรรทุกต่ำ (ประมาณ 5 ถึง 80 Hz) เพิ่มบัซหรือการสั่นเบา ความถี่ที่สูงขึ้น (200 Hz และขึ้นไป) สร้างเสียงหุ่นยนต์คลังแคลงแบบคลาสสิกและไม่ประสานกันจากวิทยาศาสตร์นิยมเก่า นี่คือเอฟเฟกต์หุ่นยนต์ที่จำได้ง่ายที่สุด

Bitcrush

Bitcrush ลดความเที่ยงของเสียงโดยจงใจ มันลดความลึกของบิต (เพิ่มเสียงรบกวนและกรรม) และลดอัตราตัวอย่าง (เพิ่มการนำเสนอแบบหยาบ) เล็กน้อยให้ crunch ดิจิตอลวินเทจ; มากมายให้พื้นผิวเครื่องจักรเสีย ต่ำ นี่คือเอฟเฟกต์ tts หุ่นยนต์ที่ทำให้เสียงรู้สึกเหมือนมาจากฮาร์ดแวร์ราคาถูกของทศวรรษที่ 1980

EQ

EQ ตัดสินใจว่าหุ่นยนต์ของคุณฟังดูอบอุ่นหรือบาง ช่วงเต็มหรือจำกัดแถบ การตัดความถี่ต่ำจะลบการสั่นพ้องของหน้าอกของมนุษย์ การเพิ่ม mids บนประมาณ 2 ถึง 4 kHz จะเพิ่มคุณภาพลำโพงบางและโลหะ Band-pass ไปยังช่วงแคบจำลองวิทยุหรือ intercom EQ คือที่ซึ่งหุ่นยนต์ไปจากสากลไปยังเฉพาะเจาะจง

สูตรการสังเคราะห์เสียงพูดแบบหุ่นยนต์: 6 สไตล์ชื่อ

นี่คือสูตรหกอย่าง การตั้งค่าอธิบายไว้อย่างชัดเจนเพราะเครื่องมือแต่ละอย่างติดป้ายปุ่มต่างกัน ใช้สิ่งเหล่านี้เป็นเป้าหมายและปรับแต่งตามรสชาติ สูตรแต่ละสูตรจะแสดงรายชื่อเสียงที่จะเริ่มต้น การตั้งค่าหลักสี่อย่าง และที่ที่มันจะเจอ

1. คอมพิวเตอร์คลาสสิก 80 ปี

ผู้บรรยายแข็งและเสียงโมโนโทนจากคอมพิวเตอร์ที่บ้านแรกและข้อมูลนำเข้าของเกม

  • ตัวเลือกเสียง: เสียงสังเคราะห์ราบเรียบ เป็นกลาง ที่ระดับเสียงกลาง และจังหวะที่ช้าเล็กน้อย หลีกเลี่ยงผู้บรรยายที่แสดงออกหรือมีอารมณ์; คุณต้องการความอบอุ่นเป็นศูนย์ตั้งแต่เริ่มต้น
  • การหาปริมาณระดับเสียง: ยาก ยึดติดกับโน้ตเดียวหรือตารางเซมิโทนแน่นเพื่อให้การส่งมอบโมโนโทนอย่างเต็มที่และมีบันไดชัดเจน
  • Ring mod: ต่ำหรือปิด หากคุณใช้มันให้เก็บผู้บรรทุกประมาณ 30 ถึง 60 Hz สำหรับบัซเบา แทนที่จะเป็นเสียงสั่น
  • Bitcrush: ปานกลาง เป้าหมายความรู้สึก 8-bit และลากอัตราตัวอย่างลงไปประมาณ 11 kHz เพื่อให้ฟังดูเหมือนมาจากลำโพงภายในขนาดเล็ก
  • EQ: ตัดทุกอย่างต่ำกว่า 200 Hz เพิ่มขึ้น 2 ถึง 4 kHz สำหรับลักษณะบางและโลหะนั้น
  • ที่ที่มันจะเจอ: เกม retro intros, ลำดับการเริ่มต้นปลอม, การแก้ไข vaporwave และ gag เสียงคอมพิวเตอร์ที่ใช้วัสดุหลากหลาย

2. ผู้ช่วยสมัยใหม่ที่หลง

เสียงลำโพงอัจฉริยะที่สะอาด โดยทั่วไปแล้ว หัก

  • ตัวเลือกเสียง: เสียงสังเคราะห์ที่สะอาดและฟังดูตามธรรมชาติ ประเภทที่คุณคาดหวังจากผู้ช่วยสมัยใหม่ ความหวาดเสียวมาจากการแตกหักสิ่งที่เริ่มต้นด้วยการแสดง
  • การหาปริมาณระดับเสียง: เบา เพียงพอที่จะรู้สึกขาดอารมณ์ ไม่ใช่โมโนโทนเต็มที่
  • Ring mod: อ่อนมาก ผู้บรรทุกประมาณ 5 ถึง 15 Hz เพื่อเพิ่มการหกล้มช้าหรือการสั่นเหมือนเสียงกำลังดิ้น
  • Bitcrush: เบา ให้เก็บความเที่ยงส่วนใหญ่เพื่อให้บั้ก glitch โดดเด่นกับเสียงที่ดี
  • EQ: ให้เก็บค่อนข้างเต็ม แต่เพิ่มการ va โลหะเล็กน้อยใกล้ 3 kHz ทำให้ glitch gagap หรือซ้ำขึ้นเป็นครั้งคราวจากคำ
  • ที่ที่มันจะเจอ: ภาพยนตร์สั้นสยองขวัญ การบรรยาย creepypasta และพื้นที่ซึ่งผู้ช่วยที่เป็นมิตรอย่างเห็นได้ชัดไม่ทำงาน

3. Glitch Bot

วุ่นวาย ความเที่ยงต่ำ และตกลงมาแยกกันในวิธีที่ดีที่สุด

  • ตัวเลือกเสียง: เกือบทุกสิ่งทำงาน; เอฟเฟกต์เหมิด เสียงสังเคราะห์ระดับเสียงกลาง ให้พื้นที่เอฟเฟกต์ในการเคี้ยว
  • การหาปริมาณระดับเสียง: ไม่ปกติ ใช้ตารางก้าวร้าวหรือสุ่มเพื่อให้ระดับเสียงกระโดดแบบไม่ธรรมชาติ
  • Ring mod: ช่วงตรงกลาง ผู้บรรทุกกวาดระหว่างประมาณ 100 ถึง 400 Hz สำหรับ edge โลหะที่เปลี่ยน
  • Bitcrush: หนัก ผลักอัตราตัวอย่างลงไป 6 ถึง 8 kHz เพื่อให้การนำเสนอและ grit ชัดเจน
  • EQ: Mids หยาบ เพิ่มขึ้น 1.5 ถึง 3 kHz และให้มันฟังเหมือนหยาบ
  • ที่ที่มันจะเจอ: Memes, ข้อความข้อผิดพลาดปลอม, การแก้ไข datamosh-style และเสียง glitchcore

4. AI เบี้ยงอทัย

ลึก ช้า และสวยงาม เครื่องจักร omniscient บรรยายบางสิ่งเมกะ

  • ตัวเลือกเสียง: เสียงสังเคราะห์ลึก ช้า และเป็นอำนาจ ลดลางหรือสัมพันธน์ลงเล็กน้อยสำหรับน้ำหนักเพิ่มเติม
  • การหาปริมาณระดับเสียง: ปิดหรือว่อนุ่ม คุณต้องการการเดอะ ไม่ใช่ความแข็ง ให้ระดับเสียงหายใจ
  • Ring mod: ผู้บรรทุกต่ำอ่อน ภายใต้ 40 Hz เพื่อให้ underone สังเคราะห์อ่อนที่ชี้บ่งว่ามันไม่ใช่มนุษย์
  • Bitcrush: น้อยที่สุด ความชัดเจนถูก ที่นี่; ความบ่อนทำลายโดยความแข็งแกร่ง
  • EQ: เพิ่มปลายความต่ำที่ 80 ถึง 150 Hz เพื่อลึก เพิ่มการดำรงอยู่ประมาณ 4 kHz และวางไว้ใน reverb ขนาดใหญ่หรือพื้นที่
  • ที่ที่มันจะเจอ: ตัวแทน voiceover, intro dramatic แสดง, การบรรยายสินรงค์ และช่วงเวลาเปิดเผย boss

5. ร็อบอต Meme เฉยชา

ผู้บรรยายแบบราบเรียบและไม่สนใจหลัง วิดีโอรูปแบบสั้นนับหมื่น

  • ตัวเลือกเสียง: เสียงสังเคราะห์เสียงโมโนโทน ไม่มีอารมณ์ด้วยการเอกท์ที่มั่นคง การหัวเราะวิวโฉมในการขาดเอกทิศทั้งหมด
  • การหาปริมาณระดับเสียง: Monotone แข็ง ล็อคเป็นโน้ตเดียว
  • Ring mod: ปิด สไตล์นี้ยังคงแห้งและเรียบง่าย
  • Bitcrush: เบาถึงปานกลาง เพียงพอที่จะส่งสัญญาณเป็นการอ่านอย่างเครื่องจักร
  • EQ: บางและเล็กน้อยจมูก ตัดความสูงต่ำต่ำกว่า 180 Hz และเพิ่มการดันโลหะไปที่ 3 kHz
  • ที่ที่มันจะเจอ: Memes การสังเคราะห์เสียงรูปแบบสั้น การบรรยายประวัติ deadpan และการหมดเวลาตลกเมื่อการส่งมอบหน้าตรงขายเรื่องตลก

6. Radio Mecha Pilot

เสียงโลหะสะปลวกผ่านช่องการสื่อสารจากภายในหุ่นยนต์ยักษ์

  • ตัวเลือกเสียง: เสียงสังเคราะห์ช่วงตรงกลาง มีพลังงาน คุณต้องการไดรฟ์บางอย่างเพื่อให้ทำการรักษาวิทยุมีชีวิตเพื่อบีบอัด
  • การหาปริมาณระดับเสียง: เบา ความรู้สึกของบันไดอ่านเป็นการสื่อสารที่มีความช่วยเหลือของเครื่องจักร
  • Ring mod: ปานกลาง ผู้บรรทุกประมาณ 80 ถึง 200 Hz เพื่อให้ cue โลหะโดยไม่ต้องเสียง clanging เชิงอเลี่ยน
  • Bitcrush: ปานกลาง เพื่อขายความรู้สึกวิทยุแบนด์วิดท์ต่ำ
  • EQ: Band-pass ไปหา 300 Hz ถึง 3 kHz สำหรับเสียง walkie-talkie เพิ่ม distortion เบาและความสัมผัสของเสียงรบกวนสถิตหรือการสื่อสารบนหาง
  • ที่ที่มันจะเจอ: ตัวละคร mecha anime โยคะสื่อสารทหาร และตัวตนหุ่นยนต์ VTuber

ตารางเปรียบเทียบรูปแบบ 6 หุ่นยนต์

ใช้สิ่งนี้เพื่อเลือกสูตรการเริ่มต้นอย่างรวดเร็ว จากนั้นปรับจากที่นั่น

รูปแบบการหาปริมาณระดับเสียงRing modBitcrushลักษณะ EQดีที่สุดสำหรับ
คอมพิวเตอร์คลาสสิก 80 ปีMonotone แข็งต่ำหรือปิดปานกลาง (8-bit, ~11 kHz)บาง ไม่มี lowsRetro intros, vaporwave
ผู้ช่วยสมัยใหม่ที่หลงเบาดี่มาก (5-15 Hz)เบาเต็มไปด้วยการ va 3 kHzสยองขวัญ creepypasta
Glitch Botไม่ปกติตรงกลาง (100-400 Hz)หนัก (6-8 kHz)Mids หยาบMemes, gag ผิดพลาด
AI เบี้ยงอทัยปิดหรือนุ่มต่ำนุ่ม (<40 Hz)น้อยที่สุดต่ำลึก + การดำรงอยู่ตัวอักษร, intros
ร็อบอต Meme เฉยชาMonotone แข็งปิดเบา-ปานกลางบาง จมูกMemes รูปแบบสั้น
Radio Mecha Pilotเบาปานกลาง (80-200 Hz)ปานกลางBand-pass 300 Hz-3 kHzMecha, roleplay สื่อสาร

วิธีสังเคราะห์เสียงพูดแบบหุ่นยนต์ทีละขั้นตอน

ถ้าคุณไม่เคยสร้างสิ่งใดมาก่อน นี่คือลำดับการดำเนินการที่ให้ทุกอย่างสะอาด ทำให้ขั้นตอนตามลำดับนี้ป้องกันเอฟเฟกต์จากการสู้รบ

  1. เขียนและสร้างเสียงพื้นฐาน ที่อักษร คำเขียนและสร้างเสียงด้วยเสียงสังเคราะห์ เลือกผู้บรรยาย ราบเรียบ ไม่แสดงออกสำหรับสไตล์หุ่นยนต์ส่วนใหญ่ เพื่อให้เอฟเฟกต์ไม่แข่งขันกับเสียงของมนุษย์
  2. ตั้งค่าการหาปริมาณระดับเสียงก่อน ตัดสินใจเลือก monotone เทียบกับ staircase เทียบกับลักษณะก่อนที่จะเพิ่มสี นี่คือกระดูกสันหลังของความแข็งที่รู้สึกของการส่งมอบ
  3. เพิ่มการมอดูเลตแหวนต่อไป เริ่มต้นที่ต่ำและนุ่ม จากนั้นเพิ่มความถี่ผู้บรรทุกเพียงไปจนกระทั่งตัวละครโลหะปรากฏ overdo และคำหยุดเป็นอ่านถูกต้อง
  4. ใช้ bitcrush จากนั้น EQ สุดท้าย Crush สำหรับพื้นผิว จากนั้นใช้ EQ เพื่อแก้ไขสิ่งใดก็ตามที่มี bitcrush ตัด ความอบอุ่นและหมุนปลายเสียง

เหตุผลที่ว่าทำไม EQ มา สุดท้ายอย่างง่าย: bitcrush และ ring mod ทั้งสองเพิ่มพลังงานที่สถานที่คาดการณ์ไม่ได้ และคุณต้องการลำจาก EQ สุดท้ายเพื่อทำความสะอาดให้กับสัญญาณที่ประมวลผลจริง ไม่ใช่เสียงดิบ

การใช้เสียงหุ่นยนต์ของคุณ: ส่งออกออฟไลน์เทียบกับไมโครโฟนเสมือนแบบสด

เมื่อสูตรของคุณฟังดีจนทำให้มี สองวิธีเพื่อใช้มันจริง และพวกเขาอาจจะใช้งานได้หลายอย่าง

ส่งออกออฟไลน์

สำหรับวิดีโอ ทำให้การบรรยาย memes และอะไรก็ตามที่บันทึกไว้ก่อนหน้านี้ แสดงผลเสียงหุ่นยนต์ไปยังไฟล์เสียงและทิ้งไป ในตัวแก้ไขของคุณ สิ่งนี้ให้คุณจำนวน retakes ไม่ จำกัด ฝีปลายที่จะเปลี่ยนแปลงอย่างละเอียด และคุณภาพสูงสุดเป็นไปได้เนื่องจากไม่มีสิ่งใดที่วิ่งเหมือนนาฬิกาที่แข่งกัน แก้ไขฟรี เช่น Audacity สามารถเก็บเอฟเฟกต์ส่วนใหญ่ และคุณสามารถไปบาดแผ้วล็อบ clip ที่จบแล้วสุดลงไปในประเทศไทย Timeline. Offline คือเรียกสำหรับเมื่อใดก็ตามที่เวลาและตำแหน่งปกค มากกว่าความพึงพอใจ

สดผ่านไมโครโฟนเสมือน

สำหรับการสตรีม Discord ผู้พูด หรือ roleplay ที่คุณพูดตามเวลาจริง กำหนดเส้นทางเสียงที่ประมวลผลผ่านไมโครโฟนเสมือน แอปพลิเคชันเดสก์ทอปเช่น VoxBooster ทำให้ปรากฎเสมือนที่ แอปพลิเคชันอื่นๆ เห็น เช่น input ปกติ ดังนั้นคุณก็เลือกว่า Discord หรือ OBS และผลกระทบหุ่นยนต์ ใช้ได้อย่างรวดเร็ว นั่นหมายความว่า คุณสามารถพูด (หรือ TTS สัญญาณ) และผู้ฟัง ได้ยินเสียง ตอนนี้ ไม่มีขั้นตอนการเคลื่อนไหว VoxBooster ทำเช่นนี้บน Windows 10 และ 11 โดยไม่มีมาตรฐาน kernel ด้วย และก็ค่าใช้จ่ายทั้งหมดให้ไว้ให้บนเครื่องของคุณ

ถ้าคุณต้องการ Mechanics ลึกที่ของโซ่เอฟเฟกต์สำหรับ persona หุ่นยนต์สดใจ robot voice maker ตัวอักษรย่อมาถึงเชือก เงา ที่สเต็ม ถ้าเตสลห์กันนซิ่งตรงเมื่อต่อชั่วงข้างด้านสังเคราะห์เสียง แนวทาง robot voice tts ปลาสียเห็นได้นี้

สำหรับการใช้งานสด ด้านจาก OBS ของ routing ก็คุ้มค่าอ่านเร็ว; OBS knowledge base ครอบคลุมวิธีเลือกและปลิด audio input devices ให้ mike ว sims ของคุณลง บน right channel

ข้อผิดพลาดทั่วไปเมื่อคุณสังเคราะห์เสียงพูดแบบหุ่นยนต์

คิดไม่ว่าไม่มี offenders แยก ที่อาจมี robot ที่สะอาดจาก muddy

  • มากเกินไปต่ำ ปัญหาที่สำหรับ มี muddy-robot ปกติหลวง ลักษณะโลหะจำหนักสดอง mids บน เสียนหลวดเชิงออกมาที่ยา tones ผู้รม mmzingมีใยน ใจmaiSH ไปง Amaz Hz agress

FAQ

การสังเคราะห์เสียงพูดแบบหุ่นยนต์คืออะไร?

การสังเคราะห์เสียงพูดแบบหุ่นยนต์คือการบรรยายแบบสังเคราะห์ที่ประมวลผลให้ฟังดูเป็นกลไกแทนที่จะเป็นมนุษย์ คุณเริ่มต้นด้วยเสียงคอมพิวเตอร์อ่านข้อความของคุณ จากนั้นเพิ่มเอฟเฟกต์เช่นการหาปริมาณระดับเสียง การมอดูเลตแหวน bitcrush และ EQ ที่มีรูปร่างเพื่อให้มันมีลักษณะเป็นโลหะที่ทำโดยเครื่องจักร

ฉันจะสร้างการสังเคราะห์เสียงพูดแบบหุ่นยนต์ได้อย่างไร?

เลือกเสียงสังเคราะห์ราบเรียบ จากนั้นซ้อนกันสี่เอฟเฟกต์: ปริมาณระดับเสียงไปยังตารางคงที่สำหรับการส่งมอบโมโนโทน เพิ่มการมอดูเลตแหวนสำหรับบัซโลหะ ใช้ bitcrush เพื่อลดความเที่ยง และใช้ EQ เพื่อบาง หรือจำกัดแถบ ปรับแต่งแต่ละรายการจนกว่าจะตรงกับสไตล์เป้าหมายของคุณ

การตั้งค่าใดทำให้เสียง TTS ฟังดูเหมือนหุ่นยนต์?

สี่หลักคือการหาปริมาณระดับเสียง (จับระดับเสียงไปยังขั้นตอนสำหรับโมโนโทน) การมอดูเลตแหวน (เพิ่มแถบข้างโลหะ) bitcrush (ลดความลึกของบิตและอัตราตัวอย่างสำหรับกรรม) และ EQ (ตัดความอบอุ่น เพิ่ม mids บนบาง) เริ่มต้นอย่างหลวมๆ ในแต่ละรายการและชั้นจนกว่าตัวละครจะลง

การมอดูเลตแหวนในเสียงหุ่นยนต์คืออะไร?

การมอดูเลตแหวนทำให้สัญญาณเสียงของคุณคูณด้วยโทนคงที่ สร้างแถบข้างโลหะที่ไม่เกิดขึ้นในการพูดตามธรรมชาติ ความถี่ต่ำเพิ่มบัซหรือการสั่นเบา ในขณะที่ความถี่ที่สูงขึ้นสร้างเสียงหุ่นยนต์คลังแคลงแบบคลาสสิกและไม่ประสานกันที่ใช้ในรายการวิทยาศาสตร์นิยมและเกมยุคเก่า

ฉันสามารถใช้ TTS แบบหุ่นยนต์สดบน Discord หรือ OBS ได้หรือไม่?

ใช่ กำหนดเส้นทางเสียงที่ประมวลผลผ่านไมโครโฟนเสมือน จากนั้นเลือกไมโครโฟนเสมือนนั้นเป็นอินพุตใน Discord, OBS หรือแอปเสียงใดๆ เอฟเฟกต์หุ่นยนต์จะถูกใช้แบบเรียลไทม์ ดังนั้นผู้ฟังจึงได้ยินเสียงกลไกแทนที่จะเป็นอินพุตดิบของคุณ

การสังเคราะห์เสียงพูดแบบหุ่นยนต์ฟรีหรือไม่?

เสียง TTS บราวเซอร์จำนวนมากและเครื่องมือเปิดไม่มีค่าใช้จ่ายใดๆ และคุณสามารถเพิ่มเอฟเฟกต์หุ่นยนต์ในตัวแก้ไขฟรีเช่น Audacity แอปพลิเคชันเดสก์ทอปเช่น VoxBooster นำเสนอการทดลองแบบเต็มสามวันโดยไม่ต้องใช้บัตรเครดิตเพื่อให้คุณสามารถทดสอบเสียงหุ่นยนต์สดก่อนที่จะตัดสินใจอะไรก็ได้

เหตุใดเสียงหุ่นยนต์ของฉันจึงฟังดูเหมือนโคลนแทนที่จะเป็นโลหะ?

โดยทั่วไปมีความอบอุ่นที่มีความถี่ต่ำเกินไปที่เหลืออยู่ในสัญญาณ ตัดทุกอย่างต่ำกว่า 200 Hz ลดความแรงของ bitcrush หากมันทำให้รายละเอียดมัวลบ และดันการเพิ่มการดำรงอยู่เล็กน้อยรอบ 3 kHz ลักษณะโลหะอาศัยอยู่ใน mids บน ไม่ใช่ bass ดังนั้นให้บางลง

บทสรุป

การสังเคราะห์เสียงพูดแบบหุ่นยนต์นั้นลดลงเป็นสูตรที่สามารถทำซ้ำได้: เลือกเสียงราบเรียบ ตั้งค่าการหาปริมาณระดับเสียง เพิ่มการมอดูเลตแหวน ความอบอุ่นและ EQ ที่มีรูปร่าง สูตรหกอย่างข้างต้นให้จุดเริ่มต้นที่ทดสอบแล้วสำหรับทุกอย่างจากเกม retro gag ไปจนถึงการบรรยายเบี้ยงอทัยและการสื่อสาร mecha สด คัดลอกสูตร ปรับแต่งการตั้งค่าตามรสชาติ และคุณจะลงจอดเสียง tts หุ่นยนต์ที่สะอาดได้เร็วกว่ามากกว่าการเดา

เมื่อคุณพร้อมรันไลฟ์เหล่านี้ VoxBooster คือตัวเลือกหนึ่งที่ใช้เอฟเฟกต์ทั้งหมดในเวลาจริงบน Windows และกำหนดเส้นทางผ่านไมโครโฟนเสมือนไปยัง Discord, OBS หรือแอปใดๆ โดยใช้การประมวลผลทั้งหมดที่คงอยู่ในเครื่องของคุณ คุณสามารถลองชุดฟีเจอร์ทั้งหมดในการทดลองสามวัน และราคาอยู่บนหน้า ราคา หากคุณตัดสินใจเก็บไว้ ดาวน์โหลด VoxBooster

ลอง VoxBooster — ทดลองใช้ฟรี 3 วัน

โคลนเสียงเรียลไทม์ ซาวด์บอร์ด และเอฟเฟกต์ — ทุกที่ที่คุณคุย

  • ไม่ต้องใช้บัตรเครดิต
  • ความหน่วง ~30ms
  • Discord · Teams · OBS
ลองฟรี 3 วัน