การสังเคราะห์เสียงพูดจริง: ได้เสียงที่เป็นธรรมชาติ

การสังเคราะห์เสียงพูดจริงเริ่มต้นด้วยการเลือกเสียงและวิศวกรรมป้อนข้อมูล เรียนรู้เวิร์กโฟลว์สำหรับ TTS ที่สมจริงและเป็นธรรมชาติ พร้อมทั้งจำกัดความสมจริงของมัน

การสังเคราะห์เสียงพูดจริงเป็นเรื่องของการค้นหาเครื่องมือวิเศษเพียงอันเดียว แต่เป็นเรื่องของการซ้อนการตัดสินใจเล็ก ๆ ที่หลุดหนึ่งหนึ่งหนึ่งออกด้านหุ่นยนต์ คนจำนวนมากวางย่อหน้าลงในเครื่องกำเนิด ฟังเสียงหนึ่งลงตัวและเครื่องกลถ้อยคำ และสรุปว่า TTS ไม่ได้อยู่ที่นั่น โดยปกติเสียงนั้นดี และอินพุตเป็นปัญหา คู่มือนี้จะอธิบายเวิร์กโฟลว์ที่แน่นอนซึ่งแยกเอาต์พุตการสังเคราะห์เสียงธรรมชาติออกจากเอาต์พุตเฉลี่ย: การเลือกเสียงที่เหมาะสม การวิศวกรรมสคริปต์ของคุณเพื่อให้เครื่องมืออ่านแบบที่มนุษย์จะ การสร้างประโยคที่พลาดใหม่ และการรู้จุดที่แม้แต่ TTS ที่ยิ่งใหญ่ก็ยอมแพ้เพื่อให้คุณสามารถสลับเครื่องมือแทนที่จะต่อสู้กับมัน


TL;DR

  • ความสมจริงเป็นสแต็ก: การเลือกเสียง + วิศวกรรมป้อนข้อมูล + การสร้างใหม่ ไม่ใช่การตั้งค่าหนึ่ง
  • เสียงประสาทสมองที่เป็นธรรมชาติแตกต่างจากเสียงเฉลี่ยในลมหายใจ การหยุดชั่วขณะในระดับจุลภาค และการออกเสียงนอกเสียงประโยค
  • เครื่องหมายวรรคตอนคือคำแนะนำเวที: เครื่องหมายจุลภาคพัก จุดตก เครื่องหมายคำถามขึ้น เส้นประ em ลังเล
  • สะกดชื่อยากและคำแบรนด์ออกเสียง ใช้เครื่องหมายเน้นซึ่งได้รับการสนับสนุน
  • แบ่งสคริปต์ของคุณออกและสร้างประโยคอ่อนแอใหม่ทีละรายการแทนการม้วนทั้งหมดกลับ
  • เหนือข้อจำกัดของความสมจริง (หัวเราะ ท้อน การแสดงที่แท้จริง) บันทึกตัวเองและใช้การแปลงเสียง AI แทน

อะไรที่ทำให้การสังเคราะห์เสียงพูดฟังเหมือนสมจริง?

การสังเคราะห์เสียงพูดจริงฟังเหมือนมนุษย์เมื่อคุณสมบัติสามประการสอดคล้องกัน: เสียงประสาทสมองที่สร้างแบบจำลองลมหายใจและจังหวะตามธรรมชาติ สคริปต์อินพุตที่เขียนเพื่อให้เครื่องมือทราบว่าจะหยุดและเน้นที่ใด และการผ่านสุดท้ายที่แก้ไขประโยคที่ลงตัวใดๆ พลาดหนึ่งและภาพลวงตาจะแตกออก

ความผิดพลาดคือการปฏิบัติต่อเครื่องมือเป็นตัวแปรเพียงตัวเดียว สองคนสามารถใช้เสียงเดียวกันทุกประการและได้ผลลัพธ์ที่แตกต่างกันมากเพราะคนหนึ่งเขียนสำหรับเครื่องจักร และอีกคนเขียนสำหรับผู้อ่านมนุษย์ หากคุณต้องการการแยกย่อยที่ลึกยิ่งขึ้นเกี่ยวกับวิธีการตัดสินคุณภาพเอาต์พุตเมื่อคุณมีมัน คู่มือของเราเกี่ยวกับ สิ่งที่แยกการสังเคราะห์เสียงพูดที่ดี จะครอบคลุมเกณฑ์การประเมินโดยละเอียด บทความนี้เป็นอีกครึ่งหนึ่ง: วิธีการสร้างคุณภาพนั้นโดยตั้งใจจริง ๆ

เริ่มต้นด้วยเสียงที่เหมาะสม: เสียงประสาทสมองธรรมชาติเทียบกับเสียงเฉลี่ย

การเลือกเสียงเป็นตัวควบคุมหลักตัวเดียวที่เด่นที่สุด และมันเป็นสิ่งที่คนข้ามไปอย่างรวดเร็วที่สุด เครื่องกำเนิดส่วนใหญ่ฝังเสียงโหล ๆ หรือมากกว่าไว้เบื้องหลังเมนูดรอปดาวน์ และความแตกต่างระหว่างพวกมันไม่ใช่เรื่องเป็นรสนิยม เสียงที่สมจริงจริง ๆ ทำงานพิเศษที่เสียงเฉลี่ยไม่ทำ

ลมหายใจและการหยุดชั่วขณะขนาดเล็ก

ฟังลมหายใจ ผู้พูดจริงหายใจเข้าก่อนประโยคยาว ๆ และหยุดชั่วขณะเล็ก ๆ ระหว่างข้อ โดยไม่คิดถึง เสียงเก่าหรือถูกกว่าข้ามสิ่งนี้ไปโดยสิ้นเชิง สร้างกำแพงเสียงโดยไม่มีอากาศ เสียงประสาทสมองที่ดีที่สุดจะแทรกเสียงลมหายใจเบาบางและการหยุดชั่วขณะในระดับจุลภาคที่ขอบเขตของข้อ และนั่นเพียงอย่างเดียวก็อธิบายสัดส่วนใหญ่ของความสมจริงที่รับรู้ เมื่อคุณทดลองเสียง ให้ป้อนข้อมูลเพื่อให้มีย่อหน้าสองประโยคที่มีจุลภาคตรงกลาง และฟังว่ามันหายใจหรือไม่

การออกเสียงสิ้นประโยค

เสียงเฉลี่ยมีแนวโน้มที่จะสิ้นสุดประโยคแต่ละประโยคบนโน้ตการร่วง เดียวกัน ซึ่งช่วยให้ส่วนยาวนั้นมีความสำนึกว่ามนุษย์อ่าน เสียงที่เป็นธรรมชาติจะเปลี่ยนแปลงโครงสร้างระดับเสียง: มันลดลงอย่างสมบูรณ์บนข้อความที่หนักแน่น ยังคงเพิ่มขึ้นเล็กน้อยเมื่อความคิดดำเนินต่อไปในบรรทัดถัดไป และเพิ่มขึ้นในคำถามที่แท้จริง การออกเสียงสิ้นประโยคนี้เป็นเครื่องหมายส่วนใหญ่ของผู้ฟังตอบสนองโดยไม่สามารถตั้งชื่อให้

ความสอดคล้องตลอดส่วนยาว

เสียงบางอันฟังเหมือนยอดเยี่ยมสำหรับประโยคเดียว จากนั้นลอยตัว เปลี่ยนอายุที่ปรากฏหรือพลังงานทั้งย่อหน้า สำหรับสิ่งใดที่นานกว่าเรื่องแสดง ทดลองด้วยย่อหน้าเต็ม ไม่ใช่บรรทัดเดียว เสียง TTS สมจริงจะรักษาลักษณะของพวกเขาจากคำแรกถึงคำสุดท้าย

เคล็ดลับที่ใช้ได้จริง: รายชื่อย่อเสียงสองสามเสียง รันสคริปต์ทดสอบ 60 คำเดียวกันผ่านแต่ละเสียง และเลือกด้วยตาปิด ผู้ชนะเกือบจะเป็นไปได้เมื่อคุณหยุดอ่านป้ายชื่อ

วิศวกรรมป้อนข้อมูล: การเขียนสคริปต์สำหรับ TTS ที่ฟังเหมือนธรรมชาติ

เมื่อตั้งเสียงแล้ว สคริปต์จะทำส่วนที่เหลือ นี่คือสถานที่ที่ความสมจริงส่วนใหญ่ที่คุณพลาดจริง ๆ อยู่ ลองนึกภาพตัวเองว่ากำลังอำนาจให้นักแสดงคนหนึ่งอ่านทุกสิ่งทั้งปวง: พวกเขาจะทำสิ่งที่หน้าพูด ดังนั้นหน้าจึงต้องบอกพวกเขาสิ่งที่ถูกต้อง

  1. ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ จุลภาคซื้อระยะหยุดชั่วขณะสั้น จุดซื้อการหยุดเต็มที่โดยมีความเสี่ยงต่ำ และเครื่องหมายคำถามยกท้าย เส้นประ em และจุดไข่ปลาเพิ่มความลังเล ประโยคนิยมโดยไม่มีเครื่องหมายวรรคตอนภายในจึงบังคับให้เครื่องมือเดาว่าจะหายใจที่ไหน และมักจะเดาได้ผิด ทำลายมัน Prosody ลีลาและความเน้นของเสียงพูด ส่วนใหญ่ถูกขับเคลื่อนโดยเครื่องหมายเหล่านี้ ดูภาพรวมของ prosody ในภาษาศาสตร์ เพื่อทำไมจังหวะจึงมีความสำคัญมากมาย

  2. ควบคุมจังหวะของย่อหน้า สลับระหว่างความยาวของประโยค บรรทัดสั้นหลังจากยาวแตะหนักกว่า ตรงเหมือนเมื่อคนพูด หากประโยคแต่ละประโยคมีความยาวเท่ากัน เอาต์พุตจะได้รับคุณภาพของเมตรโนม เปลี่ยนแปลงโดยตั้งใจ

  3. สะกดคำยากเสียง ชื่อแบรนด์ ชื่อตัวละคร คำต่างประเทศ และตัวย่อที่ไม่ธรรมดาคือที่ซึ่งเครื่องมือสืบสกปลายตัวเอง ถ้าชื่อดูสมจริง ให้สะกดใหม่วิธีที่ดูเหมือน (“Vox-booster” หรือ “Voks booster” แทนการสะกดให้ถูกต้อง) จนกว่าการออกเสียงจะล็อค สำหรับการควบคุมที่แม่นยำ เครื่องมือบางอันยอมรับอินพุตเสียงตามที่ใช้ ตัวอักษรเสียงนานาชาติ

  4. เพิ่มเครื่องหมายเน้นที่ได้รับการสนับสนุน เครื่องมือจำนวนมากอ่านชุดย่อยของภาษาเครื่องหมายการสังเคราะห์เสียง ซึ่งช่วยให้คุณสามารถแท็กความเน้น การหยุด และจังหวะโดยตรง แม้แต่แท็กเน้นง่ายๆ บนคำเดียวที่มีประโยค ก็สามารถเปลี่ยนการส่งมอบได้ ตรวจสอบว่าเครื่องกำเนิดของคุณเปิดเผย SSML และใช้มันในบรรทัดที่สำคัญที่สุด

  5. เขียนตัวเลขและสัญลักษณ์วิธีที่คุณต้องการให้อ่าน “1990” อาจออกมาเป็นหลักแยก; “หนึ่งพันเก้าร้อยเก้าสิบส” ลบความกำกวม เดียวกับสกุลเงิน เวลา และหน่วย สะกดสิ่งใดก็ตามที่คุณไม่แน่ใจว่าเครื่องมือจะตีความอย่างถูกต้อง

หากคุณต้องการขั้นตอนทีละขั้นเกี่ยวกับการทำงานของเครื่องกำเนิดจากจุดสิ้นสุดไปจนถึงขั้นสุดท้าย จากการเลือกเสียงไปจนถึงการตั้งค่าการส่งออก คู่มือของเราเกี่ยวกับการใช้ เครื่องกำเนิดการสังเคราะห์เสียง AI ครอบคลุมฝั่งอินเตอร์เฟซในขณะที่ส่วนนี้ครอบคลุมฝั่งการเขียน

ชิ้นส่วนและสร้างใหม่: แก้ไขประโยคที่อ่อนแอ

แม้มีเสียงที่ยอดเยี่ยมและสคริปต์ที่สะอาด ประโยคหนึ่งหรือสองประโยคจะออกมาลงตัว การเคลื่อนไหวของมือสมัครเล่นคือการสร้างบล็อกทั้งหมดใหม่และหวัง TTS ที่สมจริงเป็นผ่าตัด

  1. สร้างในชิ้นส่วนสั้น ไม่ใช่บล็อกขนาดใหญ่เพียงอันเดียว ให้เครื่องมือมีย่อหน้าหนึ่งหรือสองหน้า ข้อมูลนำเข้าที่สั้นกว่านั้นง่ายต่อการตรวจสอบและราคาถูกกว่าที่จะหมุนใหม่

  2. ฟังหนึ่งครั้งเพื่อจุดอ่อน มีเกือบทุกครั้งที่ประโยคเดียวสลายจุด: คำออกเสียงผิด การหยุดชั่วขณะในสถานที่ที่ผิด เน้นแปลก ทำเครื่องหมาย

  3. แก้ไขอินพุตก่อน จากนั้นสร้างเฉพาะประโยคนั้นใหม่ เก้าครั้งจากสิบครั้ง ประโยคที่อ่อนแอเป็นปัญหาสคริปต์ ไม่ใช่ปัญหาเสียง เพิ่มจุลภาค สะกดลำเดาลำบ จากนั้นสร้างบรรทัดนั้นอีกครั้ง

  4. รันอินพุตเดียวกันใหม่ถ้าเครื่องมือมีความแปรปรวน เสียงบางเสียงสร้างการโยนที่แตกต่างกันเล็กน้อยทุกครั้ง ถ้าสคริปต์ดีแล้วและเพียงแค่พลาดการโยน ให้สร้างบรรทัดเดียวกันสองหรือสามครั้งและเก็บอันดีที่สุด นี่คือวิธีการบอกเล่าโดยนิยมได้รับการอ่านแบบเต็มหลังคดี

  5. อย่าลืมขยี่ชิ้นส่วนเข้าด้วยกัน ประกอบเสียงสุดท้ายของคุณจากการโยนที่ดีที่สุดของแต่ละชิ้น เพราะคุณสร้างใหม่ที่ระดับประโยค รอยเย็บนั้นไม่ได้ยิน และคุณไม่เคยต้องเล่นการพนันทั้งหมดในลูกเต๋าครั้งเดียว

ลูปชิ้นและสร้างใหม่นี้คือความแตกต่างระหว่าง “พอดีสำหรับร่างแบบ” และสิ่งที่คุณจะเผยแพร่ ใช้เวลาอีกสองสามนาที และลบเครื่องหมายที่เห็นได้ชัดเจนเกือบทั้งหมด

เมื่อการสังเคราะห์เสียงพูดจริงยังคงฟังดูแปลก: ตารางวินิจฉัยอย่างรวดเร็ว

เมื่อบรรทัดไม่ได้ลง การแก้ไขมักจะคาดเดาได้ ใช้สิ่งนี้เพื่อแยกแยะแทนที่จะมองหาอย่างเสียหาย

อาการสาเหตุที่มีแนวโน้มมากที่สุดแก้ไขได้เร็วที่สุด
การส่งมอบแบบลงตัว น่าเบื่อเสียงเฉลี่ยหรือประโยคที่มีความยาวเท่ากันสลับเสียง เปลี่ยนความยาวประโยค
ไม่มีการหยุดชั่วขณะ ไม่หายใจเครื่องหมายวรรคตอนที่หายไปเพิ่มจุลภาคและจุด แบ่งการทำงาน
ชื่อหรือคำศัพท์ที่ออกเสียงผิดการสะกดที่ไม่ธรรมดาสะกดใหม่เสียง
สะกดคำที่ออกเสียงผิดเครื่องมือเดาเน้นเพิ่มเครื่องหมายเน้นหรือปรับโครงสร้างลำดับ
จุดสิ้นสุดหุ่นยนต์บนแต่ละบรรทัดการออกเสียงสิ้นประโยคที่ไม่ดีลองเสียงธรรมชาติมากขึ้น จบคำถามด้วยเครื่องหมายคำถาม
รีบหรือตัดชิ้นส่วนที่ยาวเกินไป ไม่มีตัวแยกย่อหน้าแบ่งออกเป็นชิ้นที่สั้นกว่า
อ่านตัวเลขหรือสัญลักษณ์ผิดการจัดรูปแบบที่กำกวมสะกดตัวเลข เวลา และหน่วย

ส่วนใหญ่เป็นปัญหาอินพุต ซึ่งเป็นข่าวดี: อินพุตเป็นส่วนที่คุณควบคุมได้อย่างสมบูรณ์

ข้อจำกัดของความสมจริง: ที่ซึ่งแม้แต่การสังเคราะห์เสียงพูดจริงที่สุดก็ล้มเหลว

นี่คือขีดจำกัดที่สุจริต มีข้อจำกัด และการผลักดัน TTS ไม่ได้นำคุณข้ามไป เครื่องมือสมัยใหม่ยอดเยี่ยมที่บทบาทกลาง คำอธิบายสงบ และอารมณ์เบา พวกเขาแตกต่างลงไปในชุดเสียงมนุษย์เฉพาะ และไม่มีเครื่องหมายวรรคตอนใดที่จะแก้ไขได้

  • การแสดงที่มีอารมณ์จริง เสียงที่ร้องไห้เพราะความเศร้าโศก ความโกรธที่เพิ่มขึ้น หรือติดลิ้นเพราะหัวเราะ เครื่องมือสามารถประมาณรูปแบบ “เศร้า” ได้ แต่พวกเขาไม่สามารถเล่นฉาก

  • ตัวกลางและปฏิกิริยา “Pfft” คำถามไม่เชื่อ “อะไรนะ!” การหายใจเข้าแรงก่อนข่าวร้าย นี่คือการแสดง ไม่ใช่ข้อความ

  • ความพยายามและเสียงที่ไม่ใช่เสียงพูด ท้อน หัวเราะ กร่ำ หลอกลวง หายใจออกด้วยความเสียใจ เครื่องมือบางอันนัดหมายหัวเราะกระป๋องแต่มันอ่านเป็นกระป๋อง

  • ระยะเวลาที่ตอบสนองต่อช่วงเวลา การหยุดชั่วขณะที่ถูกต้องจับไว้ก่อนบรรทัด punchline ประเภทของการตั้งเวลาที่บุคคลรู้สึก แทนที่จะกำหนดเวลา

สำหรับโครงการการแสดงออกที่อยู่ใกล้ข้อจำกัดนี้ บทความของเราการสังเคราะห์เสียงพูดด้วยการทำงานขุดลึกเพื่อบีบความรู้สึกออกมากขึ้นจากเครื่องมือที่สนับสนุนการควบคุมสไตล์ แต่เมื่อคุณเป็นจริงเหนือข้อจำกัด คำตอบที่ถูกต้องคือหยุดการสร้างเสียงพูดและเริ่มแสดง

ทางเลือกข้างบนข้อจำกัด: บันทึกตัวเองและแปลงเสียง

นี่คือการเคลื่อนไหวที่คนส่วนใหญ่ไม่เคยพิจารณา หากตัวบล็อกเป็นการแสดง ไม่ใช่คุณภาพเสียง ให้จัดเตรียมการแสดงของคุณเองและเปลี่ยนเสียงเท่านั้น นี่คือสิ่งที่การแปลงเสียง AI ทำ: คุณบันทึกบรรทัดด้วยการตั้งเวลา ลมหายใจ หัวเราะ และอารมณ์ของคุณเอง และเครื่องมือเขียนทับ timbre เพื่อให้เหมือนผู้พูดอื่น พร้อมทำให้การแสดงของคุณอยู่ได้

กลไกนั้นง่าย คุณพูดบรรทัดวิธีที่คุณต้องการส่งมอบ ท้อนและทั้งหมด การแปลงจะรักษาการหยุดชั่วขณะในระดับจุลภาค ทุกการพูดอดและการจมของคุณ เพราะสิ่งเหล่านี้อยู่ในเสียงที่คุณให้มัน และแลกเปลี่ยนลักษณะเสียงบน ผลลัพธ์มีความรู้สึกที่เครื่องมือสังเคราะห์เสียงไม่สามารถสร้างได้ เพราะมนุษย์ทำจริง ๆ

VoxBooster เรียกใช้การแปลงนี้บน Windows 10 และ 11 ด้วยการประมวลผลบนอุปกรณ์ที่สมบูรณ์ โดยใช้การโคลนเสียง AI ที่ได้รับการฝึกฝนเพื่อเสียงของคุณเอง สิ่งที่คุณบันทึกไม่ได้ออกจาก PC ของคุณ สำหรับผู้สร้าง มันสำคัญเป็นสองเท่า: การใช้ดิบของคุณยังคงส่วนตัว และการแปลงเกิดขึ้นแบบเรียลไทม์ผ่านไมโครโฟนเสมือน ดังนั้นคุณสามารถแสดงเข้า Discord OBS หรือเครื่องบันทึก และได้ยินเสียงที่แปลงแล้ว ไม่มีไดรเวอร์ kernel ที่ต้องติดตั้ง บทการทดลองเต็มรูปแบบช่วยให้คุณสามารถ A/B ได้รับการแปลงในสคริปต์เดียวกันตรวจสอบ แผนและราคา

กฎปฏิบัติ: ถ้าบรรทัดเป็นบทบาท ใช้การสังเคราะห์เสียงพูดจริง ถ้าบรรทัดต้องการหัวเราะ ตัดหายใจ หรือการตั้งเวลาตลก บันทึกและแปลง โครงการส่วนใหญ่เป็นส่วนผสมของทั้งสอง และใช้เครื่องมือแต่ละอย่างในสิ่งที่ดี ชนะการบังคับหนึ่งให้ทำทั้งหมด

เวิร์กโฟลว์ที่สามารถทำซ้ำได้สำหรับการสังเคราะห์เสียงพูดจริง

ใส่มันทั้งหมดเข้าด้วยกัน และคุณจะได้รายชื่อตรวจสอบที่คุณสามารถเรียกใช้ทุกครั้ง

  1. เสียงการทดลองด้วยย่อหน้าเต็ม รายชื่อย่อ สองหรือสาม เลือกตาปิด และโปรดปรานเสียงที่หายใจได้และแปรผันแปรปรวน

  2. เขียนสำหรับผู้อ่าน ไม่ใช่เครื่องจักร ตัดสินใจเปลี่ยนแปลงความยาวประโยค ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ และเก็บย่อหน้าสั้น

  3. ป้องกันปัญหาการออกเสียง สะกดชื่อและข้อมูลไม่ธรรมดาเสียงก่อนที่จะสร้างอะไร

  4. สร้างในชิ้นส่วน หนึ่งหรือสองย่อหน้าในแต่ละครั้ง ไม่เคยสคริปต์ทั้งหมดในหนึ่งความพยายาม

  5. วินิจฉัยและแก้ไขที่ระดับประโยค ใช้ตารางด้านบน แก้ไขอินพุต จากนั้นสร้างบรรทัดอ่อนเดียว

  6. รู้ข้อจำกัดของคุณ แจกเสาะหา อย่างใดบรรทัดใดก็ตามที่ต้องการความรู้สึกที่แท้จริง หัวเราะ หรือระยะเวลาตลก

  7. ทำให้บรรทัดข้อจำกัด บันทึกสิ่งเหล่านั้นด้วยตัวเองและใช้การแปลงเสียง AI เพื่อให้การแสดงรอดชีวิต

  8. ลวดสลาย ประกอบเสียงสุดท้ายจากชิ้นส่วนที่แข็งแกร่งที่สุดของแต่ละการจัดการ

รันลูปนี้ไม่กี่ครั้ง และมันจะเป็นอัตโนมัติ เอาต์พุตหยุดฟังสร้างขึ้นและเริ่มฟังเหมือนเรื่องราว

FAQ

การสังเคราะห์เสียงพูดจริงที่สุดคืออะไร?

การสังเคราะห์เสียงพูดจริงที่สุดมาจากเสียงประสาทสมองสมัยใหม่ที่สร้างแบบจำลองลมหายใจ การหยุดชั่วขณะในระดับจุลภาค และการออกเสียงนอกเสียงประโยค ไม่มีเครื่องมือใดชนะในแต่ละบรรทัด ดังนั้นความสมจริงจึงขึ้นอยู่กับเสียงที่คุณเลือกและวิธีที่คุณเขียนสคริปต์เท่าๆ กับแบบจำลองพื้นฐาน ทดลองหลายเสียงก่อนตัดสินใจ

ฉันจะทำให้การสังเคราะห์เสียงพูดดูสมจริงมากขึ้นได้อย่างไร?

เลือกเสียงประสาทสมองที่เป็นธรรมชาติ จากนั้นวิศวกรรมอินพุตของคุณ: ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ แบ่งบรรทัดยาวออกเป็นประโยคที่สั้นกว่า สะกดคำยากออกเสียง และเพิ่มเครื่องหมายเน้นที่ได้รับการสนับสนุน สุดท้าย แบ่งสคริปต์ออกและสร้างประโยคที่อ่อนแอใหม่จนกว่าจะได้ผล ความสมจริงเป็นโต้กลับของการแก้ไขขนาดเล็ก ไม่ใช่การตั้งค่าหนึ่ง

ทำไม TTS ของฉันจึงฟังดูเหมือนหุ่นยนต์?

เอาต์พุตที่ฟังดูเหมือนหุ่นยนต์มักมาจากสามสิ่ง: เสียงเก่าหรือคุณภาพต่ำ ประโยคยาวไม่มีเครื่องหมายวรรคตอนเพื่อกำหนดทิศทางเวลา และคำที่ไม่ธรรมดาที่เครื่องมือออกเสียงผิด แก้ไขเสียงก่อน จากนั้นเขียนอินพุตใหม่ด้วยจุลภาค จุด และย่อหน้าที่สั้นชัดเจน ผลลัพธ์หุ่นยนต์ส่วนใหญ่เป็นปัญหาอินพุต ไม่ใช่ข้อจำกัดเครื่องมือ

เครื่องหมายวรรคตอนเปลี่ยนเสียง TTS หรือไม่?

ใช่ จุลภาคสร้างระยะหยุดชั่วขณะ จุดสร้างการหยุดเต็มที่โดยมีโสตศิลป์ที่เน่าเสีย และเครื่องหมายคำถามจะยกเสียงที่ส่วนท้ายของบรรทัด จุดไข่ปลาและเส้นประ em เพิ่มความลังเล การปฏิบัติต่อเครื่องหมายวรรคตอนเป็นคำแนะนำเวทีเป็นหนึ่งในวิธีที่เร็วที่สุดในการได้รับ TTS ที่ฟังดูเป็นธรรมชาติจากเครื่องมือใด ๆ

การสังเคราะห์เสียงพูดสามารถแสดงความรู้สึกที่แท้จริงได้หรือไม่?

เสียงสมัยใหม่ถ่ายทำความรู้สึกที่อ่อนแอผ่านการออกเสียงและจังหวะ และบางเครื่องมือเปิดเผยแท็กสไตล์ แต่การแสดงที่มีอารมณ์จริง หัวเราะ ท้อน และเสียงพยายามยังคงอยู่เหนือข้อจำกัดของความสมจริง สำหรับช่วงเวลานั้น การบันทึกการแสดงของคุณเองและใช้การแปลงเสียง AI เพื่อเปลี่ยน timbre จะทำให้ได้ผลที่ดีกว่าเครื่องกำเนิดใด ๆ

การแปลงเสียงด้วย AI คืออะไร และแตกต่างจาก TTS อย่างไร?

การสังเคราะห์เสียงพูดสร้างเสียงพูดจากข้อความที่เขียน การแปลงเสียง AI ใช้เสียงที่คุณบันทึกไว้แล้วและเปลี่ยนเฉพาะ timbre โดยรักษาเวลา ลมหายใจ และอารมณ์ดั้งเดิมของคุณ เพราะคุณแสดงบรรทัดด้วยตัวเอง การแสดงจึงอยู่รอดในขณะที่เสียงกลายเป็นของคนอื่น มันเป็นเครื่องมือเลือกข้างบนข้อจำกัดของความสมจริง TTS

การสังเคราะห์เสียงพูดจริงฟรีหรือไม่?

เครื่องมือจำนวนมากมีปั้นอิสระพร้อมเสียงธรรมชาติจำนวนจำกัดและอักขระรายเดือน ฝาปิดอักขระที่สูงกว่าและเสียงที่เป็นธรรมชาติที่สุดมักจะเป็นแบบชำระเงิน เครื่องมือบนอุปกรณ์เช่น VoxBooster มีการทดลองฟรีเต็มรูปแบบเพื่อให้คุณสามารถทดสอบคุณภาพการแปลงก่อนที่จะมอบหมาย ตรวจสอบหน้าแผนสำหรับรายละเอียดปัจจุบัน

สรุป

การสังเคราะห์เสียงพูดจริงเป็นกระบวนการที่สามารถทำซ้ำได้ ไม่ใช่การดาวน์โหลดโชค เลือกเสียงที่หายใจและแปรผัน Intonation ของมัน เขียนสคริปต์ของคุณเพื่อให้เครื่องมือทราบว่าจะหยุดและเน้นที่ใด สร้างในชิ้นส่วน และสร้างประโยคที่พลาดใหม่ เมื่อคุณไปถึงข้อจำกัดความสมจริง ซึ่งหัวเราะ ท้อน และการแสดงที่แท้จริงอยู่ หยุดต่อสู้กับเครื่องกำเนิดและเล่นบรรทัดด้วยตัวเอง VoxBooster เป็นตัวเลือกหนึ่งที่นี่: บันทึกเล่นของคุณด้วยอารมณ์ทั้งหมดของมัน และใช้การแปลงเสียง AI บนอุปกรณ์เพื่อเปลี่ยน timbre ในขณะที่การแสดงของคุณยังคงอยู่ได้ สิ่งทั้งหมดที่ประมวลผลบน PC Windows ของคุณด้วยการทดลองฟรีเต็มรูปแบบ ใช้เครื่องมือแต่ละอย่างในสิ่งที่ดี และเสียงของคุณหยุดฟังสังเคราะห์ ดาวน์โหลด VoxBooster

ลอง VoxBooster — ทดลองใช้ฟรี 3 วัน

โคลนเสียงเรียลไทม์ ซาวด์บอร์ด และเอฟเฟกต์ — ทุกที่ที่คุณคุย

  • ไม่ต้องใช้บัตรเครดิต
  • ความหน่วง ~30ms
  • Discord · Teams · OBS
ลองฟรี 3 วัน