การสังเคราะห์เสียงพูดจริงเป็นเรื่องของการค้นหาเครื่องมือวิเศษเพียงอันเดียว แต่เป็นเรื่องของการซ้อนการตัดสินใจเล็ก ๆ ที่หลุดหนึ่งหนึ่งหนึ่งออกด้านหุ่นยนต์ คนจำนวนมากวางย่อหน้าลงในเครื่องกำเนิด ฟังเสียงหนึ่งลงตัวและเครื่องกลถ้อยคำ และสรุปว่า TTS ไม่ได้อยู่ที่นั่น โดยปกติเสียงนั้นดี และอินพุตเป็นปัญหา คู่มือนี้จะอธิบายเวิร์กโฟลว์ที่แน่นอนซึ่งแยกเอาต์พุตการสังเคราะห์เสียงธรรมชาติออกจากเอาต์พุตเฉลี่ย: การเลือกเสียงที่เหมาะสม การวิศวกรรมสคริปต์ของคุณเพื่อให้เครื่องมืออ่านแบบที่มนุษย์จะ การสร้างประโยคที่พลาดใหม่ และการรู้จุดที่แม้แต่ TTS ที่ยิ่งใหญ่ก็ยอมแพ้เพื่อให้คุณสามารถสลับเครื่องมือแทนที่จะต่อสู้กับมัน
TL;DR
- ความสมจริงเป็นสแต็ก: การเลือกเสียง + วิศวกรรมป้อนข้อมูล + การสร้างใหม่ ไม่ใช่การตั้งค่าหนึ่ง
- เสียงประสาทสมองที่เป็นธรรมชาติแตกต่างจากเสียงเฉลี่ยในลมหายใจ การหยุดชั่วขณะในระดับจุลภาค และการออกเสียงนอกเสียงประโยค
- เครื่องหมายวรรคตอนคือคำแนะนำเวที: เครื่องหมายจุลภาคพัก จุดตก เครื่องหมายคำถามขึ้น เส้นประ em ลังเล
- สะกดชื่อยากและคำแบรนด์ออกเสียง ใช้เครื่องหมายเน้นซึ่งได้รับการสนับสนุน
- แบ่งสคริปต์ของคุณออกและสร้างประโยคอ่อนแอใหม่ทีละรายการแทนการม้วนทั้งหมดกลับ
- เหนือข้อจำกัดของความสมจริง (หัวเราะ ท้อน การแสดงที่แท้จริง) บันทึกตัวเองและใช้การแปลงเสียง AI แทน
อะไรที่ทำให้การสังเคราะห์เสียงพูดฟังเหมือนสมจริง?
การสังเคราะห์เสียงพูดจริงฟังเหมือนมนุษย์เมื่อคุณสมบัติสามประการสอดคล้องกัน: เสียงประสาทสมองที่สร้างแบบจำลองลมหายใจและจังหวะตามธรรมชาติ สคริปต์อินพุตที่เขียนเพื่อให้เครื่องมือทราบว่าจะหยุดและเน้นที่ใด และการผ่านสุดท้ายที่แก้ไขประโยคที่ลงตัวใดๆ พลาดหนึ่งและภาพลวงตาจะแตกออก
ความผิดพลาดคือการปฏิบัติต่อเครื่องมือเป็นตัวแปรเพียงตัวเดียว สองคนสามารถใช้เสียงเดียวกันทุกประการและได้ผลลัพธ์ที่แตกต่างกันมากเพราะคนหนึ่งเขียนสำหรับเครื่องจักร และอีกคนเขียนสำหรับผู้อ่านมนุษย์ หากคุณต้องการการแยกย่อยที่ลึกยิ่งขึ้นเกี่ยวกับวิธีการตัดสินคุณภาพเอาต์พุตเมื่อคุณมีมัน คู่มือของเราเกี่ยวกับ สิ่งที่แยกการสังเคราะห์เสียงพูดที่ดี จะครอบคลุมเกณฑ์การประเมินโดยละเอียด บทความนี้เป็นอีกครึ่งหนึ่ง: วิธีการสร้างคุณภาพนั้นโดยตั้งใจจริง ๆ
เริ่มต้นด้วยเสียงที่เหมาะสม: เสียงประสาทสมองธรรมชาติเทียบกับเสียงเฉลี่ย
การเลือกเสียงเป็นตัวควบคุมหลักตัวเดียวที่เด่นที่สุด และมันเป็นสิ่งที่คนข้ามไปอย่างรวดเร็วที่สุด เครื่องกำเนิดส่วนใหญ่ฝังเสียงโหล ๆ หรือมากกว่าไว้เบื้องหลังเมนูดรอปดาวน์ และความแตกต่างระหว่างพวกมันไม่ใช่เรื่องเป็นรสนิยม เสียงที่สมจริงจริง ๆ ทำงานพิเศษที่เสียงเฉลี่ยไม่ทำ
ลมหายใจและการหยุดชั่วขณะขนาดเล็ก
ฟังลมหายใจ ผู้พูดจริงหายใจเข้าก่อนประโยคยาว ๆ และหยุดชั่วขณะเล็ก ๆ ระหว่างข้อ โดยไม่คิดถึง เสียงเก่าหรือถูกกว่าข้ามสิ่งนี้ไปโดยสิ้นเชิง สร้างกำแพงเสียงโดยไม่มีอากาศ เสียงประสาทสมองที่ดีที่สุดจะแทรกเสียงลมหายใจเบาบางและการหยุดชั่วขณะในระดับจุลภาคที่ขอบเขตของข้อ และนั่นเพียงอย่างเดียวก็อธิบายสัดส่วนใหญ่ของความสมจริงที่รับรู้ เมื่อคุณทดลองเสียง ให้ป้อนข้อมูลเพื่อให้มีย่อหน้าสองประโยคที่มีจุลภาคตรงกลาง และฟังว่ามันหายใจหรือไม่
การออกเสียงสิ้นประโยค
เสียงเฉลี่ยมีแนวโน้มที่จะสิ้นสุดประโยคแต่ละประโยคบนโน้ตการร่วง เดียวกัน ซึ่งช่วยให้ส่วนยาวนั้นมีความสำนึกว่ามนุษย์อ่าน เสียงที่เป็นธรรมชาติจะเปลี่ยนแปลงโครงสร้างระดับเสียง: มันลดลงอย่างสมบูรณ์บนข้อความที่หนักแน่น ยังคงเพิ่มขึ้นเล็กน้อยเมื่อความคิดดำเนินต่อไปในบรรทัดถัดไป และเพิ่มขึ้นในคำถามที่แท้จริง การออกเสียงสิ้นประโยคนี้เป็นเครื่องหมายส่วนใหญ่ของผู้ฟังตอบสนองโดยไม่สามารถตั้งชื่อให้
ความสอดคล้องตลอดส่วนยาว
เสียงบางอันฟังเหมือนยอดเยี่ยมสำหรับประโยคเดียว จากนั้นลอยตัว เปลี่ยนอายุที่ปรากฏหรือพลังงานทั้งย่อหน้า สำหรับสิ่งใดที่นานกว่าเรื่องแสดง ทดลองด้วยย่อหน้าเต็ม ไม่ใช่บรรทัดเดียว เสียง TTS สมจริงจะรักษาลักษณะของพวกเขาจากคำแรกถึงคำสุดท้าย
เคล็ดลับที่ใช้ได้จริง: รายชื่อย่อเสียงสองสามเสียง รันสคริปต์ทดสอบ 60 คำเดียวกันผ่านแต่ละเสียง และเลือกด้วยตาปิด ผู้ชนะเกือบจะเป็นไปได้เมื่อคุณหยุดอ่านป้ายชื่อ
วิศวกรรมป้อนข้อมูล: การเขียนสคริปต์สำหรับ TTS ที่ฟังเหมือนธรรมชาติ
เมื่อตั้งเสียงแล้ว สคริปต์จะทำส่วนที่เหลือ นี่คือสถานที่ที่ความสมจริงส่วนใหญ่ที่คุณพลาดจริง ๆ อยู่ ลองนึกภาพตัวเองว่ากำลังอำนาจให้นักแสดงคนหนึ่งอ่านทุกสิ่งทั้งปวง: พวกเขาจะทำสิ่งที่หน้าพูด ดังนั้นหน้าจึงต้องบอกพวกเขาสิ่งที่ถูกต้อง
-
ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ จุลภาคซื้อระยะหยุดชั่วขณะสั้น จุดซื้อการหยุดเต็มที่โดยมีความเสี่ยงต่ำ และเครื่องหมายคำถามยกท้าย เส้นประ em และจุดไข่ปลาเพิ่มความลังเล ประโยคนิยมโดยไม่มีเครื่องหมายวรรคตอนภายในจึงบังคับให้เครื่องมือเดาว่าจะหายใจที่ไหน และมักจะเดาได้ผิด ทำลายมัน Prosody ลีลาและความเน้นของเสียงพูด ส่วนใหญ่ถูกขับเคลื่อนโดยเครื่องหมายเหล่านี้ ดูภาพรวมของ prosody ในภาษาศาสตร์ เพื่อทำไมจังหวะจึงมีความสำคัญมากมาย
-
ควบคุมจังหวะของย่อหน้า สลับระหว่างความยาวของประโยค บรรทัดสั้นหลังจากยาวแตะหนักกว่า ตรงเหมือนเมื่อคนพูด หากประโยคแต่ละประโยคมีความยาวเท่ากัน เอาต์พุตจะได้รับคุณภาพของเมตรโนม เปลี่ยนแปลงโดยตั้งใจ
-
สะกดคำยากเสียง ชื่อแบรนด์ ชื่อตัวละคร คำต่างประเทศ และตัวย่อที่ไม่ธรรมดาคือที่ซึ่งเครื่องมือสืบสกปลายตัวเอง ถ้าชื่อดูสมจริง ให้สะกดใหม่วิธีที่ดูเหมือน (“Vox-booster” หรือ “Voks booster” แทนการสะกดให้ถูกต้อง) จนกว่าการออกเสียงจะล็อค สำหรับการควบคุมที่แม่นยำ เครื่องมือบางอันยอมรับอินพุตเสียงตามที่ใช้ ตัวอักษรเสียงนานาชาติ
-
เพิ่มเครื่องหมายเน้นที่ได้รับการสนับสนุน เครื่องมือจำนวนมากอ่านชุดย่อยของภาษาเครื่องหมายการสังเคราะห์เสียง ซึ่งช่วยให้คุณสามารถแท็กความเน้น การหยุด และจังหวะโดยตรง แม้แต่แท็กเน้นง่ายๆ บนคำเดียวที่มีประโยค ก็สามารถเปลี่ยนการส่งมอบได้ ตรวจสอบว่าเครื่องกำเนิดของคุณเปิดเผย SSML และใช้มันในบรรทัดที่สำคัญที่สุด
-
เขียนตัวเลขและสัญลักษณ์วิธีที่คุณต้องการให้อ่าน “1990” อาจออกมาเป็นหลักแยก; “หนึ่งพันเก้าร้อยเก้าสิบส” ลบความกำกวม เดียวกับสกุลเงิน เวลา และหน่วย สะกดสิ่งใดก็ตามที่คุณไม่แน่ใจว่าเครื่องมือจะตีความอย่างถูกต้อง
หากคุณต้องการขั้นตอนทีละขั้นเกี่ยวกับการทำงานของเครื่องกำเนิดจากจุดสิ้นสุดไปจนถึงขั้นสุดท้าย จากการเลือกเสียงไปจนถึงการตั้งค่าการส่งออก คู่มือของเราเกี่ยวกับการใช้ เครื่องกำเนิดการสังเคราะห์เสียง AI ครอบคลุมฝั่งอินเตอร์เฟซในขณะที่ส่วนนี้ครอบคลุมฝั่งการเขียน
ชิ้นส่วนและสร้างใหม่: แก้ไขประโยคที่อ่อนแอ
แม้มีเสียงที่ยอดเยี่ยมและสคริปต์ที่สะอาด ประโยคหนึ่งหรือสองประโยคจะออกมาลงตัว การเคลื่อนไหวของมือสมัครเล่นคือการสร้างบล็อกทั้งหมดใหม่และหวัง TTS ที่สมจริงเป็นผ่าตัด
-
สร้างในชิ้นส่วนสั้น ไม่ใช่บล็อกขนาดใหญ่เพียงอันเดียว ให้เครื่องมือมีย่อหน้าหนึ่งหรือสองหน้า ข้อมูลนำเข้าที่สั้นกว่านั้นง่ายต่อการตรวจสอบและราคาถูกกว่าที่จะหมุนใหม่
-
ฟังหนึ่งครั้งเพื่อจุดอ่อน มีเกือบทุกครั้งที่ประโยคเดียวสลายจุด: คำออกเสียงผิด การหยุดชั่วขณะในสถานที่ที่ผิด เน้นแปลก ทำเครื่องหมาย
-
แก้ไขอินพุตก่อน จากนั้นสร้างเฉพาะประโยคนั้นใหม่ เก้าครั้งจากสิบครั้ง ประโยคที่อ่อนแอเป็นปัญหาสคริปต์ ไม่ใช่ปัญหาเสียง เพิ่มจุลภาค สะกดลำเดาลำบ จากนั้นสร้างบรรทัดนั้นอีกครั้ง
-
รันอินพุตเดียวกันใหม่ถ้าเครื่องมือมีความแปรปรวน เสียงบางเสียงสร้างการโยนที่แตกต่างกันเล็กน้อยทุกครั้ง ถ้าสคริปต์ดีแล้วและเพียงแค่พลาดการโยน ให้สร้างบรรทัดเดียวกันสองหรือสามครั้งและเก็บอันดีที่สุด นี่คือวิธีการบอกเล่าโดยนิยมได้รับการอ่านแบบเต็มหลังคดี
-
อย่าลืมขยี่ชิ้นส่วนเข้าด้วยกัน ประกอบเสียงสุดท้ายของคุณจากการโยนที่ดีที่สุดของแต่ละชิ้น เพราะคุณสร้างใหม่ที่ระดับประโยค รอยเย็บนั้นไม่ได้ยิน และคุณไม่เคยต้องเล่นการพนันทั้งหมดในลูกเต๋าครั้งเดียว
ลูปชิ้นและสร้างใหม่นี้คือความแตกต่างระหว่าง “พอดีสำหรับร่างแบบ” และสิ่งที่คุณจะเผยแพร่ ใช้เวลาอีกสองสามนาที และลบเครื่องหมายที่เห็นได้ชัดเจนเกือบทั้งหมด
เมื่อการสังเคราะห์เสียงพูดจริงยังคงฟังดูแปลก: ตารางวินิจฉัยอย่างรวดเร็ว
เมื่อบรรทัดไม่ได้ลง การแก้ไขมักจะคาดเดาได้ ใช้สิ่งนี้เพื่อแยกแยะแทนที่จะมองหาอย่างเสียหาย
| อาการ | สาเหตุที่มีแนวโน้มมากที่สุด | แก้ไขได้เร็วที่สุด |
|---|---|---|
| การส่งมอบแบบลงตัว น่าเบื่อ | เสียงเฉลี่ยหรือประโยคที่มีความยาวเท่ากัน | สลับเสียง เปลี่ยนความยาวประโยค |
| ไม่มีการหยุดชั่วขณะ ไม่หายใจ | เครื่องหมายวรรคตอนที่หายไป | เพิ่มจุลภาคและจุด แบ่งการทำงาน |
| ชื่อหรือคำศัพท์ที่ออกเสียงผิด | การสะกดที่ไม่ธรรมดา | สะกดใหม่เสียง |
| สะกดคำที่ออกเสียงผิด | เครื่องมือเดาเน้น | เพิ่มเครื่องหมายเน้นหรือปรับโครงสร้างลำดับ |
| จุดสิ้นสุดหุ่นยนต์บนแต่ละบรรทัด | การออกเสียงสิ้นประโยคที่ไม่ดี | ลองเสียงธรรมชาติมากขึ้น จบคำถามด้วยเครื่องหมายคำถาม |
| รีบหรือตัด | ชิ้นส่วนที่ยาวเกินไป ไม่มีตัวแยกย่อหน้า | แบ่งออกเป็นชิ้นที่สั้นกว่า |
| อ่านตัวเลขหรือสัญลักษณ์ผิด | การจัดรูปแบบที่กำกวม | สะกดตัวเลข เวลา และหน่วย |
ส่วนใหญ่เป็นปัญหาอินพุต ซึ่งเป็นข่าวดี: อินพุตเป็นส่วนที่คุณควบคุมได้อย่างสมบูรณ์
ข้อจำกัดของความสมจริง: ที่ซึ่งแม้แต่การสังเคราะห์เสียงพูดจริงที่สุดก็ล้มเหลว
นี่คือขีดจำกัดที่สุจริต มีข้อจำกัด และการผลักดัน TTS ไม่ได้นำคุณข้ามไป เครื่องมือสมัยใหม่ยอดเยี่ยมที่บทบาทกลาง คำอธิบายสงบ และอารมณ์เบา พวกเขาแตกต่างลงไปในชุดเสียงมนุษย์เฉพาะ และไม่มีเครื่องหมายวรรคตอนใดที่จะแก้ไขได้
-
การแสดงที่มีอารมณ์จริง เสียงที่ร้องไห้เพราะความเศร้าโศก ความโกรธที่เพิ่มขึ้น หรือติดลิ้นเพราะหัวเราะ เครื่องมือสามารถประมาณรูปแบบ “เศร้า” ได้ แต่พวกเขาไม่สามารถเล่นฉาก
-
ตัวกลางและปฏิกิริยา “Pfft” คำถามไม่เชื่อ “อะไรนะ!” การหายใจเข้าแรงก่อนข่าวร้าย นี่คือการแสดง ไม่ใช่ข้อความ
-
ความพยายามและเสียงที่ไม่ใช่เสียงพูด ท้อน หัวเราะ กร่ำ หลอกลวง หายใจออกด้วยความเสียใจ เครื่องมือบางอันนัดหมายหัวเราะกระป๋องแต่มันอ่านเป็นกระป๋อง
-
ระยะเวลาที่ตอบสนองต่อช่วงเวลา การหยุดชั่วขณะที่ถูกต้องจับไว้ก่อนบรรทัด punchline ประเภทของการตั้งเวลาที่บุคคลรู้สึก แทนที่จะกำหนดเวลา
สำหรับโครงการการแสดงออกที่อยู่ใกล้ข้อจำกัดนี้ บทความของเราการสังเคราะห์เสียงพูดด้วยการทำงานขุดลึกเพื่อบีบความรู้สึกออกมากขึ้นจากเครื่องมือที่สนับสนุนการควบคุมสไตล์ แต่เมื่อคุณเป็นจริงเหนือข้อจำกัด คำตอบที่ถูกต้องคือหยุดการสร้างเสียงพูดและเริ่มแสดง
ทางเลือกข้างบนข้อจำกัด: บันทึกตัวเองและแปลงเสียง
นี่คือการเคลื่อนไหวที่คนส่วนใหญ่ไม่เคยพิจารณา หากตัวบล็อกเป็นการแสดง ไม่ใช่คุณภาพเสียง ให้จัดเตรียมการแสดงของคุณเองและเปลี่ยนเสียงเท่านั้น นี่คือสิ่งที่การแปลงเสียง AI ทำ: คุณบันทึกบรรทัดด้วยการตั้งเวลา ลมหายใจ หัวเราะ และอารมณ์ของคุณเอง และเครื่องมือเขียนทับ timbre เพื่อให้เหมือนผู้พูดอื่น พร้อมทำให้การแสดงของคุณอยู่ได้
กลไกนั้นง่าย คุณพูดบรรทัดวิธีที่คุณต้องการส่งมอบ ท้อนและทั้งหมด การแปลงจะรักษาการหยุดชั่วขณะในระดับจุลภาค ทุกการพูดอดและการจมของคุณ เพราะสิ่งเหล่านี้อยู่ในเสียงที่คุณให้มัน และแลกเปลี่ยนลักษณะเสียงบน ผลลัพธ์มีความรู้สึกที่เครื่องมือสังเคราะห์เสียงไม่สามารถสร้างได้ เพราะมนุษย์ทำจริง ๆ
VoxBooster เรียกใช้การแปลงนี้บน Windows 10 และ 11 ด้วยการประมวลผลบนอุปกรณ์ที่สมบูรณ์ โดยใช้การโคลนเสียง AI ที่ได้รับการฝึกฝนเพื่อเสียงของคุณเอง สิ่งที่คุณบันทึกไม่ได้ออกจาก PC ของคุณ สำหรับผู้สร้าง มันสำคัญเป็นสองเท่า: การใช้ดิบของคุณยังคงส่วนตัว และการแปลงเกิดขึ้นแบบเรียลไทม์ผ่านไมโครโฟนเสมือน ดังนั้นคุณสามารถแสดงเข้า Discord OBS หรือเครื่องบันทึก และได้ยินเสียงที่แปลงแล้ว ไม่มีไดรเวอร์ kernel ที่ต้องติดตั้ง บทการทดลองเต็มรูปแบบช่วยให้คุณสามารถ A/B ได้รับการแปลงในสคริปต์เดียวกันตรวจสอบ แผนและราคา
กฎปฏิบัติ: ถ้าบรรทัดเป็นบทบาท ใช้การสังเคราะห์เสียงพูดจริง ถ้าบรรทัดต้องการหัวเราะ ตัดหายใจ หรือการตั้งเวลาตลก บันทึกและแปลง โครงการส่วนใหญ่เป็นส่วนผสมของทั้งสอง และใช้เครื่องมือแต่ละอย่างในสิ่งที่ดี ชนะการบังคับหนึ่งให้ทำทั้งหมด
เวิร์กโฟลว์ที่สามารถทำซ้ำได้สำหรับการสังเคราะห์เสียงพูดจริง
ใส่มันทั้งหมดเข้าด้วยกัน และคุณจะได้รายชื่อตรวจสอบที่คุณสามารถเรียกใช้ทุกครั้ง
-
เสียงการทดลองด้วยย่อหน้าเต็ม รายชื่อย่อ สองหรือสาม เลือกตาปิด และโปรดปรานเสียงที่หายใจได้และแปรผันแปรปรวน
-
เขียนสำหรับผู้อ่าน ไม่ใช่เครื่องจักร ตัดสินใจเปลี่ยนแปลงความยาวประโยค ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ และเก็บย่อหน้าสั้น
-
ป้องกันปัญหาการออกเสียง สะกดชื่อและข้อมูลไม่ธรรมดาเสียงก่อนที่จะสร้างอะไร
-
สร้างในชิ้นส่วน หนึ่งหรือสองย่อหน้าในแต่ละครั้ง ไม่เคยสคริปต์ทั้งหมดในหนึ่งความพยายาม
-
วินิจฉัยและแก้ไขที่ระดับประโยค ใช้ตารางด้านบน แก้ไขอินพุต จากนั้นสร้างบรรทัดอ่อนเดียว
-
รู้ข้อจำกัดของคุณ แจกเสาะหา อย่างใดบรรทัดใดก็ตามที่ต้องการความรู้สึกที่แท้จริง หัวเราะ หรือระยะเวลาตลก
-
ทำให้บรรทัดข้อจำกัด บันทึกสิ่งเหล่านั้นด้วยตัวเองและใช้การแปลงเสียง AI เพื่อให้การแสดงรอดชีวิต
-
ลวดสลาย ประกอบเสียงสุดท้ายจากชิ้นส่วนที่แข็งแกร่งที่สุดของแต่ละการจัดการ
รันลูปนี้ไม่กี่ครั้ง และมันจะเป็นอัตโนมัติ เอาต์พุตหยุดฟังสร้างขึ้นและเริ่มฟังเหมือนเรื่องราว
FAQ
การสังเคราะห์เสียงพูดจริงที่สุดคืออะไร?
การสังเคราะห์เสียงพูดจริงที่สุดมาจากเสียงประสาทสมองสมัยใหม่ที่สร้างแบบจำลองลมหายใจ การหยุดชั่วขณะในระดับจุลภาค และการออกเสียงนอกเสียงประโยค ไม่มีเครื่องมือใดชนะในแต่ละบรรทัด ดังนั้นความสมจริงจึงขึ้นอยู่กับเสียงที่คุณเลือกและวิธีที่คุณเขียนสคริปต์เท่าๆ กับแบบจำลองพื้นฐาน ทดลองหลายเสียงก่อนตัดสินใจ
ฉันจะทำให้การสังเคราะห์เสียงพูดดูสมจริงมากขึ้นได้อย่างไร?
เลือกเสียงประสาทสมองที่เป็นธรรมชาติ จากนั้นวิศวกรรมอินพุตของคุณ: ใช้เครื่องหมายวรรคตอนเป็นคำแนะนำ แบ่งบรรทัดยาวออกเป็นประโยคที่สั้นกว่า สะกดคำยากออกเสียง และเพิ่มเครื่องหมายเน้นที่ได้รับการสนับสนุน สุดท้าย แบ่งสคริปต์ออกและสร้างประโยคที่อ่อนแอใหม่จนกว่าจะได้ผล ความสมจริงเป็นโต้กลับของการแก้ไขขนาดเล็ก ไม่ใช่การตั้งค่าหนึ่ง
ทำไม TTS ของฉันจึงฟังดูเหมือนหุ่นยนต์?
เอาต์พุตที่ฟังดูเหมือนหุ่นยนต์มักมาจากสามสิ่ง: เสียงเก่าหรือคุณภาพต่ำ ประโยคยาวไม่มีเครื่องหมายวรรคตอนเพื่อกำหนดทิศทางเวลา และคำที่ไม่ธรรมดาที่เครื่องมือออกเสียงผิด แก้ไขเสียงก่อน จากนั้นเขียนอินพุตใหม่ด้วยจุลภาค จุด และย่อหน้าที่สั้นชัดเจน ผลลัพธ์หุ่นยนต์ส่วนใหญ่เป็นปัญหาอินพุต ไม่ใช่ข้อจำกัดเครื่องมือ
เครื่องหมายวรรคตอนเปลี่ยนเสียง TTS หรือไม่?
ใช่ จุลภาคสร้างระยะหยุดชั่วขณะ จุดสร้างการหยุดเต็มที่โดยมีโสตศิลป์ที่เน่าเสีย และเครื่องหมายคำถามจะยกเสียงที่ส่วนท้ายของบรรทัด จุดไข่ปลาและเส้นประ em เพิ่มความลังเล การปฏิบัติต่อเครื่องหมายวรรคตอนเป็นคำแนะนำเวทีเป็นหนึ่งในวิธีที่เร็วที่สุดในการได้รับ TTS ที่ฟังดูเป็นธรรมชาติจากเครื่องมือใด ๆ
การสังเคราะห์เสียงพูดสามารถแสดงความรู้สึกที่แท้จริงได้หรือไม่?
เสียงสมัยใหม่ถ่ายทำความรู้สึกที่อ่อนแอผ่านการออกเสียงและจังหวะ และบางเครื่องมือเปิดเผยแท็กสไตล์ แต่การแสดงที่มีอารมณ์จริง หัวเราะ ท้อน และเสียงพยายามยังคงอยู่เหนือข้อจำกัดของความสมจริง สำหรับช่วงเวลานั้น การบันทึกการแสดงของคุณเองและใช้การแปลงเสียง AI เพื่อเปลี่ยน timbre จะทำให้ได้ผลที่ดีกว่าเครื่องกำเนิดใด ๆ
การแปลงเสียงด้วย AI คืออะไร และแตกต่างจาก TTS อย่างไร?
การสังเคราะห์เสียงพูดสร้างเสียงพูดจากข้อความที่เขียน การแปลงเสียง AI ใช้เสียงที่คุณบันทึกไว้แล้วและเปลี่ยนเฉพาะ timbre โดยรักษาเวลา ลมหายใจ และอารมณ์ดั้งเดิมของคุณ เพราะคุณแสดงบรรทัดด้วยตัวเอง การแสดงจึงอยู่รอดในขณะที่เสียงกลายเป็นของคนอื่น มันเป็นเครื่องมือเลือกข้างบนข้อจำกัดของความสมจริง TTS
การสังเคราะห์เสียงพูดจริงฟรีหรือไม่?
เครื่องมือจำนวนมากมีปั้นอิสระพร้อมเสียงธรรมชาติจำนวนจำกัดและอักขระรายเดือน ฝาปิดอักขระที่สูงกว่าและเสียงที่เป็นธรรมชาติที่สุดมักจะเป็นแบบชำระเงิน เครื่องมือบนอุปกรณ์เช่น VoxBooster มีการทดลองฟรีเต็มรูปแบบเพื่อให้คุณสามารถทดสอบคุณภาพการแปลงก่อนที่จะมอบหมาย ตรวจสอบหน้าแผนสำหรับรายละเอียดปัจจุบัน
สรุป
การสังเคราะห์เสียงพูดจริงเป็นกระบวนการที่สามารถทำซ้ำได้ ไม่ใช่การดาวน์โหลดโชค เลือกเสียงที่หายใจและแปรผัน Intonation ของมัน เขียนสคริปต์ของคุณเพื่อให้เครื่องมือทราบว่าจะหยุดและเน้นที่ใด สร้างในชิ้นส่วน และสร้างประโยคที่พลาดใหม่ เมื่อคุณไปถึงข้อจำกัดความสมจริง ซึ่งหัวเราะ ท้อน และการแสดงที่แท้จริงอยู่ หยุดต่อสู้กับเครื่องกำเนิดและเล่นบรรทัดด้วยตัวเอง VoxBooster เป็นตัวเลือกหนึ่งที่นี่: บันทึกเล่นของคุณด้วยอารมณ์ทั้งหมดของมัน และใช้การแปลงเสียง AI บนอุปกรณ์เพื่อเปลี่ยน timbre ในขณะที่การแสดงของคุณยังคงอยู่ได้ สิ่งทั้งหมดที่ประมวลผลบน PC Windows ของคุณด้วยการทดลองฟรีเต็มรูปแบบ ใช้เครื่องมือแต่ละอย่างในสิ่งที่ดี และเสียงของคุณหยุดฟังสังเคราะห์ ดาวน์โหลด VoxBooster