Tổng hợp tiếng nói thực tế ít liên quan đến việc tìm ra một công cụ ma thuật và nhiều hơn là xếp chồng các quyết định nhỏ mà mỗi quyết định loại bỏ một chút cạnh robot. Rất nhiều người dán một đoạn vào một bộ tạo, nghe thấy cái gì đó bằng phẳng và cơ học, và kết luận rằng TTS không ở đó. Thường là giọng nói tốt và đầu vào là vấn đề. Hướng dẫn này đi qua quy trình làm việc chính xác tách riêng đầu ra tổng hợp tiếng nói tự nhiên từ đầu ra trung bình: chọn giọng nói phù hợp, kỹ thuật kịch bản của bạn để công cụ đọc nó giống như một người sẽ, tạo lại các câu bị bỏ lỡ và biết điểm mà thậm chí TTS tuyệt vời cũng từ bỏ để bạn có thể chuyển công cụ thay vì chiến đấu với nó.
TL;DR
- Thực tế là một chồng: lựa chọn giọng nói + kỹ thuật input + tạo lại, không phải một cài đặt.
- Các giọng nói thần kinh tự nhiên khác với các giọng nói trung bình ở chỗ hơi thở, tạm dừng vi mô và ngữ điệu cuối câu.
- Dấu câu là hướng dẫn sân khấu: dấu phẩy tạm dừng, dấu chấm rơi, dấu chấm hỏi tăng, dấu gạch ngang em do dự.
- Viết chính tả các tên khó và các từ thương hiệu bằng cách phát âm; sử dụng các dấu nhấn mạnh nơi được hỗ trợ.
- Chia kịch bản của bạn thành các phần và tạo lại các câu yếu từng cái một thay vì cuộn lại toàn bộ.
- Phía trên giới hạn thực tế (tiếng cười, thở dài, diễn xuất thực), ghi âm chính mình và sử dụng chuyển đổi giọng nói AI thay thế.
Điều gì làm cho tổng hợp tiếng nói nghe thực tế?
Tổng hợp tiếng nói thực tế nghe như con người khi ba phẩm chất hợp nhất: một giọng nói thần kinh mô phỏng hơi thở và tốc độ tự nhiên, một kịch bản input được viết để công cụ biết ở đâu để tạm dừng và nhấn, và một lần chuyển cuối cùng sửa bất kỳ câu nào bằng phẳng. Bỏ lỡ một và ảo tưởng sẽ vỡ.
Sai lầm là coi công cụ là biến duy nhất. Hai người có thể sử dụng chính xác cùng giọng nói và nhận được kết quả rất khác nhau vì một người đã viết cho máy và người kia cho độc giả con người. Nếu bạn muốn một phần tính toán sâu hơn về cách đánh giá chất lượng output sau khi bạn có nó, hướng dẫn của chúng tôi về điều gì tách riêng tổng hợp tiếng nói tuyệt vời bao gồm các tiêu chí đánh giá chi tiết. Bài viết này là một nửa khác: cách thực sự sản xuất chất lượng đó một cách có ý định.
Bắt đầu với giọng nói phù hợp: giọng nói thần kinh tự nhiên vs. trung bình
Lựa chọn giọng nói là tay cơ chế duy nhất lớn nhất, và đó là cái mà mọi người bỏ qua nhanh nhất. Hầu hết các bộ tạo chôn một tá hoặc nhiều giọng nói đằng sau một menu thả xuống, và sự khác biệt giữa chúng không phải là mỹ phẩm. Một giọng nói thực sự tự nhiên làm công việc bổ sung mà một giọng nói trung bình không làm.
Hơi thở và tạm dừng vi mô
Hãy lắng nghe hơi thở. Những người nói chuyện con người hít vào trước các câu dài và thở dài trong những khoảng tạm dừng nhỏ giữa các mệnh đề mà không cần suy nghĩ. Các giọng nói cũ hơn hoặc rẻ hơn hoàn toàn bỏ qua điều này, tạo ra một bức tường âm thanh không có không khí. Các giọng nói thần kinh tốt nhất chèn những tiếng hơi thở mờ nhạt và tạm dừng vi mô ở ranh giới mệnh đề, và chỉ riêng điều đó chiếm một phần khổng lồ của thực tế cảm thấy. Khi bạn phỏng vấn một giọng nói, cho nó một đoạn hai câu với dấu phẩy ở giữa và lắng nghe xem nó có thở không.
Ngữ điệu cuối câu
Các giọng nói trung bình có xu hướng kết thúc mỗi câu trên cùng một ghi chú giảm, điều này mang lại cho những đoạn dài cảm giác được đọc bởi một máy móc. Một giọng nói tự nhiên thay đổi sự ngoại hình của cao độ: nó rơi hoàn toàn trên một tuyên bố cứng, vẫn được nâng cao một chút khi một suy nghĩ tiếp tục vào dòng tiếp theo, và tăng lên trên một câu hỏi thực sự. Ngữ điệu cuối câu này là lời khai khiến hầu hết các người nghe phản ứng mà không thể đặt tên cho nó.
Tính nhất quán trong một đoạn dài
Một số giọng nói nghe tuyệt vời cho một câu và sau đó trôi dạt, thay đổi tuổi biểu kiến hoặc năng lượng trong toàn bộ một đoạn. Đối với bất cứ điều gì dài hơn một chú thích, phỏng vấn với một đoạn đầy đủ, không phải một dòng duy nhất. Các giọng nói TTS thực tế giữ nhân vật của họ từ từ đầu tiên đến từ cuối cùng.
Một mẹo thực tế: danh sách ngắn hai hoặc ba giọng nói, chạy cùng một kịch bản thử nghiệm 60 từ qua mỗi kịch bản, và chọn với mắt nhắm. Người chiến thắng gần như luôn hiển nhiên khi bạn ngừng đọc nhãn.
Kỹ thuật input: viết kịch bản cho TTS nghe tự nhiên
Sau khi giọng nói được đặt, kịch bản làm phần còn lại. Đây là nơi hầu hết thực tế mà bạn bỏ lỡ thực sự sống. Hãy tưởng tượng bản thân bạn đang hướng dẫn một diễn viên đọc mọi thứ một cách theo nghĩa đen: họ sẽ làm chính xác những gì trang nói, vì vậy trang phải nói với họ những điều đúng.
-
Sử dụng dấu câu làm hướng dẫn. Dấu phẩy cho bạn một tạm dừng ngắn, dấu chấm cho bạn một dừng đầy đủ với cao độ giảm, và dấu chấm hỏi nâng cao kết thúc. Dấu gạch ngang em và dấu chấm lửng thêm sự do dự. Một câu chạy mà không có dấu câu nội bộ buộc công cụ phải đoán ở đâu để thở, và nó thường đoán sai. Phá vỡ nó. Prosody, nhịp và nhấn của lời nói, phần lớn được điều khiển bởi các dấu hiệu này; xem tổng quan về prosody trong ngôn ngữ học để hiểu lý do tại sao tốc độ mang nhiều ý nghĩa.
-
Kiểm soát nhịp điệu đoạn. Xen kẽ độ dài câu. Một dòng ngắn sau một dòng dài rơi cứng hơn, chính xác như khi một người nói chuyện. Nếu mỗi câu có cùng độ dài, đầu ra có một chất lượng metronome. Thay đổi nó một cách có ý định.
-
Viết chính tả các từ khó một cách phát âm. Tên thương hiệu, tên ký tự, từ lạ, và từ viết tắt không thường xuyên là nơi các công cụ làm xấu hổ. Nếu một tên đọc sai, hãy viết lại cách nó nghe (“Vox-booster” hoặc “Voks booster” thay vì chính tả chính xác) cho đến khi phát âm bị khoá. Để kiểm soát chính xác, một số công cụ chấp nhận đầu vào phát âm dựa trên Bảng chữ cái Phát âm Quốc tế.
-
Thêm các dấu nhấn mạnh nơi được hỗ trợ. Nhiều công cụ đọc một tập con của Ngôn ngữ Biên tập Tổng hợp Lời nói, cho phép bạn gắn thẻ nhấn, tạm dừng, và tốc độ trực tiếp. Thậm chí một thẻ nhấn mạnh đơn giản trên từ duy nhất mang một câu có thể chuyển đổi việc cung cấp. Kiểm tra xem bộ tạo của bạn có tiếp xúc SSML không và sử dụng nó trên các dòng quan trọng nhất.
-
Viết các số và ký hiệu cách bạn muốn chúng được đọc. “1990” có thể xuất hiện dưới dạng các chữ số riêng biệt; “những năm 1990” loại bỏ sự mơ hồ. Cũng giống với tiền tệ, thời gian, và đơn vị. Viết chính tả bất cứ điều gì bạn không chắc chắn công cụ sẽ diễn giải chính xác.
Nếu bạn muốn một hướng dẫn từng bước về cách vận hành một bộ tạo từ đầu đến cuối, từ lựa chọn giọng nói đến cài đặt xuất, hướng dẫn của chúng tôi về việc sử dụng một bộ tạo tổng hợp tiếng nói AI bao gồm phía giao diện trong khi phần này bao gồm phía viết.
Chia nhỏ và tạo lại: sửa các câu yếu
Thậm chí với một giọng nói tuyệt vời và một kịch bản sạch sẽ, một hoặc hai câu sẽ ra ngoài bằng phẳng. Động tác nghiệp dư là tạo lại toàn bộ khối và hy vọng. Động tác TTS thực tế là phẫu thuật.
-
Tạo những mảnh ngắn, không phải một khối khổng lồ. Cho công cụ một hoặc hai đoạn tại một thời điểm. Các đầu vào ngắn hơn dễ dàng để xem xét lại và rẻ hơn để cuộn lại.
-
Hãy lắng nghe một lần cho điểm yếu. Gần như luôn có một câu duy nhất phá vỡ cây phép thuật: một từ phát âm sai, một tạm dừng ở nơi sai, một nhấn lạ. Đánh dấu nó.
-
Sửa đầu vào trước tiên, sau đó tạo lại chỉ câu đó. Chín lần trong mười câu yếu là một vấn đề kịch bản, không phải vấn đề giọng nói. Thêm dấu phẩy, viết lại từ, chia mệnh đề, sau đó tạo lại dòng đó một mình.
-
Chạy lại cùng một đầu vào nếu công cụ có sự biến đổi. Một số giọng nói tạo ra những lần chơi hơi khác nhau mỗi lần. Nếu kịch bản đã tốt và lần chơi vừa bỏ lỡ, hãy tạo cùng một dòng hai hoặc ba lần và giữ dòng tốt nhất. Đây là cách những người kể chuyện im lặng nhận những bản đọc dài đầy đủ sạch sẽ.
-
Khâu các mảnh lại với nhau. Lắp ráp âm thanh cuối cùng của bạn từ lần chơi tốt nhất của mỗi mảnh. Vì bạn tạo lại ở cấp độ câu, những đường may là vô thính và bạn không bao giờ phải đặt cược một đoạn toàn bộ trên một cuộn.
Vòng lặp cắt và tạo lại này là sự khác biệt giữa “đủ tốt cho bản nháp” và một cái gì đó bạn sẽ xuất bản. Nó mất một vài phút thêm và loại bỏ gần như tất cả các dấu hiệu rõ ràng.
Khi tổng hợp tiếng nói thực tế vẫn nghe có vẻ off: bảng chẩn đoán nhanh
Khi một dòng không đáp ứng, sự sửa chữa thường là có thể dự đoán. Sử dụng cái này để phân loại thay vì tạo lại mù quáng.
| Triệu chứng | Nguyên nhân có khả năng nhất | Sửa chữa nhanh nhất |
|---|---|---|
| Giao hàng bằng phẳng, buồn tẻ | Giọng nói trung bình hoặc câu có cùng độ dài | Đổi giọng nói; thay đổi độ dài câu |
| Không tạm dừng, không thở | Dấu câu bị thiếu | Thêm dấu phẩy và dấu chấm; chia chạy trên |
| Tên hoặc thuật ngữ phát âm sai | Chính tả không thường xuyên | Viết lại bằng cách phát âm |
| Từ được nhấn mạnh sai | Công cụ đoán nhấn | Thêm dấu nhấn mạnh hoặc cấu trúc lại mệnh đề |
| Kết thúc giống như robot ở mỗi dòng | Ngữ điệu cuối câu tồi tệ | Hãy thử một giọng nói tự nhiên hơn; kết thúc các câu hỏi bằng dấu chấm hỏi |
| Vội vàng hoặc cắt | Mảnh quá dài, không có dòng đoạn | Phá vỡ thành những mảnh ngắn hơn |
| Đọc chữ số hoặc ký hiệu sai | Định dạng mơ hồ | Viết chính tả các số, thời gian, và đơn vị |
Hầu hết chúng là vấn đề đầu vào, đó là tin tốt: đầu vào là phần bạn hoàn toàn kiểm soát.
Giới hạn thực tế: nơi thậm chí tổng hợp tiếng nói thực tế nhất cũng thất bại
Đây là giới hạn trung thực. Có một giới hạn, và đẩy mạnh hơn trên TTS không đưa bạn qua nó. Các công cụ hiện đại tuyệt vời ở việc thuật lại trung lập, giải thích bình tĩnh, và cảm xúc nhẹ. Họ sụp đổ trên một bộ cụ thể của các âm thanh con người, và không có dấu câu nào sẽ khắc phục điều đó.
- Diễn xuất cảm xúc thực sự. Một giọng nói tróc vỏ với nỗi buồn thực sự, sự phẫn nộ gia tăng, hoặc tiếng cười bị giữ chặt. Các công cụ có thể xấp xỉ một phong cách “buồn”, nhưng họ không thể chơi một cảnh.
- Lời xen vào và phản ứng. “Pfft”, câu hỏi hoài nghi “cái gì?!”, hít vào sắc nét trước tin xấu. Đây là hiệu suất, không phải văn bản.
- Nỗ lực và âm thanh không phải lời nói. Thở dài, cười, rên, thở hơi, một hơi thở sốt ruột. Một số công cụ làm giả một tiếng cười đóng hộp, nhưng nó đọc làm đóng hộp.
- Thời gian phản ứng với một khoảnh khắc. Một tạm dừng hoàn hảo được giữ trước một dòng punchline, loại thời gian một người cảm thấy hơn là được lên lịch.
Đối với các dự án biểu cảm sống gần với giới hạn này, bài viết của chúng tôi về tổng hợp tiếng nói với exertion đào sâu để nén nhiều cảm giác hơn từ các công cụ hỗ trợ kiểm soát kiểu. Nhưng khi bạn thực sự vượt quá giới hạn, câu trả lời đúng là ngừng tạo lời nói và bắt đầu thực hiện nó.
Sự thay thế trên giới hạn: ghi âm chính mình và chuyển đổi giọng nói
Đây là động tác hầu hết mọi người không bao giờ xem xét. Nếu bộ chặn là diễn xuất, không phải chất lượng âm thanh, cung cấp diễn xuất chính mình và chỉ thay đổi giọng nói. Đó là những gì chuyển đổi giọng nói AI làm: bạn ghi âm một dòng với thời gian, hơi thở, tiếng cười, và cảm xúc của riêng bạn, và công cụ viết lại timbre để nó nghe như một người nói khác trong khi giữ cho hiệu suất của bạn nguyên vẹn.
Cơ học rất đơn giản. Bạn nói dòng cách bạn muốn nó được cung cấp, thở dài và tất cả. Chuyển đổi bảo tồn mỗi tạm dừng vi mô và mỗi lần tăng và giảm bạn thực hiện, vì những điều này sống trong âm thanh bạn đã cho nó, và trao đổi ký tự giọng nói ở trên cùng. Kết quả mang cảm xúc mà không có công cụ tổng hợp tiếng nói nào có thể tạo ra, vì một con người thực sự đã chơi nó.
VoxBooster chạy chuyển đổi này trên Windows 10 và 11 với xử lý hoàn toàn trên thiết bị, sử dụng sao chép giọng nói AI được đào tạo trên giọng nói của riêng bạn. Không có gì bạn ghi âm rời khỏi PC của bạn. Đối với các nhà sáng tạo, điều đó quan trọng hai lần: các bản thô của bạn vẫn riêng tư, và chuyển đổi xảy ra theo thời gian thực qua một micrô ảo, vì vậy bạn có thể thực hiện vào Discord, OBS, hoặc một bộ ghi âm và nghe giọng nói được chuyển đổi trực tiếp. Không có trình điều khiển hạt nhân để cài đặt. Bản dùng thử đầy đủ cho phép bạn A/B một bản chuyển đổi so với một bản TTS trên cùng kịch bản trước khi bạn nhìn vào kế hoạch và giá cả.
Quy tắc thực tế: nếu dòng là lời kể chuyện, hãy sử dụng tổng hợp tiếng nói thực tế. Nếu dòng cần một tiếng cười, một sự phá vỡ giọng nói, hoặc thời gian hài kịch, ghi âm và chuyển đổi. Hầu hết các dự án thực sự là một hỗn hợp của cả hai, và sử dụng mỗi công cụ cho những gì tốt đánh bại buộc một để làm mọi thứ.
Quy trình làm việc có thể lặp lại cho tổng hợp tiếng nói thực tế
Đặt tất cả lại với nhau và bạn nhận được một danh sách kiểm tra bạn có thể chạy mỗi lần.
- Phỏng vấn giọng nói với một đoạn đầy đủ. Danh sách ngắn hai hoặc ba, chọn với mắt nhắm, và ưu tiên cái có thở dài nghe rõ và ngữ điệu thay đổi.
- Viết cho độc giả, không phải máy. Thay đổi độ dài câu, sử dụng dấu câu làm hướng dẫn, và giữ các đoạn ngắn.
- Đặt trước các vấn đề phát âm. Viết lại các tên và các thuật ngữ không thường xuyên một cách phát âm trước khi tạo bất cứ điều gì.
- Tạo bằng những mảnh. Một hoặc hai đoạn tại một thời điểm, không bao giờ toàn bộ kịch bản trong một phiên.
- Chẩn đoán và sửa ở cấp độ câu. Sử dụng bảng ở trên; sửa đầu vào, sau đó tạo lại dòng yếu duy nhất.
- Biết giới hạn của bạn. Gắn cờ bất kỳ dòng nào cần cảm xúc thực, tiếng cười, hoặc thời gian hài kịch.
- Thực hiện các dòng giới hạn. Ghi âm những điều đó bằng chính mình và sử dụng chuyển đổi giọng nói AI để diễn xuất sống sót.
- Khâu những bản chơi tốt nhất. Lắp ráp âm thanh cuối cùng từ mảnh mạnh nhất của mỗi lần vượt qua.
Chạy vòng lặp này một vài lần và nó trở thành tự động. Đầu ra berhenti breng tạo ra và bắt đầu nghe như lời kể chuyện.
FAQ
Tổng hợp tiếng nói thực tế nhất là gì?
Tổng hợp tiếng nói thực tế nhất đến từ các giọng nói thần kinh hiện đại mô phỏng hơi thở, tạm dừng vi mô và ngữ điệu cuối câu. Không có công cụ nào chiến thắng ở mỗi dòng, vì vậy sự thực tế phụ thuộc vào giọng nói bạn chọn và cách bạn viết kịch bản cũng như mô hình cơ bản. Kiểm tra một vài giọng nói trước khi quyết định.
Làm thế nào tôi có thể làm cho tổng hợp tiếng nói nghe thực tế hơn?
Chọn một giọng nói thần kinh tự nhiên, sau đó kỹ thuật input của bạn: sử dụng dấu câu làm hướng dẫn, chia các dòng dài thành các câu ngắn hơn, viết chính tả các từ khó phát âm, và thêm các dấu nhấn mạnh nơi được hỗ trợ. Cuối cùng, chia kịch bản thành các phần và tạo lại các câu yếu cho đến khi nó hoạt động. Thực tế là một chồng những sửa chữa nhỏ, không phải một cài đặt.
Tại sao TTS của tôi nghe có vẻ giống như robot?
Đầu ra như robot thường đến từ ba điều: một giọng nói cũ hoặc kém chất lượng, các câu dài mà không có dấu câu để hướng dẫn tốc độ, và các từ không thường xuyên mà công cụ phát âm sai. Sửa giọng nói trước tiên, sau đó viết lại input với dấu phẩy, dấu chấm và các đoạn ngắn rõ ràng. Hầu hết các kết quả nghe như robot là vấn đề input, không phải giới hạn công cụ.
Dấu câu có thay đổi âm thanh TTS không?
Có. Dấu phẩy tạo thành những tạm dừng ngắn, dấu chấm tạo thành những dừng đầy đủ với ngữ điệu giảm, và dấu chấm hỏi nâng cao cao độ ở cuối dòng. Dấu chấm lửng và dấu gạch ngang em cộng thêm sự do dự. Coi dấu câu là hướng dẫn sân khấu là một trong những cách nhanh nhất để có TTS nghe tự nhiên từ công cụ bất kỳ.
Tổng hợp tiếng nói có thể thể hiện cảm xúc thực sự không?
Các giọng nói hiện đại truyền đạt cảm xúc nhẹ nhàng thông qua ngữ điệu và tốc độ, và một số công cụ tiếp xúc các thẻ kiểu. Nhưng diễn xuất cảm xúc thực sự, tiếng cười, thở dài và âm thanh cố gắng vẫn nằm trên giới hạn thực tế. Trong những lúc đó, ghi âm hiệu suất của bạn và sử dụng chuyển đổi giọng nói AI để thay đổi timbre hoạt động tốt hơn so với bất kỳ bộ tạo nào.
Chuyển đổi giọng nói AI là gì và nó khác với TTS như thế nào?
Tổng hợp tiếng nói tạo ra lời nói từ văn bản viết. Chuyển đổi giọng nói AI lấy âm thanh bạn đã ghi âm và chỉ thay đổi timbre, giữ lại thời gian, hơi thở và cảm xúc ban đầu của bạn. Vì bạn thực hiện dòng này, diễn xuất sống sót trong khi giọng nói trở thành của người khác. Đây là công cụ lựa chọn trên giới hạn thực tế TTS.
Tổng hợp tiếng nói thực tế có miễn phí không?
Nhiều công cụ cung cấp một lớp miễn phí với số lượng giọng nói tự nhiên hạn chế và ký tự hàng tháng. Giới hạn ký tự cao hơn và các giọng nói tự nhiên nhất thường phải trả tiền. Các công cụ trên thiết bị như VoxBooster cung cấp một bản dùng thử đầy đủ để bạn có thể kiểm tra chất lượng chuyển đổi trước khi cam kết. Kiểm tra trang kế hoạch để biết chi tiết hiện tại.
Kết luận
Tổng hợp tiếng nói thực tế là một quá trình có thể lặp lại, không phải tải xuống may mắn. Chọn một giọng nói mà hít hơi và thay đổi ngữ điệu của nó, viết kịch bản của bạn để công cụ biết ở đâu để tạm dừng và nhấn, tạo bằng những mảnh, và tạo lại các câu bị bỏ lỡ. Khi bạn đạt đến giới hạn thực tế, nơi tiếng cười, thở dài, và diễn xuất thực sự sống, ngừng chiến đấu với bộ tạo và chơi dòng chính mình. VoxBooster là một tùy chọn ở đó: ghi âm bản chơi của bạn với tất cả cảm xúc của nó và sử dụng chuyển đổi giọng nói AI trên thiết bị để thay đổi timbre trong khi hiệu suất của bạn vẫn nguyên vẹn, tất cả được xử lý trên PC Windows của bạn với một bản dùng thử đầy đủ. Sử dụng mỗi công cụ cho những gì tốt nhất và âm thanh của bạn ngừng nghe tổng hợp. Tải xuống VoxBooster.