Trình tạo giọng nói AI cho các nhân vật: Hướng dẫn thực tế
Trình tạo giọng nói AI cho các nhân vật là cách nhanh nhất cho một nhà sáng tạo độc lập để trao cho toàn bộ dàn diễn viên các giọng nói riên biệt và nhất quán mà không cần thuê một phòng diễn viên. Dù bạn đang xây dựng trò chơi, tạo hoạt ảnh một video ngắn, kể lại sách nói, điều hành chiến dịch chơi trò chơi bàn cờ hay điều hành một nhóm VTuber, thử thách vẫn giống nhau: mỗi nhân vật cần nghe như một người cụ thể, và cần nghe giống hệt như cùng một người mỗi lần. Hướng dẫn này bao gồm những gì trình tạo giọng nói nhân vật thực sự làm, cách thiết kế một dàn diễn viên có uy tín và cách xây dựng các cài đặt sẵn nhân vật có thể tái sử dụng từng bước.
TL;DR
- Trình tạo giọng nói nhân vật tạo ra các giọng nói riên biệt và có thể lặp lại cho mỗi thành viên dàn diễn viên bằng cách sử dụng tổng hợp lời nói, điều chỉnh pitch và formant, chuỗi hiệu ứng hoặc chuyển đổi giọng nói của chính bạn.
- Các nhân vật riên biệt đến từ việc thay đổi pitch, formant, tốc độ, âm sắc trung lập theo giọng điệu và hiệu ứng, không phải từ việc di chuyển một thanh trượt.
- Lưu mỗi nhân vật dưới dạng cài đặt sẵn được đặt tên là những gì giữ một giọng nói nhất quán qua các phiên, tập phim và tháng.
- Các nhân vật không phải con người (robot, quái vật, ma) được xây dựng bằng cách xếp chồng các hiệu ứng như ring modulation, reverb và distortion lên trên giọng nói cơ bản.
- VoxBooster chạy một mô hình cục bộ trên thiết bị trên Windows 10/11, vì vậy bạn có thể tạo ngoại tuyến, định tuyến giọng nói đến micrô ảo trực tiếp hoặc xuất âm thanh để xử lý sau sản xuất.
- Chỉ tạo giọng nói độc lập hoặc được đồng ý; không bao giờ nhân bản một người thực hoặc nhân vật được bảo vệ bản quyền để giả mạo họ.
Trình tạo giọng nói nhân vật thực sự làm gì?
Trình tạo giọng nói nhân vật là phần mềm tạo ra một hoặc nhiều giọng nói riên biệt và nhất quán dự định đại diện cho các thành viên dàn diễn viên kịch tính riêng lẻ, bằng cách tổng hợp lời nói từ văn bản hoặc chuyển đổi giọng nói hiện tại, sau đó định hình kết quả bằng pitch, formant, tốc độ và hiệu ứng. Thay vì một giọng nói kể chuyện duy nhất, nó cho phép bạn xác định một anh hùng, một ác nhân, một trợ tá và một người kể chuyện dưới dạng các cài đặt sẵn riêng biệt, mỗi cái có âm sắc của riêng nó. Trình tạo xử lý âm thanh; bạn xử lý các quyết định đúc.
Sự khác biệt này rất quan trọng bởi vì hai phần khó của công việc nhân vật là sự đa dạng và tính nhất quán. Sự đa dạng có nghĩa là mỗi nhân vật có thể phân biệt được ngay lập tức chỉ bằng tai nghe, thậm chí trong một cảnh đối thoại nhanh tới lui. Tính nhất quán có nghĩa là kẻ ác ở tập một nghe giống hệt với kẻ ác ở tập mười hai, được ghi lại cách nhau hàng tháng. Một trình tạo giọng nói nhân vật tốt giải quyết cả hai bằng cách cung cấp cho bạn kiểm soát độc lập trên các tham số xác định giọng nói và bằng cách cho phép bạn lưu trữ mỗi kết hợp dưới dạng cài đặt sẵn có thể gọi lại.
Tổng hợp lời nói, chuyển đổi giọng nói và hiệu ứng: Ba cách xây dựng giọng nói
Có ba kỹ thuật cơ bản mà trình tạo giọng nói nhân vật sử dụng, và các quy trình công việc tốt nhất trộn cả ba.
Thứ nhất là tổng hợp lời nói. Bạn nhập một dòng, chọn giọng nói cơ bản, và công cụ tổng hợp âm thanh nói. Điều này là lý tưởng khi bạn không biểu diễn trực tiếp, ví dụ như viết đối thoại cho trò chơi hoặc lời kể cho hoạt ảnh. Nó có thể mở rộng dễ dàng đến hàng trăm dòng.
Thứ hai là chuyển đổi giọng nói, được điều khiển bởi AI voice cloning với mô hình cục bộ trên thiết bị. Ở đây bạn nói hoặc ghi một dòng, và công cụ hiển thị lại nó với âm sắc của giọng nói mục tiêu trong khi bảo tồn hiệu suất, thời gian và cảm xúc của bạn. Bởi vì diễn xuất của bạn được giữ lại, các dòng được chuyển đổi thường cảm thấy sống động hơn so với tổng hợp thuần túy, đó là lý do tại sao các diễn viên thích chuyển đổi cho các vai chính.
Thứ ba là định hình hiệu ứng. Dịch chuyển pitch, điều chỉnh formant, EQ, reverb, distortion và modulation chuyển đổi bất kỳ cơ sở nào bạn bắt đầu. Các hiệu ứng là những gì biến giọng nói bình thường thành robot, người khổng lồ hoặc ma, và đó là những gì tách biệt hai nhân vật chia sẻ cùng một giọng nói cơ bản.
Cách thiết kế một dàn diễn viên nghe khác nhau
Đúc một bộ giọng nói nhân vật AI là một vấn đề thiết kế, không phải vấn đề ngẫu nhiên. Nếu bạn chỉ pitch mỗi nhân vật lên hoặc xuống, họ sẽ nghe như cùng một giọng nói ở các tốc độ khác nhau. Mục tiêu là di chuyển nhiều kích thước độc lập cùng một lúc để không có hai nhân vật nào chồng chéo trên mọi trục.
Bắt đầu với pitch, tần số cơ bản. Đây là kiểm soát thô nhất của bạn: một đối thủ sâu so với một trợ tá thần kinh. Nhưng pitch một mình yếu, bởi vì người nghe nhanh chóng nghe rằng đó là một giọng nói được tăng tốc độ hoặc giảm tốc độ.
Lớp trong formant, sự cộng hưởng của ống giọng nói báo hiệu kích thước cơ thể và hình dạng đầu độc lập với pitch. Chuyển formant lên gợi ý một người nói nhỏ hơn; chuyển nó xuống gợi ý một cái lớn hơn. Hai nhân vật ở pitch tương tự nhưng formants đối lập được đọc là những người hoàn toàn khác nhau. Formant là kiểm soát được sử dụng kém nhất trong công việc nhân vật.
Thay đổi tốc độ và nhịp điệu. Một nhân vật thần kinh nói trong những đợt nhanh và ngắn; một bậc thầy khôn ngoan nói chậm với những tạm dừng dài. Trong tổng hợp đây là cài đặt tốc độ và tạm dừng; trong chuyển đổi nó đến từ hiệu suất của chính bạn. Nhịp điệu thường dễ nhận biết hơn âm sắc.
Ưu tiên timbres trung lập theo giọng điệu làm cơ sở của bạn khi bạn dự định dịch hoặc bản địa hóa sau, sau đó thêm nhân vật qua các kích thước khác. Một cơ sở trung lập di chuyển tốt hơn trên các ngôn ngữ so với một giọng điệu khu vực mạnh mẽ, có thể xung đột một khi một dòng được lồng tiếng.
Cuối cùng, dành riêng hiệu ứng cho các nhân vật cần chúng. Không phải mỗi nhân vật nên có reverb hoặc distortion; khi mọi người có một hiệu ứng, không ai nổi bật. Tiết kiệm hiệu ứng cho các thành viên không phải con người của dàn diễn viên bạn và để các nhân vật con người được xác định bởi pitch, formant và tốc độ một mình.
Nguyên mẫu nhân vật để công thức giọng nói
Bảng dưới đây ánh xạ các nguyên mẫu nhân vật phổ biến với công thức khởi động. Xem xét đây là hướng dẫn, không phải cài đặt sẵn cố định, và điều chỉnh theo thị hiếu sau khi bạn nghe chúng trong bối cảnh.
| Nguyên mẫu nhân vật | Cơ sở | Pitch | Formant | Tốc độ | Hiệu ứng |
|---|---|---|---|---|---|
| Vai chính anh hùng | Giọng nói của bạn, được chuyển đổi | Trung lập | Hơi lên | Ổn định, tự tin | Tăng cường sự có mặt EQ nhẹ |
| Ác nhân đe dọa | Giọng TTS sâu | Xuống 3-5 st | Xuống | Chậm, cố ý | Reverb thấp tinh tế |
| Trợ tá hài hước | Giọng TTS sáng | Lên 3-4 st | Lên | Nhanh, cắt | Nén nhẹ |
| Bậc thầy khôn ngoan | Giọng nói cơ sở ấm | Xuống 1-2 st | Trung lập | Chậm, tạm dừng dài | Ấm áp EQ nhẹ nhàng |
| Nhân vật trẻ em | Giọng nói cơ sở sáng | Lên 4-6 st | Lên mạnh mẽ | Vui vẻ | Không có |
| Robot / AI | Bất kỳ cơ sở nào | Trung lập | Trung lập | Đều, metronom | Ring modulation, EQ |
| Quái vật / khổng lồ | Giọng nói cơ sở sâu | Xuống 6-8 st | Xuống mạnh mẽ | Chậm, gầm | Reverb nặng, distortion |
| Ma / tâm linh | Giọng nói cơ sở mềm | Xuống 1-2 st | Hơi xuống | Kéo dài, thở | Reverb dài, delay tinh tế |
Các trường hợp sử dụng cho Giọng nói nhân vật
Cùng một bộ công cụ phục vụ một phạm vi nhà sáng tạo đáng ngạc nhiên.
Trong phát triển trò chơi, các đội indie trao giọng nói cho toàn bộ danh sách NPC mà không có ngân sách đúc. Một nhà phát triển duy nhất có thể tạo barks, cây đối thoại và chế giếu boss, cung cấp cho mỗi faction một danh tính giọng nói nhất quán thông qua các cài đặt sẵn đã lưu.
Trong hoạt ảnh, giọng nói nhân vật có thể được tạo từ kịch bản trong khi tạo nước ngoài và tinh chỉnh sau, cho phép studio nhỏ nghe thời gian và hiệu suất trước khi cam kết ghi âm cuối cùng.
Đối với sách nói, một người kể chuyện có thể trao giọng nói cho một dàn diễn viên đầy đủ có phân biệt, vì vậy người nghe luôn biết ai đang nói mà không có thẻ đối thoại, và mỗi nhân vật vẫn nhất quán trong suốt một cuốn sách dài.
Trong trò chơi lăn tục trên bàn, một quản lý trò chơi có thể gán cài đặt sẵn cho mỗi NPC lặp lại và chuyển đổi giữa các cuộc họp trực tiếp trong phiên, được định tuyến trực tiếp vào kênh thoại Discord để người chơi nghe ác nhân trong giọng nói của ác nhân.
Đối với các nhóm VTuber, một nhà điều hành có thể chạy một số nhân vật trên màn hình, mỗi cái có cài đặt sẵn của riêng nó, và chuyển đổi giữa các nhân vật trong thời gian thực, cho phép một streamer solo để đặt sân khấu một dàn diễn viên đầy đủ.
Cách xây dựng Cài đặt sẵn nhân vật múltiple trong VoxBooster
Đây là một quy trình công việc thực tế và có thể lặp lại để xây dựng một dàn diễn viên giọng nói nhân vật trong VoxBooster trên Windows 10 hoặc 11.
-
Cài đặt VoxBooster và bắt đầu dùng thử. Tải xuống ứng dụng và khởi chạy dùng thử đầy đủ 3 ngày. Mọi thứ chạy cục bộ trên PC của bạn thông qua một mô hình cục bộ trên thiết bị, vì vậy không cần kết nối Internet để tạo hoặc chuyển đổi giọng nói.
-
Chọn cơ sở của bạn cho mỗi nhân vật. Đối với các nhân vật bạn sẽ biểu diễn trực tiếp, hãy kế hoạch sử dụng chuyển đổi giọng nói để diễn xuất của bạn được giữ lại. Đối với các nhân vật có các dòng kịch bản cố định, hãy chọn giọng nói cơ sở tổng hợp lời nói. Bạn có thể trộn cả hai cách tiếp cận trong một dự án.
-
Tạo cài đặt sẵn nhân vật đầu tiên. Chọn hoặc chuyển đổi sang giọng nói cơ sở được chọn của bạn, sau đó đặt pitch và formant của nó theo công thức của bạn. Bắt đầu thận trọng; các giá trị cực đoan khó giữ có thể hiểu được. Nghe một dòng thử nghiệm trước khi tiếp tục.
-
Thêm rantai hiệu ứng nếu nhân vật cần nó. Đối với các nhân vật không phải con người, các hiệu ứng lớp như reverb, distortion hoặc ring modulation trên các cài đặt pitch và formant. Đối với các nhân vật con người, thường tắt hiệu ứng và để pitch, formant và tốc độ xác định chúng.
-
Lưu cài đặt sẵn bằng tên rõ ràng. Tên nó sau nhân vật, không phải các cài đặt, ví dụ: Villain-Kael hơn là Deep-Reverb-1. Một tên mô tả là những gì làm cho giọng nói có thể gọi lại và nhất quán hàng tháng sau.
-
Lặp lại cho phần còn lại của dàn diễn viên. Xây dựng mỗi nhân vật còn lại như cài đặt sẵn của nó, cố ý thay đổi ít nhất hai kích thước từ mỗi nhân vật khác để không có hai kích thước nào chồng chéo. Nghe thử các nhân vật mới so với những người hiện có trong một đối thoại hỗn hợp ngắn để xác nhận họ có thể phân biệt được.
-
Định tuyến đến micrô ảo để sử dụng trực tiếp. Để biểu diễn các nhân vật trực tiếp trong Discord, OBS hoặc một trò chơi, hãy đặt micrô ảo VoxBooster làm thiết bị đầu vào trong ứng dụng đó. Các cài đặt sẵn chuyển đổi thay đổi nhân vật mà khán giả của bạn nghe được trong thời gian thực.
-
Xuất audio để xử lý sau sản xuất. Đối với trò chơi, hoạt ảnh hoặc sách nói, tạo hoặc chuyển đổi các dòng của bạn và xuất các tệp audio. Vì mỗi nhân vật là cài đặt sẵn đã lưu, bạn có thể hiển thị các dòng mới sau đó phù hợp với các bản ghi trước đó chính xác.
Giữ giọng nói nhất quán trong toàn bộ dự án
Tính nhất quán là siêu lực yên tĩnh của việc tạo nhân vật dựa trên cài đặt sẵn. Một diễn viên lồng tiếng chơi một vai lặp lại phải ghi nhớ và tái tạo một nhân vật bằng tai, mà trôi dạt qua một dự án dài. Một cài đặt sẵn đã lưu không trôi dạt. Gọi lại nó tái tạo giọng nói tương tự, chính xác là điều nội dung episodic đòi hỏi.
Để bảo vệ tính nhất quán, hãy giữ một tài liệu dự án ngắn liệt kê mỗi nhân vật, tên cài đặt sẵn của nó và mô tả một dòng của âm thanh dự định của nó. Khi bạn quay lại một dự án sau khi tạm dừng, tài liệu này cho phép bạn tải lại cài đặt sẵn phù hợp ngay lập tức thay vì cố gắng xây dựng lại giọng nói từ bộ nhớ. Đối với các nhân vật chuyển đổi giọng nói, hãy cố gắng ghi lại các dòng theo dõi trong môi trường tương tự và ở khoảng cách tương tự từ micrô, vì vậy đầu vào vào mô hình vẫn có thể so sánh được.
Ghi chú về Đạo đức và Sự đồng ý
Việc tạo giọng nói nhân vật mạnh mẽ, và với đó đến trách nhiệm. Đường dẫn rõ ràng và an toàn là tạo giọng nói nhân vật độc lập và được phát minh, hoặc sử dụng giọng nói của chính bạn làm nguồn chuyển đổi. Cả hai đều hoàn toàn hợp pháp và là những gì hướng dẫn này được xây dựng.
Những gì bạn không nên làm là nhân bản giọng nói của một người thực hoặc tái tạo một nhân vật được bảo vệ bản quyền và dễ nhận biết để giả mạo họ mà không có sự đồng ý. Thuyết trình giọng nói tổng hợp như một cá nhân thực tế cụ thể hoặc một nhân vật được bảo vệ mà bạn không có quyền, có thể gây ra tổn hại thực sự và có thể vượt qua các dòng pháp lý liên quan đến giống nhau và bản quyền. Thiết kế các âm sắc độc lập, sử dụng các giọng nói nguồn được đồng ý và giữ các nhân vật của bạn là của riêng bạn. Làm như vậy sẽ bảo vệ những người xung quanh bạn và giữ cho các dự án của bạn ở một nền tảng vững chắc.
FAQ
Trình tạo giọng nói AI cho các nhân vật là gì? Đó là phần mềm tạo ra các giọng nói riên biệt và có thể lặp lại cho các thành viên diễn viên riêng lẻ. Bạn tạo lời nói từ văn bản hoặc chuyển đổi giọng nói của chính mình, sau đó định hình pitch, formant, tốc độ và hiệu ứng để mỗi nhân vật có một âm sắc dễ nhận biết. Lưu các cài đặt sẵn cho phép bạn tái tạo mỗi giọng nói một cách nhất quán trong toàn bộ dự án.
Làm cách nào để làm cho mỗi nhân vật nghe khác nhau? Thay đổi các tham số cơ bản thay vì chỉ pitch. Kết hợp giọng nói TTS cơ bản hoặc âm sắc đã chuyển đổi với độ lệch pitch cụ thể, dịch chuyển formant, tốc độ và hiệu ứng nhẹ. Hai nhân vật có thể chia sẻ giọng nói cơ bản nhưng nghe hoàn toàn khác nhau sau khi formant và nhịp điệu khác nhau. Lưu mỗi kết hợp dưới dạng cài đặt sẵn được đặt tên.
Tôi có thể giữ giọng nói nhân vật nhất quán qua nhiều phiên làm việc không? Có. Chìa khóa là lưu mỗi nhân vật dưới dạng cài đặt sẵn được đặt tên lưu trữ giọng nói, pitch, formant và chuỗi hiệu ứng của nó. Gọi lại cài đặt sẵn đó sẽ tái tạo chính xác cùng một âm sắc vài tuần sau, điều quan trọng đối với các trò chơi episodic, loạt phim và sách nói nơi một nhân vật phải nghe giống hệt mỗi lần.
Làm cách nào để tạo giọng nói nhân vật không phải con người hoặc quái vật? Bắt đầu từ giọng nói cơ bản, sau đó áp dụng các dịch chuyển formant lớn hơn, các hiệu ứng bổ sung như reverb, distortion, ring modulation hoặc pitch phân lớp, và tốc độ chậm hơn hoặc bị gãy. Robot phù hợp với ring modulation kim loại và thời gian chặt chẽ, trong khi quái vật phù hợp với pitch sâu, formant hướng xuống và reverb nặng cho kích thước.
Có hợp pháp khi tạo giọng nói cho các nhân vật của tôi không? Tạo các giọng nói nhân vật độc lập và được phát minh là được phép, và sử dụng giọng nói của chính bạn làm cơ sở là được phép. Các vấn đề chỉ phát sinh khi bạn nhân bản giọng nói của một người thực hoặc tái tạo một nhân vật được bảo vệ bản quyền và dễ nhận biết để giả mạo họ mà không có sự đồng ý. Thiết kế các âm sắc độc lập hoặc sử dụng các giọng nói nguồn được đồng ý và bạn sẽ an toàn.
Tôi có cần kết nối Internet để tạo giọng nói nhân vật không? Không với VoxBooster. Nó chạy một mô hình cục bộ trên thiết bị và xử lý âm thanh trực tiếp trên máy Windows 10 hoặc 11 của bạn, vì vậy việc tạo giọng nói và chuyển đổi thời gian thực hoạt động ngoại tuyến. Điều này cũng giữ các kịch bản và bản ghi của bạn riêng tư, vì không có gì được tải lên máy chủ từ xa để xử lý.
Tôi có thể sử dụng các giọng nói nhân vật này trực tiếp và trong các bản ghi không? Cả hai. Bạn có thể định tuyến cài đặt sẵn nhân vật đến micrô ảo để nó cấp nguồn Discord, OBS hoặc một trò chơi trong thời gian thực cho các phiên chơi bàn cờ và các nhóm VTuber. Bạn cũng có thể tạo hoặc chuyển đổi các dòng từ văn bản và xuất các tệp âm thanh để tạo hoạt ảnh, trò chơi và sản xuất sách nói.
Trao giọng nói cho toàn bộ dàn diễn viên của bạn
Một dàn diễn viên có uy tín nằm trong tầm tay của một nhà sáng tạo độc lập khi công cụ của bạn xử lý cả tính đa dạng và nhất quán. Thiết kế mỗi nhân vật bằng cách di chuyển pitch, formant, tốc độ và hiệu ứng độc lập, lưu mỗi giọng nói dưới dạng cài đặt sẵn được đặt tên, và định tuyến đến micrô ảo để công việc trực tiếp hoặc xuất để xử lý sau sản xuất. VoxBooster làm tất cả điều này cục bộ trên Windows 10 và 11, không có trình điều khiển kernel và dùng thử đầy đủ 3 ngày. Tải xuống VoxBooster để bắt đầu xây dựng các nhân vật của bạn, hoặc xem tùy chọn giá cả cho giấy phép suất mệnh, và duyệt thêm hướng dẫn trên blog.