Giọng Nói Đáng Sợ Text to Speech: Tạo Giọng TTS Rợn Tình
Giọng nói đáng sợ text to speech lấy bất kỳ dòng nào bạn gõ và đọc lại trong giọng đáng sợ, không phải con người, khiến nó trở thành một trong những cách nhanh nhất để ghi điểm một video kinh dị, một bộ phận Halloween hoặc một trò chơi thực tế thay thế mà không cần ghi lại một dòng. Thủ thuật không phải là tìm một giọng nói đáng sợ kỳ diệu, mà là kết hợp một người đọc tổng hợp sâu với chuỗi hiệu ứng kinh dị có chủ ý. Hướng dẫn này phá vỡ chính xác những gì làm cho giọng nói TTS có vẻ đáng sợ, cách xây dựng hiệu ứng từ đầu, các trường hợp sử dụng phù hợp, và một quy trình được đánh số với các công thức sẵn sàng sao chép cho các giọng nói daemon, ma, thì thầm và glitch.
TL;DR
- TTS đáng sợ = giọng nói tổng hợp sâu và chậm cộng với chuỗi hiệu ứng kinh dị (pitch, tốc độ, thì thầm, reverb, bóp méo, glitch).
- Không có cài đặt duy nhất nào đáng sợ theo chính nó. Sự sợ hãi đến từ việc xếp chồng bốn hoặc năm manh mối tinh tế với nhau.
- Bắt đầu với giọng nói tổng hợp thấp, chậm lại tốc độ, sau đó thêm reverb, lớp thì thầm không được điều chỉnh và bóp méo nhẹ.
- Bốn công thức sẵn sàng dưới đây: daemon, ma, thì thầm và glitch, mỗi với các giá trị pitch, tốc độ, reverb và lớp.
- Trường hợp sử dụng: tiếu thuật kinh dị, bộ phận Halloween, ARG, đọc creepypasta và các nhân vật trò chơi đe dọa.
- Chỉ sử dụng có trách nhiệm: đây là dành cho hư cấu và nội dung, không bao giờ để làm sợ hãi hoặc quấy rối một người thực sự.
Điều gì Khiến Giọng Nói Text to Speech Có Vẻ Đáng Sợ?
Giọng nói text to speech đáng sợ là giọng nói tổng hợp bị tước bỏ một cách cố ý những manh mối mà bộ não của bạn sử dụng để nhận ra một người nói con người bình tĩnh và khỏe mạnh, sau đó được cung cấp những manh mối mới báo hiệu kích thước, thiệt hại hoặc sự kỳ lạ. Động cơ tổng hợp xử lý các từ; kinh dị đến từ pitch, tốc độ, hình dạng quang phổ và không gian được áp dụng trên đó. Loại bỏ đủ ấm áp con người và thêm đủ kết cấu không tự nhiên, và câu tương tự có vẻ trung tính bây giờ có vẻ như một mối đe dọa.
Tai của bạn đánh giá “đáng sợ” từ một danh sách tín hiệu ngắn, và mỗi cái ánh xạ đến một hoạt động âm thanh cụ thể mà bạn có thể điều chỉnh:
- Pitch sâu — tần số cơ bản thấp được đọc là lớn, mạnh mẽ và chiếm ưu thế về mặt vật lý.
- Tốc độ chậm, đáng sợ — giao hàng không vội vàng và cách nhau đều loại bỏ nhịp tự nhiên của lời nói ngẫu hứng và cảm thấy cố ý hoặc hung dữ.
- Thì thầm hoặc hơi thở — một lớp thì thầm báo hiệu sự thân mật và mối đe dọa cùng một lúc, giống như một cái gì đó nói trực tiếp vào tai bạn.
- Bóp méo và cát — thiệt hại hòa điệu gợi ý giọng nói bị hỏng, không con người hoặc đến qua thiết bị bị lỗi.
- Reverb và tiếng vang — một đuôi tối dài đặt giọng nói trong một hang động, một hội trường trống hoặc một khoảng trống, không bao giờ một phòng bình thường.
- Formants được điều chỉnh phân tầng — bản sao thứ hai của giọng nói được pitch hoặc formant-shifted một chút từ bản sao đầu tiên tạo ra một dàn hợp x唱坐trong thung lũng kỳ lạ.
- Glitch và stutter — lặp lại đột ngột, dropout hoặc các đoạn bit-crushed ngụ ý một tín hiệu bị hỏng hoặc một sự hiện diện không hoàn toàn “ở đó”.
Không có cái nào kỳ lạ. Đây là các hoạt động tiêu chuẩn từ thiết kế âm thanh phim và sản xuất nhạc. Điều phân biệt giọng nói đáng sợ thực sự lo lắng so với điều kỳ quặc là sự kiềm chế và kết hợp: hai hoặc ba manh mối xếp chồng tinh tế đánh bại một manh mối được đẩy đến mức cường.
Khoa Học Đằng Sau Giọng Nói Tổng Hợp Đáng Sợ
Để điều chỉnh hiệu ứng cho chính bạn thay vì dựa vào một cài đặt trước, sẽ hữu ích khi biết mỗi lớp đang làm gì cho âm thanh.
Pitch và Formants
Giọng nói con người mang hai lớp độc lập: tần số cơ bản được sản xuất bởi các dây thanh âm, và formants, các đỉnh cộng hưởng được định hình bởi cổ họng và miệng xác định timbre. Các động cơ tổng hợp lời nói tạo ra cả hai. Khi bạn giảm pitch của giọng nói tổng hợp nhưng cũng dịch chuyển các formant của nó thấp hơn, người nghe cảm nhận được một cơ thể lớn hơn nhiều tạo ra âm thanh. Hạ pitch mà không chạm vào formants và bạn chỉ nhận được một bản đọc chậm lại, rõ ràng là nhân tạo, đó là lỗi phổ biến nhất trong TTS đáng sợ sơ cấp.
Tốc độ và Prosody
Prosody là nhạc điệu và giai điệu của lời nói. Lời nói con người bình thường là không đều và nhanh; một giọng nói đáng sợ là chậm và metronomic. Nhiều động cơ TTS tiếp xúc tốc độ lời nói trực tiếp, và đặc tả SSML W3C cho phép bạn chèn tạm dừng và kiểm soát tốc độ xung quanh các từ cụ thể. Chậm lại tốc độ và thêm các khoảng tạm dừng nửa giây trước các từ chính thường đáng sợ hơn bất kỳ hiệu ứng nào, bởi vì tốc độ cố ý ngụ ý ý định.
Reverb và Không Gian
Giọng nói được ghi âm trong một phòng được xử lý có vẻ gần và nhỏ. Thêm reverb với một đuôi tối dài và giọng nói tương tự dường như đến từ một nhà thờ, một hang động hoặc không ở đâu cả. Không gian là một trong những manh mối kinh dị mạnh nhất vì nó cho người nghe biết rằng người nói đang ở một nơi họ không thể nhìn thấy. Giữ reverb nhẹ hơn cho công việc thời gian thực để nói chuyện vẫn có thể hiểu được; đi nặng hơn cho narration được kết xuất trước.
Bóp méo, Thì Thầm và Glitch
Bóp méo thêm nội dung hòa điệu mà họng của con người không thể sản xuất sạch sẽ, điều này được đọc là thiệt hại hoặc mất nhân tính. Một lớp thì thầm thêm hơi thở và sự thân mật. Các hiệu ứng glitch (bit-crushing, stutter, granular dropouts) ngụ ý một sự hiện diện bị hỏng hoặc không ổn định. Được sử dụng một cách cô đọng, mỗi cái đẩy giọng nói xa hơn từ “người nói” và gần hơn với “có gì đó sai”.
Cách Xây Dựng Giọng Nói Đáng Sợ từ Text to Speech
Công thức cốt lõi rất đơn giản: tạo dòng với giọng nói tổng hợp sâu, sau đó chạy nó qua chuỗi hiệu ứng kinh dị pitch, tốc độ, reverb, một bản sao phân tầng, và bóp méo hoặc glitch. Dưới đây là quy trình công việc được đánh số hoàn chỉnh sử dụng text to speech, hiệu ứng và soundboard tích hợp của VoxBooster.
- Gõ dòng của bạn và chọn giọng nói cơ sở sâu. Trong mô-đun TTS, dán văn bản của bạn và chọn giọng nói tổng hợp thấp nhất, trung lập nhất có sẵn. Một điểm bắt đầu phẳng, vô cảm hấp thụ xử lý kinh dị tốt hơn một giọng nói đã có kịch tính.
- Làm chậm tốc độ lời nói. Giảm tốc độ để giao hàng cảm thấy cố ý. Thêm các tạm dừng ngắn trước các từ bạn muốn hạ cánh cứng nhất. Tốc độ cố ý làm nhiều điều hơn cho nỗi sợ hãi so với bất kỳ hiệu ứng duy nhất nào.
- Hạ pitch. Hạ giọng nói được kết xuất. Ba đến năm bán âm để thì thầm lo lắng, sáu đến chín cho quỷ. Giảm nhỏ là đáng sợ hơn những cái cực đoan, lật thành hài kịch.
- Dịch chuyển formants để phù hợp. Hạ formants cùng với pitch để giọng nói nghe như cơ thể lớn hơn, không phải băng được chậm lại. Đây là bước mà hầu hết mọi người bỏ qua, và đó là điều phân biệt thuyết phục từ rẻ tiền.
- Thêm reverb. Áp dụng reverb tối tăm dài ở khoảng 20 đến 35 phần trăm ướt. Một xung thánh đường hoặc hang động hoạt động tốt. Dễ dàng nếu các từ bắt đầu vón cục với nhau.
- Lớp một bản sao không được điều chỉnh hoặc thì thầm. Nhân bản giọng nói, pitch hoặc detune bản sao một chút, hoặc chuyển đổi nó thành thì thầm thở dốc, và trộn thấp dưới bản đọc chính. Phương pháp này tạo ra một dàn hợp x唱kỳ lạ làm cho người nghe lo lắng.
- Giới thiệu bóp méo hoặc glitch để nếm. Đối với daemon, thêm bão hòa cho cát. Đối với một thực thể bị hỏng hoặc kỹ thuật số, thêm bit-crusher hoặc stutter ngắn. Giữ nó tinh tế trừ khi nhân vật được dự định để bị phá vỡ.
- Xem trước, sau đó kết xuất hoặc định tuyến. Nghe qua tai nghe. Đối với video, xuất audio xử lý thành một tệp. Để sử dụng trực tiếp, định tuyến đầu ra tới thiết bị âm thanh ảo mà phần mềm truyền phát hoặc trò chơi của bạn đọc dưới dạng đầu vào, hoặc thả clip được kết xuất lên một miếng đệm soundboard và hotkey.
VoxBooster chạy toàn bộ chuỗi này trên thiết bị với độ trễ thấp và không có trình điều khiển kernel, vì vậy giọng nói tổng hợp, chuỗi hiệu ứng và kích hoạt soundboard đều sống trong một ứng dụng thay vì một tệp các công cụ riêng biệt.
Công Thức Giọng Nói Đáng Sợ: Bảng Cài Đặt
Sử dụng chúng làm điểm bắt đầu, sau đó điều chỉnh để phù hợp với dự án của bạn. Các giá trị giả định một giọng nói tổng hợp cơ sở sâu và trung lập từ động cơ TTS.
| Giọng Nói Đáng Sợ | Dịch Chuyển Pitch | Tốc Độ / Tỷ Lệ | Reverb | Bóp Méo / Glitch | Lớp |
|---|---|---|---|---|---|
| Daemon | -7 bán âm | Chậm, tỷ lệ -20% | Plat tối ngắn, 20% ướt | Bão hòa ống trung bình | Sao chép một octave dưới ở -14 dB |
| Ma / Wraith | +2 bán âm | Rất chậm, thở dốc | Hội trường dài, 40% ướt | Không có | Sao chép thì thầm + dàn hợp chậm |
| Thực Thể Thì Thầm | -2 bán âm | Chậm, cảm giác gần micrô | Phòng nhỏ, 10% ướt | Tiếng gầm hơi thở nhẹ | Thì thầm không được điều chỉnh ở -8 dB |
| Glitch / Bị Hỏng | -3 bán âm | Không đều, khoảng cách stutter | Plat trung bình, 25% ướt | Bit-crush + lặp lại stutter | Sao chép ring-mod ở -12 dB |
Lưu ý: đối với ma, pitch và formants đi lên, không phải xuống. Một giọng nói thoáng nhất và có không khí, không nặng. Đối với giọng nói glitch, tốc độ không đều và stutter quan trọng hơn so với giảm pitch, vì vậy hãy nghiêng vào lặp lại đột ngột và dropout ngắn.
Nơi Sử Dụng Text to Speech Đáng Sợ
Một giọng nói đáng sợ tổng hợp kiếm được vị trí của nó ở bất kỳ nơi nào bạn cần một nhân vật kể chuyện không con người nhất quán không bao giờ mệt mỏi hoặc phá vỡ tính cách giữa các cảnh quay.
- Tiếu thuật video kinh dị. Các kênh Creepypasta, phim kinh dị ngắn và loạt phim kinh dị tương tự sử dụng TTS đáng sợ để tính giọng của nhân vật kể chuyện, thực thể và mối đe dọa ngoài màn hình. Người đọc tổng hợp cung cấp cho bạn một giọng nói nhất quán trên hàng chục tập.
- Bộ phận và trang trí Halloween. Lời chào được kích hoạt bởi chuyển động, đầu lâu nói chuyện, một chuông cửa trả lời bằng giọng daemon, hoặc một hệ thống PA ngôi nhà bị ma ám. Tạo trước các dòng và kích hoạt từ soundboard hoặc một thiết bị phát lại đơn giản.
- Trò chơi thực tế thay thế (ARG). ARG phát triển trên các manh mối âm thanh lo lắng: tin nhắn thoại bị biến dạng, phát sóng glitched, hướng dẫn thì thầm ẩn trong video. TTS đáng sợ cho phép một nhà thiết kế tạo ra nhiều dòng đáng sợ ngắn một cách nhanh chóng và giữ chúng nhất quán về mặt tonal.
- Creepypasta và tiếu thuật âm thanh. Đọc một câu chuyện bằng giọng nói đáng sợ, hoặc cho một nhân vật trong câu chuyện một giọng nói thực thể riêng biệt, thêm giá trị sản xuất vào kênh tiếu thuật mà không cần thuê diễn viên thoại.
- Trí chiêu hấp dẫn. Phòng thoát và bước qua trí chiêu hấp dẫn cần âm thanh có thể lặp lại và luôn bật. Một dòng đáng sợ được kết xuất phát giống hệt nhau mỗi lần, điều mà các diễn viên trực tiếp không thể đảm bảo.
- **Chơi game và trò chơi truyện.**Các NPC đe dọa, một nhân vật bị chiếm giữ hoặc một boss eldritch trong một trò chơi được sửa đổi hoặc phiên chơi game. Định tuyến chuỗi hiệu ứng qua micrô ảo và nói-để-xác định loại, hoặc kích hoạt các dòng được tạo trước từ hotkey ở giữa cảnh.
Lời Khuyên cho Một Bản Đọc Đáng Sợ Thuyết Phục
Các lựa chọn nhỏ tách một kết quả thực sự đáng sợ từ một kết quả rõ ràng là giả.
- Viết các dòng ngắn. Các đoạn và câu chậm đơn lẻ đáng sợ hơn những đoạn văn dài. Không gian và im lặng làm nhiều công việc.
- Chấm phẩy cho các tạm dừng. Thời kỳ và dấu phẩy kiểm soát tốc độ TTS. Phá một mối đe dọa trên hai câu ngắn để câu thứ hai hạ cánh sau một nhịp im lặng.
- Đừng xử lý quá mức. Nếu bạn có thể nghe từng hiệu ứng riêng biệt, hãy giảm bớt. Mục tiêu là một giọng nói có vẻ sai, không phải một giọng nói chôn vùi trong reverb và cát.
- Kết hợp không gian với câu chuyện. Reverb hang động phù hợp với quái vật; thì thầm gần nhỏ phù hợp với một cái gì đó trong phòng với bạn. Hãy để hiệu ứng mô tả vị trí.
- Lớp với ambience. Ghép giọng nói với nada phòng, âm thanh xa hoặc một drone thấp từ soundboard. Giọng nói cộng với bầu không khí đánh bại giọng nói một mình.
- Giữ một giọng nói chữ ký. Đối với một loạt hoặc nhân vật lặp lại, lưu công thức chính xác làm cài đặt trước để mỗi lần xuất hiện trùng khớp. Người xem theo dõi các nhân vật, không phải các hiệu ứng một lần.
Sử Dụng Có Trách Nhiệm
Giọng nói đáng sợ text to speech là một công cụ cho hư cấu, nội dung và niềm vui theo mùa, và nó phải ở đó. Sử dụng nó cho video kinh dị, trò chơi, ARG và bộ phận Halloween nơi khán giả của bạn hiểu rằng họ đang nghe một màn trình diễn. Không sử dụng giọng nói tổng hợp đáng sợ để mạo danh một người thực sự, lừa dối ai đó nghĩ rằng một mối đe dọa chân chính hiện diện, hoặc làm sợ hãi, quấy rối hoặc đe dọa ai đó. Giữ nội dung đáng sợ rõ ràng là hư cấu và đồng ý, và kiểm tra các quy tắc của bất kỳ nền tảng nào bạn xuất bản. Hiệu ứng chỉ vui khi mọi người đều biết đó là một câu chuyện.
FAQ
Giọng nói đáng sợ text to speech là gì?
Giọng nói đáng sợ text to speech chuyển đổi những từ được gõ thành âm thanh được phát âm, sau đó xử lý âm thanh đó thông qua chuỗi hiệu ứng kinh dị. Giọng nói tổng hợp sâu cung cấp những từ trong khi giảm pitch, tốc độ chậm, lớp thì thầm, reverb và bóp méo cung cấp sự sợ hãi. Kết quả kể bất kỳ văn bản nào theo một giọng điệu đáng sợ.
Làm thế nào để tạo giọng text to speech có vẻ đáng sợ?
Bắt đầu với giọng nói tổng hợp thấp và chậm, sau đó xếp chồng các hiệu ứng: hạ pitch vài bán âm, chậm lại tốc độ, thêm reverb tối tăm dài, chồng lên bản sao không được điều chỉnh hoặc thì thầm bên dưới, và áp dụng bóp méo nhẹ hoặc glitch stutter. Mỗi lớp loại bỏ một manh mối khác rằng giọng nói là con người.
Những cài đặt nào tạo ra giọng demonicnhân từ text to speech?
Để đọc quỷ dữ, hạ giọng nói tổng hợp khoảng sáu đến chín bán âm, dịch chuyển các formant thấp hơn, thêm bão hòa nặng, và chồng lên bản sao thứ hai được tone lên một octave hoàn toàn ở âm lượng thấp. Reverb plat ngắn và gầm phụ mơ hồ bên dưới hoàn thành hiệu ứng daemon.
Tôi có thể sử dụng giọng TTS đáng sợ trong thời gian thực để truyền phát không?
Vâng. Tạo dòng nói từ văn bản, định tuyến qua chuỗi hiệu ứng kinh dí, và gửi đầu ra tới thiết bị âm thanh ảo mà phần mềm truyền phát của bạn đọc dưới dạng micrô hoặc nguồn phương tiện. Tạo trước các dòng dài hơn và kích hoạt từ soundboard mang lại kết quả sạch hơn cho các cảnh kinh dí trực tiếp.
Có phải máy phát giọng đáng sợ miễn phí sử dụng không?
Một số công cụ cung cấp các mức miễn phí với giọng nói hoặc tập hợp hiệu ứng bị giới hạn. Kiểm soát sâu hơn trên pitch, formant, reverb, phân tầng và glitch thường nằm phía sau mức trả tiền hoặc thử nghiệm. VoxBooster gói text to speech, hiệu ứng và soundboard trong một ứng dụng với dùng thử đầy đủ để bạn có thể kiểm tra đầu tiên một đoạn đáng sợ.
Trường hợp sử dụng tốt nhất cho text to speech đáng sợ là gì?
Tiếu thuật video kinh dị, trang trí Halloween và lời chào chuông cửa, trò chơi thực tế thay thế, đọc creepypasta, âm thanh trí chiêu hấp dẫn và các nhân vật trò chơi đe dọa. Bất kỳ dự án nào cần một nhân vật kể chuyện không nhân tạo nhất quán có lợi, bởi vì giọng nói tổng hợp không bao giờ mệt mỏi hoặc phá vỡ tính cách giữa các cảnh quay.
Có ổn không khi sử dụng giọng TTS đáng sợ trên người thực?
Sử dụng nó cho nội dung, không phải để lừa dối, làm sợ hãi hoặc quấy rối bất kỳ ai. TTS đáng sợ rất tốt cho hư cấu, trò chơi và trang trí theo mùa nơi khán giả biết đó là một màn trình diễn. Không mạo danh một người thực sự hoặc sử dụng giọng nói đáng sợ để đe dọa hoặc làm sợ hãi ai đó. Giữ nó rõ ràng là hư cấu.
Kết Luận
Một đoạn đọc giọng nói đáng sợ text to speech thuyết phục không bao giờ là một cài đặt, nó là một người đọc tổng hợp sâu cộng với chuỗi các manh mối nhỏ cố ý: pitch thấp, tốc độ chậm, reverb tối tăm, lớp thì thầm không được điều chỉnh, và một chút bóp méo hoặc glitch. Pitch một mình nghe giống như một chuỗi phim được chậm lại. Reverb một mình nghe như một phòng lớn. Xếp chồng với nhau và hiệu chỉnh theo các công thức daemon, ma, thì thầm hoặc glitch ở trên, chúng biến đổi bất kỳ dòng được gõ thành thứ gì đó thực sự làm cho người nghe lo lắng.
Đối với một ứng dụng duy nhất tạo ra giọng nói, chạy chuỗi hiệu ứng kinh dị và kích hoạt các dòng được kết xuất từ một soundboard hotkey, VoxBooster xử lý toàn bộ quy trình công việc trên thiết bị với độ trễ thấp và không có trình điều khiển kernel. Trang giá cả có chi tiết thử nghiệm nếu bạn muốn kiểm tra một bản đọc đáng sợ trước khi cam kết, và hướng dẫn để nghe giống như một quái vật là một bài đọc tiếp theo tốt nếu bạn muốn tính giọng của các nhân vật kinh dị của bạn trực tiếp thay vì từ văn bản. Giọng nói là sự sợ hãi. Phần mềm chỉ là công cụ.