Cách thêm âm thanh vào trò chơi AI là bước mà hầu hết những người sáng tạo gặp phải ngay sau khi trình tạo trò chơi AI không mã trao cho họ một dự án hoàn thành trông như thế nào được phát trong im lặng hoàn toàn. Hình ảnh ở đó, các cấp độ tải, người chơi di chuyển - và không có gì tạo ra tiếng ồn. Hướng dẫn này giải thích tại sao điều đó xảy ra, bốn loại âm thanh mà trò chơi thực sự cần, nơi tìm hoặc tạo từng loại, và một quy trình làm việc được đánh số để lấy giọng nói, hiệu ứng âm thanh và tiếng kể chuyện vào trò chơi được tạo AI của bạn mà không cần chạm vào một studio ghi âm.
Tóm tắt
- Những người tạo trò chơi AI thường xuất các dự án câm vì âm thanh khó khớp tự động với gameplay, vì vậy bạn thêm nó cho riêng bạn
- Âm thanh trò chơi có bốn lớp: hiệu ứng âm thanh, vòng lặp không khí, giọng nhân vật và tiếng kể chuyện
- Nguồn SFX từ các thư viện miễn phí bản quyền như freesound.org và đọc giấy phép mỗi clip trước khi gửi
- Tạo tiếng kể chuyện và hội thoại NPC bằng AI chuyển văn bản thành giọng nói, sau đó tái định nghĩa giọng nói bằng bộ thay đổi giọng nói thời gian thực cho các nhân vật khác biệt
- Xuất SFX ngắn dưới dạng WAV và các vòng lặp hoặc hội thoại dài hơn dưới dạng OGG/MP3, sau đó kết nối mỗi clip với một sự kiện trò chơi
- Các công cụ trên thiết bị cho phép bạn tạo ra toàn bộ dàn diễn viên lồng tiếng ngoại tuyến mà không có phí trên mây theo dòng
Tại sao các trò chơi được tạo bằng AI được phát hành mà không có âm thanh?
Trò chơi AI là một dự án có thể chơi được được xây dựng phần lớn hoặc hoàn toàn bởi một công cụ AI - trình tạo trò chơi trình duyệt, nền tảng không mã lời nhắc-để-trò chơi, hoặc trợ lý mã scaffolds một dự án hoàn chỉnh từ một mô tả. Các công cụ này xuất sắc trong sprite, bố cục và logic nhưng coi âm thanh là suy nghĩ ở bước cuối cùng, vì vậy xuất là thường câm và để bạn chịu trách nhiệm hoàn toàn cho thiết kế âm thanh.
Lý do là cấu trúc, không lười biếng. Hình ảnh có thể được hiển thị trực tiếp từ lời nhắc văn bản vì một hình ảnh tự chứa. Âm thanh khác: tiếng bước chân chỉ hoạt động khi nó phát hành trên khung chính xác nơi chân của nhân vật hạ cánh, và vòng lặp không khí căng thẳng chỉ hoạt động khi nó khớp với tâm trạng mà nhà thiết kế cấp độ dự định. Sự khớp nối về thời gian và ý định đó khó để suy ra từ một lời nhắc, vì vậy hầu hết các trình tạo đều bỏ qua nó. Bạn kết thúc công việc bằng cách gắn âm thanh đúng vào thời điểm đúng cho riêng bạn.
Bốn lớp âm thanh trò chơi
Trước khi bạn tìm được điều gì đó, sẽ hữu ích nếu biết những gì bạn đang tìm nguồn. Âm thanh trò chơi chia thành bốn lớp khác biệt, và hầu hết các dự án chỉ cần hai hoặc ba. Xử lý chúng riêng giữ dự án của bạn được tổ chức và ngăn bạn sản xuất quá mức một trò chơi nhỏ.
- Hiệu ứng âm thanh (SFX). Các clip ngắn và sắc nét gắn với các hành động: nhảy, đánh, bắt xu, nhấp chuột menu, nổ tung. Đây là âm thanh có tác động cao nhất mà bạn có thể thêm và dễ nhất để tìm nguồn. Một trò chơi chỉ có SFX tốt đã cảm thấy sống động.
- Không khí và âm nhạc. Âm thanh nền lặp lại đặt tâm trạng - gió ở cấp độ rừng, một tiếng gừ ở trạm vũ trụ, một bài chiptune trên màn hình tiêu đề. Bầu không khí chạy liên tục, vì vậy phải lặp lại sạch sẽ mà không có một đường khâu được nghe thấy.
- Giọng nhân vật. Các dòng được nói cho NPC và nhân vật người chơi: sự chào đón của chủ cửa hàng, lời chế nhạo của sếp, gợi ý của người bạn. Đây là nơi hầu hết các trò chơi AI cảm thấy bằng phẳng, vì sự im lặng nơi một nhân vật nên nói nghe như chưa hoàn thành.
- Tiếng kể chuyện. Một giọng nói hướng dẫn khung lại trải nghiệm - một giới thiệu đặt ra khung cảnh, lời nhắc hướng dẫn, hoặc một kể chuyện giữa các cấp độ. Tiếng kể chuyện là cách rẻ nhất để thêm giá trị sản xuất vì một giọng nói nhất quán mang cả trò chơi.
Loại âm thanh trò chơi chung - nghiên cứu về cách các lớp này kết hợp để hình thành trải nghiệm người chơi - được ghi chép tốt trên tổng quan về âm thanh trò chơi Wikipedia, đó là một nguyên tắc hữu ích nếu bạn muốn hiểu sự khéo léo đằng sau các lớp trước khi bạn bắt đầu đặt các tệp.
Nơi tìm từng loại âm thanh
Bạn có ba tuyến đường rộng để lấy âm thanh: tải xuống từ thư viện miễn phí bản quyền, tạo bằng AI, hoặc ghi âm cho riêng bạn. Cái nào phù hợp tùy thuộc vào lớp. Bảng dưới đây ánh xạ từng loại âm thanh tới nguồn chính tốt nhất của nó và những điểm yếu thực tế.
| Loại âm thanh | Nguồn tốt nhất | Cảnh báo giấy phép | Ghi chú |
|---|---|---|---|
| Hiệu ứng âm thanh | Thư viện miễn phí bản quyền (freesound.org, gói SFX trả phí) | Một số clip yêu cầu ghi công; kiểm tra từng tệp | Chiến thắng nhanh; một gói tốt bao phủ toàn bộ trò chơi |
| Bầu không khí / âm nhạc | Thư viện âm nhạc miễn phí bản quyền, công cụ âm nhạc sinh tạo | Giấy phép âm nhạc yêu cầu hơn SFX; xác minh sử dụng thương mại | Phải lặp lại một cách liền mạch; cắt thành zero-crossing |
| Giọng nhân vật | AI chuyển văn bản thành giọng nói + bộ thay đổi giọng nói thời gian thực | Đầu ra TTS là của bạn; kiểm tra điều khoản công cụ | Một người có thể lồng tiếng cho một dàn diễn viên hoàn chỉnh trên PC của họ |
| Tiếng kể chuyện | AI chuyển văn bản thành giọng nói (mô hình cục bộ trên thiết bị) | Không nếu tạo cục bộ từ tập lệnh của riêng bạn | Giữ một giọng nói nhất quán trên toàn bộ trò chơi |
Đối với hiệu ứng âm thanh, freesound.org là điểm bắt đầu tiêu chuẩn: hàng trăm ngàn clip tải lên bởi cộng đồng theo các giấy phép Creative Commons. Thói quen quan trọng là đọc giấy phép trên mỗi tệp riêng lẻ - một số hoàn toàn miễn phí để sử dụng thương mại, một số yêu cầu bạn ghi công tác giả, và một số cấm sử dụng trong các sản phẩm trả phí. Tạo một tệp văn bản nhỏ liệt kê mỗi clip và giấy phép của nó khi bạn đi, vì vậy ghi công không đau khi bạn gửi.
Đối với giọng nói nhân vật và tiếng kể chuyện, tạo ra chúng gần như luôn luôn nhanh hơn và rẻ hơn so với ghi âm, đó là nơi VoxBooster phù hợp với quy trình làm việc.
Tạo các dòng giọng nói bằng AI chuyển văn bản thành giọng nói
Phần chậm nhất của âm thanh trò chơi từng là cổ chai con người: viết hội thoại, đặt diễn viên, ghi các lần quay, chỉnh sửa chúng. AI chuyển văn bản thành giọng nói sụp đổ điều đó vào gõ phím. Bạn viết dòng, chọn giọng nói, và nhận một lần quay sạch sẽ và nhất quán trong vài giây - không có booth, không có lần quay lại, không có lên lịch.
VoxBooster chạy AI chuyển văn bản thành giọng nói trên một mô hình cục bộ trên thiết bị, điều này quan trọng đối với các dự án trò chơi theo hai cách cụ thể. Thứ nhất, không có phí trên mây theo nhân vật, vì vậy một trò chơi có tám mươi dòng NPC chi phí tương tự như một trò chơi có tám. Thứ hai, nó hoạt động ngoại tuyến, vì vậy bạn có thể lặp lại các cuộc hội thoại trên một máy tính xách tay mà không cần kết nối và tái tạo một dòng ngay khi bạn sửa đổi tập lệnh. Bạn dán tập lệnh cho một tiếng kể chuyện hướng dẫn hoặc chủ cửa hàng, tạo âm thanh, và xuất nó trực tiếp vào một tệp.
Đầu ra tự nhiên nhất quán. Vì mô hình giọng nói tương tự tạo ra mỗi dòng, tiếng kể chuyện của bạn nghe giống hệt nhau ở cấp độ một và cấp độ mười - điều gì đó thực sự khó để đảm bảo với các phiên ghi âm con người cách nhau nhiều tuần.
Cấp cho mỗi nhân vật một giọng nói khác biệt
Một giọng nói AI cho mỗi nhân vật là dấu hiệu rằng một trò chơi được tạo nhanh chóng và rẻ tiền. Sửa chữa là cấp cho mỗi nhân vật một âm sắc riêng biệt, và bạn không cần một diễn viên khác hoặc thậm chí một giọng nói TTS khác để làm điều đó - bạn định hình lại một giọng nói thành nhiều.
Sau khi bạn tạo hoặc ghi âm một dòng, chạy nó qua bộ thay đổi giọng nói thời gian thực hoặc sao chép giọng nói AI của VoxBooster. Cùng một lần quay cơ sở có thể trở thành một người bảo vệ cau, một chủ cửa hàng vui vẻ và cao, và một sếp robot sâu và sâu bằng cách áp dụng một hồ sơ giọng nói khác nhau cho mỗi. Vì xử lý xảy ra trên một mô hình cục bộ trên PC của riêng bạn, bạn có thể chạy bao nhiêu dòng thông qua bao nhiêu hồ sơ như bạn muốn mà không có chi phí bổ sung. Một buổi chiều và một chiếc microphone - hoặc một tập lệnh TTS - trở thành một dàn diễn viên hoàn chỉnh và đa dạng.
Đây cũng là cách bạn xử lý nhân vật người chơi và những tiếng gâu gâu phản ứng: các dòng ngắn như một tiếng chỉnh sửa bị thương, một tiếng gào khai phá, hoặc một đung đưa nhàn rỗi. Tạo hoặc ghi âm chúng một lần, tái định nghĩa cho mỗi nhân vật, và bạn có hàng chục khoảnh khắc giọng nói riêng biệt từ một lượng nhỏ âm thanh nguồn.
Ghi âm SFX và giọng nói của riêng bạn
Đôi khi clip bạn cần không tồn tại trong bất kỳ thư viện nào - một âm thanh UI cụ thể, một cụm từ tùy chỉnh, một tiếng ồn duy nhất cho thế giới của trò chơi bạn. Đối với những cái đó, hãy ghi âm của riêng bạn. Bạn không cần một studio: một microphone USB tử tế trong một phòng yên tĩnh là đủ. Đối với hiệu ứng tạo bằng miệng (bước chân trên bìa các tông, một cú tua tẩu bằng tay, một vụ nổ giả), hãy ghi âm khô và sạch sẽ, sau đó xử lý sau.
Đây là một nơi khác mà bộ thay đổi giọng nói trên thiết bị chứng minh giá trị của nó. Ghi âm một dòng dẹp, sau đó áp dụng các thay đổi pitch và timbre để biến giọng nói của riêng bạn thành một sinh vật, đứa trẻ, hoặc robot mà không cần đặt tên bất kỳ diễn viên cụ thể nào. Loại bỏ tiếng ồn trên cùng một công cụ làm sạch tiếng gừ phòng trước khi clip bao giờ đạt đến dự án trò chơi của bạn, vì vậy ngay cả một thiết lập nhà ồn ào cũng tạo ra âm thanh có thể sử dụng được.
Cách thêm âm thanh vào trò chơi AI của bạn: từng bước một
Với âm thanh của bạn được tìm nguồn, đây là quy trình làm việc để đưa nó vào một dự án trò chơi được tạo AI. Các tên menu chính xác khác nhau giữa các công cụ trò chơi AI, nhưng chuỗi là như nhau ở mọi nơi.
- Kiểm toán những gì trò chơi của bạn cần. Chơi và viết ra từng khoảnh khắc nên tạo ra một tiếng ồn: mỗi hành động, tâm trạng của mỗi cấp độ, mỗi dòng hội thoại. Danh sách này là danh sách mua sắm của bạn và ngăn bạn sản xuất quá mức.
- Nguồn SFX của bạn trước tiên. Kéo các âm thanh hành động từ freesound.org hoặc một gói SFX. Hiệu ứng âm thanh mang lại lợi nhuận tức thì lớn nhất, vì vậy hãy nhận được những cái này trước khi có bất cứ thứ gì khác.
- Tạo tiếng kể chuyện và hội thoại. Viết kịch bản của bạn, sau đó tạo mỗi dòng với AI chuyển văn bản thành giọng nói trong VoxBooster. Xuất tiếng kể chuyện dưới dạng một giọng nói nhất quán duy nhất và mỗi dòng NPC dưới dạng tệp của riêng nó.
- Tái định nghĩa giọng nói nhân vật. Chạy các dòng hội thoại qua bộ thay đổi giọng nói hoặc sao chép giọng nói AI, áp dụng một hồ sơ giọng nói riên biệt cho mỗi nhân vật để không có hai NPC nghe giống hệt nhau.
- Làm sạch và xuất. Áp dụng loại bỏ tiếng ồn cho bất kỳ clip ghi âm nào, sau đó xuất SFX ngắn dưới dạng WAV và các vòng lặp hoặc hội thoại dài hơn dưới dạng OGG/MP3. Giữ lại WAV chính của mọi thứ.
- Đặt tên tệp theo sự kiện. Đổi tên các clip để khớp với các sự kiện trò chơi -
jump.wav,coin.wav,boss_intro.ogg,npc_shop_greet.ogg. Những cái tên rõ ràng làm cho bước tiếp theo trở thành tầm thường. - Nhập vào công cụ trò chơi của bạn. Tải lên các tệp vào bảng tài sản của trình tạo trò chơi AI hoặc thả chúng vào thư mục âm thanh của dự án nếu nó xuất các tệp thô.
- Kết nối mỗi clip với một kích hoạt. Trong trình chỉnh sửa logic hoặc sự kiện của công cụ, gắn mỗi âm thanh vào sự kiện của nó: phát
jump.wavtrên hành động nhảy, vòng lặp theo dõi không khí trên tải cấp độ, phát dòng tiếng kể khi cảnh giới thiệu bắt đầu. - Kiểm tra thời gian và âm lượng. Chơi và kiểm tra xem tiếng ồn có phát hành trên khung chính xác và không có lớp nào đuối âm thanh cái khác. Hạ thấp âm lượng không khí để hội thoại vẫn rõ ràng.
- Lặp lại. Thay thế bất kỳ clip nào cảm thấy tắt, tạo lại bất kỳ dòng giọng nói nào sai lầm đọc một từ, và xuất lại. Vì các công cụ TTS và giọng nói của bạn là cục bộ, vòng lặp này là tức thì và miễn phí.
Những lỗi thường gặp để tránh
Cách nhanh nhất để làm cho một trò chơi AI nghe có vẻ thô lỗ là sai mix, không phải clip. Một vài cạm bẫy lặp lại đáng nói đến để bạn có thể tránh chúng.
- Bầu không khí quá lớn. Loop lbackground nên ngồi dưới mọi thứ khác. Nếu người chơi cố gắng nghe hội thoại qua gió, bầu không khí đang giành được một trận chiến nó nên thua.
- Tiếng kể chuyện không nhất quán. Trộn lẫn hai giọng nói tiếng kể khác nhau ở những cấp độ khác nhau phá vỡ sự ngâm mình. Tạo tất cả tiếng kể từ một giọng nói TTS duy nhất cho một chủ đề liền mạch.
- Bỏ qua giấy phép. Một clip âm thanh miễn phí với yêu cầu ghi công có thể trở thành một vấn đề thực sự trong một trò chơi thương mại được gửi. Ghi lại từng giấy phép khi bạn tải xuống.
- Khâu trong vòng lặp. Bầu không khí và âm nhạc klik hoặc bật trên điểm vòng lặp ngay lập tức loại người chơi. Cắt các vòng lặp thành zero-crossing để nối liền lặng im.
- Một giọng nói cho mỗi NPC. Người báo hiệu lớn nhất của một trò chơi AI vội vàng. Tái định nghĩa cho mỗi nhân vật - không có chi phí khi xử lý cục bộ.
Giữ mọi thứ trên PC của riêng bạn
Một chủ đề lặp lại trên mỗi lớp ở đây là xử lý cục bộ. AI chuyển văn bản thành giọng nói, thay đổi giọng nói, sao chép giọng nói AI, và loại bỏ tiếng ồn tất cả chạy trên một mô hình cục bộ trên thiết bị trong VoxBooster, có ba lợi ích cụ thể cho âm thanh trò chơi. Không có phí trên mây theo dòng, vì vậy một trò chơi giàu hội thoại không đắt hơn một trò chơi yên tĩnh. Mọi thứ hoạt động ngoại tuyến, vì vậy bạn có thể xây dựng trên một máy bay hoặc kết nối café. Và kịch bản và bản ghi của bạn không bao giờ rời khỏi máy của bạn, điều này quan trọng nếu câu chuyện trò chơi của bạn vẫn chưa được công bố.
Đối với các nhu cầu liền kề với bản ghi âm - như biến các cuộc hội thoại độc thoại được ghi âm thành một tập lệnh sạch sẽ mà bạn có thể tái tạo lại - một quy trình làm việc dựa trên Whisper xử lý nó. Whisper của OpenAI là tiêu chuẩn mở để chuyển đổi từ giọng nói thành văn bản và kết hợp tự nhiên với phần còn lại của một đường ống âm thanh cục bộ.
FAQ
Tại sao các trò chơi được tạo bằng AI thường được phát hành mà không có âm thanh? Hầu hết các trình tạo trò chơi AI dựa trên trình duyệt và các công cụ không mã tập trung vào hình ảnh, bố cục và logic vì chúng dễ dàng được hiển thị từ lời nhắc. Âm thanh khó hơn để khớp với gameplay, vì vậy dự án được xuất ra là câm. Bạn thêm âm thanh cho riêng bạn sau đó bằng cách kết nối các tệp SFX và giọng nói với các sự kiện trò chơi.
Trò chơi AI cần bao nhiêu loại âm thanh? Bốn lớp bao gồm hầu như tất cả: hiệu ứng âm thanh cho các hành động như nhảy và đánh, vòng lặp không khí đặt tâm trạng của một cấp độ, giọng nhân vật cho các cuộc hội thoại và phản ứng, và tiếng kể chuyện hướng dẫn người chơi. Bạn hiếm khi cần cả bốn cùng một lúc, vì vậy hãy bắt đầu với SFX và một dòng tiếng kể.
Làm cách nào để thêm giọng vào trò chơi AI mà không cần thuê diễn viên lồng tiếng? Sử dụng AI chuyển văn bản thành giọng nói để tạo tiếng kể chuyện sạch sẽ và dòng NPC từ các tập lệnh được gõ, sau đó tùy chọn chạy kết quả qua bộ thay đổi giọng nói thời gian thực để mỗi nhân vật có âm sắc riêng biệt. Điều này cho phép một người tạo ra toàn bộ dàn diễn viên lồng tiếng trong một buổi chiều, hoàn toàn trên PC của họ.
Tôi có thể lấy hiệu ứng âm thanh trò chơi miễn phí bản quyền ở đâu? Freesound.org lưu trữ hàng trăm ngàn clip Creative Commons, và nhiều gói được bán dưới dạng gói mua một lần có giấy phép thương mại. Luôn đọc giấy phép cụ thể trên mỗi tệp, vì một số yêu cầu ghi công và những tệp khác cấm bán lại trong bản dựng trò chơi thương mại.
Tôi có thể làm cho mỗi NPC nghe khác nhau bằng một chiếc microphone không? Vâng. Ghi âm hoặc tạo mỗi dòng, sau đó áp dụng một hồ sơ giọng nói khác nhau cho mỗi nhân vật bằng cách sử dụng bộ thay đổi giọng nói hoặc mô hình cục bộ trên thiết bị. Một người bảo vệ cau có, một chủ cửa hàng vui vẻ và một boss robot có thể đều đến từ một lần quay được tái định nghĩa thành ba giọng nói khác biệt mà không cần các diễn viên riêng biệt.
Tôi nên xuất âm thanh trò chơi ở định dạng audio nào? Sử dụng WAV cho SFX ngắn khi phát lại ngay lập tức quan trọng và OGG hoặc MP3 cho các vòng lặp không khí dài hơn và các cuộc đối thoại khi kích thước tệp quan trọng. Hầu hết các runtime web và công cụ đều chấp nhận cả ba. Giữ WAV chính của mỗi clip để bạn có thể xuất lại ở các mức nén khác nhau sau này.
Tôi có cần kết nối internet để tạo giọng nói trò chơi không? Không nếu bạn sử dụng các công cụ trên thiết bị. Một công cụ AI chuyển văn bản thành giọng nói cục bộ và bộ thay đổi giọng nói thời gian thực chạy hoàn toàn trên PC của bạn, vì vậy bạn có thể tạo và xử lý các dòng giọng nói không giới hạn ngoại tuyến mà không có phí trên mây theo nhân vật, điều này quan trọng khi một trò chơi có hàng chục dòng hội thoại.
Trao giọng nói cho trò chơi AI của bạn
Một trò chơi AI câm là một trò chơi hoàn thành một nửa, và đóng khoảng cách đó phần lớn là vấn đề tìm clip đúng và kết nối chúng với những khoảnh khắc đúng. Hiệu ứng âm thanh mang lại sự sống cho thế giới, bầu không khí đặt tâm trạng, và giọng nói biến các nhân vật dẹp thành một dàn diễn viên đáng nhớ. Với AI chuyển văn bản thành giọng nói và bộ thay đổi giọng nói thời gian thực chạy cục bộ, một người có thể tạo ra toàn bộ đáng giá âm thanh trò chơi trong một buổi - không có studio, không có diễn viên, không có phí per-line.
Khi bạn sẵn sàng bắt đầu tạo giọng nói và hiệu ứng, tải xuống VoxBooster và thử nó trên một thử nghiệm đầy đủ 3 ngày, hoặc xem những gì một giấy phép trọn đời bao phủ trên trang giá cả. Để biết thêm các hướng dẫn âm thanh, blog có hướng dẫn về sao chép giọng nói, tiếng kể chuyện và loại bỏ tiếng ồn phù hợp với quy trình làm việc ở trên.