
Tổng hợp văn bản thành giọng nói đa nền tảng, ngoại tuyến cho Unreal Engine. Tạo ra giọng nói tự nhiên với hơn 2800 giọng đọc trên 51 ngôn ngữ - bao gồm các mô hình giọng nói chất lượng phòng thu Kokoro và TTS phát trực tuyến - với hỗ trợ đầy đủ Blueprint và C++.
Văn bản được tổng hợp hoàn toàn trên thiết bị bằng các mô hình giọng nói Piper hoặc Kokoro thông qua ONNX Runtime - tiêu chuẩn hoặc phát trực tuyến - không cần kết nối internet, không cần khóa API và không gửi dữ liệu ra ngoài. Âm thanh PCM thu được tích hợp trực tiếp với Runtime Audio Importer để phát ngay lập tức.
Bất kỳ chuỗi nào từ Blueprint, C++ hoặc được chuyển từ phản hồi của chatbot AI
Chọn một mô hình Piper hoặc Kokoro theo tên hoặc đối tượng, với các tùy chọn người nói và chất lượng
ONNX Runtime xử lý văn bản cục bộ - tiêu chuẩn hoặc phát trực tuyến - mà không có dữ liệu nào được gửi ra bên ngoài
Dữ liệu PCM Float32 sẵn sàng để phát lại, lưu, đồng bộ môi, hoặc bất kỳ xử lý âm thanh hạ nguồn nào
Hai kiến trúc mô hình bao phủ nhiều trường hợp sử dụng, từ phạm vi ngôn ngữ rộng đến đầu ra chất lượng phòng thu.
Các mô hình dựa trên ONNX bao phủ 51 ngôn ngữ với 166 mô hình giọng nói và hơn 2800 người nói duy nhất. Chấp nhận các mô hình ONNX được huấn luyện tùy chỉnh.
151 mô hình giọng nói mã nguồn mở chất lượng cao trên 8 ngôn ngữ: Tiếng Anh (US & UK), Tiếng Trung Giản thể, Tiếng Tây Ban Nha, Tiếng Bồ Đào Nha, Tiếng Hindi, Tiếng Pháp và Tiếng Ý. Nằm trong số các giải pháp TTS mã nguồn mở chất lượng cao nhất hiện có.
Nhập các mô hình giọng nói Piper (ONNX + JSON) hoặc Kokoro (BIN + JSON) của riêng bạn trực tiếp qua cài đặt plugin cho các giọng nói hoặc ngôn ngữ chuyên biệt.
Phạm vi ngôn ngữ rộng và hỗ trợ hạng nhất cho mọi nền tảng chính mà Unreal Engine hướng tới.
Ngoài khả năng tổng hợp cơ bản, plugin cung cấp đầu ra phát trực tuyến, lựa chọn nhiều giọng nói, các thao tác có thể hủy bỏ, và các tiện ích quản lý mô hình - tất cả đều có thể truy cập từ Blueprints hoặc C++.
Hai chế độ tổng hợp: hoàn tất toàn bộ văn bản trước khi trả về âm thanh, hoặc phát trực tuyến các khối PCM theo thời gian thực khi chúng được tạo ra để phát lại ngay lập tức các văn bản dài.
Nhiều mô hình hỗ trợ nhiều giọng nói - LibriTTS tiếng Anh bao gồm hơn 900 giọng nói riêng biệt. Truy vấn số lượng giọng nói cho từng mô hình và chọn theo chỉ mục tại thời điểm tổng hợp.
Hủy bất kỳ quá trình tổng hợp nào đang diễn ra bất cứ lúc nào - điều thiết yếu cho các ứng dụng phản hồi nhanh cần ngắt và khởi động lại giọng nói giữa chừng.
Tải xuống, xem trước và quản lý các mô hình giọng nói trực tiếp từ Unreal Editor. Liệt kê các mô hình có sẵn, truy vấn siêu dữ liệu và kiểm soát bộ nhớ lưu trữ mà không cần rời khỏi engine.
Truy xuất siêu dữ liệu mô hình, ngôn ngữ, hạng chất lượng và số lượng giọng nói theo tên hoặc tham chiếu đối tượng. Chọn mô hình động trong thời gian chạy dựa trên ngôn ngữ hoặc các tiêu chí khác.
Không cần kết nối internet, không cần khóa API, không có dữ liệu nào rời khỏi thiết bị. Phù hợp với các ứng dụng nhạy cảm về quyền riêng tư, môi trường cách ly mạng và trò chơi ngoại tuyến.
Ví dụ Blueprint - TTS phát trực tuyến với phát lại theo thời gian thực

Có sẵn bản demo Windows để trải nghiệm trực tiếp chất lượng giọng nói của plugin. Bản demo bao gồm tuyển chọn các mô hình giọng nói Piper và Kokoro thể hiện các ngôn ngữ, số lượng người nói, và các chế độ tổng hợp khác nhau.
Mô hình chuẩn, đa người nói và mô hình Kokoro chất lượng phòng thu
So sánh cả hai chế độ tổng hợp cạnh nhau với đầu vào văn bản tùy chỉnh
Triển khai Blueprint đầy đủ trong dự án demo để tham khảo
Video Hướng dẫn
Runtime Text To Speech là lớp đầu ra giọng nói của bộ plugin Georgy Dev - điều khiển khớp môi, hỗ trợ các quy trình nhân vật AI và hoàn thiện vòng lặp nhận dạng giọng nói.
Nhận đầu ra âm thanh PCM từ quá trình tổng hợp TTS và phát lại, phát trực tuyến hoặc xử lý thêm trong thời gian chạy.
Tìm hiểu thêmĐiều khiển hoạt ảnh khớp môi thời gian thực trên MetaHuman và các nhân vật tùy chỉnh trực tiếp từ đầu ra âm thanh TTS.
Tìm hiểu thêmKhép kín vòng lặp giọng nói - kết hợp nhận dạng giọng nói ngoại tuyến với TTS ngoại tuyến để có trải nghiệm hội thoại hoàn toàn trên thiết bị.
Tìm hiểu thêmĐưa văn bản do AI tạo ra từ nhiều nhà cung cấp khác nhau trực tiếp vào quá trình tổng hợp TTS để có phản hồi NPC có đầy đủ giọng nói.
Tìm hiểu thêmTạo hội thoại bằng LLM trên thiết bị ở chế độ ngoại tuyến, sau đó điều khiển khớp môi từ giọng nói đã tổng hợp để có tương tác nhân vật hoàn toàn ngoại tuyến.
Tìm hiểu thêmTài liệu toàn diện bao gồm tất cả các chế độ tổng hợp, quản lý mô hình, cấu hình nhiều người nói, quy trình phát trực tuyến và hướng dẫn dành riêng cho từng nền tảng.
Hướng dẫn từng bước cho tất cả các tính năng, với các ví dụ Blueprint và C++
Cộng đồng Discord năng động với sự hỗ trợ từ nhà phát triển
Tích hợp hoặc phát triển tính năng theo yêu cầu - [email protected]
Demo - Tải xuống và xem trước mô hình giọng nói trong trình chỉnh sửa

Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm tất cả các mô hình giọng nói, tài liệu đầy đủ và một dự án demo giới thiệu TTS phát trực tuyến và các giọng Kokoro.