Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Tổng hợp văn bản thành giọng nói đa nền tảng, ngoại tuyến cho Unreal Engine. Tạo ra giọng nói tự nhiên với hơn 2800 giọng đọc trên 51 ngôn ngữ - bao gồm các mô hình giọng nói chất lượng phòng thu Kokoro và TTS phát trực tuyến - với hỗ trợ đầy đủ Blueprint và C++.

UE 4.27 – 5.8
Blueprints & C++
Hỗ trợ tất cả các nền tảng
51 ngôn ngữ, hơn 2800 giọng đọc

Cách hoạt động

Văn bản được tổng hợp hoàn toàn trên thiết bị bằng các mô hình giọng nói Piper hoặc Kokoro thông qua ONNX Runtime - tiêu chuẩn hoặc phát trực tuyến - không cần kết nối internet, không cần khóa API và không gửi dữ liệu ra ngoài. Âm thanh PCM thu được tích hợp trực tiếp với Runtime Audio Importer để phát ngay lập tức.

1

Đầu vào văn bản

Bất kỳ chuỗi nào từ Blueprint, C++ hoặc được chuyển từ phản hồi của chatbot AI

2

Mô hình giọng nói

Chọn một mô hình Piper hoặc Kokoro theo tên hoặc đối tượng, với các tùy chọn người nói và chất lượng

3

Tổng hợp trên thiết bị

ONNX Runtime xử lý văn bản cục bộ - tiêu chuẩn hoặc phát trực tuyến - mà không có dữ liệu nào được gửi ra bên ngoài

4

Đầu ra âm thanh PCM

Dữ liệu PCM Float32 sẵn sàng để phát lại, lưu, đồng bộ môi, hoặc bất kỳ xử lý âm thanh hạ nguồn nào

Các loại mô hình giọng nói

Hai kiến trúc mô hình bao phủ nhiều trường hợp sử dụng, từ phạm vi ngôn ngữ rộng đến đầu ra chất lượng phòng thu.

Các mô hình giọng nói Piper

Các mô hình dựa trên ONNX bao phủ 51 ngôn ngữ với 166 mô hình giọng nói và hơn 2800 người nói duy nhất. Chấp nhận các mô hình ONNX được huấn luyện tùy chỉnh.

Các mô hình chất lượng phòng thu Kokoro

151 mô hình giọng nói mã nguồn mở chất lượng cao trên 8 ngôn ngữ: Tiếng Anh (US & UK), Tiếng Trung Giản thể, Tiếng Tây Ban Nha, Tiếng Bồ Đào Nha, Tiếng Hindi, Tiếng Pháp và Tiếng Ý. Nằm trong số các giải pháp TTS mã nguồn mở chất lượng cao nhất hiện có.

Các mô hình giọng nói tùy chỉnh

Nhập các mô hình giọng nói Piper (ONNX + JSON) hoặc Kokoro (BIN + JSON) của riêng bạn trực tiếp qua cài đặt plugin cho các giọng nói hoặc ngôn ngữ chuyên biệt.

Ngôn ngữ & Hỗ trợ nền tảng

Phạm vi ngôn ngữ rộng và hỗ trợ hạng nhất cho mọi nền tảng chính mà Unreal Engine hướng tới.

Phạm vi ngôn ngữ

Tiếng Anh (US & UK)
Tiếng Đức
Tiếng Tây Ban Nha
Tiếng Pháp
Tiếng Trung Giản thể
Tiếng Nga
Tiếng Bồ Đào Nha
Tiếng Hindi
Tiếng Ý
Tiếng Ba Lan
41 ngôn ngữ khác - Tiếng Ả Rập, Tiếng Hà Lan, Tiếng Thổ Nhĩ Kỳ, Tiếng Hàn, Tiếng Việt, Tiếng Ukraina, Tiếng Catalan...

Hỗ trợ nền tảng

Windows
Mac
Linux
Android
iOS
Meta Quest

Điều khiển giọng nói đầy đủ tính năng

Ngoài khả năng tổng hợp cơ bản, plugin cung cấp đầu ra phát trực tuyến, lựa chọn nhiều giọng nói, các thao tác có thể hủy bỏ, và các tiện ích quản lý mô hình - tất cả đều có thể truy cập từ Blueprints hoặc C++.

Tổng hợp chuẩn & phát trực tuyến

Hai chế độ tổng hợp: hoàn tất toàn bộ văn bản trước khi trả về âm thanh, hoặc phát trực tuyến các khối PCM theo thời gian thực khi chúng được tạo ra để phát lại ngay lập tức các văn bản dài.

Lựa chọn nhiều giọng nói

Nhiều mô hình hỗ trợ nhiều giọng nói - LibriTTS tiếng Anh bao gồm hơn 900 giọng nói riêng biệt. Truy vấn số lượng giọng nói cho từng mô hình và chọn theo chỉ mục tại thời điểm tổng hợp.

Các thao tác có thể hủy bỏ

Hủy bất kỳ quá trình tổng hợp nào đang diễn ra bất cứ lúc nào - điều thiết yếu cho các ứng dụng phản hồi nhanh cần ngắt và khởi động lại giọng nói giữa chừng.

Quản lý mô hình trong trình biên tập

Tải xuống, xem trước và quản lý các mô hình giọng nói trực tiếp từ Unreal Editor. Liệt kê các mô hình có sẵn, truy vấn siêu dữ liệu và kiểm soát bộ nhớ lưu trữ mà không cần rời khỏi engine.

Siêu dữ liệu giọng nói & tiện ích

Truy xuất siêu dữ liệu mô hình, ngôn ngữ, hạng chất lượng và số lượng giọng nói theo tên hoặc tham chiếu đối tượng. Chọn mô hình động trong thời gian chạy dựa trên ngôn ngữ hoặc các tiêu chí khác.

Hoàn toàn trên thiết bị

Không cần kết nối internet, không cần khóa API, không có dữ liệu nào rời khỏi thiết bị. Phù hợp với các ứng dụng nhạy cảm về quyền riêng tư, môi trường cách ly mạng và trò chơi ngoại tuyến.

Ví dụ Blueprint - TTS phát trực tuyến với phát lại theo thời gian thực

Ví dụ blueprint TTS phát trực tuyến với Runtime Audio Importer

Dùng thử bản demo

Có sẵn bản demo Windows để trải nghiệm trực tiếp chất lượng giọng nói của plugin. Bản demo bao gồm tuyển chọn các mô hình giọng nói Piper và Kokoro thể hiện các ngôn ngữ, số lượng người nói, và các chế độ tổng hợp khác nhau.

Nhiều loại mô hình giọng nói

Mô hình chuẩn, đa người nói và mô hình Kokoro chất lượng phòng thu

Tổng hợp tiêu chuẩn và phát trực tuyến

So sánh cả hai chế độ tổng hợp cạnh nhau với đầu vào văn bản tùy chỉnh

Bao gồm mã nguồn Blueprint

Triển khai Blueprint đầy đủ trong dự án demo để tham khảo

Tải Demo (Windows)

Video Hướng dẫn

Hệ sinh thái Plugin

Runtime Text To Speech là lớp đầu ra giọng nói của bộ plugin Georgy Dev - điều khiển khớp môi, hỗ trợ các quy trình nhân vật AI và hoàn thiện vòng lặp nhận dạng giọng nói.

Runtime Audio Importer

Nhận đầu ra âm thanh PCM từ quá trình tổng hợp TTS và phát lại, phát trực tuyến hoặc xử lý thêm trong thời gian chạy.

Tìm hiểu thêm

Runtime MetaHuman Lip Sync

Điều khiển hoạt ảnh khớp môi thời gian thực trên MetaHuman và các nhân vật tùy chỉnh trực tiếp từ đầu ra âm thanh TTS.

Tìm hiểu thêm

Runtime Speech Recognizer

Khép kín vòng lặp giọng nói - kết hợp nhận dạng giọng nói ngoại tuyến với TTS ngoại tuyến để có trải nghiệm hội thoại hoàn toàn trên thiết bị.

Tìm hiểu thêm

AI Chatbot Integrator

Đưa văn bản do AI tạo ra từ nhiều nhà cung cấp khác nhau trực tiếp vào quá trình tổng hợp TTS để có phản hồi NPC có đầy đủ giọng nói.

Tìm hiểu thêm

Runtime Local LLM

Tạo hội thoại bằng LLM trên thiết bị ở chế độ ngoại tuyến, sau đó điều khiển khớp môi từ giọng nói đã tổng hợp để có tương tác nhân vật hoàn toàn ngoại tuyến.

Tìm hiểu thêm

Tài liệu & Hỗ trợ

Tài liệu toàn diện bao gồm tất cả các chế độ tổng hợp, quản lý mô hình, cấu hình nhiều người nói, quy trình phát trực tuyến và hướng dẫn dành riêng cho từng nền tảng.

Tài liệu đầy đủ

Hướng dẫn từng bước cho tất cả các tính năng, với các ví dụ Blueprint và C++

Cộng đồng & Hỗ trợ

Cộng đồng Discord năng động với sự hỗ trợ từ nhà phát triển

Phát triển tùy chỉnh

Tích hợp hoặc phát triển tính năng theo yêu cầu - [email protected]

Demo - Tải xuống và xem trước mô hình giọng nói trong trình chỉnh sửa

Tải xuống và xem trước các mô hình giọng nói trong trình chỉnh sửa

Sẵn sàng thêm tính năng chuyển văn bản thành giọng nói vào dự án của bạn?

Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm tất cả các mô hình giọng nói, tài liệu đầy đủ và một dự án demo giới thiệu TTS phát trực tuyến và các giọng Kokoro.