Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

跨平台、离线的 Unreal Engine 文本转语音合成。生成自然语音 支持 51 种语言的 2800+ 种声音——包括 Kokoro 录音室级语音模型和流式 TTS ——并完全支持 Blueprint 和 C++。

UE 4.27 – 5.8
Blueprints 与 C++
支持所有平台
51 种语言,2800+ 种声音

工作原理

文本完全在设备端通过 ONNX Runtime 使用 Piper 或 Kokoro 语音模型合成——标准或流式——无需互联网连接、无需 API 密钥,也不会向外部发送任何数据。生成的 PCM 音频直接与 Runtime Audio Importer 集成,可立即播放。

1

文本输入

任何字符串,可来自 Blueprint、C++,或从 AI 聊天机器人响应中传入

2

语音模型

按名称或对象选择 Piper 或 Kokoro 模型,可设置可选的说话人和质量选项

3

设备端合成

ONNX Runtime 在本地处理文本——标准或流式——且不会向外部发送任何数据

4

PCM 音频输出

Float32 PCM 数据可直接用于播放、保存、口型同步或任何下游音频处理

语音模型类型

两种模型架构覆盖广泛的使用场景,从广泛的语言覆盖到工作室级输出质量。

Piper 语音模型

基于 ONNX 的模型,覆盖 51 种语言,包含 166 个语音模型和 2800 多位独特说话人。支持接受自定义训练的 ONNX 模型。

Kokoro 工作室级质量模型

151 个高质量开源语音模型,覆盖 8 种语言:英语(美国与英国)、简体中文、西班牙语、葡萄牙语、印地语、法语和意大利语。属于目前可用的最高质量开源 TTS 解决方案之一。

自定义语音模型

通过插件设置直接导入您自己的 Piper(ONNX + JSON)或 Kokoro(BIN + JSON)语音模型,以支持特定语音或语言。

语言与平台支持

广泛的语言覆盖范围,以及对 Unreal Engine 所面向的每个主要平台的一流支持。

语言覆盖

英语(美国与英国)
德语
西班牙语
法语
简体中文
俄语
葡萄牙语
印地语
意大利语
波兰语
另有 41 种 - 阿拉伯语、荷兰语、土耳其语、 韩语、越南语、乌克兰语、加泰罗尼亚语...

平台支持

Windows
Mac
Linux
Android
iOS
Meta Quest

全功能语音控制

除了基本的合成功能外,该插件还提供流式输出、多说话人选择、可取消操作和模型管理工具——所有这些都可以从 Blueprints 或 C++ 中访问。

标准与流式合成

两种合成模式:先完成整个文本再返回音频,或在生成时实时流式传输 PCM 数据块,以便立即播放长文本。

多说话人选择

许多模型支持多个说话人——英语 LibriTTS 包含 900 多种不同的声音。在合成时查询每个模型的说话人数量,并按索引选择。

可取消操作

随时取消任何正在进行的合成——对于需要在生成过程中中断并重新开始语音的响应式应用至关重要。

编辑器内模型管理

直接从 Unreal Editor 下载、预览和管理语音模型。无需离开引擎即可列出可用模型、查询元数据和控制存储。

语音元数据与工具

按名称或对象引用检索模型元数据、语言、质量等级和说话人数量。在运行时根据语言或其他条件动态选择模型。

完全在设备端运行

无需互联网连接、无需 API 密钥、数据不会离开设备。适用于对隐私敏感的应用、物理隔离环境和离线游戏。

Blueprint 示例 - 带实时播放的流式 TTS

使用 Runtime Audio Importer 蓝图示例的流式 TTS

试用演示

提供 Windows 演示版,以便亲身感受插件的语音质量。该演示 包含精选的 Piper 和 Kokoro 语音模型,展示不同的语言、 说话人数量和合成模式。

多种语音模型类型

标准、多说话人以及 Kokoro 录音室级模型

标准合成与流式合成

通过自定义文本输入并排比较两种合成模式

包含 Blueprint 源代码

演示项目中提供完整的 Blueprint 实现,以供参考

下载演示版 (Windows)

视频教程

插件生态系统

Runtime Text To Speech 是 Georgy Dev 插件套件的语音输出层——驱动口型同步、为 AI 角色管线提供动力,并完成语音识别闭环。

Runtime Audio Importer

接收来自 TTS 合成的 PCM 音频输出,并在运行时播放、流式传输或进一步处理。

了解更多

Runtime MetaHuman Lip Sync

直接根据 TTS 音频输出,在 MetaHuman 和自定义角色上驱动实时口型同步动画。

了解更多

Runtime Speech Recognizer

闭合语音闭环——将离线语音识别与离线 TTS 结合,带来完全设备端的对话体验。

了解更多

AI Chatbot Integrator

将来自不同提供商的 AI 生成文本直接导入 TTS 合成,实现完全语音化的 NPC 响应。

了解更多

Runtime Local LLM

使用设备端 LLM 在离线状态下生成对话,然后通过合成的语音驱动口型同步,实现完全离线的角色交互。

了解更多

文档与支持

全面的文档涵盖了所有合成模式、模型管理、多说话人 配置、流式工作流以及特定平台指南。

完整文档

所有功能的分步指南,包含 Blueprint 和 C++ 示例

社区与支持

活跃的 Discord 社区,提供开发者支持

定制开发

定制集成或功能开发 - [email protected]

演示 - 在编辑器中下载和预览语音模型

在编辑器中下载并预览语音模型

准备好为您的项目添加文本转语音功能了吗?

适用于 UE 4.27 – 5.8,可在 Fab 上获取。包含所有语音模型、完整文档,以及一个展示流式 TTS 和 Kokoro 语音的演示项目。