Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

面向 Unreal Engine 的跨平台离线语音识别。由 Whisper AI 驱动 - 将语音完全在设备端转换为文本,支持所有平台,无需互联网连接。

UE 4.27 – 5.8
Blueprints 和 C++
支持所有平台
95+ 种语言

离线语音识别,任何平台

基于 whisper.cpp 对 OpenAI 的 Whisper 模型的实现 - 最先进的准确性完全在设备端运行,不向外部服务器发送任何数据。

流式识别

在捕获音频时实时处理音频 - 非常适合实时语音命令和交互式应用程序。

非流式识别

单次处理完整的音频文件或缓冲区,以获得最高转录准确度。

95+ 种语言

自动语言检测或手动选择。还支持翻译成英语。

GPU 加速

在 Windows 上基于 Vulkan 的 GPU 加速,可显著提升识别速度。其他所有平台使用 CPU + 内部函数。

工作原理

音频完全在设备端使用 Whisper 模型处理。无需互联网连接,无需外部 API 调用,数据不会离开设备。

1

音频输入

麦克风采集、音频文件或任何 PCM 源 - 包括 Runtime Audio Importer

2

设备端处理

Whisper 模型在本地运行 - 流式或全缓冲区,并支持可选的 VAD 预过滤。

3

转录

文本输出,包含分段时间戳、语言检测结果和置信度数据

4

您的游戏逻辑

在 Blueprint 或 C++ 中绑定结果委托,并立即对识别出的文本做出响应

选择您的模型

五种模型大小可让您针对目标平台,在转录准确度与内存占用、处理速度之间进行权衡。

模型 大小 语言 最适合
Tiny 75 MB Multi / EN 移动端、Quest
基础 142 MB 多语言 / 英语 低端设备
466 MB 多语言 / 英语 平衡
1.5 GB 多语言 / 英语 高精度
3 GB 多语言 最高精度

还提供量化变体以降低内存使用。支持自定义模型。

通用语言支持

支持 95+ 种语言的语音识别,可自动检测,也可显式指定语言以获得最佳性能。还支持翻译成英语。

英语
中文
西班牙语
法语
德语
日语
韩语
俄语
阿拉伯语
印地语
葡萄牙语
+ 84 种其他语言
查看完整语言列表

完整识别控制

对识别参数、性能调优和输出过滤进行细粒度控制 - 全部可从 Blueprints 或 C++ 中访问。

识别参数

配置线程数、步长、束宽、音频上下文大小,以及无上下文 / 单段模式。为流式模式和非流式模式分别设置默认值。

性能调优

启用加速模式,为多 GPU 系统选择 GPU 设备 ID,并调整音频上下文大小,以便在受限硬件上用准确性换取速度。

提示与输出控制

提供初始提示以引导转写风格。抑制空白段和非语音标记,使输出保持整洁和结构化。

VAD 集成

与 Runtime Audio Importer 的语音活动检测相结合,仅将语音片段送入识别器 - 提高准确性并减少计算浪费。

翻译

将识别出的语音从任何受支持的语言直接翻译成英语,一次性完成 - 无需单独的翻译步骤。

完全设备端

无需互联网连接,无需 API 密钥,数据不会离开设备。适用于隐私敏感型应用和物理隔离环境。

Blueprint 示例 - 使用语音活动检测的流式识别

带 VAD 的流式语音识别 Blueprint 示例

支持所有平台

同样的 Blueprint 和 C++ API 可在 Unreal Engine 支持的每个平台上运行 - 从桌面到移动设备再到游戏主机。

通过 Vulkan 在 Windows 上进行 GPU 加速。在所有其他平台(包括 Android、iOS 和游戏主机)上使用 CPU + intrinsics 加速。

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

插件生态系统

Runtime Speech Recognizer 天然融入 Georgy Dev 插件套件 - 将其与音频采集、TTS 和 AI 聊天相结合,构建完整的语音驱动角色管线。

Runtime Audio Importer

支持语音活动检测的麦克风采集 - 将干净的 语音片段直接馈送给识别器。

了解更多

Runtime MetaHuman Lip Sync

MetaHuman 和自定义角色的实时唇形同步 - 对识别出的语音响应 进行动画制作。

了解更多

Runtime Text To Speech

完全离线的语音合成 - 通过向用户朗读响应 来闭合语音回路。

了解更多

AI 聊天机器人集成器

使用各种 AI 提供商(OpenAI、Claude、DeepSeek、Gemini、Grok、Ollama、ElevenLabs、Google Cloud 和 Azure)处理识别出的语音,以 驱动智能对话 NPC。

了解更多

Runtime Local LLM

使用设备端 LLM 离线生成对话,然后驱动唇形同步 从 合成的语音,实现完全离线的角色交互。

了解更多

文档与支持

全面的文档涵盖流式和非流式工作流、模型选择、语言配置、VAD 集成以及平台特定指南。

完整文档

所有功能的逐步指南,包含 Blueprint 和 C++ 示例

视频教程

完整演示,涵盖设置、流式识别和 VAD 集成

社区与支持

活跃的 Discord 社区,提供开发者支持

定制开发

量身定制的集成或功能开发 - [email protected]

准备好为您的项目添加语音识别了吗?

可在 Fab 上获取,适用于 UE 4.27 – 5.8。包含所有模型尺寸、完整文档和演示项目。