基于 whisper.cpp 对 OpenAI 的 Whisper 模型的实现 - 最先进的准确性完全在设备端运行,不向外部服务器发送任何数据。
在捕获音频时实时处理音频 - 非常适合实时语音命令和交互式应用程序。
单次处理完整的音频文件或缓冲区,以获得最高转录准确度。
自动语言检测或手动选择。还支持翻译成英语。
在 Windows 上基于 Vulkan 的 GPU 加速,可显著提升识别速度。其他所有平台使用 CPU + 内部函数。
音频完全在设备端使用 Whisper 模型处理。无需互联网连接,无需外部 API 调用,数据不会离开设备。
麦克风采集、音频文件或任何 PCM 源 - 包括 Runtime Audio Importer
Whisper 模型在本地运行 - 流式或全缓冲区,并支持可选的 VAD 预过滤。
文本输出,包含分段时间戳、语言检测结果和置信度数据
在 Blueprint 或 C++ 中绑定结果委托,并立即对识别出的文本做出响应
五种模型大小可让您针对目标平台,在转录准确度与内存占用、处理速度之间进行权衡。
| 模型 | 大小 | 语言 | 最适合 |
|---|---|---|---|
| Tiny | 75 MB | Multi / EN | 移动端、Quest |
| 基础 | 142 MB | 多语言 / 英语 | 低端设备 |
| 小 | 466 MB | 多语言 / 英语 | 平衡 |
| 中 | 1.5 GB | 多语言 / 英语 | 高精度 |
| 大 | 3 GB | 多语言 | 最高精度 |
还提供量化变体以降低内存使用。支持自定义模型。
支持 95+ 种语言的语音识别,可自动检测,也可显式指定语言以获得最佳性能。还支持翻译成英语。
对识别参数、性能调优和输出过滤进行细粒度控制 - 全部可从 Blueprints 或 C++ 中访问。
配置线程数、步长、束宽、音频上下文大小,以及无上下文 / 单段模式。为流式模式和非流式模式分别设置默认值。
启用加速模式,为多 GPU 系统选择 GPU 设备 ID,并调整音频上下文大小,以便在受限硬件上用准确性换取速度。
提供初始提示以引导转写风格。抑制空白段和非语音标记,使输出保持整洁和结构化。
与 Runtime Audio Importer 的语音活动检测相结合,仅将语音片段送入识别器 - 提高准确性并减少计算浪费。
将识别出的语音从任何受支持的语言直接翻译成英语,一次性完成 - 无需单独的翻译步骤。
无需互联网连接,无需 API 密钥,数据不会离开设备。适用于隐私敏感型应用和物理隔离环境。
Blueprint 示例 - 使用语音活动检测的流式识别

同样的 Blueprint 和 C++ API 可在 Unreal Engine 支持的每个平台上运行 - 从桌面到移动设备再到游戏主机。
通过 Vulkan 在 Windows 上进行 GPU 加速。在所有其他平台(包括 Android、iOS 和游戏主机)上使用 CPU + intrinsics 加速。
Runtime Speech Recognizer 天然融入 Georgy Dev 插件套件 - 将其与音频采集、TTS 和 AI 聊天相结合,构建完整的语音驱动角色管线。
使用各种 AI 提供商(OpenAI、Claude、DeepSeek、Gemini、Grok、Ollama、ElevenLabs、Google Cloud 和 Azure)处理识别出的语音,以 驱动智能对话 NPC。
了解更多全面的文档涵盖流式和非流式工作流、模型选择、语言配置、VAD 集成以及平台特定指南。
所有功能的逐步指南,包含 Blueprint 和 C++ 示例
完整演示,涵盖设置、流式识别和 VAD 集成
活跃的 Discord 社区,提供开发者支持
量身定制的集成或功能开发 - [email protected]