Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

跨平台離線語音辨識,適用於 Unreal Engine。由 Whisper AI 提供支援 - 完全在裝置端將語音轉換 為文字,涵蓋所有平台,且無需網際網路連線。

UE 4.27 – 5.8
Blueprints 與 C++
支援所有平台
95 種以上語言

離線語音辨識,適用於任何平台

基於 whisper.cpp 實作 OpenAI 的 Whisper 模型 - 最先進的準確度,完全在裝置端執行,且不會將任何資料傳送至外部伺服器。

串流辨識

在擷取時即時處理音訊,非常適合即時語音指令和互動式應用程式。

非串流辨識

一次處理完整的音訊檔案或緩衝區,以達到最高的轉錄準確度。

95+ 種語言

自動語言偵測或明確選擇。也支援翻譯成英文。

GPU 加速

在 Windows 上使用基於 Vulkan 的 GPU 加速,可顯著提升辨識速度。其他所有平台則使用 CPU + 內建指令集。

運作方式

使用 Whisper 模型完全在裝置上處理音訊。無需網際網路連線、無需外部 API 呼叫,且不會有任何資料離開裝置。

1

音訊輸入

麥克風擷取、音訊檔案或任何 PCM 來源 - 包括 Runtime Audio Importer

2

裝置端處理

Whisper 模型在本機執行 - 串流或完整緩衝區,可選用 VAD 前置濾波

3

轉錄

文字輸出,包含片段時間戳、語言偵測結果與信心度資料

4

您的遊戲邏輯

在 Blueprint 或 C++ 中綁定結果委派,並立即對辨識出的文字採取行動。

選擇您的模型

五種模型大小可讓您針對目標平台,在轉錄準確度、記憶體使用量與處理速度之間取得平衡。

模型 大小 語言 最適合
Tiny 75 MB 多語言 / EN 行動裝置、Quest
基礎 142 MB 多語言/英文 低階裝置
小型 466 MB 多語言/英文 均衡
中等 1.5 GB 多語言/英文 高準確度
大型 3 GB 多語言 最高準確度

也提供量化版本以減少記憶體使用。支援自訂模型。

通用語言支援

可辨識 95 種以上語言的語音,並具備自動偵測功能,也可明確指定語言以獲得最佳效能。亦支援翻譯成英文。

英文
中文
西班牙文
法文
德文
日文
韓文
俄文
阿拉伯文
印地文
葡萄牙文
+ 84 更多
查看完整語言清單

完整辨識控制

細粒度控制辨識參數、效能調整和輸出篩選 - 全部可從 Blueprints 或 C++ 存取。

辨識參數

設定執行緒數量、步階大小、光束大小、音訊上下文大小,以及無上下文/單一區段模式。串流和非串流模式有各自獨立的預設值。

效能調整

啟用加速模式、為多 GPU 系統選擇 GPU 裝置 ID,並調整音訊上下文大小,在受限硬體上以準確度換取速度。

提示與輸出控制

提供初始提示以引導轉錄風格。抑制空白區段和非語音標記,保持輸出乾淨且結構化。

VAD 整合

與 Runtime Audio Importer 的語音活動偵測結合,僅將語音區段送入辨識器 - 提升準確度並減少浪費的運算。

翻譯

將任何受支援語言的已辨識語音,在單次處理中直接翻譯成英文 - 不需要額外的翻譯步驟。

完全在裝置端

無需網際網路連線、無需 API 金鑰、資料不會離開裝置。適合對隱私敏感的應用程式和氣隙隔離環境。

Blueprint 範例 - 使用語音活動偵測的串流辨識

搭配 VAD 的串流語音辨識 Blueprint 範例

支援所有平台

相同的 Blueprint 和 C++ API 在 Unreal Engine 支援的所有平台上皆可使用 - 從桌面平台到行動平台再到遊戲主機。

在 Windows 上透過 Vulkan 進行 GPU 加速。在所有其他平台(包括 Android、iOS 和主機)上透過 CPU + 內建函式加速。

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

外掛生態系統

Runtime Speech Recognizer 自然融入 Georgy Dev 外掛套件 - 將它與音訊擷取、TTS 和 AI 聊天結合,以建立完整的語音驅動角色管線。

Runtime Audio Importer

麥克風擷取搭配語音活動偵測 - 將乾淨的 語音片段直接送入辨識器。

了解更多

Runtime MetaHuman Lip Sync

即時唇形同步適用於 MetaHuman 和自訂角色 - 動畫化 對辨識語音的回應。

了解更多

Runtime Text To Speech

完全離線的語音合成 - 透過朗讀 回應給使用者,閉合語音迴圈。

了解更多

AI 聊天機器人整合器

使用各種 AI 提供者(OpenAI、Claude、DeepSeek、Gemini、Grok、Ollama、ElevenLabs、Google Cloud 和 Azure)處理辨識語音,以 驅動智慧對話式 NPC。

了解更多

Runtime Local LLM

在裝置上離線使用 LLM 產生對話,然後根據合成語音 驅動 唇形同步,以實現完全離線的角色互動。

了解更多

文件與支援

完整的文件涵蓋串流和非串流工作流程、模型選擇、語言設定、VAD 整合,以及特定平台的指南。

完整文件

所有功能的逐步指南,包含 Blueprint 與 C++ 範例

影片教學

完整的逐步解說,涵蓋設定、串流辨識與 VAD 整合

社群與支援

活躍的 Discord 社群,提供開發者支援

客製化開發

量身打造的整合或功能開發 - [email protected]

準備好為您的專案加入語音辨識功能了嗎?

可在 Fab 上取得,支援 UE 4.27 – 5.8。包含所有模型大小、完整文件與示範專案。