基於 whisper.cpp 實作 OpenAI 的 Whisper 模型 - 最先進的準確度,完全在裝置端執行,且不會將任何資料傳送至外部伺服器。
在擷取時即時處理音訊,非常適合即時語音指令和互動式應用程式。
一次處理完整的音訊檔案或緩衝區,以達到最高的轉錄準確度。
自動語言偵測或明確選擇。也支援翻譯成英文。
在 Windows 上使用基於 Vulkan 的 GPU 加速,可顯著提升辨識速度。其他所有平台則使用 CPU + 內建指令集。
使用 Whisper 模型完全在裝置上處理音訊。無需網際網路連線、無需外部 API 呼叫,且不會有任何資料離開裝置。
麥克風擷取、音訊檔案或任何 PCM 來源 - 包括 Runtime Audio Importer
Whisper 模型在本機執行 - 串流或完整緩衝區,可選用 VAD 前置濾波
文字輸出,包含片段時間戳、語言偵測結果與信心度資料
在 Blueprint 或 C++ 中綁定結果委派,並立即對辨識出的文字採取行動。
五種模型大小可讓您針對目標平台,在轉錄準確度、記憶體使用量與處理速度之間取得平衡。
| 模型 | 大小 | 語言 | 最適合 |
|---|---|---|---|
| Tiny | 75 MB | 多語言 / EN | 行動裝置、Quest |
| 基礎 | 142 MB | 多語言/英文 | 低階裝置 |
| 小型 | 466 MB | 多語言/英文 | 均衡 |
| 中等 | 1.5 GB | 多語言/英文 | 高準確度 |
| 大型 | 3 GB | 多語言 | 最高準確度 |
也提供量化版本以減少記憶體使用。支援自訂模型。
可辨識 95 種以上語言的語音,並具備自動偵測功能,也可明確指定語言以獲得最佳效能。亦支援翻譯成英文。
細粒度控制辨識參數、效能調整和輸出篩選 - 全部可從 Blueprints 或 C++ 存取。
設定執行緒數量、步階大小、光束大小、音訊上下文大小,以及無上下文/單一區段模式。串流和非串流模式有各自獨立的預設值。
啟用加速模式、為多 GPU 系統選擇 GPU 裝置 ID,並調整音訊上下文大小,在受限硬體上以準確度換取速度。
提供初始提示以引導轉錄風格。抑制空白區段和非語音標記,保持輸出乾淨且結構化。
與 Runtime Audio Importer 的語音活動偵測結合,僅將語音區段送入辨識器 - 提升準確度並減少浪費的運算。
將任何受支援語言的已辨識語音,在單次處理中直接翻譯成英文 - 不需要額外的翻譯步驟。
無需網際網路連線、無需 API 金鑰、資料不會離開裝置。適合對隱私敏感的應用程式和氣隙隔離環境。
Blueprint 範例 - 使用語音活動偵測的串流辨識

相同的 Blueprint 和 C++ API 在 Unreal Engine 支援的所有平台上皆可使用 - 從桌面平台到行動平台再到遊戲主機。
在 Windows 上透過 Vulkan 進行 GPU 加速。在所有其他平台(包括 Android、iOS 和主機)上透過 CPU + 內建函式加速。
Runtime Speech Recognizer 自然融入 Georgy Dev 外掛套件 - 將它與音訊擷取、TTS 和 AI 聊天結合,以建立完整的語音驅動角色管線。
使用各種 AI 提供者(OpenAI、Claude、DeepSeek、Gemini、Grok、Ollama、ElevenLabs、Google Cloud 和 Azure)處理辨識語音,以 驅動智慧對話式 NPC。
了解更多完整的文件涵蓋串流和非串流工作流程、模型選擇、語言設定、VAD 整合,以及特定平台的指南。
所有功能的逐步指南,包含 Blueprint 與 C++ 範例
完整的逐步解說,涵蓋設定、串流辨識與 VAD 整合
活躍的 Discord 社群,提供開發者支援
量身打造的整合或功能開發 - [email protected]