Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

適用於 Unreal Engine 的跨平台離線文字轉語音合成。可產生自然流暢的語音, 支援 51 種語言、超過 2800 種聲音(包括 Kokoro 錄音室品質語音模型與串流 TTS), 並完整支援 Blueprint 與 C++。

UE 4.27 – 5.8
Blueprints 與 C++
支援所有平台
51 種語言、超過 2800 種聲音

運作方式

文字完全在裝置端使用 Piper 或 Kokoro 語音模型,透過 ONNX Runtime(標準或串流)進行合成 - 無需網際網路連線、無需 API 金鑰,也不會將任何資料傳送到外部。產生的 PCM 音訊可直接與 Runtime Audio Importer 整合,立即播放。

1

文字輸入

來自 Blueprint、C++ 或從 AI 聊天機器人回應傳入的任何字串

2

語音模型

按名稱或物件選擇 Piper 或 Kokoro 模型,並可選擇說話者與品質設定

3

裝置端合成

ONNX Runtime 在本機處理文字 - 標準或串流 - 不會將任何資料傳送到外部

4

PCM 音訊輸出

Float32 PCM 資料可立即用於播放、儲存、口型同步或任何後續音訊處理

語音模型類型

兩種模型架構涵蓋廣泛的使用案例,從廣泛的語言支援到錄音室品質的輸出。

Piper 語音模型

基於 ONNX 的模型涵蓋 51 種語言,包含 166 個語音模型和 2800+ 位獨特說話者。接受自訂訓練的 ONNX 模型。

Kokoro 錄音室品質模型

151 個高品質開源語音模型,涵蓋 8 種語言:英文(美國和英國)、簡體中文、西班牙文、葡萄牙文、印地文、法文和義大利文。是現有最高品質的開源 TTS 解決方案之一。

自訂語音模型

透過外掛程式設定直接匯入您自己的 Piper (ONNX + JSON) 或 Kokoro (BIN + JSON) 語音模型,以支援特殊語音或語言。

語言與平台支援

廣泛的語言涵蓋範圍,並為 Unreal Engine 所支援的每個主要平台提供一流的支援。

語言涵蓋範圍

英文(美國和英國)
德文
西班牙文
法文
簡體中文
俄文
葡萄牙文
印地文
義大利文
波蘭語
另外 41 種 - 阿拉伯語、荷蘭語、土耳其語、 韓語、越南語、烏克蘭語、加泰隆尼亞語...

平台支援

Windows
Mac
Linux
Android
iOS
Meta Quest

功能完整的語音控制

除了基本合成之外,此外掛程式還提供串流輸出、多說話者選擇、可取消 的操作,以及模型管理工具 - 全部可從 Blueprints 或 C++ 存取。

標準與串流合成

兩種合成模式:在傳回音訊前先完成完整文字,或在生成時即時串流 PCM 區塊,以便立即播放長文字。

多說話者選擇

許多模型支援多個說話者 - English LibriTTS 包含 900+ 種不同的聲音。在合成時查詢每個模型的說話者數量,並依索引選擇。

可取消的操作

隨時取消任何進行中的合成 - 對於需要在生成中途中斷並重新開始語音的響應式應用程式而言至關重要。

編輯器內模型管理

直接從 Unreal Editor 下載、預覽和管理語音模型。無需離開引擎即可列出可用模型、查詢中繼資料及控制儲存空間。

語音中繼資料與工具

依名稱或物件參考擷取模型中繼資料、語言、品質等級及說話者數量。在執行階段依語言或其他條件動態選擇模型。

完全在裝置端

無需網際網路連線、不需要 API 金鑰、資料不會離開裝置。適合重視隱私的應用程式、網路隔離環境和離線遊戲。

Blueprint 範例 - 即時播放的串流 TTS

使用 Runtime Audio Importer 藍圖範例的串流 TTS

試用示範

有一個 Windows 示範版可用來親身體驗外掛程式的語音品質。該示範版 包含精心挑選的 Piper 與 Kokoro 語音模型,展示不同的語言、 說話者數量與合成模式。

多種語音模型類型

標準、多說話者與 Kokoro 錄音室品質模型

標準合成與串流合成

使用自訂文字輸入並排比較兩種合成模式

包含 Blueprint 原始碼

示範專案中包含完整的 Blueprint 實作供參考

下載示範版 (Windows)

影片教學

外掛生態系統

Runtime Text To Speech 是 Georgy Dev 外掛程式套件的語音輸出層,負責驅動口型同步、為 AI 角色管線提供動力,並完成語音辨識迴圈。

Runtime Audio Importer

從 TTS 合成接收 PCM 音訊輸出,並在執行時期播放、串流或進一步處理。

了解更多

Runtime MetaHuman Lip Sync

直接從 TTS 音訊輸出驅動 MetaHuman 及自訂角色上的即時口型同步動畫。

了解更多

Runtime Speech Recognizer

閉合語音迴圈:將離線語音辨識與離線 TTS 結合,實現完全裝置端的對話體驗。

了解更多

AI Chatbot Integrator

直接將各種提供者產生的 AI 文字輸入 TTS 合成,以獲得完整配音的 NPC 回應。

了解更多

Runtime Local LLM

在離線狀態下使用裝置端 LLM 生成對話,然後從合成的語音驅動口型同步,實現完全離線的角色互動。

了解更多

文件與支援

完整的文件涵蓋所有合成模式、模型管理、多說話者 設定、串流工作流程與平台專屬指引。

完整文件

所有功能的逐步指南,包含 Blueprint 和 C++ 範例

社群與支援

活躍的 Discord 社群,提供開發者支援

自訂開發

量身打造的整合或功能開發 - [email protected]

示範 - 在編輯器中下載與預覽語音模型

在編輯器中下載並預覽語音模型

準備好將文字轉語音加入您的專案了嗎?

在 Fab 上適用於 UE 4.27 – 5.8。包含所有語音模型、完整文件,以及一個展示串流式 TTS 與 Kokoro 語音的示範專案。