Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Unreal Engine向けのクロスプラットフォーム、オフラインのテキスト読み上げ合成。自然な音声を生成 51言語、2800以上の音声に対応 - Kokoroのスタジオ品質の音声モデルとストリーミングTTSを含む - 完全なBlueprintおよびC++サポート付き。

UE 4.27 – 5.8
Blueprints および C++
すべてのプラットフォームに対応
51言語、2800以上の音声

仕組み

テキストは、ONNX Runtimeを介してPiperまたはKokoroの音声モデルを使用し、デバイス上で完全に合成されます。標準またはストリーミングのいずれでも、インターネット接続やAPIキーは不要で、外部にデータは送信されません。生成されたPCMオーディオはRuntime Audio Importerに直接統合され、即座に再生できます。

1

テキスト入力

Blueprint、C++、またはAIチャットボットの応答から渡される任意の文字列

2

音声モデル

名前またはオブジェクトでPiperまたはKokoroモデルを選択し、オプションのスピーカーと品質設定を指定します

3

オンデバイス合成

ONNX Runtimeはテキストをローカルで処理します(標準またはストリーミング)。外部にデータが送信されることはありません。

4

PCMオーディオ出力

Float32 PCMデータ。再生、保存、リップシンク、または後続のオーディオ処理に利用できます。

音声モデルの種類

幅広い言語カバレッジからスタジオ品質の出力まで、さまざまなユースケースをカバーする2つのモデルアーキテクチャ。

Piper音声モデル

ONNXベースのモデルで、51言語、166の音声モデル、2800以上のユニークなスピーカーをカバーしています。カスタムトレーニングされたONNXモデルも受け付けます。

Kokoroスタジオ品質モデル

8言語にわたる151の高品質なオープンソース音声モデル:英語(米国・英国)、簡体字中国語、スペイン語、ポルトガル語、ヒンディー語、フランス語、イタリア語。利用可能なオープンソースTTSソリューションの中でも最高品質の一つです。

カスタム音声モデル

プラグイン設定から独自のPiper(ONNX + JSON)またはKokoro(BIN + JSON)音声モデルを直接インポートして、専門的な音声や言語に対応できます。

言語とプラットフォームのサポート

幅広い言語カバレッジと、Unreal Engineが対応するすべての主要プラットフォームに対するファーストクラスのサポート。

言語カバレッジ

英語(米国・英国)
ドイツ語
スペイン語
フランス語
簡体字中国語
ロシア語
ポルトガル語
ヒンディー語
イタリア語
ポーランド語
他41言語 - アラビア語、オランダ語、トルコ語、 韓国語、ベトナム語、ウクライナ語、カタロニア語...

対応プラットフォーム

Windows
Mac
Linux
Android
iOS
Meta Quest

フル機能の音声制御

基本的な合成に加えて、このプラグインはストリーミング出力、マルチスピーカー選択、キャンセル可能な 操作、およびモデル管理ユーティリティを提供します。これらはすべて Blueprint または C++ からアクセスできます。

標準 & ストリーミング合成

2つの合成モードがあります:全文を合成し終えてからオーディオを返すか、生成されたPCMチャンクをリアルタイムでストリーミングして、長いテキストを即座に再生します。

マルチスピーカー選択

多くのモデルが複数の話者に対応しています。English LibriTTS には 900 以上の異なる音声が含まれています。モデルごとの話者数を照会し、合成時にインデックスで選択できます。

キャンセル可能な操作

進行中の合成はいつでもキャンセルできます。生成途中で音声を中断して再開する必要がある、応答性の高いアプリケーションに不可欠です。

エディタ内モデル管理

Unreal Editor から直接、音声モデルのダウンロード、プレビュー、管理ができます。利用可能なモデルの一覧表示、メタデータの照会、ストレージの管理を、エンジンを離れることなく行えます。

音声メタデータ & ユーティリティ

名前またはオブジェクト参照で、モデルのメタデータ、言語、品質レベル、話者数を取得できます。実行時に言語やその他の条件に基づいてモデルを動的に選択できます。

完全オンデバイス

インターネット接続不要、APIキー不要、デバイスの外部にデータが出ることもありません。プライバシーを重視するアプリケーション、エアギャップ環境、オフラインゲームに適しています。

Blueprint の例 - リアルタイム再生対応のストリーミング TTS

Runtime Audio Importer Blueprint の例を使用したストリーミングTTS

デモを試す

Windows デモを使用して、プラグインの音声品質を実際に体験できます。デモには、さまざまな言語、スピーカー数、合成モードを紹介する厳選された Piper および Kokoro 音声モデルが含まれています。

複数の音声モデルタイプ

標準、マルチスピーカー、Kokoro スタジオ品質のモデル

標準およびストリーミング合成

カスタムテキスト入力で両方の合成モードを並べて比較

Blueprint ソースコードを含む

参考用にデモプロジェクトに完全な Blueprint 実装を収録

デモをダウンロード (Windows)

ビデオチュートリアル

プラグインエコシステム

Runtime Text To Speech は、Georgy Dev プラグインスイートの音声出力レイヤーであり、リップシンクを駆動し、AI キャラクターパイプラインを強化し、音声認識ループを完成させます。

Runtime Audio Importer

TTS 合成から PCM オーディオ出力を受信し、再生したり、ストリーミングしたり、実行時にさらに処理したりできます。

詳細はこちら

Runtime MetaHuman Lip Sync

TTS オーディオ出力から直接、MetaHuman およびカスタムキャラクター上でリアルタイムのリップシンクアニメーションを駆動します。

詳細はこちら

Runtime Speech Recognizer

音声ループを閉じる - オフライン音声認識とオフライン TTS を組み合わせて、完全にデバイス上で動作する会話体験を実現します。

詳細はこちら

AI Chatbot Integrator

さまざまなプロバイダーから AI が生成したテキストを TTS 合成に直接渡し、完全に音声付きの NPC 応答を実現します。

詳細はこちら

Runtime Local LLM

オンデバイス LLM を使用してオフラインで対話を生成し、合成音声からリップシンクを駆動することで、完全にオフラインのキャラクターインタラクションを実現します。

詳細はこちら

ドキュメント & サポート

包括的なドキュメントでは、すべての合成モード、モデル管理、マルチスピーカー設定、ストリーミングワークフロー、およびプラットフォーム固有のガイダンスをカバーしています。

完全なドキュメント

全機能のステップバイステップガイド(Blueprint および C++ の例付き)

コミュニティとサポート

開発者サポートのある活発な Discord コミュニティ

カスタム開発

カスタマイズされた統合または機能開発 - [email protected]

デモ - エディタでの音声モデルのダウンロードとプレビュー

エディターで音声モデルをダウンロードしてプレビュー

プロジェクトにテキスト読み上げを追加する準備はできましたか?

Fab で UE 4.27 – 5.8 向けに利用可能です。すべての音声モデル、完全なドキュメント、ストリーミング TTS と Kokoro ボイスを紹介するデモプロジェクトが含まれています。