Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Unreal Engine向けのクロスプラットフォームなオフライン音声認識。Whisper AIを搭載 - インターネット接続を必要とせず、すべてのプラットフォームで完全にデバイス上で音声をテキストに変換します。

UE 4.27 – 5.8
Blueprints & C++
全プラットフォーム対応
95以上の言語

オフライン音声認識、あらゆるプラットフォーム対応

基づいて構築された whisper.cpp OpenAIのWhisperモデルの実装 - 最先端の精度で完全にデバイス上で動作し、外部サーバーにデータを送信しません。

ストリーミング認識

キャプチャされた音声をリアルタイムで処理 - ライブ音声コマンドやインタラクティブアプリケーションに最適です。

非ストリーミング認識

最大の文字起こし精度を実現するため、オーディオファイルまたはバッファ全体を1回のパスで処理します。

95以上の言語

自動言語検出または明示的な選択が可能です。英語への翻訳もサポートされています。

GPUアクセラレーション

WindowsではVulkanベースのGPUアクセラレーションにより、認識が大幅に高速化されます。他のすべてのプラットフォームではCPU + intrinsicsを使用します。

仕組み

オーディオはWhisperモデルを使用してデバイス上で完全に処理されます。インターネット接続は不要、外部 API呼び出しもなく、デバイスからデータが送信されることもありません。

1

オーディオ入力

マイクキャプチャ、オーディオファイル、または任意のPCMソース - Runtime Audio Importerを含む

2

オンデバイス処理

Whisperモデルはローカルで実行されます - ストリーミングまたはフルバッファ、オプションのVADプリフィルタリング付き

3

文字起こし

セグメントタイムスタンプ、言語検出結果、信頼度データ付きのテキスト出力

4

ゲームロジック

BlueprintまたはC++で結果デリゲートにバインドし、認識されたテキストに即座にアクションを実行します。

モデルを選択

5つのモデルサイズから、ターゲットプラットフォームに合わせて文字起こし精度とメモリ使用量、処理速度のバランスを調整できます。

モデル サイズ 言語 最適な用途
Tiny 75 MB 多言語 / EN モバイル、Quest
ベース 142 MB 多言語 / 英語 ローエンド端末
466 MB 多言語 / 英語 バランス
1.5 GB 多言語 / 英語 高精度
3 GB 多言語 最高精度

量子化バリアントも利用可能で、メモリ使用量を削減できます。カスタムモデルにも対応しています。

ユニバーサル言語サポート

自動検出により95以上の言語の音声を認識します。最適なパフォーマンスを得るには、言語を明示的に指定することもできます。英語への翻訳にも対応しています。

英語
中国語
スペイン語
フランス語
ドイツ語
日本語
韓国語
ロシア語
アラビア語
ヒンディー語
ポルトガル語
+ 他84言語
完全な言語リストを表示

完全な認識制御

認識パラメータ、パフォーマンスチューニング、出力フィルタリングに対するきめ細かな制御 - すべてBlueprintsまたはC++からアクセス可能。

認識パラメータ

スレッド数、ステップサイズ、ビームサイズ、オーディオコンテキストサイズ、およびノーコンテキスト/シングルセグメントモードを設定します。ストリーミングモードと非ストリーミングモードで別々のデフォルト値を用意しています。

パフォーマンスチューニング

スピードアップモードを有効にし、マルチGPUシステムのGPUデバイスIDを選択し、オーディオコンテキストサイズを調整して、リソースが限られたハードウェア上で精度と速度をトレードオフします。

プロンプトと出力制御

初期プロンプトを指定して文字起こしスタイルを誘導します。空白セグメントや非音声トークンを抑制し、出力をクリーンで構造化された状態に保ちます。

VAD統合

Runtime Audio Importerの音声アクティビティ検出と組み合わせることで、音声セグメントのみを認識器に渡し、精度を向上させるとともに無駄な計算を削減します。

翻訳

認識された音声を、対応する任意の言語から英語へ、シングルパスで直接翻訳します。別途翻訳ステップは必要ありません。

完全オンデバイス

インターネット接続不要、APIキー不要、デバイス外にデータが送信されることもありません。プライバシーに配慮したアプリケーションやエアギャップ環境に適しています。

Blueprintの例 - 音声アクティビティ検出によるストリーミング認識

VAD Blueprintの例を使ったストリーミング音声認識

全プラットフォーム対応

同じBlueprintおよびC++ APIが、Unreal Engineがサポートするすべてのプラットフォームで動作します - デスクトップからモバイル、コンソールまで。

WindowsではVulkanによるGPUアクセラレーション。その他すべてのプラットフォーム(Android、iOS、コンソールを含む)ではCPU + イントリンシックによるアクセラレーション。

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

プラグインエコシステム

Runtime Speech Recognizerは、Georgy Devプラグインスイートに自然に統合されます。オーディオキャプチャ、TTS、AIチャットと組み合わせて、完全な音声駆動キャラクターパイプラインを構築できます。

Runtime Audio Importer

音声アクティビティ検出によるマイクキャプチャ - クリーンな 音声セグメントを認識器に直接渡します。

詳細を見る

Runtime MetaHuman Lip Sync

MetaHumanおよびカスタムキャラクター向けのリアルタイムリップシンク - 認識された音声への応答を アニメーション化します。

詳細を見る

Runtime Text To Speech

完全オフラインの音声合成 - 応答をユーザーに話しかけることで、 音声ループを閉じます。

詳細を見る

AI Chatbot Integrator

認識された音声をさまざまなAIプロバイダー(OpenAI、Claude、DeepSeek、Gemini、Grok、Ollama、ElevenLabs、Google Cloud、Azure)で処理し、 インテリジェントな対話型NPCを実現します。

詳細を見る

Runtime Local LLM

オンデバイスLLMを使用してオフラインで対話を生成し、合成された音声からリップシンクを駆動して、完全オフラインのキャラクターインタラクションを実現します。

詳細を見る

ドキュメントとサポート

包括的なドキュメントは、ストリーミングおよび非ストリーミングのワークフロー、モデル選択、言語設定、VAD統合、プラットフォーム固有のガイダンスを網羅しています。

完全なドキュメント

すべての機能のステップバイステップガイド、Blueprint および C++ の例付き

ビデオチュートリアル

セットアップ、ストリーミング認識、VAD統合をカバーする完全なウォークスルー

コミュニティ & サポート

開発者サポートを備えた活発なDiscordコミュニティ

カスタム開発

オーダーメイドの統合または機能開発 - [email protected]

プロジェクトに音声認識を追加する準備はできていますか?

UE 4.27 – 5.8 向けに Fab で入手できます。すべてのモデルサイズ、完全なドキュメント、デモプロジェクトが含まれます。