Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Plattformübergreifende Offline-Spracherkennung für Unreal Engine. Angetrieben von Whisper AI - wandeln Sie Sprache vollständig auf dem Gerät in Text um, auf allen Plattformen, ohne dass eine Internetverbindung erforderlich ist.

UE 4.27 – 5.8
Blueprints & C++
Alle Plattformen werden unterstützt
95+ Sprachen

Offline-Spracherkennung auf jeder Plattform

Basiert auf der whisper.cpp Implementierung des OpenAI-Whisper-Modells - modernste Genauigkeit bei vollständig lokaler Verarbeitung, ohne dass Daten an externe Server gesendet werden.

Streaming-Erkennung

Verarbeiten Sie Audio in Echtzeit, während es erfasst wird - ideal für Live-Sprachbefehle und interaktive Anwendungen.

Nicht-Streaming-Erkennung

Verarbeiten Sie vollständige Audiodateien oder Puffer in einem einzigen Durchgang für maximale Transkriptionsgenauigkeit.

95+ Sprachen

Automatische Sprachdetektion oder explizite Auswahl. Übersetzung ins Englische wird ebenfalls unterstützt.

GPU-Beschleunigung

Vulkan-basierte GPU-Beschleunigung unter Windows für deutlich schnellere Erkennung. CPU + Intrinsics auf allen anderen Plattformen.

So funktioniert es

Audio wird vollständig auf dem Gerät mit dem Whisper-Modell verarbeitet. Keine Internetverbindung, keine externen API-Aufrufe, keine Daten verlassen das Gerät.

1

Audio-Eingabe

Mikrofonaufnahme, Audiodateien oder jede PCM-Quelle – einschließlich Runtime Audio Importer

2

Verarbeitung auf dem Gerät

Das Whisper-Modell läuft lokal – Streaming oder vollständiger Puffer, mit optionaler VAD-Vorfilterung

3

Transkription

Textausgabe mit Segment-Zeitstempeln, Ergebnis der Sprachdetektion und Konfidenzdaten

4

Ihre Spiellogik

Binden Sie Ergebnis-Delegates in Blueprint oder C++ und reagieren Sie sofort auf erkannten Text.

Wählen Sie Ihr Modell

Fünf Modellgrößen ermöglichen es Ihnen, Transkriptionsgenauigkeit gegen Speicherbedarf und Verarbeitungsgeschwindigkeit für Ihre Zielplattform abzuwägen.

Modell Größe Sprachen Am besten für
Tiny 75 MB Multi / EN Mobil, Quest
Basis 142 MB Mehrsprachig / EN Leistungsschwache Geräte
Klein 466 MB Mehrsprachig / EN Ausgewogen
Mittel 1.5 GB Mehrsprachig / EN Hohe Genauigkeit
Groß 3 GB Mehrsprachig Maximale Genauigkeit

Quantisierte Varianten sind ebenfalls für einen reduzierten Speicherverbrauch verfügbar. Benutzerdefinierte Modelle werden unterstützt.

Universelle Sprachunterstützung

Erkennt Sprache in 95+ Sprachen mit automatischer Erkennung, oder legen Sie die Sprache für beste Leistung explizit fest. Die Übersetzung ins Englische wird ebenfalls unterstützt.

Englisch
Chinesisch
Spanisch
Französisch
Deutsch
Japanisch
Koreanisch
Russisch
Arabisch
Hindi
Portugiesisch
+ 84 weitere
Vollständige Sprachliste anzeigen

Volle Erkennungssteuerung

Feinkörnige Steuerung der Erkennungsparameter, Leistungsoptimierung und Ausgabefilterung - alles über Blueprints oder C++ zugänglich.

Erkennungsparameter

Konfigurieren Sie Thread-Anzahl, Schrittgröße, Beam-Größe, Audio-Kontextgröße und No-Context-/Einzelsegment-Modi. Separate Standardwerte für Streaming- und Nicht-Streaming-Modi.

Leistungsoptimierung

Aktivieren Sie den Beschleunigungsmodus, wählen Sie die GPU-Geräte-ID für Multi-GPU-Systeme und passen Sie die Audio-Kontextgröße an, um bei eingeschränkter Hardware Genauigkeit gegen Geschwindigkeit einzutauschen.

Prompt- und Ausgabesteuerung

Geben Sie einen anfänglichen Prompt an, um den Transkriptionsstil zu steuern. Unterdrücken Sie leere Segmente und Nicht-Sprach-Token, um die Ausgabe sauber und strukturiert zu halten.

VAD-Integration

Kombinieren Sie es mit der Sprachaktivitätserkennung von Runtime Audio Importer, um nur Sprachsegmente in den Spracherkenner einzuspeisen - was die Genauigkeit verbessert und verschwendete Rechenleistung reduziert.

Übersetzung

Übersetzen Sie erkannte Sprache aus jeder unterstützten Sprache in einem einzigen Durchgang direkt ins Englische - kein separater Übersetzungsschritt erforderlich.

Vollständig auf dem Gerät

Keine Internetverbindung erforderlich, keine API-Schlüssel, keine Daten verlassen das Gerät. Geeignet für datenschutzsensible Anwendungen und abgeschottete Umgebungen.

Blueprint-Beispiel - Streaming-Erkennung mit Sprachaktivitätserkennung

Streaming-Spracherkennung mit VAD-Blueprint-Beispiel

Alle Plattformen unterstützt

Dieselbe Blueprint- und C++-API funktioniert auf jeder Plattform, die Unreal Engine unterstützt - vom Desktop über Mobilgeräte bis zu Konsolen.

GPU-Beschleunigung über Vulkan unter Windows. CPU- und Intrinsics-Beschleunigung auf allen anderen Plattformen, einschließlich Android, iOS und Konsolen.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Plugin-Ökosystem

Runtime Speech Recognizer passt natürlich in die Georgy Dev Plugin-Suite - kombinieren Sie es mit Audioaufnahme, TTS und AI-Chat, um vollständige sprachgesteuerte Charakter-Pipelines zu erstellen.

Runtime Audio Importer

Mikrofonaufnahme mit Sprachaktivitätserkennung - übergeben Sie saubere Sprachsegmente direkt an den Recognizer.

Mehr erfahren

Runtime MetaHuman Lip Sync

Echtzeit-Lippensynchronisation für MetaHuman und benutzerdefinierte Charaktere - animieren Sie Antworten auf erkannte Sprache.

Mehr erfahren

Runtime Text To Speech

Vollständig offline Sprachsynthese - schließen Sie die Sprachschleife, indem Sie dem Benutzer Antworten zurücksprechen.

Mehr erfahren

AI-Chatbot-Integrator

Verarbeiten Sie erkannte Sprache mit verschiedenen AI-Anbietern (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud und Azure), um intelligente Konversations-NPCs zu ermöglichen.

Mehr erfahren

Runtime Local LLM

Generieren Sie Dialoge offline mit On-Device-LLMs und steuern Sie dann die Lippensynchronisation anhand der synthetisierten Sprache für vollständig offline Charakterinteraktionen.

Mehr erfahren

Dokumentation & Support

Die umfassende Dokumentation behandelt Streaming- und Nicht-Streaming-Workflows, Modellauswahl, Sprachkonfiguration, VAD-Integration und plattformspezifische Anleitungen.

Vollständige Dokumentation

Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen

Video-Tutorial

Komplette Anleitung, die Einrichtung, Streaming-Erkennung und VAD-Integration abdeckt

Community & Support

Aktive Discord-Community mit Entwickler-Support

Individuelle Entwicklung

Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]

Bereit, Ihrem Projekt Spracherkennung hinzuzufügen?

Verfügbar auf Fab für UE 4.27 – 5.8. Enthält alle Modellgrößen, vollständige Dokumentation und ein Demo-Projekt.