
Plattformübergreifende Offline-Spracherkennung für Unreal Engine. Angetrieben von Whisper AI - wandeln Sie Sprache vollständig auf dem Gerät in Text um, auf allen Plattformen, ohne dass eine Internetverbindung erforderlich ist.
Basiert auf der whisper.cpp Implementierung des OpenAI-Whisper-Modells - modernste Genauigkeit bei vollständig lokaler Verarbeitung, ohne dass Daten an externe Server gesendet werden.
Verarbeiten Sie Audio in Echtzeit, während es erfasst wird - ideal für Live-Sprachbefehle und interaktive Anwendungen.
Verarbeiten Sie vollständige Audiodateien oder Puffer in einem einzigen Durchgang für maximale Transkriptionsgenauigkeit.
Automatische Sprachdetektion oder explizite Auswahl. Übersetzung ins Englische wird ebenfalls unterstützt.
Vulkan-basierte GPU-Beschleunigung unter Windows für deutlich schnellere Erkennung. CPU + Intrinsics auf allen anderen Plattformen.
Audio wird vollständig auf dem Gerät mit dem Whisper-Modell verarbeitet. Keine Internetverbindung, keine externen API-Aufrufe, keine Daten verlassen das Gerät.
Mikrofonaufnahme, Audiodateien oder jede PCM-Quelle – einschließlich Runtime Audio Importer
Das Whisper-Modell läuft lokal – Streaming oder vollständiger Puffer, mit optionaler VAD-Vorfilterung
Textausgabe mit Segment-Zeitstempeln, Ergebnis der Sprachdetektion und Konfidenzdaten
Binden Sie Ergebnis-Delegates in Blueprint oder C++ und reagieren Sie sofort auf erkannten Text.
Fünf Modellgrößen ermöglichen es Ihnen, Transkriptionsgenauigkeit gegen Speicherbedarf und Verarbeitungsgeschwindigkeit für Ihre Zielplattform abzuwägen.
| Modell | Größe | Sprachen | Am besten für |
|---|---|---|---|
| Tiny | 75 MB | Multi / EN | Mobil, Quest |
| Basis | 142 MB | Mehrsprachig / EN | Leistungsschwache Geräte |
| Klein | 466 MB | Mehrsprachig / EN | Ausgewogen |
| Mittel | 1.5 GB | Mehrsprachig / EN | Hohe Genauigkeit |
| Groß | 3 GB | Mehrsprachig | Maximale Genauigkeit |
Quantisierte Varianten sind ebenfalls für einen reduzierten Speicherverbrauch verfügbar. Benutzerdefinierte Modelle werden unterstützt.
Erkennt Sprache in 95+ Sprachen mit automatischer Erkennung, oder legen Sie die Sprache für beste Leistung explizit fest. Die Übersetzung ins Englische wird ebenfalls unterstützt.
Feinkörnige Steuerung der Erkennungsparameter, Leistungsoptimierung und Ausgabefilterung - alles über Blueprints oder C++ zugänglich.
Konfigurieren Sie Thread-Anzahl, Schrittgröße, Beam-Größe, Audio-Kontextgröße und No-Context-/Einzelsegment-Modi. Separate Standardwerte für Streaming- und Nicht-Streaming-Modi.
Aktivieren Sie den Beschleunigungsmodus, wählen Sie die GPU-Geräte-ID für Multi-GPU-Systeme und passen Sie die Audio-Kontextgröße an, um bei eingeschränkter Hardware Genauigkeit gegen Geschwindigkeit einzutauschen.
Geben Sie einen anfänglichen Prompt an, um den Transkriptionsstil zu steuern. Unterdrücken Sie leere Segmente und Nicht-Sprach-Token, um die Ausgabe sauber und strukturiert zu halten.
Kombinieren Sie es mit der Sprachaktivitätserkennung von Runtime Audio Importer, um nur Sprachsegmente in den Spracherkenner einzuspeisen - was die Genauigkeit verbessert und verschwendete Rechenleistung reduziert.
Übersetzen Sie erkannte Sprache aus jeder unterstützten Sprache in einem einzigen Durchgang direkt ins Englische - kein separater Übersetzungsschritt erforderlich.
Keine Internetverbindung erforderlich, keine API-Schlüssel, keine Daten verlassen das Gerät. Geeignet für datenschutzsensible Anwendungen und abgeschottete Umgebungen.
Blueprint-Beispiel - Streaming-Erkennung mit Sprachaktivitätserkennung

Dieselbe Blueprint- und C++-API funktioniert auf jeder Plattform, die Unreal Engine unterstützt - vom Desktop über Mobilgeräte bis zu Konsolen.
GPU-Beschleunigung über Vulkan unter Windows. CPU- und Intrinsics-Beschleunigung auf allen anderen Plattformen, einschließlich Android, iOS und Konsolen.
Runtime Speech Recognizer passt natürlich in die Georgy Dev Plugin-Suite - kombinieren Sie es mit Audioaufnahme, TTS und AI-Chat, um vollständige sprachgesteuerte Charakter-Pipelines zu erstellen.
Mikrofonaufnahme mit Sprachaktivitätserkennung - übergeben Sie saubere Sprachsegmente direkt an den Recognizer.
Mehr erfahrenEchtzeit-Lippensynchronisation für MetaHuman und benutzerdefinierte Charaktere - animieren Sie Antworten auf erkannte Sprache.
Mehr erfahrenVollständig offline Sprachsynthese - schließen Sie die Sprachschleife, indem Sie dem Benutzer Antworten zurücksprechen.
Mehr erfahrenVerarbeiten Sie erkannte Sprache mit verschiedenen AI-Anbietern (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud und Azure), um intelligente Konversations-NPCs zu ermöglichen.
Mehr erfahrenGenerieren Sie Dialoge offline mit On-Device-LLMs und steuern Sie dann die Lippensynchronisation anhand der synthetisierten Sprache für vollständig offline Charakterinteraktionen.
Mehr erfahrenDie umfassende Dokumentation behandelt Streaming- und Nicht-Streaming-Workflows, Modellauswahl, Sprachkonfiguration, VAD-Integration und plattformspezifische Anleitungen.
Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen
Komplette Anleitung, die Einrichtung, Streaming-Erkennung und VAD-Integration abdeckt
Aktive Discord-Community mit Entwickler-Support
Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]
Verfügbar auf Fab für UE 4.27 – 5.8. Enthält alle Modellgrößen, vollständige Dokumentation und ein Demo-Projekt.