
Plattformübergreifende Offline-Text-to-Speech-Synthese für Unreal Engine. Erzeugen Sie natürlich klingende Sprache mit über 2800 Stimmen in 51 Sprachen – einschließlich Kokoro-Stimmmodellen in Studioqualität und Streaming-TTS – mit vollständiger Blueprint- und C++-Unterstützung.
Der Text wird vollständig auf dem Gerät synthetisiert, mit Piper- oder Kokoro-Stimmmodellen über ONNX Runtime – im Standard- oder Streamingmodus – ohne Internetverbindung, ohne API-Schlüssel und ohne dass Daten nach außen gesendet werden. Das resultierende PCM-Audio wird direkt in Runtime Audio Importer integriert und kann sofort wiedergegeben werden.
Beliebige Zeichenkette aus Blueprint, C++ oder aus einer KI-Chatbot-Antwort eingespeist.
Wählen Sie ein Piper- oder Kokoro-Modell nach Name oder Objekt aus, mit optionalen Sprecher- und Qualitätseinstellungen
ONNX Runtime verarbeitet den Text lokal - im Standard- oder Streaming-Modus - ohne dass Daten extern gesendet werden.
Float32-PCM-Daten, bereit für Wiedergabe, Speichern, Lippensynchronisation oder jede nachgelagerte Audioverarbeitung
Zwei Modellarchitekturen decken eine breite Palette von Anwendungsfällen ab, von umfassender Sprachabdeckung bis hin zu Studioqualität.
ONNX-basierte Modelle decken 51 Sprachen mit 166 Stimmmodellen und über 2800 einzigartigen Sprechern ab. Akzeptiert individuell trainierte ONNX-Modelle.
151 hochwertige Open-Source-Stimmmodelle in 8 Sprachen: Englisch (US & UK), vereinfachtes Chinesisch, Spanisch, Portugiesisch, Hindi, Französisch und Italienisch. Gehört zu den hochwertigsten verfügbaren Open-Source-TTS-Lösungen.
Importieren Sie Ihre eigenen Piper- (ONNX + JSON) oder Kokoro-Stimmmodelle (BIN + JSON) direkt über die Plugin-Einstellungen für spezialisierte Stimmen oder Sprachen.
Breite Sprachabdeckung und erstklassige Unterstützung für jede große Plattform, die Unreal Engine anspricht.
Über die grundlegende Synthese hinaus bietet das Plugin Streaming-Ausgabe, Mehrsprecher-Auswahl, abbrechbare Operationen und Dienstprogramme zur Modellverwaltung – alles von Blueprints oder C++ aus zugänglich.
Zwei Synthese-Modi: Entweder den gesamten Text vervollständigen, bevor Audio zurückgegeben wird, oder PCM-Chunks in Echtzeit streamen, während sie erzeugt werden, für die sofortige Wiedergabe langer Texte.
Viele Modelle unterstützen mehrere Sprecher – das englische LibriTTS enthält über 900 verschiedene Stimmen. Fragen Sie die Sprecheranzahl pro Modell ab und wählen Sie zur Synthesezeit per Index aus.
Brechen Sie jederzeit eine laufende Synthese ab – unerlässlich für reaktionsschnelle Anwendungen, die Sprache mitten in der Erzeugung unterbrechen und neu starten müssen.
Laden Sie Sprachmodelle direkt aus dem Unreal Editor herunter, zeigen Sie Vorschauen an und verwalten Sie sie. Listen Sie verfügbare Modelle auf, fragen Sie Metadaten ab und steuern Sie den Speicher, ohne die Engine zu verlassen.
Rufen Sie Modellmetadaten, Sprache, Qualitätsstufe und Sprecheranzahl anhand von Name oder Objektverweis ab. Wählen Sie Modelle zur Laufzeit dynamisch basierend auf Sprache oder anderen Kriterien aus.
Keine Internetverbindung, keine API-Schlüssel, keine Daten verlassen das Gerät. Geeignet für datenschutzsensible Anwendungen, abgeschottete Umgebungen und Offline-Spiele.
Blueprint-Beispiel - Streaming-TTS mit Echtzeit-Wiedergabe

Ein Windows-Demo ist verfügbar, um die Stimmqualität des Plugins aus erster Hand zu erleben. Das Demo enthält eine handverlesene Auswahl an Piper- und Kokoro-Stimmmodellen, die verschiedene Sprachen, Sprecherzahlen und Synthesemodi präsentiert.
Standard-, Mehrsprecher- und Kokoro-Studioqualitätsmodelle
Vergleichen Sie beide Synthesemodi Seite an Seite mit benutzerdefinierter Texteingabe.
Vollständige Blueprint-Implementierung im Demo-Projekt als Referenz
Video-Tutorial
Runtime Text To Speech ist die Sprachausgabeschicht der Georgy Dev Plugin-Suite – sie treibt die Lippensynchronisation an, versorgt AI-Charakter-Pipelines mit Sprache und schließt die Spracherkennungsschleife.
PCM-Audioausgabe aus der TTS-Synthese empfangen und abspielen, streamen oder zur Laufzeit weiterverarbeiten.
Mehr erfahrenSteuern Sie Echtzeit-Lippensynchronisations-Animationen auf MetaHuman- und benutzerdefinierten Charakteren direkt aus der TTS-Audioausgabe.
Mehr erfahrenSchließen Sie die Sprachschleife – kombinieren Sie Offline-Spracherkennung mit Offline-TTS für vollständig auf dem Gerät laufende Gesprächserlebnisse.
Mehr erfahrenLeiten Sie AI-generierten Text von verschiedenen Anbietern direkt in die TTS-Synthese, um vollständig vertonte NPC-Antworten zu erhalten.
Mehr erfahrenGenerieren Sie Dialoge offline mit On-Device-LLMs und steuern Sie dann die Lippensynchronisation aus der synthetisierten Sprache für vollständig offline ablaufende Charakterinteraktionen.
Mehr erfahrenUmfassende Dokumentation behandelt alle Synthesemodi, die Modellverwaltung, die Mehrsprecher- Konfiguration, Streaming-Workflows und plattformspezifische Anleitungen.
Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen
Aktive Discord-Community mit Entwickler-Support
Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]
Demo - Sprachmodell-Download und Vorschau im Editor

Verfügbar auf Fab für UE 4.27 – 5.8. Enthält alle Sprachmodelle, vollständige Dokumentation und ein Demo-Projekt, das Streaming-TTS und Kokoro-Stimmen zeigt.