Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Plattformübergreifende Offline-Text-to-Speech-Synthese für Unreal Engine. Erzeugen Sie natürlich klingende Sprache mit über 2800 Stimmen in 51 Sprachen – einschließlich Kokoro-Stimmmodellen in Studioqualität und Streaming-TTS – mit vollständiger Blueprint- und C++-Unterstützung.

UE 4.27 – 5.8
Blueprints und C++
Alle Plattformen unterstützt
51 Sprachen, über 2800 Stimmen

So funktioniert es

Der Text wird vollständig auf dem Gerät synthetisiert, mit Piper- oder Kokoro-Stimmmodellen über ONNX Runtime – im Standard- oder Streamingmodus – ohne Internetverbindung, ohne API-Schlüssel und ohne dass Daten nach außen gesendet werden. Das resultierende PCM-Audio wird direkt in Runtime Audio Importer integriert und kann sofort wiedergegeben werden.

1

Texteingabe

Beliebige Zeichenkette aus Blueprint, C++ oder aus einer KI-Chatbot-Antwort eingespeist.

2

Stimmmodell

Wählen Sie ein Piper- oder Kokoro-Modell nach Name oder Objekt aus, mit optionalen Sprecher- und Qualitätseinstellungen

3

Lokale Synthese

ONNX Runtime verarbeitet den Text lokal - im Standard- oder Streaming-Modus - ohne dass Daten extern gesendet werden.

4

PCM-Audioausgabe

Float32-PCM-Daten, bereit für Wiedergabe, Speichern, Lippensynchronisation oder jede nachgelagerte Audioverarbeitung

Stimmmodell-Typen

Zwei Modellarchitekturen decken eine breite Palette von Anwendungsfällen ab, von umfassender Sprachabdeckung bis hin zu Studioqualität.

Piper-Stimmmodelle

ONNX-basierte Modelle decken 51 Sprachen mit 166 Stimmmodellen und über 2800 einzigartigen Sprechern ab. Akzeptiert individuell trainierte ONNX-Modelle.

Kokoro-Modelle in Studioqualität

151 hochwertige Open-Source-Stimmmodelle in 8 Sprachen: Englisch (US & UK), vereinfachtes Chinesisch, Spanisch, Portugiesisch, Hindi, Französisch und Italienisch. Gehört zu den hochwertigsten verfügbaren Open-Source-TTS-Lösungen.

Benutzerdefinierte Stimmmodelle

Importieren Sie Ihre eigenen Piper- (ONNX + JSON) oder Kokoro-Stimmmodelle (BIN + JSON) direkt über die Plugin-Einstellungen für spezialisierte Stimmen oder Sprachen.

Sprachen & Plattformunterstützung

Breite Sprachabdeckung und erstklassige Unterstützung für jede große Plattform, die Unreal Engine anspricht.

Sprachabdeckung

Englisch (US & UK)
Deutsch
Spanisch
Französisch
Vereinfachtes Chinesisch
Russisch
Portugiesisch
Hindi
Italienisch
Polnisch
41 weitere - Arabisch, Niederländisch, Türkisch, Koreanisch, Vietnamesisch, Ukrainisch, Katalanisch...

Plattformunterstützung

Windows
Mac
Linux
Android
iOS
Meta Quest

Umfassende Sprachsteuerung

Über die grundlegende Synthese hinaus bietet das Plugin Streaming-Ausgabe, Mehrsprecher-Auswahl, abbrechbare Operationen und Dienstprogramme zur Modellverwaltung – alles von Blueprints oder C++ aus zugänglich.

Standard- und Streaming-Synthese

Zwei Synthese-Modi: Entweder den gesamten Text vervollständigen, bevor Audio zurückgegeben wird, oder PCM-Chunks in Echtzeit streamen, während sie erzeugt werden, für die sofortige Wiedergabe langer Texte.

Mehrsprecher-Auswahl

Viele Modelle unterstützen mehrere Sprecher – das englische LibriTTS enthält über 900 verschiedene Stimmen. Fragen Sie die Sprecheranzahl pro Modell ab und wählen Sie zur Synthesezeit per Index aus.

Abbrechbare Operationen

Brechen Sie jederzeit eine laufende Synthese ab – unerlässlich für reaktionsschnelle Anwendungen, die Sprache mitten in der Erzeugung unterbrechen und neu starten müssen.

Modellverwaltung im Editor

Laden Sie Sprachmodelle direkt aus dem Unreal Editor herunter, zeigen Sie Vorschauen an und verwalten Sie sie. Listen Sie verfügbare Modelle auf, fragen Sie Metadaten ab und steuern Sie den Speicher, ohne die Engine zu verlassen.

Sprachmetadaten und Dienstprogramme

Rufen Sie Modellmetadaten, Sprache, Qualitätsstufe und Sprecheranzahl anhand von Name oder Objektverweis ab. Wählen Sie Modelle zur Laufzeit dynamisch basierend auf Sprache oder anderen Kriterien aus.

Vollständig auf dem Gerät

Keine Internetverbindung, keine API-Schlüssel, keine Daten verlassen das Gerät. Geeignet für datenschutzsensible Anwendungen, abgeschottete Umgebungen und Offline-Spiele.

Blueprint-Beispiel - Streaming-TTS mit Echtzeit-Wiedergabe

Streaming-TTS mit Blueprint-Beispiel für Runtime Audio Importer

Demo ausprobieren

Ein Windows-Demo ist verfügbar, um die Stimmqualität des Plugins aus erster Hand zu erleben. Das Demo enthält eine handverlesene Auswahl an Piper- und Kokoro-Stimmmodellen, die verschiedene Sprachen, Sprecherzahlen und Synthesemodi präsentiert.

Mehrere Stimmmodelltypen

Standard-, Mehrsprecher- und Kokoro-Studioqualitätsmodelle

Standard- und Streaming-Synthese

Vergleichen Sie beide Synthesemodi Seite an Seite mit benutzerdefinierter Texteingabe.

Blueprint-Quellcode enthalten

Vollständige Blueprint-Implementierung im Demo-Projekt als Referenz

Demo herunterladen (Windows)

Video-Tutorial

Plugin-Ökosystem

Runtime Text To Speech ist die Sprachausgabeschicht der Georgy Dev Plugin-Suite – sie treibt die Lippensynchronisation an, versorgt AI-Charakter-Pipelines mit Sprache und schließt die Spracherkennungsschleife.

Runtime Audio Importer

PCM-Audioausgabe aus der TTS-Synthese empfangen und abspielen, streamen oder zur Laufzeit weiterverarbeiten.

Mehr erfahren

Runtime MetaHuman Lip Sync

Steuern Sie Echtzeit-Lippensynchronisations-Animationen auf MetaHuman- und benutzerdefinierten Charakteren direkt aus der TTS-Audioausgabe.

Mehr erfahren

Runtime Speech Recognizer

Schließen Sie die Sprachschleife – kombinieren Sie Offline-Spracherkennung mit Offline-TTS für vollständig auf dem Gerät laufende Gesprächserlebnisse.

Mehr erfahren

AI Chatbot Integrator

Leiten Sie AI-generierten Text von verschiedenen Anbietern direkt in die TTS-Synthese, um vollständig vertonte NPC-Antworten zu erhalten.

Mehr erfahren

Runtime Local LLM

Generieren Sie Dialoge offline mit On-Device-LLMs und steuern Sie dann die Lippensynchronisation aus der synthetisierten Sprache für vollständig offline ablaufende Charakterinteraktionen.

Mehr erfahren

Dokumentation & Support

Umfassende Dokumentation behandelt alle Synthesemodi, die Modellverwaltung, die Mehrsprecher- Konfiguration, Streaming-Workflows und plattformspezifische Anleitungen.

Vollständige Dokumentation

Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen

Community & Support

Aktive Discord-Community mit Entwickler-Support

Individuelle Entwicklung

Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]

Demo - Sprachmodell-Download und Vorschau im Editor

Stimmmodelle im Editor herunterladen und anhören

Bereit, Text-to-Speech zu Ihrem Projekt hinzuzufügen?

Verfügbar auf Fab für UE 4.27 – 5.8. Enthält alle Sprachmodelle, vollständige Dokumentation und ein Demo-Projekt, das Streaming-TTS und Kokoro-Stimmen zeigt.