Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Synthèse vocale hors ligne et multiplateforme pour Unreal Engine. Générez une parole naturelle avec plus de 2800 voix dans 51 langues - y compris des modèles vocaux de qualité studio Kokoro et le TTS en streaming - avec la prise en charge complète de Blueprint et C++.

UE 4.27 – 5.8
Blueprints et C++
Toutes les plateformes prises en charge
51 langues, plus de 2800 voix

Comment ça marche

Le texte est synthétisé entièrement sur l'appareil à l'aide des modèles vocaux Piper ou Kokoro via ONNX Runtime - standard ou streaming - sans connexion Internet, sans clés API et sans envoi de données à l'extérieur. L'audio PCM résultant s'intègre directement avec Runtime Audio Importer pour une lecture immédiate.

1

Saisie de texte

Toute chaîne provenant de Blueprint, C++, ou injectée depuis une réponse de chatbot AI

2

Modèle vocal

Sélectionnez un modèle Piper ou Kokoro par nom ou par objet, avec des paramètres optionnels de locuteur et de qualité

3

Synthèse sur l'appareil

ONNX Runtime traite le texte localement - standard ou streaming - sans qu'aucune donnée ne soit envoyée à l'extérieur

4

Sortie audio PCM

Données PCM Float32 prêtes pour la lecture, l'enregistrement, la synchro labiale ou tout traitement audio en aval

Types de modèles vocaux

Deux architectures de modèles couvrant un large éventail de cas d'usage, d'une couverture linguistique étendue à une sortie de qualité studio.

Modèles vocaux Piper

Modèles basés sur ONNX couvrant 51 langues avec 166 modèles vocaux et 2800+ locuteurs uniques. Accepte les modèles ONNX personnalisés.

Modèles Kokoro de qualité studio

151 modèles vocaux open source de haute qualité dans 8 langues : anglais (US et UK), chinois simplifié, espagnol, portugais, hindi, français et italien. Parmi les solutions TTS open source de la plus haute qualité disponibles.

Modèles vocaux personnalisés

Importez vos propres modèles vocaux Piper (ONNX + JSON) ou Kokoro (BIN + JSON) directement via les paramètres du plugin pour des voix ou des langues spécialisées.

Langues et prise en charge des plateformes

Couverture linguistique étendue et prise en charge de premier ordre pour chaque plateforme majeure ciblée par Unreal Engine.

Couverture linguistique

Anglais (US et UK)
Allemand
Espagnol
Français
Chinois simplifié
Russe
Portugais
Hindi
Italien
Polonais
41 de plus - arabe, néerlandais, turc, coréen, vietnamien, ukrainien, catalan...

Prise en charge des plateformes

Windows
Mac
Linux
Android
iOS
Meta Quest

Contrôle vocal complet

Au-delà de la synthèse de base, le plugin offre la sortie en streaming, la sélection multi-locuteurs, des opérations annulables et des utilitaires de gestion de modèles - le tout accessible depuis les Blueprints ou le C++.

Synthèse standard et en streaming

Deux modes de synthèse : terminer le texte complet avant de renvoyer l'audio, ou diffuser des morceaux PCM en temps réel au fur et à mesure de leur génération pour une lecture immédiate des textes longs.

Sélection multi-locuteurs

De nombreux modèles prennent en charge plusieurs locuteurs - l'anglais LibriTTS comprend plus de 900 voix distinctes. Interrogez le nombre de locuteurs par modèle et sélectionnez par index au moment de la synthèse.

Opérations annulables

Annulez toute synthèse en cours à tout moment - essentiel pour les applications réactives qui doivent interrompre et redémarrer la parole en pleine génération.

Gestion des modèles dans l'éditeur

Téléchargez, prévisualisez et gérez les modèles vocaux directement depuis Unreal Editor. Listez les modèles disponibles, interrogez les métadonnées et contrôlez le stockage sans quitter le moteur.

Métadonnées vocales et utilitaires

Récupérez les métadonnées du modèle, la langue, le niveau de qualité et le nombre de locuteurs par nom ou référence d'objet. Sélectionnez dynamiquement les modèles au runtime en fonction de la langue ou d'autres critères.

Entièrement sur l'appareil

Aucune connexion Internet, aucune clé API, aucune donnée ne quitte l'appareil. Convient aux applications sensibles à la confidentialité, aux environnements isolés et aux jeux hors ligne.

Exemple Blueprint - TTS en streaming avec lecture en temps réel

Exemple de Blueprint TTS en streaming avec Runtime Audio Importer

Essayez la démo

Une démo Windows est disponible pour découvrir la qualité vocale du plugin de première main. La démo comprend une sélection choisie de modèles vocaux Piper et Kokoro présentant différentes langues, nombres de locuteurs et modes de synthèse.

Plusieurs types de modèles vocaux

Modèles standard, multi-locuteurs et Kokoro de qualité studio

Synthèse standard et en streaming

Comparez les deux modes de synthèse côte à côte avec une saisie de texte personnalisée

Code source Blueprint inclus

Implémentation Blueprint complète dans le projet de démo pour référence

Télécharger la démo (Windows)

Tutoriel vidéo

Écosystème de plugins

Runtime Text To Speech est la couche de sortie vocale de la suite de plugins Georgy Dev - pilotant la synchronisation labiale, alimentant les pipelines de personnages AI et complétant la boucle de reconnaissance vocale.

Runtime Audio Importer

Recevez la sortie audio PCM de la synthèse TTS et lisez-la, diffusez-la en streaming ou traitez-la davantage à l'exécution.

En savoir plus

Runtime MetaHuman Lip Sync

Pilotez des animations de synchronisation labiale en temps réel sur MetaHuman et des personnages personnalisés directement à partir de la sortie audio TTS.

En savoir plus

Runtime Speech Recognizer

Bouclez la boucle vocale - associez la reconnaissance vocale hors ligne avec la TTS hors ligne pour des expériences conversationnelles entièrement sur l'appareil.

En savoir plus

AI Chatbot Integrator

Acheminez le texte généré par AI depuis divers fournisseurs directement dans la synthèse TTS pour des réponses NPC entièrement vocales.

En savoir plus

Runtime Local LLM

Générez des dialogues hors ligne avec des LLM sur l'appareil, puis pilotez la synchronisation labiale à partir de la parole synthétisée pour des interactions de personnages entièrement hors ligne.

En savoir plus

Documentation et support

Une documentation complète couvre tous les modes de synthèse, la gestion des modèles, la configuration multi-locuteurs, les flux de travail en streaming et les conseils spécifiques à chaque plateforme.

Documentation complète

Guides étape par étape pour toutes les fonctionnalités, avec des exemples Blueprint et C++

Communauté et support

Communauté Discord active avec support pour développeurs

Développement personnalisé

Intégration personnalisée ou développement de fonctionnalités - [email protected]

Démo - Téléchargement et aperçu du modèle vocal dans l'éditeur

Télécharger et prévisualiser les modèles vocaux dans l'éditeur

Prêt à ajouter la synthèse vocale à votre projet ?

Disponible sur Fab pour UE 4.27 – 5.8. Inclut tous les modèles vocaux, une documentation complète et un projet de démonstration présentant le TTS en streaming et les voix Kokoro.