
Synthèse vocale hors ligne et multiplateforme pour Unreal Engine. Générez une parole naturelle avec plus de 2800 voix dans 51 langues - y compris des modèles vocaux de qualité studio Kokoro et le TTS en streaming - avec la prise en charge complète de Blueprint et C++.
Le texte est synthétisé entièrement sur l'appareil à l'aide des modèles vocaux Piper ou Kokoro via ONNX Runtime - standard ou streaming - sans connexion Internet, sans clés API et sans envoi de données à l'extérieur. L'audio PCM résultant s'intègre directement avec Runtime Audio Importer pour une lecture immédiate.
Toute chaîne provenant de Blueprint, C++, ou injectée depuis une réponse de chatbot AI
Sélectionnez un modèle Piper ou Kokoro par nom ou par objet, avec des paramètres optionnels de locuteur et de qualité
ONNX Runtime traite le texte localement - standard ou streaming - sans qu'aucune donnée ne soit envoyée à l'extérieur
Données PCM Float32 prêtes pour la lecture, l'enregistrement, la synchro labiale ou tout traitement audio en aval
Deux architectures de modèles couvrant un large éventail de cas d'usage, d'une couverture linguistique étendue à une sortie de qualité studio.
Modèles basés sur ONNX couvrant 51 langues avec 166 modèles vocaux et 2800+ locuteurs uniques. Accepte les modèles ONNX personnalisés.
151 modèles vocaux open source de haute qualité dans 8 langues : anglais (US et UK), chinois simplifié, espagnol, portugais, hindi, français et italien. Parmi les solutions TTS open source de la plus haute qualité disponibles.
Importez vos propres modèles vocaux Piper (ONNX + JSON) ou Kokoro (BIN + JSON) directement via les paramètres du plugin pour des voix ou des langues spécialisées.
Couverture linguistique étendue et prise en charge de premier ordre pour chaque plateforme majeure ciblée par Unreal Engine.
Au-delà de la synthèse de base, le plugin offre la sortie en streaming, la sélection multi-locuteurs, des opérations annulables et des utilitaires de gestion de modèles - le tout accessible depuis les Blueprints ou le C++.
Deux modes de synthèse : terminer le texte complet avant de renvoyer l'audio, ou diffuser des morceaux PCM en temps réel au fur et à mesure de leur génération pour une lecture immédiate des textes longs.
De nombreux modèles prennent en charge plusieurs locuteurs - l'anglais LibriTTS comprend plus de 900 voix distinctes. Interrogez le nombre de locuteurs par modèle et sélectionnez par index au moment de la synthèse.
Annulez toute synthèse en cours à tout moment - essentiel pour les applications réactives qui doivent interrompre et redémarrer la parole en pleine génération.
Téléchargez, prévisualisez et gérez les modèles vocaux directement depuis Unreal Editor. Listez les modèles disponibles, interrogez les métadonnées et contrôlez le stockage sans quitter le moteur.
Récupérez les métadonnées du modèle, la langue, le niveau de qualité et le nombre de locuteurs par nom ou référence d'objet. Sélectionnez dynamiquement les modèles au runtime en fonction de la langue ou d'autres critères.
Aucune connexion Internet, aucune clé API, aucune donnée ne quitte l'appareil. Convient aux applications sensibles à la confidentialité, aux environnements isolés et aux jeux hors ligne.
Exemple Blueprint - TTS en streaming avec lecture en temps réel

Une démo Windows est disponible pour découvrir la qualité vocale du plugin de première main. La démo comprend une sélection choisie de modèles vocaux Piper et Kokoro présentant différentes langues, nombres de locuteurs et modes de synthèse.
Modèles standard, multi-locuteurs et Kokoro de qualité studio
Comparez les deux modes de synthèse côte à côte avec une saisie de texte personnalisée
Implémentation Blueprint complète dans le projet de démo pour référence
Tutoriel vidéo
Runtime Text To Speech est la couche de sortie vocale de la suite de plugins Georgy Dev - pilotant la synchronisation labiale, alimentant les pipelines de personnages AI et complétant la boucle de reconnaissance vocale.
Recevez la sortie audio PCM de la synthèse TTS et lisez-la, diffusez-la en streaming ou traitez-la davantage à l'exécution.
En savoir plusPilotez des animations de synchronisation labiale en temps réel sur MetaHuman et des personnages personnalisés directement à partir de la sortie audio TTS.
En savoir plusBouclez la boucle vocale - associez la reconnaissance vocale hors ligne avec la TTS hors ligne pour des expériences conversationnelles entièrement sur l'appareil.
En savoir plusAcheminez le texte généré par AI depuis divers fournisseurs directement dans la synthèse TTS pour des réponses NPC entièrement vocales.
En savoir plusGénérez des dialogues hors ligne avec des LLM sur l'appareil, puis pilotez la synchronisation labiale à partir de la parole synthétisée pour des interactions de personnages entièrement hors ligne.
En savoir plusUne documentation complète couvre tous les modes de synthèse, la gestion des modèles, la configuration multi-locuteurs, les flux de travail en streaming et les conseils spécifiques à chaque plateforme.
Guides étape par étape pour toutes les fonctionnalités, avec des exemples Blueprint et C++
Communauté Discord active avec support pour développeurs
Intégration personnalisée ou développement de fonctionnalités - [email protected]
Démo - Téléchargement et aperçu du modèle vocal dans l'éditeur

Disponible sur Fab pour UE 4.27 – 5.8. Inclut tous les modèles vocaux, une documentation complète et un projet de démonstration présentant le TTS en streaming et les voix Kokoro.