
Síntesis de texto a voz multiplataforma y sin conexión para Unreal Engine. Genera voz de sonido natural con más de 2800 voces en 51 idiomas - incluidos modelos de voz Kokoro de calidad de estudio y TTS en streaming - con soporte completo para Blueprint y C++.
El texto se sintetiza íntegramente en el dispositivo mediante modelos de voz Piper o Kokoro a través de ONNX Runtime - estándar o en streaming - sin conexión a Internet, sin claves API y sin enviar datos al exterior. El audio PCM resultante se integra directamente con Runtime Audio Importer para su reproducción inmediata.
Cualquier cadena de Blueprint, C++ o canalizada desde una respuesta de chatbot de IA
Seleccione un modelo Piper o Kokoro por nombre u objeto, con ajustes opcionales de hablante y calidad
ONNX Runtime procesa el texto localmente (estándar o en streaming) sin enviar datos al exterior
Datos PCM Float32 listos para reproducción, guardado, sincronización de labios o cualquier procesamiento de audio posterior
Dos arquitecturas de modelos que cubren una amplia gama de casos de uso, desde una amplia cobertura de idiomas hasta resultados de calidad de estudio.
Modelos basados en ONNX que cubren 51 idiomas con 166 modelos de voz y más de 2800 hablantes únicos. Acepta modelos ONNX personalizados.
151 modelos de voz de código abierto de alta calidad en 8 idiomas: inglés (EE. UU. y Reino Unido), chino simplificado, español, portugués, hindi, francés e italiano. Entre las soluciones de TTS de código abierto de mayor calidad disponibles.
Importe sus propios modelos de voz Piper (ONNX + JSON) o Kokoro (BIN + JSON) directamente mediante la configuración del plugin para voces o idiomas especializados.
Amplia cobertura de idiomas y soporte de primera clase para todas las plataformas principales a las que se dirige Unreal Engine.
Más allá de la síntesis básica, el plugin ofrece salida en streaming, selección de múltiples voces, operaciones cancelables y utilidades de gestión de modelos - todo accesible desde Blueprints o C++.
Dos modos de síntesis: completar el texto completo antes de devolver el audio, o transmitir fragmentos PCM en tiempo real a medida que se generan para la reproducción inmediata de textos largos.
Muchos modelos admiten múltiples voces: el LibriTTS en inglés incluye más de 900 voces distintas. Consulte el número de voces por modelo y seleccione por índice en el momento de la síntesis.
Cancele cualquier síntesis en curso en cualquier momento - esencial para aplicaciones con capacidad de respuesta que necesitan interrumpir y reiniciar la voz a mitad de la generación.
Descargue, previsualice y gestione los modelos de voz directamente desde el Unreal Editor. Enumere los modelos disponibles, consulte los metadatos y controle el almacenamiento sin salir del motor.
Recupere los metadatos del modelo, el idioma, el nivel de calidad y el número de voces por nombre o referencia a objeto. Seleccione modelos dinámicamente en tiempo de ejecución según el idioma u otros criterios.
Sin conexión a internet, sin claves de API, sin datos que salgan del dispositivo. Adecuado para aplicaciones sensibles a la privacidad, entornos aislados de la red y juegos sin conexión.
Ejemplo de Blueprint - TTS en streaming con reproducción en tiempo real

Hay una demostración para Windows disponible para experimentar de primera mano la calidad de voz del plugin. La demostración incluye una selección curada de modelos de voz Piper y Kokoro que muestran diferentes idiomas, cantidades de hablantes y modos de síntesis.
Modelos estándar, multi-hablante y Kokoro de calidad de estudio
Compare ambos modos de síntesis lado a lado con entrada de texto personalizada
Implementación completa de Blueprint en el proyecto de demostración como referencia
Tutorial en video
Runtime Text To Speech es la capa de salida de voz de la suite de plugins de Georgy Dev: impulsa la sincronización de labios, potencia los pipelines de personajes con IA y completa el bucle de reconocimiento de voz.
Recibe la salida de audio PCM de la síntesis TTS y reprodúcela, transmítela en streaming o procésala más a fondo en tiempo de ejecución.
Aprende másImpulsa animaciones de sincronización de labios en tiempo real en MetaHuman y personajes personalizados directamente desde la salida de audio TTS.
Aprende másCierra el bucle de voz: combina el reconocimiento de voz sin conexión con TTS sin conexión para experiencias conversacionales totalmente en el dispositivo.
Aprende másCanaliza el texto generado por IA de varios proveedores directamente a la síntesis TTS para obtener respuestas de NPC totalmente locutadas.
Aprende másGenera diálogos con LLM en el dispositivo sin conexión y luego impulsa la sincronización de labios desde el habla sintetizada para interacciones de personajes completamente sin conexión.
Aprende másLa documentación completa cubre todos los modos de síntesis, la gestión de modelos, la configuración multi-hablante, los flujos de trabajo de streaming y la orientación específica para cada plataforma.
Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++
Comunidad activa de Discord con soporte para desarrolladores
Integración personalizada o desarrollo de funciones - [email protected]
Demo - Descarga y vista previa del modelo de voz en el editor

Disponible en Fab para UE 4.27 – 5.8. Incluye todos los modelos de voz, documentación completa y un proyecto de demostración que muestra TTS en streaming y voces Kokoro.