Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Síntesis de texto a voz multiplataforma y sin conexión para Unreal Engine. Genera voz de sonido natural con más de 2800 voces en 51 idiomas - incluidos modelos de voz Kokoro de calidad de estudio y TTS en streaming - con soporte completo para Blueprint y C++.

UE 4.27 – 5.8
Blueprints y C++
Todas las plataformas compatibles
51 idiomas, más de 2800 voces

Cómo funciona

El texto se sintetiza íntegramente en el dispositivo mediante modelos de voz Piper o Kokoro a través de ONNX Runtime - estándar o en streaming - sin conexión a Internet, sin claves API y sin enviar datos al exterior. El audio PCM resultante se integra directamente con Runtime Audio Importer para su reproducción inmediata.

1

Entrada de texto

Cualquier cadena de Blueprint, C++ o canalizada desde una respuesta de chatbot de IA

2

Modelo de voz

Seleccione un modelo Piper o Kokoro por nombre u objeto, con ajustes opcionales de hablante y calidad

3

Síntesis en el dispositivo

ONNX Runtime procesa el texto localmente (estándar o en streaming) sin enviar datos al exterior

4

Salida de audio PCM

Datos PCM Float32 listos para reproducción, guardado, sincronización de labios o cualquier procesamiento de audio posterior

Tipos de modelos de voz

Dos arquitecturas de modelos que cubren una amplia gama de casos de uso, desde una amplia cobertura de idiomas hasta resultados de calidad de estudio.

Modelos de voz Piper

Modelos basados en ONNX que cubren 51 idiomas con 166 modelos de voz y más de 2800 hablantes únicos. Acepta modelos ONNX personalizados.

Modelos de calidad de estudio Kokoro

151 modelos de voz de código abierto de alta calidad en 8 idiomas: inglés (EE. UU. y Reino Unido), chino simplificado, español, portugués, hindi, francés e italiano. Entre las soluciones de TTS de código abierto de mayor calidad disponibles.

Modelos de voz personalizados

Importe sus propios modelos de voz Piper (ONNX + JSON) o Kokoro (BIN + JSON) directamente mediante la configuración del plugin para voces o idiomas especializados.

Idiomas y soporte de plataforma

Amplia cobertura de idiomas y soporte de primera clase para todas las plataformas principales a las que se dirige Unreal Engine.

Cobertura de idiomas

Inglés (EE. UU. y Reino Unido)
Alemán
Español
Francés
Chino simplificado
Ruso
Portugués
Hindi
Italiano
polaco
41 más - árabe, neerlandés, turco, coreano, vietnamita, ucraniano, catalán...

Compatibilidad de plataformas

Windows
Mac
Linux
Android
iOS
Meta Quest

Control de voz completo

Más allá de la síntesis básica, el plugin ofrece salida en streaming, selección de múltiples voces, operaciones cancelables y utilidades de gestión de modelos - todo accesible desde Blueprints o C++.

Síntesis estándar y en streaming

Dos modos de síntesis: completar el texto completo antes de devolver el audio, o transmitir fragmentos PCM en tiempo real a medida que se generan para la reproducción inmediata de textos largos.

Selección de múltiples voces

Muchos modelos admiten múltiples voces: el LibriTTS en inglés incluye más de 900 voces distintas. Consulte el número de voces por modelo y seleccione por índice en el momento de la síntesis.

Operaciones cancelables

Cancele cualquier síntesis en curso en cualquier momento - esencial para aplicaciones con capacidad de respuesta que necesitan interrumpir y reiniciar la voz a mitad de la generación.

Gestión de modelos en el editor

Descargue, previsualice y gestione los modelos de voz directamente desde el Unreal Editor. Enumere los modelos disponibles, consulte los metadatos y controle el almacenamiento sin salir del motor.

Metadatos y utilidades de voz

Recupere los metadatos del modelo, el idioma, el nivel de calidad y el número de voces por nombre o referencia a objeto. Seleccione modelos dinámicamente en tiempo de ejecución según el idioma u otros criterios.

Totalmente en el dispositivo

Sin conexión a internet, sin claves de API, sin datos que salgan del dispositivo. Adecuado para aplicaciones sensibles a la privacidad, entornos aislados de la red y juegos sin conexión.

Ejemplo de Blueprint - TTS en streaming con reproducción en tiempo real

TTS en streaming con ejemplo de Blueprint de Runtime Audio Importer

Probar la demo

Hay una demostración para Windows disponible para experimentar de primera mano la calidad de voz del plugin. La demostración incluye una selección curada de modelos de voz Piper y Kokoro que muestran diferentes idiomas, cantidades de hablantes y modos de síntesis.

Varios tipos de modelos de voz

Modelos estándar, multi-hablante y Kokoro de calidad de estudio

Síntesis estándar y en streaming

Compare ambos modos de síntesis lado a lado con entrada de texto personalizada

Código fuente de Blueprint incluido

Implementación completa de Blueprint en el proyecto de demostración como referencia

Descargar demo (Windows)

Tutorial en video

Ecosistema de plugins

Runtime Text To Speech es la capa de salida de voz de la suite de plugins de Georgy Dev: impulsa la sincronización de labios, potencia los pipelines de personajes con IA y completa el bucle de reconocimiento de voz.

Runtime Audio Importer

Recibe la salida de audio PCM de la síntesis TTS y reprodúcela, transmítela en streaming o procésala más a fondo en tiempo de ejecución.

Aprende más

Runtime MetaHuman Lip Sync

Impulsa animaciones de sincronización de labios en tiempo real en MetaHuman y personajes personalizados directamente desde la salida de audio TTS.

Aprende más

Runtime Speech Recognizer

Cierra el bucle de voz: combina el reconocimiento de voz sin conexión con TTS sin conexión para experiencias conversacionales totalmente en el dispositivo.

Aprende más

AI Chatbot Integrator

Canaliza el texto generado por IA de varios proveedores directamente a la síntesis TTS para obtener respuestas de NPC totalmente locutadas.

Aprende más

Runtime Local LLM

Genera diálogos con LLM en el dispositivo sin conexión y luego impulsa la sincronización de labios desde el habla sintetizada para interacciones de personajes completamente sin conexión.

Aprende más

Documentación y soporte

La documentación completa cubre todos los modos de síntesis, la gestión de modelos, la configuración multi-hablante, los flujos de trabajo de streaming y la orientación específica para cada plataforma.

Documentación completa

Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++

Comunidad y soporte

Comunidad activa de Discord con soporte para desarrolladores

Desarrollo personalizado

Integración personalizada o desarrollo de funciones - [email protected]

Demo - Descarga y vista previa del modelo de voz en el editor

Descarga y previsualiza modelos de voz en el editor

¿Listo para añadir texto a voz a tu proyecto?

Disponible en Fab para UE 4.27 – 5.8. Incluye todos los modelos de voz, documentación completa y un proyecto de demostración que muestra TTS en streaming y voces Kokoro.