Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Síntese de texto para fala offline e multiplataforma para Unreal Engine. Gere fala com som natural com mais de 2800 vozes em 51 idiomas - incluindo modelos de voz Kokoro de qualidade de estúdio e TTS em streaming - com suporte total a Blueprint e C++.

UE 4.27 – 5.8
Blueprints e C++
Todas as plataformas suportadas
51 idiomas, mais de 2800 vozes

Como Funciona

O texto é sintetizado inteiramente no dispositivo usando modelos de voz Piper ou Kokoro via ONNX Runtime - padrão ou em streaming - sem conexão com a internet, sem chaves de API e sem envio de dados externos. O áudio PCM resultante integra-se diretamente com o Runtime Audio Importer para reprodução imediata.

1

Entrada de Texto

Qualquer string do Blueprint, C++ ou proveniente de uma resposta de chatbot de IA

2

Modelo de Voz

Selecione um modelo Piper ou Kokoro por nome ou objeto, com configurações opcionais de locutor e qualidade

3

Síntese no Dispositivo

O ONNX Runtime processa o texto localmente - padrão ou streaming - sem enviar dados externamente

4

Saída de Áudio PCM

Dados PCM Float32 prontos para reprodução, salvamento, sincronização labial ou qualquer processamento de áudio subsequente

Tipos de Modelos de Voz

Duas arquiteturas de modelo que cobrem uma ampla gama de casos de uso, desde ampla cobertura de idiomas até saída de qualidade de estúdio.

Modelos de Voz Piper

Modelos baseados em ONNX que cobrem 51 idiomas com 166 modelos de voz e mais de 2800 locutores únicos. Aceita modelos ONNX treinados personalizados.

Modelos de Qualidade de Estúdio Kokoro

151 modelos de voz de alta qualidade e código aberto em 8 idiomas: inglês (EUA e Reino Unido), chinês simplificado, espanhol, português, hindi, francês e italiano. Entre as soluções de TTS de código aberto de mais alta qualidade disponíveis.

Modelos de Voz Personalizados

Importe seus próprios modelos de voz Piper (ONNX + JSON) ou Kokoro (BIN + JSON) diretamente pelas configurações do plugin para vozes ou idiomas especializados.

Idiomas e Suporte a Plataformas

Ampla cobertura de idiomas e suporte de primeira linha para todas as principais plataformas que o Unreal Engine tem como alvo.

Cobertura de Idiomas

Inglês (EUA e Reino Unido)
Alemão
Espanhol
Francês
Chinês Simplificado
Russo
Português
Hindi
Italiano
polonês
mais 41 - árabe, holandês, turco, coreano, vietnamita, ucraniano, catalão...

Suporte a Plataformas

Windows
Mac
Linux
Android
iOS
Meta Quest

Controle de Fala Completo

Além da síntese básica, o plugin oferece saída em streaming, seleção de múltiplos falantes, operações canceláveis e utilitários de gerenciamento de modelos - tudo acessível por Blueprints ou C++.

Síntese Padrão e em Streaming

Dois modos de síntese: completar o texto inteiro antes de retornar o áudio, ou transmitir blocos de PCM em tempo real à medida que são gerados, para reprodução imediata de textos longos.

Seleção de Múltiplos Falantes

Muitos modelos suportam vários falantes - o LibriTTS em inglês inclui 900+ vozes distintas. Consulte o número de falantes por modelo e selecione por índice no momento da síntese.

Operações Canceláveis

Cancele qualquer síntese em andamento a qualquer momento - essencial para aplicações responsivas que precisam interromper e reiniciar a fala no meio da geração.

Gerenciamento de Modelos no Editor

Baixe, visualize e gerencie modelos de voz diretamente do Unreal Editor. Liste os modelos disponíveis, consulte metadados e controle o armazenamento sem sair do mecanismo.

Metadados de Voz e Utilitários

Recupere metadados do modelo, idioma, nível de qualidade e número de falantes por nome ou referência de objeto. Selecione modelos dinamicamente em tempo de execução com base no idioma ou em outros critérios.

Totalmente no Dispositivo

Sem conexão com a internet, sem chaves de API, sem dados deixando o dispositivo. Adequado para aplicações sensíveis à privacidade, ambientes isolados e jogos offline.

Exemplo de Blueprint - TTS em streaming com reprodução em tempo real

TTS em streaming com exemplo de Blueprint do Runtime Audio Importer

Experimente a Demo

Uma demonstração para Windows está disponível para experimentar a qualidade de voz do plugin em primeira mão. A demonstração inclui uma seleção criteriosa de modelos de voz Piper e Kokoro, mostrando diferentes idiomas, quantidades de falantes e modos de síntese.

Vários tipos de modelos de voz

Modelos padrão, multifalantes e Kokoro de qualidade de estúdio

Síntese padrão e em streaming

Compare os dois modos de síntese lado a lado com entrada de texto personalizada

Código-fonte do Blueprint incluído

Implementação completa em Blueprint no projeto de demonstração para referência

Baixar Demo (Windows)

Vídeo Tutorial

Ecossistema de Plugins

Runtime Text To Speech é a camada de saída de voz da suíte de plugins Georgy Dev - impulsionando a sincronização labial, alimentando pipelines de personagens de IA e completando o ciclo de reconhecimento de fala.

Runtime Audio Importer

Receba a saída de áudio PCM da síntese de TTS e reproduza-a, transmita-a ou processe-a posteriormente em tempo de execução.

Saiba mais

Runtime MetaHuman Lip Sync

Acione animações de sincronização labial em tempo real em MetaHuman e personagens personalizados diretamente da saída de áudio do TTS.

Saiba mais

Runtime Speech Recognizer

Feche o ciclo de voz - combine o reconhecimento de fala offline com TTS offline para experiências conversacionais totalmente no dispositivo.

Saiba mais

AI Chatbot Integrator

Envie texto gerado por IA de vários provedores diretamente para a síntese de TTS para respostas de NPC totalmente dubladas.

Saiba mais

Runtime Local LLM

Gere diálogo com LLMs offline no dispositivo e, em seguida, acione a sincronização labial a partir da fala sintetizada para interações de personagens totalmente offline.

Saiba mais

Documentação e Suporte

A documentação abrangente cobre todos os modos de síntese, gerenciamento de modelos, configuração multifalante, fluxos de trabalho de streaming e orientações específicas da plataforma.

Documentação Completa

Guias passo a passo para todos os recursos, com exemplos em Blueprint e C++

Comunidade e Suporte

Comunidade ativa no Discord com suporte para desenvolvedores

Desenvolvimento Personalizado

Integração personalizada ou desenvolvimento de recursos - [email protected]

Demo - Download e pré-visualização do modelo de voz no editor

Baixe e visualize modelos de voz no editor

Pronto para adicionar Text-to-Speech ao seu projeto?

Disponível na Fab para UE 4.27 – 5.8. Inclui todos os modelos de voz, documentação completa e um projeto de demonstração que apresenta streaming de TTS e vozes Kokoro.