
Síntese de texto para fala offline e multiplataforma para Unreal Engine. Gere fala com som natural com mais de 2800 vozes em 51 idiomas - incluindo modelos de voz Kokoro de qualidade de estúdio e TTS em streaming - com suporte total a Blueprint e C++.
O texto é sintetizado inteiramente no dispositivo usando modelos de voz Piper ou Kokoro via ONNX Runtime - padrão ou em streaming - sem conexão com a internet, sem chaves de API e sem envio de dados externos. O áudio PCM resultante integra-se diretamente com o Runtime Audio Importer para reprodução imediata.
Qualquer string do Blueprint, C++ ou proveniente de uma resposta de chatbot de IA
Selecione um modelo Piper ou Kokoro por nome ou objeto, com configurações opcionais de locutor e qualidade
O ONNX Runtime processa o texto localmente - padrão ou streaming - sem enviar dados externamente
Dados PCM Float32 prontos para reprodução, salvamento, sincronização labial ou qualquer processamento de áudio subsequente
Duas arquiteturas de modelo que cobrem uma ampla gama de casos de uso, desde ampla cobertura de idiomas até saída de qualidade de estúdio.
Modelos baseados em ONNX que cobrem 51 idiomas com 166 modelos de voz e mais de 2800 locutores únicos. Aceita modelos ONNX treinados personalizados.
151 modelos de voz de alta qualidade e código aberto em 8 idiomas: inglês (EUA e Reino Unido), chinês simplificado, espanhol, português, hindi, francês e italiano. Entre as soluções de TTS de código aberto de mais alta qualidade disponíveis.
Importe seus próprios modelos de voz Piper (ONNX + JSON) ou Kokoro (BIN + JSON) diretamente pelas configurações do plugin para vozes ou idiomas especializados.
Ampla cobertura de idiomas e suporte de primeira linha para todas as principais plataformas que o Unreal Engine tem como alvo.
Além da síntese básica, o plugin oferece saída em streaming, seleção de múltiplos falantes, operações canceláveis e utilitários de gerenciamento de modelos - tudo acessível por Blueprints ou C++.
Dois modos de síntese: completar o texto inteiro antes de retornar o áudio, ou transmitir blocos de PCM em tempo real à medida que são gerados, para reprodução imediata de textos longos.
Muitos modelos suportam vários falantes - o LibriTTS em inglês inclui 900+ vozes distintas. Consulte o número de falantes por modelo e selecione por índice no momento da síntese.
Cancele qualquer síntese em andamento a qualquer momento - essencial para aplicações responsivas que precisam interromper e reiniciar a fala no meio da geração.
Baixe, visualize e gerencie modelos de voz diretamente do Unreal Editor. Liste os modelos disponíveis, consulte metadados e controle o armazenamento sem sair do mecanismo.
Recupere metadados do modelo, idioma, nível de qualidade e número de falantes por nome ou referência de objeto. Selecione modelos dinamicamente em tempo de execução com base no idioma ou em outros critérios.
Sem conexão com a internet, sem chaves de API, sem dados deixando o dispositivo. Adequado para aplicações sensíveis à privacidade, ambientes isolados e jogos offline.
Exemplo de Blueprint - TTS em streaming com reprodução em tempo real

Uma demonstração para Windows está disponível para experimentar a qualidade de voz do plugin em primeira mão. A demonstração inclui uma seleção criteriosa de modelos de voz Piper e Kokoro, mostrando diferentes idiomas, quantidades de falantes e modos de síntese.
Modelos padrão, multifalantes e Kokoro de qualidade de estúdio
Compare os dois modos de síntese lado a lado com entrada de texto personalizada
Implementação completa em Blueprint no projeto de demonstração para referência
Vídeo Tutorial
Runtime Text To Speech é a camada de saída de voz da suíte de plugins Georgy Dev - impulsionando a sincronização labial, alimentando pipelines de personagens de IA e completando o ciclo de reconhecimento de fala.
Receba a saída de áudio PCM da síntese de TTS e reproduza-a, transmita-a ou processe-a posteriormente em tempo de execução.
Saiba maisAcione animações de sincronização labial em tempo real em MetaHuman e personagens personalizados diretamente da saída de áudio do TTS.
Saiba maisFeche o ciclo de voz - combine o reconhecimento de fala offline com TTS offline para experiências conversacionais totalmente no dispositivo.
Saiba maisEnvie texto gerado por IA de vários provedores diretamente para a síntese de TTS para respostas de NPC totalmente dubladas.
Saiba maisGere diálogo com LLMs offline no dispositivo e, em seguida, acione a sincronização labial a partir da fala sintetizada para interações de personagens totalmente offline.
Saiba maisA documentação abrangente cobre todos os modos de síntese, gerenciamento de modelos, configuração multifalante, fluxos de trabalho de streaming e orientações específicas da plataforma.
Guias passo a passo para todos os recursos, com exemplos em Blueprint e C++
Comunidade ativa no Discord com suporte para desenvolvedores
Integração personalizada ou desenvolvimento de recursos - [email protected]
Demo - Download e pré-visualização do modelo de voz no editor

Disponível na Fab para UE 4.27 – 5.8. Inclui todos os modelos de voz, documentação completa e um projeto de demonstração que apresenta streaming de TTS e vozes Kokoro.