Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Reconhecimento de fala offline multiplataforma para Unreal Engine. Com tecnologia Whisper AI - converta fala em texto inteiramente no dispositivo, em todas as plataformas, sem necessidade de conexão com a internet.

UE 4.27 – 5.8
Blueprints & C++
Todas as plataformas suportadas
95+ idiomas

Reconhecimento de Fala Offline, Qualquer Plataforma

Construído sobre o whisper.cpp - a implementação do modelo Whisper da OpenAI - precisão de última geração executando inteiramente no dispositivo, sem enviar dados para servidores externos.

Reconhecimento em Streaming

Processa áudio em tempo real conforme é capturado - ideal para comandos de voz ao vivo e aplicações interativas.

Reconhecimento Não-Streaming

Processe arquivos de áudio completos ou buffers em uma única passada para máxima precisão de transcrição.

95+ Idiomas

Detecção automática de idioma ou seleção explícita. A tradução para o inglês também é suportada.

Aceleração via GPU

Aceleração de GPU baseada em Vulkan no Windows para reconhecimento significativamente mais rápido. CPU + intrinsics em todas as outras plataformas.

Como Funciona

O áudio é processado inteiramente no dispositivo usando o modelo Whisper. Sem conexão com a internet, sem chamadas de API externas, nenhum dado sai do dispositivo.

1

Entrada de Áudio

Captura de microfone, arquivos de áudio ou qualquer fonte PCM - incluindo Runtime Audio Importer

2

Processamento no Dispositivo

O modelo Whisper roda localmente - streaming ou buffer completo, com pré-filtragem VAD opcional

3

Transcrição

Saída de texto com carimbos de tempo de segmento, resultado de detecção de idioma e dados de confiança

4

Sua Lógica de Jogo

Vincule-se a delegates de resultado em Blueprint ou C++ e aja sobre o texto reconhecido imediatamente

Escolha Seu Modelo

Cinco tamanhos de modelo permitem equilibrar a precisão da transcrição em relação ao uso de memória e à velocidade de processamento para sua plataforma alvo.

Modelo Tamanho Idiomas Melhor para
Tiny 75 MB Multi / EN Mobile, Quest
Base 142 MB Multi / EN Dispositivos de baixo desempenho
Pequeno 466 MB Multi / EN Equilibrado
Médio 1.5 GB Multi / EN Alta precisão
Grande 3 GB Multi Precisão máxima

Variantes quantizadas também estão disponíveis para reduzir o uso de memória. Modelos personalizados são suportados.

Suporte universal a idiomas

Reconhece fala em mais de 95 idiomas com detecção automática, ou especifique o idioma explicitamente para obter o melhor desempenho. A tradução para o inglês também é suportada.

Inglês
Chinês
Espanhol
Francês
Alemão
Japonês
Coreano
Russo
Árabe
Hindi
Português
+ 84 mais
Ver lista completa de idiomas

Controle Completo de Reconhecimento

Controle refinado sobre parâmetros de reconhecimento, ajuste de desempenho e filtragem de saída - tudo acessível a partir de Blueprints ou C++.

Parâmetros de Reconhecimento

Configure o número de threads, tamanho do passo, tamanho do feixe, tamanho do contexto de áudio e modos sem contexto / de segmento único. Padrões separados para modos de streaming e não streaming.

Ajuste de Desempenho

Ative o modo de aceleração, selecione o ID do dispositivo GPU para sistemas multi-GPU e ajuste o tamanho do contexto de áudio para trocar precisão por velocidade em hardware limitado.

Controle de Prompt e Saída

Forneça um prompt inicial para orientar o estilo da transcrição. Suprima segmentos vazios e tokens sem fala para manter a saída limpa e estruturada.

Integração de VAD

Combine com a Detecção de Atividade de Fala do Runtime Audio Importer para alimentar o reconhecedor apenas com segmentos de fala - melhorando a precisão e reduzindo o processamento desperdiçado.

Tradução

Traduza a fala reconhecida de qualquer idioma suportado diretamente para o inglês em uma única passada - sem necessidade de uma etapa de tradução separada.

Totalmente no Dispositivo

Nenhuma conexão com a internet é necessária, sem chaves de API, nenhum dado sai do dispositivo. Adequado para aplicações sensíveis à privacidade e ambientes isolados de rede.

Exemplo de Blueprint - Reconhecimento em streaming com Detecção de Atividade de Fala

Exemplo de Blueprint de reconhecimento de fala em streaming com VAD

Todas as Plataformas Suportadas

A mesma API Blueprint e C++ funciona em todas as plataformas que o Unreal Engine suporta - de desktop a mobile e consoles.

Aceleração por GPU via Vulkan no Windows. Aceleração por CPU + intrinsics em todas as outras plataformas, incluindo Android, iOS e consoles.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Ecossistema de Plugins

Runtime Speech Recognizer se encaixa naturalmente no conjunto de plugins da Georgy Dev - combine-o com captura de áudio, TTS e chat de IA para construir pipelines completos de personagens controlados por voz.

Runtime Audio Importer

Captura de microfone com Detecção de Atividade de Voz - alimente segmentos de fala limpos diretamente ao reconhecedor.

Saiba mais

Runtime MetaHuman Lip Sync

Sincronização labial em tempo real para MetaHuman e personagens personalizados - anime respostas à fala reconhecida.

Saiba mais

Runtime Text To Speech

Síntese de fala totalmente offline - feche o ciclo de voz falando respostas de volta ao usuário.

Saiba mais

AI Chatbot Integrator

Processe a fala reconhecida com vários provedores de IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud e Azure) para potencializar NPCs conversacionais inteligentes.

Saiba mais

Runtime Local LLM

Gere diálogo com LLMs no dispositivo offline, depois conduza a sincronização labial a partir da fala sintetizada para interações de personagens totalmente offline.

Saiba mais

Documentação e Suporte

A documentação abrangente cobre fluxos de trabalho de streaming e não streaming, seleção de modelos, configuração de idioma, integração de VAD e orientações específicas da plataforma.

Documentação Completa

Guias passo a passo para todos os recursos, com exemplos de Blueprint e C++

Tutorial em Vídeo

Passo a passo completo cobrindo configuração, reconhecimento por streaming e integração de VAD

Comunidade e Suporte

Comunidade ativa no Discord com suporte a desenvolvedores

Desenvolvimento Personalizado

Integração personalizada ou desenvolvimento de recursos - [email protected]

Pronto para Adicionar Reconhecimento de Fala ao Seu Projeto?

Disponível na Fab para UE 4.27 – 5.8. Inclui todos os tamanhos de modelo, documentação completa e um projeto de demonstração.