
Reconhecimento de fala offline multiplataforma para Unreal Engine. Com tecnologia Whisper AI - converta fala em texto inteiramente no dispositivo, em todas as plataformas, sem necessidade de conexão com a internet.
Construído sobre o whisper.cpp - a implementação do modelo Whisper da OpenAI - precisão de última geração executando inteiramente no dispositivo, sem enviar dados para servidores externos.
Processa áudio em tempo real conforme é capturado - ideal para comandos de voz ao vivo e aplicações interativas.
Processe arquivos de áudio completos ou buffers em uma única passada para máxima precisão de transcrição.
Detecção automática de idioma ou seleção explícita. A tradução para o inglês também é suportada.
Aceleração de GPU baseada em Vulkan no Windows para reconhecimento significativamente mais rápido. CPU + intrinsics em todas as outras plataformas.
O áudio é processado inteiramente no dispositivo usando o modelo Whisper. Sem conexão com a internet, sem chamadas de API externas, nenhum dado sai do dispositivo.
Captura de microfone, arquivos de áudio ou qualquer fonte PCM - incluindo Runtime Audio Importer
O modelo Whisper roda localmente - streaming ou buffer completo, com pré-filtragem VAD opcional
Saída de texto com carimbos de tempo de segmento, resultado de detecção de idioma e dados de confiança
Vincule-se a delegates de resultado em Blueprint ou C++ e aja sobre o texto reconhecido imediatamente
Cinco tamanhos de modelo permitem equilibrar a precisão da transcrição em relação ao uso de memória e à velocidade de processamento para sua plataforma alvo.
| Modelo | Tamanho | Idiomas | Melhor para |
|---|---|---|---|
| Tiny | 75 MB | Multi / EN | Mobile, Quest |
| Base | 142 MB | Multi / EN | Dispositivos de baixo desempenho |
| Pequeno | 466 MB | Multi / EN | Equilibrado |
| Médio | 1.5 GB | Multi / EN | Alta precisão |
| Grande | 3 GB | Multi | Precisão máxima |
Variantes quantizadas também estão disponíveis para reduzir o uso de memória. Modelos personalizados são suportados.
Reconhece fala em mais de 95 idiomas com detecção automática, ou especifique o idioma explicitamente para obter o melhor desempenho. A tradução para o inglês também é suportada.
Controle refinado sobre parâmetros de reconhecimento, ajuste de desempenho e filtragem de saída - tudo acessível a partir de Blueprints ou C++.
Configure o número de threads, tamanho do passo, tamanho do feixe, tamanho do contexto de áudio e modos sem contexto / de segmento único. Padrões separados para modos de streaming e não streaming.
Ative o modo de aceleração, selecione o ID do dispositivo GPU para sistemas multi-GPU e ajuste o tamanho do contexto de áudio para trocar precisão por velocidade em hardware limitado.
Forneça um prompt inicial para orientar o estilo da transcrição. Suprima segmentos vazios e tokens sem fala para manter a saída limpa e estruturada.
Combine com a Detecção de Atividade de Fala do Runtime Audio Importer para alimentar o reconhecedor apenas com segmentos de fala - melhorando a precisão e reduzindo o processamento desperdiçado.
Traduza a fala reconhecida de qualquer idioma suportado diretamente para o inglês em uma única passada - sem necessidade de uma etapa de tradução separada.
Nenhuma conexão com a internet é necessária, sem chaves de API, nenhum dado sai do dispositivo. Adequado para aplicações sensíveis à privacidade e ambientes isolados de rede.
Exemplo de Blueprint - Reconhecimento em streaming com Detecção de Atividade de Fala

A mesma API Blueprint e C++ funciona em todas as plataformas que o Unreal Engine suporta - de desktop a mobile e consoles.
Aceleração por GPU via Vulkan no Windows. Aceleração por CPU + intrinsics em todas as outras plataformas, incluindo Android, iOS e consoles.
Runtime Speech Recognizer se encaixa naturalmente no conjunto de plugins da Georgy Dev - combine-o com captura de áudio, TTS e chat de IA para construir pipelines completos de personagens controlados por voz.
Captura de microfone com Detecção de Atividade de Voz - alimente segmentos de fala limpos diretamente ao reconhecedor.
Saiba maisSincronização labial em tempo real para MetaHuman e personagens personalizados - anime respostas à fala reconhecida.
Saiba maisSíntese de fala totalmente offline - feche o ciclo de voz falando respostas de volta ao usuário.
Saiba maisProcesse a fala reconhecida com vários provedores de IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud e Azure) para potencializar NPCs conversacionais inteligentes.
Saiba maisGere diálogo com LLMs no dispositivo offline, depois conduza a sincronização labial a partir da fala sintetizada para interações de personagens totalmente offline.
Saiba maisA documentação abrangente cobre fluxos de trabalho de streaming e não streaming, seleção de modelos, configuração de idioma, integração de VAD e orientações específicas da plataforma.
Guias passo a passo para todos os recursos, com exemplos de Blueprint e C++
Passo a passo completo cobrindo configuração, reconhecimento por streaming e integração de VAD
Comunidade ativa no Discord com suporte a desenvolvedores
Integração personalizada ou desenvolvimento de recursos - [email protected]
Disponível na Fab para UE 4.27 – 5.8. Inclui todos os tamanhos de modelo, documentação completa e um projeto de demonstração.