
Reconocimiento de voz sin conexión multiplataforma para Unreal Engine. Impulsado por Whisper AI - convierte voz a texto completamente en el dispositivo, en todas las plataformas, sin necesidad de conexión a internet.
Construido sobre la whisper.cpp implementación del modelo Whisper de OpenAI - precisión de vanguardia ejecutándose completamente en el dispositivo, sin enviar datos a servidores externos.
Procesa audio en tiempo real a medida que se captura - ideal para comandos de voz en vivo y aplicaciones interactivas.
Procesa archivos de audio o búferes completos en una sola pasada para obtener la máxima precisión de transcripción.
Detección automática de idioma o selección explícita. También se admite la traducción al inglés.
Aceleración por GPU basada en Vulkan en Windows para un reconocimiento significativamente más rápido. CPU + instrucciones intrínsecas en todas las demás plataformas.
El audio se procesa completamente en el dispositivo utilizando el modelo Whisper. Sin conexión a internet, sin llamadas externas a API, sin que los datos salgan del dispositivo.
Captura de micrófono, archivos de audio o cualquier fuente PCM, incluido Runtime Audio Importer
El modelo Whisper se ejecuta localmente, ya sea en streaming o con búfer completo, con prefiltrado VAD opcional
Salida de texto con marcas de tiempo de segmento, resultado de detección de idioma y datos de confianza
Vincula delegados de resultado en Blueprint o C++ y actúa sobre el texto reconocido de inmediato
Cinco tamaños de modelo te permiten equilibrar la precisión de transcripción con la huella de memoria y la velocidad de procesamiento para tu plataforma de destino.
| Modelo | Tamaño | Idiomas | Ideal para |
|---|---|---|---|
| Tiny | 75 MB | Multi / EN | Móvil, Quest |
| Base | 142 MB | Multilingüe / EN | Dispositivos de gama baja |
| Pequeño | 466 MB | Multilingüe / EN | Equilibrado |
| Medio | 1.5 GB | Multilingüe / EN | Alta precisión |
| Grande | 3 GB | Multilingüe | Precisión máxima |
Variantes cuantizadas también disponibles para un menor uso de memoria. Se admiten modelos personalizados.
Reconoce voz en más de 95 idiomas con detección automática, o especifica el idioma explícitamente para obtener el mejor rendimiento. También se admite la traducción al inglés.
Control detallado sobre los parámetros de reconocimiento, ajuste de rendimiento y filtrado de salida - todo accesible desde Blueprints o C++.
Configura el número de hilos, el tamaño de paso, el tamaño del haz, el tamaño del contexto de audio y los modos sin contexto / de segmento único. Valores predeterminados separados para los modos de streaming y no streaming.
Habilita el modo de aceleración, selecciona el ID del dispositivo GPU para sistemas con varias GPU y ajusta el tamaño del contexto de audio para intercambiar precisión por velocidad en hardware limitado.
Proporciona una indicación inicial para guiar el estilo de transcripción. Suprime los segmentos vacíos y los tokens de no habla para mantener una salida limpia y estructurada.
Combínalo con la Detección de Actividad de Voz de Runtime Audio Importer para alimentar solo los segmentos de habla al reconocedor - mejorando la precisión y reduciendo el cómputo desperdiciado.
Traduce el habla reconocida desde cualquier idioma compatible directamente al inglés en una sola pasada: no se requiere un paso de traducción por separado.
No se requiere conexión a internet, no hay claves API, ningún dato sale del dispositivo. Adecuado para aplicaciones sensibles a la privacidad y entornos aislados de red.
Ejemplo de Blueprint - Reconocimiento en streaming con Detección de Actividad de Voz

La misma API de Blueprint y C++ funciona en todas las plataformas compatibles con Unreal Engine - desde escritorio hasta móviles y consolas.
Aceleración por GPU mediante Vulkan en Windows. Aceleración por CPU + intrinsics en todas las demás plataformas, incluidas Android, iOS y consolas.
Runtime Speech Recognizer encaja naturalmente en la suite de plugins de Georgy Dev - combínalo con captura de audio, TTS y chat de IA para crear canalizaciones completas de personajes controlados por voz.
Captura de micrófono con detección de actividad de voz - envía segmentos de voz limpios directamente al reconocedor.
Saber másSincronización de labios en tiempo real para MetaHuman y personajes personalizados - anima las respuestas a la voz reconocida.
Saber másSíntesis de voz totalmente sin conexión - cierra el bucle de voz pronunciando respuestas al usuario.
Saber másProcesa la voz reconocida con varios proveedores de IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud y Azure) para impulsar NPC conversacionales inteligentes.
Saber másGenera diálogo con LLMs en el dispositivo sin conexión, y luego dirige la sincronización de labios desde la voz sintetizada para lograr interacciones de personajes totalmente sin conexión.
Saber másLa documentación completa cubre flujos de trabajo de streaming y no streaming, selección de modelos, configuración de idiomas, integración de VAD y guía específica por plataforma.
Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++
Guía completa que cubre configuración, reconocimiento en streaming e integración de VAD
Comunidad activa de Discord con soporte para desarrolladores
Integración a medida o desarrollo de funciones - [email protected]
Disponible en Fab para UE 4.27 – 5.8. Incluye todos los tamaños de modelo, documentación completa y un proyecto demo.