Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Reconocimiento de voz sin conexión multiplataforma para Unreal Engine. Impulsado por Whisper AI - convierte voz a texto completamente en el dispositivo, en todas las plataformas, sin necesidad de conexión a internet.

UE 4.27 – 5.8
Blueprints y C++
Todas las plataformas compatibles
95+ idiomas

Reconocimiento de voz sin conexión, en cualquier plataforma

Construido sobre la whisper.cpp implementación del modelo Whisper de OpenAI - precisión de vanguardia ejecutándose completamente en el dispositivo, sin enviar datos a servidores externos.

Reconocimiento por streaming

Procesa audio en tiempo real a medida que se captura - ideal para comandos de voz en vivo y aplicaciones interactivas.

Reconocimiento sin streaming

Procesa archivos de audio o búferes completos en una sola pasada para obtener la máxima precisión de transcripción.

Más de 95 idiomas

Detección automática de idioma o selección explícita. También se admite la traducción al inglés.

Aceleración por GPU

Aceleración por GPU basada en Vulkan en Windows para un reconocimiento significativamente más rápido. CPU + instrucciones intrínsecas en todas las demás plataformas.

Cómo funciona

El audio se procesa completamente en el dispositivo utilizando el modelo Whisper. Sin conexión a internet, sin llamadas externas a API, sin que los datos salgan del dispositivo.

1

Entrada de audio

Captura de micrófono, archivos de audio o cualquier fuente PCM, incluido Runtime Audio Importer

2

Procesamiento en el dispositivo

El modelo Whisper se ejecuta localmente, ya sea en streaming o con búfer completo, con prefiltrado VAD opcional

3

Transcripción

Salida de texto con marcas de tiempo de segmento, resultado de detección de idioma y datos de confianza

4

Tu lógica de juego

Vincula delegados de resultado en Blueprint o C++ y actúa sobre el texto reconocido de inmediato

Elige tu modelo

Cinco tamaños de modelo te permiten equilibrar la precisión de transcripción con la huella de memoria y la velocidad de procesamiento para tu plataforma de destino.

Modelo Tamaño Idiomas Ideal para
Tiny 75 MB Multi / EN Móvil, Quest
Base 142 MB Multilingüe / EN Dispositivos de gama baja
Pequeño 466 MB Multilingüe / EN Equilibrado
Medio 1.5 GB Multilingüe / EN Alta precisión
Grande 3 GB Multilingüe Precisión máxima

Variantes cuantizadas también disponibles para un menor uso de memoria. Se admiten modelos personalizados.

Soporte de idiomas universal

Reconoce voz en más de 95 idiomas con detección automática, o especifica el idioma explícitamente para obtener el mejor rendimiento. También se admite la traducción al inglés.

Inglés
Chino
Español
Francés
Alemán
japonés
coreano
ruso
árabe
hindi
portugués
+ 84 más
Ver la lista completa de idiomas

Control total del reconocimiento

Control detallado sobre los parámetros de reconocimiento, ajuste de rendimiento y filtrado de salida - todo accesible desde Blueprints o C++.

Parámetros de reconocimiento

Configura el número de hilos, el tamaño de paso, el tamaño del haz, el tamaño del contexto de audio y los modos sin contexto / de segmento único. Valores predeterminados separados para los modos de streaming y no streaming.

Ajuste de rendimiento

Habilita el modo de aceleración, selecciona el ID del dispositivo GPU para sistemas con varias GPU y ajusta el tamaño del contexto de audio para intercambiar precisión por velocidad en hardware limitado.

Control de indicaciones y salida

Proporciona una indicación inicial para guiar el estilo de transcripción. Suprime los segmentos vacíos y los tokens de no habla para mantener una salida limpia y estructurada.

Integración de VAD

Combínalo con la Detección de Actividad de Voz de Runtime Audio Importer para alimentar solo los segmentos de habla al reconocedor - mejorando la precisión y reduciendo el cómputo desperdiciado.

Traducción

Traduce el habla reconocida desde cualquier idioma compatible directamente al inglés en una sola pasada: no se requiere un paso de traducción por separado.

Totalmente en el dispositivo

No se requiere conexión a internet, no hay claves API, ningún dato sale del dispositivo. Adecuado para aplicaciones sensibles a la privacidad y entornos aislados de red.

Ejemplo de Blueprint - Reconocimiento en streaming con Detección de Actividad de Voz

Reconocimiento de voz por streaming con ejemplo de Blueprint de VAD

Todas las plataformas compatibles

La misma API de Blueprint y C++ funciona en todas las plataformas compatibles con Unreal Engine - desde escritorio hasta móviles y consolas.

Aceleración por GPU mediante Vulkan en Windows. Aceleración por CPU + intrinsics en todas las demás plataformas, incluidas Android, iOS y consolas.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Ecosistema de plugins

Runtime Speech Recognizer encaja naturalmente en la suite de plugins de Georgy Dev - combínalo con captura de audio, TTS y chat de IA para crear canalizaciones completas de personajes controlados por voz.

Runtime Audio Importer

Captura de micrófono con detección de actividad de voz - envía segmentos de voz limpios directamente al reconocedor.

Saber más

Runtime MetaHuman Lip Sync

Sincronización de labios en tiempo real para MetaHuman y personajes personalizados - anima las respuestas a la voz reconocida.

Saber más

Runtime Text To Speech

Síntesis de voz totalmente sin conexión - cierra el bucle de voz pronunciando respuestas al usuario.

Saber más

AI Chatbot Integrator

Procesa la voz reconocida con varios proveedores de IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud y Azure) para impulsar NPC conversacionales inteligentes.

Saber más

Runtime Local LLM

Genera diálogo con LLMs en el dispositivo sin conexión, y luego dirige la sincronización de labios desde la voz sintetizada para lograr interacciones de personajes totalmente sin conexión.

Saber más

Documentación y soporte

La documentación completa cubre flujos de trabajo de streaming y no streaming, selección de modelos, configuración de idiomas, integración de VAD y guía específica por plataforma.

Documentación completa

Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++

Tutorial en vídeo

Guía completa que cubre configuración, reconocimiento en streaming e integración de VAD

Comunidad y soporte

Comunidad activa de Discord con soporte para desarrolladores

Desarrollo personalizado

Integración a medida o desarrollo de funciones - [email protected]

¿Listo para añadir reconocimiento de voz a tu proyecto?

Disponible en Fab para UE 4.27 – 5.8. Incluye todos los tamaños de modelo, documentación completa y un proyecto demo.