
Ejecuta modelos de lenguaje de gran tamaño completamente en el dispositivo en Unreal Engine. Inferencia de GGUF sin conexión con transmisión token a token, contexto de conversación y un administrador de modelos en el editor - con soporte completo de Blueprint y C++.
Basado en llama.cpp - carga cualquier modelo GGUF y ejecuta la inferencia localmente, sin servicios en la nube, sin claves de API y sin que los datos salgan del dispositivo. Se actualiza periódicamente para seguir las versiones upstream de llama.cpp.
Sin conexión a Internet, sin claves de API, sin telemetría. Toda la inferencia se ejecuta localmente en el dispositivo del usuario.
Recibe cada token generado en tiempo real mediante delegados: actualiza las interfaces de chat y dispara eventos de juego mientras el modelo escribe.
Vulkan en Windows y Linux, Metal en Mac y iOS, CPU + intrinsics en Android y Meta Quest.
Explora, descarga, importa, elimina y prueba modelos directamente en la configuración del proyecto. Los modelos se incluyen automáticamente con las compilaciones empaquetadas.
Administra modelos en el editor, cárgalos en tiempo de ejecución con tus parámetros de inferencia elegidos y envía mensajes. Los tokens se transmiten de vuelta a través de delegados mientras el modelo genera - todo en un hilo en segundo plano, con devoluciones de llamada en el hilo del juego.
Descarga desde el catálogo, importa archivos GGUF personalizados u obtén desde una URL en tiempo de ejecución.
Elige por nombre, ruta de archivo o URL con parámetros de inferencia configurables
Pasa mensajes del usuario y recibe respuestas en streaming, con el contexto de la conversación preservado.
Impulsa el diálogo de los NPC, genera contenido dinámico o alimenta otros complementos como TTS y lip sync.
Cualquier modelo en formato GGUF funciona. El editor incluye un catálogo de modelos populares predefinidos para descarga con un clic, y puedes importar cualquier archivo GGUF personalizado.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama y cualquier otro modelo comunitario en formato GGUF.
Desde Q2_K (el más pequeño, el más rápido) pasando por Q4_K_M, Q5_K_M, Q8_0, hasta F16 / F32. Elige el nivel que se ajuste a la RAM y al presupuesto de rendimiento de tu dispositivo de destino.
El complemento se actualiza regularmente en Fab para seguir los lanzamientos upstream de llama.cpp, por lo que los últimos formatos de modelos GGUF siguen siendo compatibles a medida que se publican.
Aceleración de hardware optimizada por plataforma: cómputo por GPU cuando esté disponible, CPU + intrínsecas cuando no.
| Plataforma | Aceleración |
|---|---|
| Windows | GPU Vulkan |
| Linux | GPU Vulkan |
| Mac | GPU Metal |
| iOS | GPU Metal |
| Android | CPU + intrínsecas |
| Meta Quest | CPU + intrínsecas |
Para dispositivos móviles y de realidad virtual, se recomiendan cuantizaciones más pequeñas (Q2_K hasta Q4_K_M) con modelos compactos (de 1B a 3B parámetros). Las plataformas de escritorio pueden ejecutar modelos más grandes con niveles de cuantización más altos.
Un panel de configuración dedicado dentro del Unreal Editor para explorar, descargar, importar, eliminar, y probar modelos - no se requieren herramientas de línea de comandos ni descargas externas.
Explora un catálogo integrado de modelos populares con descarga con un solo clic. Múltiples descargas en paralelo, con barras de progreso y soporte de cancelación.
Importa cualquier archivo GGUF desde el disco o desde una URL directa. Los modelos personalizados se tratan de forma idéntica a los modelos del catálogo y se incluyen en las compilaciones empaquetadas.
Una ventana de prueba integrada te permite seleccionar un modelo, configurar parámetros, enviar prompts y ver cómo las respuestas se transmiten en tiempo real, todo sin entrar en el modo Play.
Más allá de la carga e inferencia básicas, el plugin proporciona múltiples métodos de carga de modelos, nodos de Blueprint asíncronos, descarga en tiempo de ejecución, gestión del contexto de conversación y parámetros de inferencia configurables.
Carga por nombre de modelo, por ruta de archivo absoluta o directamente desde una URL con descarga automática. Precarga modelos en caché sin cargarlos.
Cada token generado activa un delegado en el hilo del juego: actualiza inmediatamente las interfaces de chat, dispara eventos de jugabilidad o canaliza la salida a otros sistemas a medida que llega.
Las conversaciones de varios turnos conservan el historial de mensajes automáticamente. Restablece el contexto en cualquier momento y, opcionalmente, conserva el prompt del sistema para un comportamiento de personaje persistente.
Controla la temperatura, Top-P, Top-K, penalización de repetición, descarga de capas a GPU, tamaño del contexto, semilla, número de hilos, máximo de tokens y prompt del sistema, por carga de modelo.
Nodos asíncronos dedicados para cargar, enviar mensajes y descargar, con pines de salida para tokens, finalización, progreso y errores. No es necesario vincular delegados manualmente.
Los modelos en Content/RuntimeLocalLLM/Models se preparan automáticamente mediante NonUFS para que se incluyan en las compilaciones empaquetadas. No se requiere configuración manual del proyecto.
Ejemplo de Blueprint: chat simple con respuestas en streaming

Hay una demo para Windows disponible para que puedas experimentar la inferencia en el dispositivo de primera mano. La demo incluye una interfaz de chat con respuestas en streaming, descargas de modelos en tiempo de ejecución mediante URL y un menú de ajustes para los parámetros de inferencia, todo creado con Blueprints y UMG.
Envía mensajes y observa cómo se generan las respuestas token a token en tiempo real
Modelos listos para usar, además de descargas por URL en tiempo de ejecución para modelos adicionales
Menú de ajustes en el juego para temperatura, máximo de tokens, tamaño del contexto y más
Implementación completa de Blueprint en la carpeta de contenido Demo del plugin, compatible con UE 4.27+
Tutorial en video
Vista previa del proyecto demo
Algunos de los flujos de trabajo que el plugin admite de serie, todos ejecutándose localmente sin dependencias externas.
Conversaciones impulsadas por personajes con contexto persistente: los NPC recuerdan intercambios pasados y se mantienen en su personaje mediante el mensaje del sistema.
Genera texto de misiones, descripciones de objetos, fragmentos de lore o frases breves en tiempo de ejecución, variando la salida en cada sesión sin tener que crear cada variante.
Asistentes y chatbots dentro del juego que funcionan sin internet, útiles para juegos sin conexión, despliegues en entornos aislados y aplicaciones sensibles a la privacidad.
Combínalo con Speech Recognizer para la entrada de voz, TTS para respuestas habladas y Lip Sync para la animación, creando personajes conversacionales totalmente sin conexión.
Runtime Local LLM es el cerebro de IA sin conexión de la suite de plugins de Georgy Dev: combínalo con reconocimiento de voz, TTS y lip sync para crear personajes conversacionales totalmente en el dispositivo.
Procesa y reproduce la salida de audio de TTS en tiempo de ejecución. Compañero esencial para manejar datos de audio en streaming de cualquier proveedor de TTS.
Más informaciónConversión de voz a texto sin conexión mediante Whisper. Convierte el habla del jugador en texto e introdúcelo directamente en el LLM local.
Más informaciónTTS sin conexión con más de 2800 voces en 51 idiomas: pronuncia en voz alta las respuestas del LLM localmente.
Más informaciónLip sync en tiempo real para MetaHumans y personajes personalizados, impulsado por la salida de audio de las respuestas sintetizadas del LLM.
Más informaciónAlternativa de IA en la nube: OpenAI, Claude, DeepSeek y otros. Úsalo junto con Runtime Local LLM para escenarios híbridos en línea/sin conexión.
Más informaciónLa documentación completa cubre el administrador de modelos del editor, la API de runtime, los parámetros de inferencia, ejemplos listos para usar (chat simple, diálogo de NPC, descarga previa) y el proyecto de demostración incluido.
Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++
Comunidad activa de Discord con soporte para desarrolladores
Integración o desarrollo de funciones a medida - [email protected]
Editor - Importación de modelos GGUF personalizados
Disponible en Fab para UE 4.27 – 5.8. Incluye el administrador de modelos del editor, la API de runtime, el proyecto de demostración y la documentación completa.