Runtime Local LLM | Georgy Dev

Runtime Local LLM

Ejecuta modelos de lenguaje de gran tamaño completamente en el dispositivo en Unreal Engine. Inferencia de GGUF sin conexión con transmisión token a token, contexto de conversación y un administrador de modelos en el editor - con soporte completo de Blueprint y C++.

UE 4.27 – 5.8
Blueprints y C++
Windows, Mac, Linux, Android, iOS, Quest
Cualquier modelo GGUF

Inferencia de LLM en el dispositivo

Basado en llama.cpp - carga cualquier modelo GGUF y ejecuta la inferencia localmente, sin servicios en la nube, sin claves de API y sin que los datos salgan del dispositivo. Se actualiza periódicamente para seguir las versiones upstream de llama.cpp.

Completamente sin conexión

Sin conexión a Internet, sin claves de API, sin telemetría. Toda la inferencia se ejecuta localmente en el dispositivo del usuario.

Transmisión de tokens

Recibe cada token generado en tiempo real mediante delegados: actualiza las interfaces de chat y dispara eventos de juego mientras el modelo escribe.

Aceleración por GPU

Vulkan en Windows y Linux, Metal en Mac y iOS, CPU + intrinsics en Android y Meta Quest.

Administrador de modelos del editor

Explora, descarga, importa, elimina y prueba modelos directamente en la configuración del proyecto. Los modelos se incluyen automáticamente con las compilaciones empaquetadas.

Cómo funciona

Administra modelos en el editor, cárgalos en tiempo de ejecución con tus parámetros de inferencia elegidos y envía mensajes. Los tokens se transmiten de vuelta a través de delegados mientras el modelo genera - todo en un hilo en segundo plano, con devoluciones de llamada en el hilo del juego.

1

Administrar modelos

Descarga desde el catálogo, importa archivos GGUF personalizados u obtén desde una URL en tiempo de ejecución.

2

Cargar un modelo

Elige por nombre, ruta de archivo o URL con parámetros de inferencia configurables

3

Enviar mensajes

Pasa mensajes del usuario y recibe respuestas en streaming, con el contexto de la conversación preservado.

4

Usar la salida

Impulsa el diálogo de los NPC, genera contenido dinámico o alimenta otros complementos como TTS y lip sync.

Modelos compatibles

Cualquier modelo en formato GGUF funciona. El editor incluye un catálogo de modelos populares predefinidos para descarga con un clic, y puedes importar cualquier archivo GGUF personalizado.

Familias de modelos

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama y cualquier otro modelo comunitario en formato GGUF.

Niveles de cuantización

Desde Q2_K (el más pequeño, el más rápido) pasando por Q4_K_M, Q5_K_M, Q8_0, hasta F16 / F32. Elige el nivel que se ajuste a la RAM y al presupuesto de rendimiento de tu dispositivo de destino.

llama.cpp actualizado

El complemento se actualiza regularmente en Fab para seguir los lanzamientos upstream de llama.cpp, por lo que los últimos formatos de modelos GGUF siguen siendo compatibles a medida que se publican.

Aceleración por plataforma

Aceleración de hardware optimizada por plataforma: cómputo por GPU cuando esté disponible, CPU + intrínsecas cuando no.

Plataforma Aceleración
Windows GPU Vulkan
Linux GPU Vulkan
Mac GPU Metal
iOS GPU Metal
Android CPU + intrínsecas
Meta Quest CPU + intrínsecas

Para dispositivos móviles y de realidad virtual, se recomiendan cuantizaciones más pequeñas (Q2_K hasta Q4_K_M) con modelos compactos (de 1B a 3B parámetros). Las plataformas de escritorio pueden ejecutar modelos más grandes con niveles de cuantización más altos.

Administrador de modelos del Editor

Un panel de configuración dedicado dentro del Unreal Editor para explorar, descargar, importar, eliminar, y probar modelos - no se requieren herramientas de línea de comandos ni descargas externas.

Descargas del catálogo

Explora un catálogo integrado de modelos populares con descarga con un solo clic. Múltiples descargas en paralelo, con barras de progreso y soporte de cancelación.

Importación de modelos personalizados

Importa cualquier archivo GGUF desde el disco o desde una URL directa. Los modelos personalizados se tratan de forma idéntica a los modelos del catálogo y se incluyen en las compilaciones empaquetadas.

Pruebas en el Editor

Una ventana de prueba integrada te permite seleccionar un modelo, configurar parámetros, enviar prompts y ver cómo las respuestas se transmiten en tiempo real, todo sin entrar en el modo Play.

API de tiempo de ejecución con todas las funciones

Más allá de la carga e inferencia básicas, el plugin proporciona múltiples métodos de carga de modelos, nodos de Blueprint asíncronos, descarga en tiempo de ejecución, gestión del contexto de conversación y parámetros de inferencia configurables.

Múltiples métodos de carga

Carga por nombre de modelo, por ruta de archivo absoluta o directamente desde una URL con descarga automática. Precarga modelos en caché sin cargarlos.

Streaming token a token

Cada token generado activa un delegado en el hilo del juego: actualiza inmediatamente las interfaces de chat, dispara eventos de jugabilidad o canaliza la salida a otros sistemas a medida que llega.

Contexto de conversación

Las conversaciones de varios turnos conservan el historial de mensajes automáticamente. Restablece el contexto en cualquier momento y, opcionalmente, conserva el prompt del sistema para un comportamiento de personaje persistente.

Inferencia configurable

Controla la temperatura, Top-P, Top-K, penalización de repetición, descarga de capas a GPU, tamaño del contexto, semilla, número de hilos, máximo de tokens y prompt del sistema, por carga de modelo.

Nodos de Blueprint asíncronos

Nodos asíncronos dedicados para cargar, enviar mensajes y descargar, con pines de salida para tokens, finalización, progreso y errores. No es necesario vincular delegados manualmente.

Empaquetado automático

Los modelos en Content/RuntimeLocalLLM/Models se preparan automáticamente mediante NonUFS para que se incluyan en las compilaciones empaquetadas. No se requiere configuración manual del proyecto.

Ejemplo de Blueprint: chat simple con respuestas en streaming

Ejemplo sencillo de Blueprint de chat

Prueba la demo

Hay una demo para Windows disponible para que puedas experimentar la inferencia en el dispositivo de primera mano. La demo incluye una interfaz de chat con respuestas en streaming, descargas de modelos en tiempo de ejecución mediante URL y un menú de ajustes para los parámetros de inferencia, todo creado con Blueprints y UMG.

Interfaz de chat con streaming de tokens

Envía mensajes y observa cómo se generan las respuestas token a token en tiempo real

Modelos preincluidos y descargables

Modelos listos para usar, además de descargas por URL en tiempo de ejecución para modelos adicionales

Parámetros configurables

Menú de ajustes en el juego para temperatura, máximo de tokens, tamaño del contexto y más

Código fuente incluido con el plugin

Implementación completa de Blueprint en la carpeta de contenido Demo del plugin, compatible con UE 4.27+

Descargar demo (Windows)

Tutorial en video

Vista previa del proyecto demo

Casos de uso comunes

Algunos de los flujos de trabajo que el plugin admite de serie, todos ejecutándose localmente sin dependencias externas.

Diálogo de NPC

Conversaciones impulsadas por personajes con contexto persistente: los NPC recuerdan intercambios pasados y se mantienen en su personaje mediante el mensaje del sistema.

Contenido dinámico

Genera texto de misiones, descripciones de objetos, fragmentos de lore o frases breves en tiempo de ejecución, variando la salida en cada sesión sin tener que crear cada variante.

Chatbots sin conexión

Asistentes y chatbots dentro del juego que funcionan sin internet, útiles para juegos sin conexión, despliegues en entornos aislados y aplicaciones sensibles a la privacidad.

Pipelines de IA

Combínalo con Speech Recognizer para la entrada de voz, TTS para respuestas habladas y Lip Sync para la animación, creando personajes conversacionales totalmente sin conexión.

Ecosistema de plugins

Runtime Local LLM es el cerebro de IA sin conexión de la suite de plugins de Georgy Dev: combínalo con reconocimiento de voz, TTS y lip sync para crear personajes conversacionales totalmente en el dispositivo.

Runtime Audio Importer

Procesa y reproduce la salida de audio de TTS en tiempo de ejecución. Compañero esencial para manejar datos de audio en streaming de cualquier proveedor de TTS.

Más información

Runtime Speech Recognizer

Conversión de voz a texto sin conexión mediante Whisper. Convierte el habla del jugador en texto e introdúcelo directamente en el LLM local.

Más información

Runtime Text To Speech

TTS sin conexión con más de 2800 voces en 51 idiomas: pronuncia en voz alta las respuestas del LLM localmente.

Más información

Runtime MetaHuman Lip Sync

Lip sync en tiempo real para MetaHumans y personajes personalizados, impulsado por la salida de audio de las respuestas sintetizadas del LLM.

Más información

AI Chatbot Integrator

Alternativa de IA en la nube: OpenAI, Claude, DeepSeek y otros. Úsalo junto con Runtime Local LLM para escenarios híbridos en línea/sin conexión.

Más información

Documentación y soporte

La documentación completa cubre el administrador de modelos del editor, la API de runtime, los parámetros de inferencia, ejemplos listos para usar (chat simple, diálogo de NPC, descarga previa) y el proyecto de demostración incluido.

Documentación completa

Guías paso a paso para todas las funciones, con ejemplos de Blueprint y C++

Comunidad y soporte

Comunidad activa de Discord con soporte para desarrolladores

Desarrollo personalizado

Integración o desarrollo de funciones a medida - [email protected]

Editor - Importación de modelos GGUF personalizados

¿Listo para añadir LLM locales a tu proyecto?

Disponible en Fab para UE 4.27 – 5.8. Incluye el administrador de modelos del editor, la API de runtime, el proyecto de demostración y la documentación completa.