
Execute modelos de linguagem grandes inteiramente no dispositivo no Unreal Engine. Inferência offline de GGUF com streaming token por token, contexto de conversa e um gerenciador de modelos no editor — com suporte completo a Blueprint e C++.
Baseado em llama.cpp - carregue qualquer modelo GGUF e execute inferência localmente, sem serviços em nuvem, sem chaves de API e sem dados saindo do dispositivo. Atualizado regularmente para acompanhar os lançamentos upstream do llama.cpp.
Sem conexão com a internet, sem chaves de API, sem telemetria. Toda a inferência é executada localmente no dispositivo do usuário.
Receba cada token gerado em tempo real por meio de delegates - atualize UIs de chat e dispare eventos de gameplay enquanto o modelo escreve.
Vulkan no Windows e Linux, Metal no Mac e iOS, CPU + intrínsecos no Android e Meta Quest.
Navegue, baixe, importe, exclua e teste modelos diretamente nas configurações do projeto. Os modelos são incluídos automaticamente em builds empacotados.
Gerencie modelos no editor, carregue-os em tempo de execução com os parâmetros de inferência escolhidos e envie mensagens. Os tokens retornam via streaming por meio de delegates conforme o modelo gera - tudo em uma thread de segundo plano, com callbacks na thread do jogo.
Baixe do catálogo, importe arquivos GGUF personalizados ou obtenha de URL em tempo de execução.
Escolha por nome, caminho do arquivo ou URL com parâmetros de inferência configuráveis.
Envie mensagens do usuário e receba respostas em streaming, com o contexto da conversa preservado.
Conduza diálogos de NPC, gere conteúdo dinâmico ou alimente outros plugins como TTS e sincronização labial.
Qualquer modelo no formato GGUF funciona. O editor inclui um catálogo de modelos populares pré-definidos para download com um clique, e você pode importar qualquer arquivo GGUF personalizado.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama e qualquer outro modelo GGUF da comunidade.
De Q2_K (menor, mais rápido) passando por Q4_K_M, Q5_K_M, Q8_0, até F16 / F32. Escolha o nível que se adequa à RAM e ao orçamento de desempenho do dispositivo de destino.
O plugin é atualizado regularmente na Fab para acompanhar os lançamentos upstream do llama.cpp, de modo que os formatos mais recentes de modelos GGUF permanecem suportados conforme são lançados.
Aceleração de hardware otimizada por plataforma - computação em GPU quando disponível, CPU + intrinsics quando não.
| Plataforma | Aceleração |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + intrinsics |
| Meta Quest | CPU + intrinsics |
Para dispositivos móveis e de VR, quantizações menores (Q2_K até Q4_K_M) com modelos compactos (1B–3B de parâmetros) são recomendadas. Plataformas desktop podem executar modelos maiores com níveis de quantização mais altos.
Um painel de configurações dedicado dentro do Unreal Editor para navegar, baixar, importar, excluir, e testar modelos - sem necessidade de ferramentas de linha de comando ou downloads externos.
Navegue por um catálogo integrado de modelos populares com download em um clique. Vários downloads em paralelo, com barras de progresso e suporte a cancelamento.
Importe qualquer arquivo GGUF do disco ou de uma URL direta. Modelos personalizados são tratados de forma idêntica aos modelos do catálogo e são incluídos nas builds empacotadas.
Uma janela de teste integrada permite selecionar um modelo, configurar parâmetros, enviar prompts e ver as respostas em streaming em tempo real - tudo sem entrar no modo Play.
Além do carregamento e da inferência básicos, o plugin oferece vários métodos de carregamento de modelo, nós assíncronos de Blueprint, download em tempo de execução, gerenciamento de contexto de conversa e parâmetros de inferência configuráveis.
Carregue por nome do modelo, por caminho de arquivo absoluto ou diretamente de uma URL com download automático. Pré-cacheie modelos sem carregá-los.
Cada token gerado dispara um delegate na thread do jogo — atualize imediatamente as UIs de chat, dispare eventos de gameplay ou direcione a saída para outros sistemas à medida que chega.
Conversas com vários turnos preservam o histórico de mensagens automaticamente. Redefina o contexto a qualquer momento, mantendo opcionalmente o system prompt para um comportamento persistente do personagem.
Controle temperature, Top-P, Top-K, penalidade de repetição, descarregamento de camadas na GPU, tamanho do contexto, seed, número de threads, máximo de tokens e system prompt — por carregamento de modelo.
Nós assíncronos dedicados para carregamento, envio de mensagens e download — com pinos de saída para tokens, conclusão, progresso e erros. Nenhuma vinculação manual de delegate é necessária.
Modelos em Content/RuntimeLocalLLM/Models são incluídos automaticamente via NonUFS para que acompanhem os builds empacotados. Nenhuma configuração manual de projeto é necessária.
Exemplo de Blueprint - Chat simples com respostas em streaming

Uma demo para Windows está disponível para que você experimente a inferência no dispositivo em primeira mão. A demo inclui uma interface de chat com respostas em streaming, downloads de modelos em tempo de execução via URL e um menu de configurações para parâmetros de inferência — tudo criado com Blueprints e UMG.
Envie mensagens e veja as respostas sendo geradas token por token em tempo real
Modelos prontos para uso, além de downloads por URL em tempo de execução para modelos adicionais
Menu de configurações in-game para temperature, máximo de tokens, tamanho do contexto e mais
Implementação completa em Blueprint na pasta Demo do plugin, compatível com UE 4.27+
Tutorial em Vídeo
Prévia do Projeto Demo
Alguns dos fluxos de trabalho que o plugin suporta prontos para uso - todos rodando localmente, sem dependências externas.
Conversas conduzidas por personagens com contexto persistente - NPCs lembram de trocas anteriores e permanecem no personagem por meio do prompt de sistema.
Gere textos de missões, descrições de itens, trechos de lore ou falas curtas em tempo de execução - variando a saída a cada sessão sem precisar criar todas as variantes.
Assistentes e chatbots no jogo que funcionam sem internet - úteis para jogos offline, implantações em ambientes isolados e aplicações sensíveis à privacidade.
Combine com o Speech Recognizer para entrada de voz, TTS para respostas faladas e Lip Sync para animação - criando personagens conversacionais totalmente offline.
Runtime Local LLM é o cérebro de IA offline do pacote de plugins Georgy Dev - combine-o com reconhecimento de fala, TTS e lip sync para personagens conversacionais totalmente no dispositivo.
Processe e reproduza a saída de áudio do TTS em tempo de execução. Companheiro essencial para lidar com dados de áudio em streaming de qualquer provedor de TTS.
Saiba maisReconhecimento de fala para texto offline via Whisper. Converta a fala do jogador em texto e alimente diretamente o LLM local.
Saiba maisTTS offline com mais de 2800 vozes em 51 idiomas - fale as respostas do LLM em voz alta localmente.
Saiba maisLip sync em tempo real para MetaHumans e personagens personalizados, conduzido pela saída de áudio das respostas sintetizadas do LLM.
Saiba maisAlternativa de IA na nuvem - OpenAI, Claude, DeepSeek e outros. Use junto com Runtime Local LLM para cenários híbridos online/offline.
Saiba maisA documentação abrangente cobre o gerenciador de modelos do editor, a API de runtime, os parâmetros de inferência, exemplos prontos para uso (chat simples, diálogo de NPC, pré-download) e o projeto de demonstração incluído.
Guias passo a passo para todos os recursos, com exemplos em Blueprint e C++
Comunidade ativa no Discord com suporte para desenvolvedores
Integração personalizada ou desenvolvimento de recursos - [email protected]
Editor - Importação de modelos GGUF personalizados
Disponível no Fab para UE 4.27 – 5.8. Inclui o gerenciador de modelos do editor, API de runtime, projeto de demonstração e documentação completa.