Runtime Local LLM | Georgy Dev

Runtime Local LLM

Execute modelos de linguagem grandes inteiramente no dispositivo no Unreal Engine. Inferência offline de GGUF com streaming token por token, contexto de conversa e um gerenciador de modelos no editor — com suporte completo a Blueprint e C++.

UE 4.27 – 5.8
Blueprints e C++
Windows, Mac, Linux, Android, iOS, Quest
Qualquer modelo GGUF

Inferência de LLM no Dispositivo

Baseado em llama.cpp - carregue qualquer modelo GGUF e execute inferência localmente, sem serviços em nuvem, sem chaves de API e sem dados saindo do dispositivo. Atualizado regularmente para acompanhar os lançamentos upstream do llama.cpp.

Totalmente Offline

Sem conexão com a internet, sem chaves de API, sem telemetria. Toda a inferência é executada localmente no dispositivo do usuário.

Streaming de Tokens

Receba cada token gerado em tempo real por meio de delegates - atualize UIs de chat e dispare eventos de gameplay enquanto o modelo escreve.

Aceleração de GPU

Vulkan no Windows e Linux, Metal no Mac e iOS, CPU + intrínsecos no Android e Meta Quest.

Gerenciador de Modelos do Editor

Navegue, baixe, importe, exclua e teste modelos diretamente nas configurações do projeto. Os modelos são incluídos automaticamente em builds empacotados.

Como Funciona

Gerencie modelos no editor, carregue-os em tempo de execução com os parâmetros de inferência escolhidos e envie mensagens. Os tokens retornam via streaming por meio de delegates conforme o modelo gera - tudo em uma thread de segundo plano, com callbacks na thread do jogo.

1

Gerenciar Modelos

Baixe do catálogo, importe arquivos GGUF personalizados ou obtenha de URL em tempo de execução.

2

Carregar um Modelo

Escolha por nome, caminho do arquivo ou URL com parâmetros de inferência configuráveis.

3

Enviar Mensagens

Envie mensagens do usuário e receba respostas em streaming, com o contexto da conversa preservado.

4

Usar a Saída

Conduza diálogos de NPC, gere conteúdo dinâmico ou alimente outros plugins como TTS e sincronização labial.

Modelos Suportados

Qualquer modelo no formato GGUF funciona. O editor inclui um catálogo de modelos populares pré-definidos para download com um clique, e você pode importar qualquer arquivo GGUF personalizado.

Famílias de Modelos

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama e qualquer outro modelo GGUF da comunidade.

Níveis de Quantização

De Q2_K (menor, mais rápido) passando por Q4_K_M, Q5_K_M, Q8_0, até F16 / F32. Escolha o nível que se adequa à RAM e ao orçamento de desempenho do dispositivo de destino.

llama.cpp Atualizado

O plugin é atualizado regularmente na Fab para acompanhar os lançamentos upstream do llama.cpp, de modo que os formatos mais recentes de modelos GGUF permanecem suportados conforme são lançados.

Aceleração de Plataforma

Aceleração de hardware otimizada por plataforma - computação em GPU quando disponível, CPU + intrinsics quando não.

Plataforma Aceleração
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + intrinsics
Meta Quest CPU + intrinsics

Para dispositivos móveis e de VR, quantizações menores (Q2_K até Q4_K_M) com modelos compactos (1B–3B de parâmetros) são recomendadas. Plataformas desktop podem executar modelos maiores com níveis de quantização mais altos.

Gerenciador de Modelos do Editor

Um painel de configurações dedicado dentro do Unreal Editor para navegar, baixar, importar, excluir, e testar modelos - sem necessidade de ferramentas de linha de comando ou downloads externos.

Downloads do Catálogo

Navegue por um catálogo integrado de modelos populares com download em um clique. Vários downloads em paralelo, com barras de progresso e suporte a cancelamento.

Importação de Modelo Personalizado

Importe qualquer arquivo GGUF do disco ou de uma URL direta. Modelos personalizados são tratados de forma idêntica aos modelos do catálogo e são incluídos nas builds empacotadas.

Testes no Editor

Uma janela de teste integrada permite selecionar um modelo, configurar parâmetros, enviar prompts e ver as respostas em streaming em tempo real - tudo sem entrar no modo Play.

API de Runtime Completa

Além do carregamento e da inferência básicos, o plugin oferece vários métodos de carregamento de modelo, nós assíncronos de Blueprint, download em tempo de execução, gerenciamento de contexto de conversa e parâmetros de inferência configuráveis.

Múltiplos Métodos de Carregamento

Carregue por nome do modelo, por caminho de arquivo absoluto ou diretamente de uma URL com download automático. Pré-cacheie modelos sem carregá-los.

Streaming Token por Token

Cada token gerado dispara um delegate na thread do jogo — atualize imediatamente as UIs de chat, dispare eventos de gameplay ou direcione a saída para outros sistemas à medida que chega.

Contexto de Conversa

Conversas com vários turnos preservam o histórico de mensagens automaticamente. Redefina o contexto a qualquer momento, mantendo opcionalmente o system prompt para um comportamento persistente do personagem.

Inferência Configurável

Controle temperature, Top-P, Top-K, penalidade de repetição, descarregamento de camadas na GPU, tamanho do contexto, seed, número de threads, máximo de tokens e system prompt — por carregamento de modelo.

Nós Assíncronos de Blueprint

Nós assíncronos dedicados para carregamento, envio de mensagens e download — com pinos de saída para tokens, conclusão, progresso e erros. Nenhuma vinculação manual de delegate é necessária.

Empacotamento Automático

Modelos em Content/RuntimeLocalLLM/Models são incluídos automaticamente via NonUFS para que acompanhem os builds empacotados. Nenhuma configuração manual de projeto é necessária.

Exemplo de Blueprint - Chat simples com respostas em streaming

Exemplo simples de Blueprint de chat

Experimente a Demo

Uma demo para Windows está disponível para que você experimente a inferência no dispositivo em primeira mão. A demo inclui uma interface de chat com respostas em streaming, downloads de modelos em tempo de execução via URL e um menu de configurações para parâmetros de inferência — tudo criado com Blueprints e UMG.

Interface de chat com streaming de tokens

Envie mensagens e veja as respostas sendo geradas token por token em tempo real

Modelos pré-incluídos e baixáveis

Modelos prontos para uso, além de downloads por URL em tempo de execução para modelos adicionais

Parâmetros configuráveis

Menu de configurações in-game para temperature, máximo de tokens, tamanho do contexto e mais

Código-fonte incluído com o plugin

Implementação completa em Blueprint na pasta Demo do plugin, compatível com UE 4.27+

Baixar Demo (Windows)

Tutorial em Vídeo

Prévia do Projeto Demo

Casos de Uso Comuns

Alguns dos fluxos de trabalho que o plugin suporta prontos para uso - todos rodando localmente, sem dependências externas.

Diálogo de NPC

Conversas conduzidas por personagens com contexto persistente - NPCs lembram de trocas anteriores e permanecem no personagem por meio do prompt de sistema.

Conteúdo Dinâmico

Gere textos de missões, descrições de itens, trechos de lore ou falas curtas em tempo de execução - variando a saída a cada sessão sem precisar criar todas as variantes.

Chatbots Offline

Assistentes e chatbots no jogo que funcionam sem internet - úteis para jogos offline, implantações em ambientes isolados e aplicações sensíveis à privacidade.

Pipelines de IA

Combine com o Speech Recognizer para entrada de voz, TTS para respostas faladas e Lip Sync para animação - criando personagens conversacionais totalmente offline.

Ecossistema de Plugins

Runtime Local LLM é o cérebro de IA offline do pacote de plugins Georgy Dev - combine-o com reconhecimento de fala, TTS e lip sync para personagens conversacionais totalmente no dispositivo.

Runtime Audio Importer

Processe e reproduza a saída de áudio do TTS em tempo de execução. Companheiro essencial para lidar com dados de áudio em streaming de qualquer provedor de TTS.

Saiba mais

Runtime Speech Recognizer

Reconhecimento de fala para texto offline via Whisper. Converta a fala do jogador em texto e alimente diretamente o LLM local.

Saiba mais

Runtime Text To Speech

TTS offline com mais de 2800 vozes em 51 idiomas - fale as respostas do LLM em voz alta localmente.

Saiba mais

Runtime MetaHuman Lip Sync

Lip sync em tempo real para MetaHumans e personagens personalizados, conduzido pela saída de áudio das respostas sintetizadas do LLM.

Saiba mais

AI Chatbot Integrator

Alternativa de IA na nuvem - OpenAI, Claude, DeepSeek e outros. Use junto com Runtime Local LLM para cenários híbridos online/offline.

Saiba mais

Documentação e Suporte

A documentação abrangente cobre o gerenciador de modelos do editor, a API de runtime, os parâmetros de inferência, exemplos prontos para uso (chat simples, diálogo de NPC, pré-download) e o projeto de demonstração incluído.

Documentação Completa

Guias passo a passo para todos os recursos, com exemplos em Blueprint e C++

Comunidade e Suporte

Comunidade ativa no Discord com suporte para desenvolvedores

Desenvolvimento Personalizado

Integração personalizada ou desenvolvimento de recursos - [email protected]

Editor - Importação de modelos GGUF personalizados

Pronto para adicionar LLMs locais ao seu projeto?

Disponível no Fab para UE 4.27 – 5.8. Inclui o gerenciador de modelos do editor, API de runtime, projeto de demonstração e documentação completa.