Runtime Local LLM | Georgy Dev

Runtime Local LLM

在Unreal Engine中完全在设备端运行大型语言模型。离线GGUF推理,支持逐Token 流式传输、对话上下文和编辑器模型管理器——并完整支持Blueprint和C++。

UE 4.27 – 5.8
Blueprints 和 C++
Windows、Mac、Linux、Android、iOS、Quest
任何GGUF模型

设备端LLM推理

基于 llama.cpp - 加载任意GGUF模型并在本地运行推理,无需云服务、无需API密钥,且不会有数据 离开设备。定期更新以跟踪上游llama.cpp版本。

完全离线

无需互联网连接、无需API密钥、无遥测数据。所有推理均在用户设备本地运行。

Token 流式传输

通过委托实时接收每个生成的 Token - 在模型生成时更新聊天 UI 并触发游戏事件。

GPU 加速

在 Windows 和 Linux 上使用 Vulkan,在 Mac 和 iOS 上使用 Metal,在 Android 和 Meta Quest 上使用 CPU + 内建函数。

编辑器模型管理器

在项目设置中直接浏览、下载、导入、删除和测试模型。模型会自动随打包构建一同发布。

工作原理

在编辑器中管理模型,在运行时使用你选择的推理参数加载模型,然后发送消息。 模型生成时,Token 通过委托流式返回 - 全部在后台线程上进行,并在游戏线程上回调。

1

管理模型

从目录下载、导入自定义 GGUF 文件,或在运行时从 URL 获取

2

加载模型

按名称、文件路径或 URL 选择,并配置推理参数

3

发送消息

传递用户消息并接收流式响应,同时保留对话上下文

4

使用输出

驱动 NPC 对话、生成动态内容,或输入到其他插件如 TTS 和口型同步

支持的模型

任何 GGUF 格式的模型都可以使用。编辑器包含常用预定义模型目录,可一键下载,你还可以导入任意自定义 GGUF 文件。

模型系列

Llama (Meta)、Mistral / Mixtral、Phi (Microsoft)、Gemma (Google)、Qwen (Alibaba)、TinyLlama,以及任何其他 GGUF 社区模型。

量化级别

从 Q2_K (最小、最快) 到 Q4_K_M、Q5_K_M、Q8_0,直到 F16 / F32。选择适合目标设备 RAM 和性能预算的级别。

最新版 llama.cpp

该插件在 Fab 上定期更新,以跟踪上游 llama.cpp 版本,从而在最新 GGUF 模型格式发布时保持支持。

平台加速

针对各平台调优的硬件加速——在可用时使用 GPU 计算,否则使用 CPU + 内建函数。

平台 加速
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + 内建函数
Meta Quest CPU + 内建函数

对于移动设备和 VR 设备,建议使用较小的量化级别(Q2_K 至 Q4_K_M)以及紧凑型模型(1B–3B 参数)。桌面平台可以运行更大的模型和更高的量化级别。

编辑器模型管理器

一个位于 Unreal Editor 内的专用设置面板,用于浏览、下载、导入、删除、 以及测试模型——无需命令行工具或外部下载。

目录下载

浏览内置的热门模型目录,并一键下载。可并行执行多个下载任务,带进度条并支持取消。

自定义模型导入

支持从磁盘或直接 URL 导入任意 GGUF 文件。自定义模型与目录模型受到同等对待,并会随打包版本一同提供。

编辑器内测试

内置的测试窗口可让你选择模型、配置参数、发送提示词,并实时查看流式返回的响应——全程无需进入 Play 模式。

全功能运行时 API

除了基本的加载和推理之外,该插件还提供多种模型加载方式、异步 Blueprint 节点、 运行时下载、对话上下文管理和可配置的推理参数。

多种加载方式

按模型名称、绝对文件路径加载,或直接从 URL 自动下载加载。可预缓存模型而无需加载。

逐 Token 流式输出

每个生成的 Token 都会在游戏线程上触发一个委托——立即更新聊天 UI、触发游戏事件,或在输出到达时将其传递到其他系统。

对话上下文

多轮对话自动保留消息历史。可随时重置上下文,并可选保留系统提示词以维持角色行为的一致性。

可配置的推理

每次加载模型时可控制温度、Top-P、Top-K、重复惩罚、GPU 层卸载、上下文大小、随机种子、线程数、最大 Token 数和系统提示词。

异步 Blueprint 节点

专用于加载、发送消息和下载的异步节点——带有用于 Token、完成、进度和错误的输出引脚。无需手动绑定委托。

自动打包

Content/RuntimeLocalLLM/Models 中的模型会通过 NonUFS 自动暂存,因此会随打包版本一起发布。无需手动配置项目。

Blueprint 示例——带流式响应的简单聊天

简单的聊天Blueprint示例

尝试演示

Windows 演示可供您亲身体验设备端推理。该演示 包含带流式响应的聊天界面、通过 URL 进行运行时模型下载,以及 用于推理参数的设置菜单——全部使用 Blueprints 和 UMG 构建。

带 Token 流式输出的聊天界面

发送消息,实时观看回复逐 Token 生成

预置及可下载的模型

开箱即用的模型,外加通过运行时 URL 下载更多模型

可配置的参数

游戏内设置菜单,可调节温度、最大 Token 数、上下文大小等

插件附带源码

插件 Demo 内容文件夹中提供完整的 Blueprint 实现,支持 UE 4.27+

下载演示 (Windows)

视频教程

演示项目预览

常见用例

该插件开箱即支持的部分工作流——全部在本地运行,无需外部依赖。

NPC 对话

以角色为核心的对话,具有持久上下文——NPC 能记住过往交流,并通过系统提示词保持角色设定。

动态内容

在运行时生成任务文本、物品描述、背景故事片段或战斗喊话——每次会话输出各不相同,无需逐一编写所有变体。

离线聊天机器人

无需互联网即可运行的游戏内助手和聊天机器人——适用于离线游戏、物理隔离部署以及对隐私敏感的应用程序。

AI 流水线

与 Speech Recognizer 配合实现语音输入,TTS 用于口语回复,口型同步用于动画——打造完全离线的对话角色。

插件生态系统

Runtime Local LLM 是 Georgy Dev 插件套件的离线 AI 大脑——将其与语音识别、TTS 和口型同步结合,即可打造完全在设备端运行的对话角色。

Runtime Audio Importer

在运行时处理并播放 TTS 音频输出。处理来自任何 TTS 提供商的流式音频数据时,这是必不可少的搭档。

了解更多

Runtime Speech Recognizer

通过 Whisper 实现离线语音转文字。将玩家的语音转换为文本,并直接将其输入本地 LLM。

了解更多

Runtime Text To Speech

离线 TTS,支持 51 种语言、2800+ 种音色——在本地朗读 LLM 的回复。

了解更多

Runtime MetaHuman Lip Sync

针对 MetaHuman 和自定义角色的实时口型同步,由合成的 LLM 回复音频输出驱动。

了解更多

AI 聊天机器人集成器

云 AI 替代方案——OpenAI、Claude、DeepSeek 等。与 Runtime Local LLM 配合使用,适用于在线/离线混合场景。

了解更多

文档与支持

综合文档涵盖编辑器模型管理器、运行时 API、推理参数、 开箱即用的示例(简单聊天、NPC 对话、预下载)以及附带的演示项目。

完整文档

所有功能的逐步指南,包含 Blueprint 与 C++ 示例

社区与支持

活跃的 Discord 社区,提供开发者支持

自定义开发

定制的集成或功能开发 - [email protected]

编辑器 - 导入自定义 GGUF 模型

准备好将本地 LLM 添加到您的项目了吗?

可在 Fab 上获取,支持 UE 4.27 – 5.8。包含编辑器模型管理器、运行时 API、演示项目和完整文档。