基于 llama.cpp - 加载任意GGUF模型并在本地运行推理,无需云服务、无需API密钥,且不会有数据 离开设备。定期更新以跟踪上游llama.cpp版本。
无需互联网连接、无需API密钥、无遥测数据。所有推理均在用户设备本地运行。
通过委托实时接收每个生成的 Token - 在模型生成时更新聊天 UI 并触发游戏事件。
在 Windows 和 Linux 上使用 Vulkan,在 Mac 和 iOS 上使用 Metal,在 Android 和 Meta Quest 上使用 CPU + 内建函数。
在项目设置中直接浏览、下载、导入、删除和测试模型。模型会自动随打包构建一同发布。
在编辑器中管理模型,在运行时使用你选择的推理参数加载模型,然后发送消息。 模型生成时,Token 通过委托流式返回 - 全部在后台线程上进行,并在游戏线程上回调。
从目录下载、导入自定义 GGUF 文件,或在运行时从 URL 获取
按名称、文件路径或 URL 选择,并配置推理参数
传递用户消息并接收流式响应,同时保留对话上下文
驱动 NPC 对话、生成动态内容,或输入到其他插件如 TTS 和口型同步
任何 GGUF 格式的模型都可以使用。编辑器包含常用预定义模型目录,可一键下载,你还可以导入任意自定义 GGUF 文件。
Llama (Meta)、Mistral / Mixtral、Phi (Microsoft)、Gemma (Google)、Qwen (Alibaba)、TinyLlama,以及任何其他 GGUF 社区模型。
从 Q2_K (最小、最快) 到 Q4_K_M、Q5_K_M、Q8_0,直到 F16 / F32。选择适合目标设备 RAM 和性能预算的级别。
该插件在 Fab 上定期更新,以跟踪上游 llama.cpp 版本,从而在最新 GGUF 模型格式发布时保持支持。
针对各平台调优的硬件加速——在可用时使用 GPU 计算,否则使用 CPU + 内建函数。
| 平台 | 加速 |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + 内建函数 |
| Meta Quest | CPU + 内建函数 |
对于移动设备和 VR 设备,建议使用较小的量化级别(Q2_K 至 Q4_K_M)以及紧凑型模型(1B–3B 参数)。桌面平台可以运行更大的模型和更高的量化级别。
一个位于 Unreal Editor 内的专用设置面板,用于浏览、下载、导入、删除、 以及测试模型——无需命令行工具或外部下载。
浏览内置的热门模型目录,并一键下载。可并行执行多个下载任务,带进度条并支持取消。
支持从磁盘或直接 URL 导入任意 GGUF 文件。自定义模型与目录模型受到同等对待,并会随打包版本一同提供。
内置的测试窗口可让你选择模型、配置参数、发送提示词,并实时查看流式返回的响应——全程无需进入 Play 模式。
除了基本的加载和推理之外,该插件还提供多种模型加载方式、异步 Blueprint 节点、 运行时下载、对话上下文管理和可配置的推理参数。
按模型名称、绝对文件路径加载,或直接从 URL 自动下载加载。可预缓存模型而无需加载。
每个生成的 Token 都会在游戏线程上触发一个委托——立即更新聊天 UI、触发游戏事件,或在输出到达时将其传递到其他系统。
多轮对话自动保留消息历史。可随时重置上下文,并可选保留系统提示词以维持角色行为的一致性。
每次加载模型时可控制温度、Top-P、Top-K、重复惩罚、GPU 层卸载、上下文大小、随机种子、线程数、最大 Token 数和系统提示词。
专用于加载、发送消息和下载的异步节点——带有用于 Token、完成、进度和错误的输出引脚。无需手动绑定委托。
Content/RuntimeLocalLLM/Models 中的模型会通过 NonUFS 自动暂存,因此会随打包版本一起发布。无需手动配置项目。
Blueprint 示例——带流式响应的简单聊天

Windows 演示可供您亲身体验设备端推理。该演示 包含带流式响应的聊天界面、通过 URL 进行运行时模型下载,以及 用于推理参数的设置菜单——全部使用 Blueprints 和 UMG 构建。
发送消息,实时观看回复逐 Token 生成
开箱即用的模型,外加通过运行时 URL 下载更多模型
游戏内设置菜单,可调节温度、最大 Token 数、上下文大小等
插件 Demo 内容文件夹中提供完整的 Blueprint 实现,支持 UE 4.27+
视频教程
演示项目预览
该插件开箱即支持的部分工作流——全部在本地运行,无需外部依赖。
以角色为核心的对话,具有持久上下文——NPC 能记住过往交流,并通过系统提示词保持角色设定。
在运行时生成任务文本、物品描述、背景故事片段或战斗喊话——每次会话输出各不相同,无需逐一编写所有变体。
无需互联网即可运行的游戏内助手和聊天机器人——适用于离线游戏、物理隔离部署以及对隐私敏感的应用程序。
与 Speech Recognizer 配合实现语音输入,TTS 用于口语回复,口型同步用于动画——打造完全离线的对话角色。
Runtime Local LLM 是 Georgy Dev 插件套件的离线 AI 大脑——将其与语音识别、TTS 和口型同步结合,即可打造完全在设备端运行的对话角色。
综合文档涵盖编辑器模型管理器、运行时 API、推理参数、 开箱即用的示例(简单聊天、NPC 对话、预下载)以及附带的演示项目。
所有功能的逐步指南,包含 Blueprint 与 C++ 示例
活跃的 Discord 社区,提供开发者支持
定制的集成或功能开发 - [email protected]
编辑器 - 导入自定义 GGUF 模型
可在 Fab 上获取,支持 UE 4.27 – 5.8。包含编辑器模型管理器、运行时 API、演示项目和完整文档。