Runtime Local LLM | Georgy Dev

Runtime Local LLM

在Unreal Engine中完全於裝置端執行大型語言模型。離線GGUF推論,採用逐Token 串流、對話上下文,以及編輯器模型管理器——並提供完整的Blueprint與C++支援。

UE 4.27 – 5.8
Blueprints 與 C++
Windows, Mac, Linux, Android, iOS, Quest
任何GGUF模型

裝置端LLM推論

建構於 llama.cpp - 載入任何GGUF模型並在本機執行推論,無需雲端服務、無需API金鑰,且不會有任何資料 離開裝置。定期更新以跟上上游llama.cpp的版本。

完全離線

無需網路連線,無需API金鑰,無遙測。所有推論皆在使用者裝置上本機執行。

Token 串流

透過委派即時接收每個生成的 Token - 在模型生成時更新聊天 UI 並觸發遊戲事件。

GPU 加速

Windows 和 Linux 上使用 Vulkan,Mac 和 iOS 上使用 Metal,Android 和 Meta Quest 上使用 CPU + intrinsics。

編輯器模型管理器

直接在專案設定中瀏覽、下載、匯入、刪除和測試模型。模型會自動隨打包版本一起提供。

運作方式

在編輯器中管理模型,在執行時期以您選擇的推論參數載入模型,並傳送訊息。 Token 會在模型生成時透過委派串流回傳 - 全部在背景執行緒上進行,並在遊戲執行緒上回呼。

1

管理模型

從目錄下載、匯入自訂 GGUF 檔案,或在執行時期從 URL 取得

2

載入模型

依名稱、檔案路徑或 URL 選擇,並可設定推論參數

3

傳送訊息

傳遞使用者訊息並接收串流回應,同時保留對話上下文

4

使用輸出

驅動 NPC 對話、產生動態內容,或饋送到其他外掛程式,例如 TTS 和口型同步。

支援的模型

任何 GGUF 格式的模型均可運作。編輯器內含常用預先定義模型的目錄,可一鍵下載,您也可以匯入任何自訂 GGUF 檔案。

模型家族

Llama (Meta)、Mistral / Mixtral、Phi (Microsoft)、Gemma (Google)、Qwen (Alibaba)、TinyLlama,以及任何其他 GGUF 社群模型。

量化等級

從 Q2_K(最小、最快)到 Q4_K_M、Q5_K_M、Q8_0,最高可達 F16 / F32。請選擇符合目標裝置 RAM 與效能預算的等級。

最新的 llama.cpp

此外掛程式會定期在 Fab 上更新,以追蹤上游 llama.cpp 的發行版本,因此最新 GGUF 模型格式一經推出即可持續獲得支援。

平台加速

依各平台調校的硬體加速——有 GPU 運算可用時使用 GPU,否則使用 CPU + 內建指令集。

平台 加速
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + 內建指令集
Meta Quest CPU + 內建指令集

對於行動裝置和 VR 裝置,建議使用較小的量化(Q2_K 至 Q4_K_M)搭配緊湊型模型(1B–3B 參數)。桌面平台則可執行較大的模型並使用更高的量化等級。

編輯器模型管理器

一個位於 Unreal Editor 內的專用設定面板,用於瀏覽、下載、匯入、刪除和測試模型——無需命令列工具或外部下載。

目錄下載

瀏覽內建的熱門模型目錄,並可一鍵下載。支援多個下載並行,具備進度列和取消功能。

自訂模型匯入

從磁碟或直接 URL 匯入任何 GGUF 檔案。自訂模型與目錄模型的處理方式完全相同,並會隨打包建置一同提供。

編輯器內測試

內建的測試視窗可讓您選擇模型、設定參數、傳送提示詞,並即時串流查看回應——完全不需要進入播放模式。

全功能執行時期 API

除了基本的載入與推論功能之外,此外掛程式還提供多種模型載入方法、非同步 Blueprint 節點、執行階段下載、對話上下文管理,以及可設定的推論參數。

多種載入方法

依模型名稱、絕對檔案路徑載入,或直接從 URL 下載。可預先快取模型,而不實際載入。

逐 Token 串流

每個產生的 Token 都會在遊戲執行緒上觸發委派——立即更新聊天 UI、觸發遊戲事件,或將輸出即時傳送至其他系統。

對話上下文

多輪對話會自動保留訊息歷史。您可以隨時重置上下文,也可選擇保留系統提示詞,以維持一致的角色行為。

可設定的推論

每次載入模型時,可控制溫度、Top-P、Top-K、重複懲罰、GPU 層卸載、上下文大小、隨機種子、執行緒數、最大 Token 數,以及系統提示詞。

非同步 Blueprint 節點

提供專用的非同步節點,用於載入、傳送訊息與下載——具備 Token、完成、進度與錯誤的輸出針腳。無需手動綁定委派。

自動打包

Content/RuntimeLocalLLM/Models 中的模型會透過 NonUFS 自動暫存,因此會隨打包版本一起發布。無需手動設定專案。

Blueprint 範例 - 使用串流回應的簡單聊天

簡單的聊天Blueprint範例

試用示範版

提供 Windows 示範版,讓您親身體驗裝置端推論。示範版包含具有串流回應的聊天介面、透過 URL 的執行階段模型下載,以及用於調整推論參數的設定選單——全部皆以 Blueprint 和 UMG 建置。

具有 Token 串流的聊天介面

傳送訊息,並即時觀看回應逐 Token 產生。

預先內建與可下載的模型

開箱即用的模型,並可透過執行階段 URL 下載其他模型。

可設定的參數

遊戲內設定選單,可調整溫度、最大 Token 數、上下文大小等。

隨外掛程式附上原始碼

外掛程式 Demo 內容資料夾中的完整 Blueprint 實作,支援 UE 4.27+

下載示範版 (Windows)

影片教學

示範專案預覽

常見使用案例

這個外掛程式開箱即用支援的幾種工作流程——全部在本機執行,且無外部依賴。

NPC 對話

以角色驅動的對話,具備持續上下文——NPC 會記住先前的交流,並透過系統提示維持角色設定。

動態內容

在執行時生成任務文字、物品描述、背景故事片段或簡短台詞——每次工作階段的輸出都有所不同,無需為每個變體逐一編寫。

離線聊天機器人

遊戲內的助理與聊天機器人,無需網際網路即可運作——非常適合離線遊戲、隔離網路部署,以及隱私敏感應用。

AI 管線

可與 Speech Recognizer 搭配進行語音輸入、以 TTS 產生語音回應、以 Lip Sync 驅動動畫——建立完全離線的對話角色。

外掛生態系統

Runtime Local LLM 是 Georgy Dev 外掛套件的離線 AI 大腦——將它與語音辨識、TTS 和唇形同步結合,即可打造完全在裝置端運作的對話角色。

Runtime Audio Importer

在執行時處理並播放 TTS 音訊輸出。是處理來自任何 TTS 提供者之串流音訊資料的必備配套。

了解更多

Runtime Speech Recognizer

使用 Whisper 進行離線語音轉文字。將玩家的語音轉換為文字,並直接送入本機 LLM。

了解更多

Runtime Text To Speech

離線 TTS,提供 2800+ 種聲音、涵蓋 51 種語言——在本機將 LLM 的回應朗讀出來。

了解更多

Runtime MetaHuman Lip Sync

為 MetaHumans 與自訂角色提供即時唇形同步,由 LLM 合成回應的音訊輸出所驅動。

了解更多

AI 聊天機器人整合器

雲端 AI 替代方案——OpenAI、Claude、DeepSeek 等。可與 Runtime Local LLM 並用,以應對線上/離線混合情境。

了解更多

文件與支援

全面的文件涵蓋編輯器模型管理器、執行時期 API、推論參數、 可直接使用的範例(簡單聊天、NPC 對話、預先下載),以及隨附的示範專案。

完整文件

所有功能的逐步指南,附有 Blueprint 與 C++ 範例

社群與支援

活躍的 Discord 社群,提供開發者支援

自訂開發

量身打造的整合或功能開發 - [email protected]

編輯器 - 匯入自訂 GGUF 模型

準備好為您的專案加入本機 LLM 了嗎?

可在 Fab 上取得,適用於 UE 4.27 – 5.8。包含編輯器模型管理器、執行時期 API、示範專案與完整文件。