建構於 llama.cpp - 載入任何GGUF模型並在本機執行推論,無需雲端服務、無需API金鑰,且不會有任何資料 離開裝置。定期更新以跟上上游llama.cpp的版本。
無需網路連線,無需API金鑰,無遙測。所有推論皆在使用者裝置上本機執行。
透過委派即時接收每個生成的 Token - 在模型生成時更新聊天 UI 並觸發遊戲事件。
Windows 和 Linux 上使用 Vulkan,Mac 和 iOS 上使用 Metal,Android 和 Meta Quest 上使用 CPU + intrinsics。
直接在專案設定中瀏覽、下載、匯入、刪除和測試模型。模型會自動隨打包版本一起提供。
在編輯器中管理模型,在執行時期以您選擇的推論參數載入模型,並傳送訊息。 Token 會在模型生成時透過委派串流回傳 - 全部在背景執行緒上進行,並在遊戲執行緒上回呼。
從目錄下載、匯入自訂 GGUF 檔案,或在執行時期從 URL 取得
依名稱、檔案路徑或 URL 選擇,並可設定推論參數
傳遞使用者訊息並接收串流回應,同時保留對話上下文
驅動 NPC 對話、產生動態內容,或饋送到其他外掛程式,例如 TTS 和口型同步。
任何 GGUF 格式的模型均可運作。編輯器內含常用預先定義模型的目錄,可一鍵下載,您也可以匯入任何自訂 GGUF 檔案。
Llama (Meta)、Mistral / Mixtral、Phi (Microsoft)、Gemma (Google)、Qwen (Alibaba)、TinyLlama,以及任何其他 GGUF 社群模型。
從 Q2_K(最小、最快)到 Q4_K_M、Q5_K_M、Q8_0,最高可達 F16 / F32。請選擇符合目標裝置 RAM 與效能預算的等級。
此外掛程式會定期在 Fab 上更新,以追蹤上游 llama.cpp 的發行版本,因此最新 GGUF 模型格式一經推出即可持續獲得支援。
依各平台調校的硬體加速——有 GPU 運算可用時使用 GPU,否則使用 CPU + 內建指令集。
| 平台 | 加速 |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + 內建指令集 |
| Meta Quest | CPU + 內建指令集 |
對於行動裝置和 VR 裝置,建議使用較小的量化(Q2_K 至 Q4_K_M)搭配緊湊型模型(1B–3B 參數)。桌面平台則可執行較大的模型並使用更高的量化等級。
一個位於 Unreal Editor 內的專用設定面板,用於瀏覽、下載、匯入、刪除和測試模型——無需命令列工具或外部下載。
瀏覽內建的熱門模型目錄,並可一鍵下載。支援多個下載並行,具備進度列和取消功能。
從磁碟或直接 URL 匯入任何 GGUF 檔案。自訂模型與目錄模型的處理方式完全相同,並會隨打包建置一同提供。
內建的測試視窗可讓您選擇模型、設定參數、傳送提示詞,並即時串流查看回應——完全不需要進入播放模式。
除了基本的載入與推論功能之外,此外掛程式還提供多種模型載入方法、非同步 Blueprint 節點、執行階段下載、對話上下文管理,以及可設定的推論參數。
依模型名稱、絕對檔案路徑載入,或直接從 URL 下載。可預先快取模型,而不實際載入。
每個產生的 Token 都會在遊戲執行緒上觸發委派——立即更新聊天 UI、觸發遊戲事件,或將輸出即時傳送至其他系統。
多輪對話會自動保留訊息歷史。您可以隨時重置上下文,也可選擇保留系統提示詞,以維持一致的角色行為。
每次載入模型時,可控制溫度、Top-P、Top-K、重複懲罰、GPU 層卸載、上下文大小、隨機種子、執行緒數、最大 Token 數,以及系統提示詞。
提供專用的非同步節點,用於載入、傳送訊息與下載——具備 Token、完成、進度與錯誤的輸出針腳。無需手動綁定委派。
Content/RuntimeLocalLLM/Models 中的模型會透過 NonUFS 自動暫存,因此會隨打包版本一起發布。無需手動設定專案。
Blueprint 範例 - 使用串流回應的簡單聊天

提供 Windows 示範版,讓您親身體驗裝置端推論。示範版包含具有串流回應的聊天介面、透過 URL 的執行階段模型下載,以及用於調整推論參數的設定選單——全部皆以 Blueprint 和 UMG 建置。
傳送訊息,並即時觀看回應逐 Token 產生。
開箱即用的模型,並可透過執行階段 URL 下載其他模型。
遊戲內設定選單,可調整溫度、最大 Token 數、上下文大小等。
外掛程式 Demo 內容資料夾中的完整 Blueprint 實作,支援 UE 4.27+
影片教學
示範專案預覽
這個外掛程式開箱即用支援的幾種工作流程——全部在本機執行,且無外部依賴。
以角色驅動的對話,具備持續上下文——NPC 會記住先前的交流,並透過系統提示維持角色設定。
在執行時生成任務文字、物品描述、背景故事片段或簡短台詞——每次工作階段的輸出都有所不同,無需為每個變體逐一編寫。
遊戲內的助理與聊天機器人,無需網際網路即可運作——非常適合離線遊戲、隔離網路部署,以及隱私敏感應用。
可與 Speech Recognizer 搭配進行語音輸入、以 TTS 產生語音回應、以 Lip Sync 驅動動畫——建立完全離線的對話角色。
Runtime Local LLM 是 Georgy Dev 外掛套件的離線 AI 大腦——將它與語音辨識、TTS 和唇形同步結合,即可打造完全在裝置端運作的對話角色。
全面的文件涵蓋編輯器模型管理器、執行時期 API、推論參數、 可直接使用的範例(簡單聊天、NPC 對話、預先下載),以及隨附的示範專案。
所有功能的逐步指南,附有 Blueprint 與 C++ 範例
活躍的 Discord 社群,提供開發者支援
量身打造的整合或功能開發 - [email protected]
編輯器 - 匯入自訂 GGUF 模型
可在 Fab 上取得,適用於 UE 4.27 – 5.8。包含編輯器模型管理器、執行時期 API、示範專案與完整文件。