
Chạy các mô hình ngôn ngữ lớn hoàn toàn trên thiết bị trong Unreal Engine. Suy luận GGUF ngoại tuyến với truyền từng token, ngữ cảnh hội thoại và một trình quản lý mô hình trong trình biên tập - với hỗ trợ đầy đủ Blueprint và C++.
Được xây dựng trên llama.cpp - tải bất kỳ mô hình GGUF nào và chạy suy luận cục bộ mà không cần dịch vụ đám mây, không cần khóa API và không có dữ liệu rời khỏi thiết bị. Được cập nhật thường xuyên để theo kịp các bản phát hành llama.cpp thượng nguồn.
Không cần kết nối internet, không cần khóa API, không có telemetry. Tất cả suy luận đều chạy cục bộ trên thiết bị của người dùng.
Nhận từng token được tạo ra trong thời gian thực qua các delegate - cập nhật giao diện trò chuyện và kích hoạt các sự kiện gameplay khi mô hình đang viết.
Vulkan trên Windows và Linux, Metal trên Mac và iOS, CPU + intrinsics trên Android và Meta Quest.
Duyệt, tải xuống, nhập, xóa và kiểm tra các mô hình trực tiếp trong cài đặt dự án. Các mô hình tự động đi kèm trong các bản build đã đóng gói.
Quản lý mô hình trong trình chỉnh sửa, tải chúng khi chạy với các tham số suy luận bạn chọn và gửi tin nhắn. Token truyền ngược qua delegate khi mô hình tạo ra - tất cả trên một luồng nền, với callback trên luồng game.
Tải xuống từ danh mục, nhập tệp GGUF tùy chỉnh hoặc tải từ URL khi chạy
Chọn theo tên, đường dẫn tệp hoặc URL với các tham số suy luận có thể cấu hình
Truyền tin nhắn người dùng và nhận phản hồi theo luồng, giữ nguyên ngữ cảnh hội thoại
Điều khiển hội thoại NPC, tạo nội dung động hoặc đưa vào các plugin khác như TTS và lip sync
Mọi mô hình định dạng GGUF đều hoạt động. Trình chỉnh sửa bao gồm danh mục các mô hình phổ biến được định nghĩa sẵn để tải xuống một chạm và bạn có thể nhập bất kỳ tệp GGUF tùy chỉnh nào.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama và bất kỳ mô hình cộng đồng GGUF nào khác.
Từ Q2_K (nhỏ nhất, nhanh nhất) qua Q4_K_M, Q5_K_M, Q8_0, lên đến F16 / F32. Chọn mức phù hợp với RAM và ngân sách hiệu năng của thiết bị mục tiêu.
Plugin được cập nhật thường xuyên trên Fab để bám sát các bản phát hành llama.cpp thượng nguồn, nhờ đó các định dạng mô hình GGUF mới nhất tiếp tục được hỗ trợ ngay khi phát hành.
Tăng tốc phần cứng được tinh chỉnh theo từng nền tảng - tính toán GPU khi có sẵn, CPU + intrinsics khi không.
| Nền tảng | Tăng tốc |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + intrinsics |
| Meta Quest | CPU + intrinsics |
Đối với thiết bị di động và VR, nên sử dụng các mức lượng tử hóa nhỏ hơn (Q2_K đến Q4_K_M) với các mô hình nhỏ gọn (1B–3B tham số). Các nền tảng máy tính để bàn có thể chạy các mô hình lớn hơn với mức lượng tử hóa cao hơn.
Một bảng cài đặt chuyên dụng trong Unreal Editor để duyệt, tải xuống, nhập, xóa, và kiểm thử các mô hình - không cần công cụ dòng lệnh hoặc tải xuống bên ngoài.
Duyệt qua danh mục tích hợp gồm các mô hình phổ biến với tính năng tải xuống một cú nhấp chuột. Nhiều bản tải xuống song song, có thanh tiến trình và hỗ trợ hủy.
Nhập bất kỳ tệp GGUF nào từ đĩa hoặc URL trực tiếp. Các mô hình tùy chỉnh được xử lý giống hệt như các mô hình trong danh mục và được đóng gói cùng với bản dựng xuất bản.
Cửa sổ kiểm thử tích hợp cho phép bạn chọn mô hình, cấu hình tham số, gửi lời nhắc (prompt) và xem phản hồi được phát trực tiếp theo thời gian thực - tất cả mà không cần vào chế độ Play.
Ngoài việc tải và suy luận cơ bản, plugin cung cấp nhiều phương pháp tải mô hình, các nút Blueprint bất đồng bộ, tải xuống trong thời gian chạy, quản lý ngữ cảnh hội thoại và các tham số suy luận có thể cấu hình.
Tải theo tên mô hình, theo đường dẫn tệp tuyệt đối, hoặc trực tiếp từ URL với tính năng tự động tải xuống. Có thể lưu trước các mô hình vào bộ nhớ đệm mà không cần tải.
Mỗi token được tạo ra sẽ kích hoạt một delegate trên luồng game - ngay lập tức cập nhật giao diện chat, kích hoạt các sự kiện gameplay, hoặc chuyển đầu ra vào các hệ thống khác khi dữ liệu đến.
Các cuộc hội thoại nhiều lượt tự động lưu giữ lịch sử tin nhắn. Có thể đặt lại ngữ cảnh bất cứ lúc nào, tùy chọn giữ lại system prompt để duy trì hành vi nhân vật nhất quán.
Kiểm soát temperature, Top-P, Top-K, repeat penalty, GPU layer offload, kích thước ngữ cảnh, seed, số luồng, max tokens và system prompt - cho từng lần tải mô hình.
Các nút bất đồng bộ chuyên dụng để tải, gửi tin nhắn và tải xuống - với các pin đầu ra cho token, hoàn thành, tiến trình và lỗi. Không cần gán delegate thủ công.
Các mô hình trong thư mục Content/RuntimeLocalLLM/Models được tự động đưa vào giai đoạn đóng gói qua NonUFS để chúng được phân phối cùng bản build đã đóng gói. Không cần cấu hình dự án thủ công.
Ví dụ Blueprint - Trò chuyện đơn giản với phản hồi truyền phát

Bản demo Windows có sẵn để bạn có thể trải nghiệm trực tiếp tính năng suy luận trên thiết bị. Bản demo bao gồm giao diện chat với phản hồi truyền phát, tính năng tải mô hình trực tiếp qua URL trong thời gian chạy, và menu cài đặt cho các tham số suy luận - tất cả được xây dựng bằng Blueprints và UMG.
Gửi tin nhắn và xem phản hồi được tạo ra từng token một trong thời gian thực
Các mô hình sẵn sàng sử dụng ngay, cùng với tính năng tải xuống qua URL trong thời gian chạy để bổ sung thêm mô hình.
Menu cài đặt trong trò chơi cho temperature, max tokens, kích thước ngữ cảnh và hơn thế nữa
Triển khai Blueprint đầy đủ trong thư mục nội dung Demo của plugin, hỗ trợ UE 4.27+
Video hướng dẫn
Xem trước dự án demo
Một vài quy trình làm việc mà plugin hỗ trợ sẵn - tất cả đều chạy cục bộ không cần phụ thuộc bên ngoài.
Hội thoại do nhân vật dẫn dắt với ngữ cảnh được duy trì - NPC nhớ các trao đổi trước đó và luôn giữ đúng tính cách nhờ lời nhắc hệ thống.
Tạo văn bản nhiệm vụ, mô tả vật phẩm, đoạn bối cảnh hoặc câu thoại ngắn khi chạy - kết quả thay đổi theo từng phiên mà không cần soạn trước mọi biến thể.
Trợ lý trong trò chơi và chatbot hoạt động mà không cần internet - hữu ích cho các trò chơi ngoại tuyến, các bản triển khai trong môi trường cách ly mạng và các ứng dụng nhạy cảm về quyền riêng tư.
Kết hợp với Trình nhận dạng giọng nói để nhận đầu vào giọng nói, TTS để tạo phản hồi nói và khớp khẩu hình để tạo hoạt ảnh - xây dựng nhân vật hội thoại hoàn toàn ngoại tuyến.
Runtime Local LLM là bộ não AI ngoại tuyến của bộ plugin Georgy Dev - kết hợp nó với nhận dạng giọng nói, TTS và khớp khẩu hình để tạo nhân vật hội thoại hoàn toàn trên thiết bị.
Xử lý và phát đầu ra âm thanh TTS khi chạy. Là công cụ đồng hành thiết yếu để xử lý dữ liệu âm thanh phát trực tuyến từ bất kỳ nhà cung cấp TTS nào.
Tìm hiểu thêmChuyển giọng nói thành văn bản ngoại tuyến qua Whisper. Chuyển lời nói của người chơi thành văn bản và đưa trực tiếp vào LLM cục bộ.
Tìm hiểu thêmTTS ngoại tuyến với 2800+ giọng đọc trên 51 ngôn ngữ - đọc to phản hồi của LLM ngay trên máy.
Tìm hiểu thêmKhớp khẩu hình thời gian thực cho MetaHuman và các nhân vật tùy chỉnh, được điều khiển bởi đầu ra âm thanh của các phản hồi do LLM tổng hợp.
Tìm hiểu thêmGiải pháp thay thế AI đám mây - OpenAI, Claude, DeepSeek và các dịch vụ khác. Sử dụng cùng Runtime Local LLM cho các kịch bản kết hợp trực tuyến/ngoại tuyến.
Tìm hiểu thêmTài liệu toàn diện bao gồm trình quản lý mô hình trong editor, runtime API, các tham số suy luận, các ví dụ sẵn sàng sử dụng (trò chuyện đơn giản, hội thoại NPC, tải trước), và dự án demo đi kèm.
Hướng dẫn từng bước cho mọi tính năng, kèm ví dụ Blueprint và C++
Cộng đồng Discord sôi động với sự hỗ trợ từ nhà phát triển
Tích hợp hoặc phát triển tính năng theo yêu cầu - [email protected]
Editor - Nhập các mô hình GGUF tùy chỉnh
Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm trình quản lý mô hình trong editor, runtime API, dự án demo và tài liệu đầy đủ.