Runtime Local LLM | Georgy Dev

Runtime Local LLM

Chạy các mô hình ngôn ngữ lớn hoàn toàn trên thiết bị trong Unreal Engine. Suy luận GGUF ngoại tuyến với truyền từng token, ngữ cảnh hội thoại và một trình quản lý mô hình trong trình biên tập - với hỗ trợ đầy đủ Blueprint và C++.

UE 4.27 – 5.8
Blueprints và C++
Windows, Mac, Linux, Android, iOS, Quest
Bất kỳ mô hình GGUF nào

Suy luận LLM trên thiết bị

Được xây dựng trên llama.cpp - tải bất kỳ mô hình GGUF nào và chạy suy luận cục bộ mà không cần dịch vụ đám mây, không cần khóa API và không có dữ liệu rời khỏi thiết bị. Được cập nhật thường xuyên để theo kịp các bản phát hành llama.cpp thượng nguồn.

Hoàn toàn ngoại tuyến

Không cần kết nối internet, không cần khóa API, không có telemetry. Tất cả suy luận đều chạy cục bộ trên thiết bị của người dùng.

Truyền phát Token

Nhận từng token được tạo ra trong thời gian thực qua các delegate - cập nhật giao diện trò chuyện và kích hoạt các sự kiện gameplay khi mô hình đang viết.

Tăng tốc GPU

Vulkan trên Windows và Linux, Metal trên Mac và iOS, CPU + intrinsics trên Android và Meta Quest.

Trình quản lý mô hình trong Editor

Duyệt, tải xuống, nhập, xóa và kiểm tra các mô hình trực tiếp trong cài đặt dự án. Các mô hình tự động đi kèm trong các bản build đã đóng gói.

Cách hoạt động

Quản lý mô hình trong trình chỉnh sửa, tải chúng khi chạy với các tham số suy luận bạn chọn và gửi tin nhắn. Token truyền ngược qua delegate khi mô hình tạo ra - tất cả trên một luồng nền, với callback trên luồng game.

1

Quản lý mô hình

Tải xuống từ danh mục, nhập tệp GGUF tùy chỉnh hoặc tải từ URL khi chạy

2

Tải mô hình

Chọn theo tên, đường dẫn tệp hoặc URL với các tham số suy luận có thể cấu hình

3

Gửi tin nhắn

Truyền tin nhắn người dùng và nhận phản hồi theo luồng, giữ nguyên ngữ cảnh hội thoại

4

Sử dụng đầu ra

Điều khiển hội thoại NPC, tạo nội dung động hoặc đưa vào các plugin khác như TTS và lip sync

Các mô hình được hỗ trợ

Mọi mô hình định dạng GGUF đều hoạt động. Trình chỉnh sửa bao gồm danh mục các mô hình phổ biến được định nghĩa sẵn để tải xuống một chạm và bạn có thể nhập bất kỳ tệp GGUF tùy chỉnh nào.

Các họ mô hình

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama và bất kỳ mô hình cộng đồng GGUF nào khác.

Các mức lượng tử hóa

Từ Q2_K (nhỏ nhất, nhanh nhất) qua Q4_K_M, Q5_K_M, Q8_0, lên đến F16 / F32. Chọn mức phù hợp với RAM và ngân sách hiệu năng của thiết bị mục tiêu.

llama.cpp cập nhật mới nhất

Plugin được cập nhật thường xuyên trên Fab để bám sát các bản phát hành llama.cpp thượng nguồn, nhờ đó các định dạng mô hình GGUF mới nhất tiếp tục được hỗ trợ ngay khi phát hành.

Tăng tốc nền tảng

Tăng tốc phần cứng được tinh chỉnh theo từng nền tảng - tính toán GPU khi có sẵn, CPU + intrinsics khi không.

Nền tảng Tăng tốc
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + intrinsics
Meta Quest CPU + intrinsics

Đối với thiết bị di động và VR, nên sử dụng các mức lượng tử hóa nhỏ hơn (Q2_K đến Q4_K_M) với các mô hình nhỏ gọn (1B–3B tham số). Các nền tảng máy tính để bàn có thể chạy các mô hình lớn hơn với mức lượng tử hóa cao hơn.

Trình quản lý mô hình trong Editor

Một bảng cài đặt chuyên dụng trong Unreal Editor để duyệt, tải xuống, nhập, xóa, và kiểm thử các mô hình - không cần công cụ dòng lệnh hoặc tải xuống bên ngoài.

Tải xuống từ danh mục

Duyệt qua danh mục tích hợp gồm các mô hình phổ biến với tính năng tải xuống một cú nhấp chuột. Nhiều bản tải xuống song song, có thanh tiến trình và hỗ trợ hủy.

Nhập mô hình tùy chỉnh

Nhập bất kỳ tệp GGUF nào từ đĩa hoặc URL trực tiếp. Các mô hình tùy chỉnh được xử lý giống hệt như các mô hình trong danh mục và được đóng gói cùng với bản dựng xuất bản.

Kiểm thử trong Editor

Cửa sổ kiểm thử tích hợp cho phép bạn chọn mô hình, cấu hình tham số, gửi lời nhắc (prompt) và xem phản hồi được phát trực tiếp theo thời gian thực - tất cả mà không cần vào chế độ Play.

API thời gian chạy đầy đủ tính năng

Ngoài việc tải và suy luận cơ bản, plugin cung cấp nhiều phương pháp tải mô hình, các nút Blueprint bất đồng bộ, tải xuống trong thời gian chạy, quản lý ngữ cảnh hội thoại và các tham số suy luận có thể cấu hình.

Nhiều phương thức tải

Tải theo tên mô hình, theo đường dẫn tệp tuyệt đối, hoặc trực tiếp từ URL với tính năng tự động tải xuống. Có thể lưu trước các mô hình vào bộ nhớ đệm mà không cần tải.

Truyền phát từng token

Mỗi token được tạo ra sẽ kích hoạt một delegate trên luồng game - ngay lập tức cập nhật giao diện chat, kích hoạt các sự kiện gameplay, hoặc chuyển đầu ra vào các hệ thống khác khi dữ liệu đến.

Ngữ cảnh hội thoại

Các cuộc hội thoại nhiều lượt tự động lưu giữ lịch sử tin nhắn. Có thể đặt lại ngữ cảnh bất cứ lúc nào, tùy chọn giữ lại system prompt để duy trì hành vi nhân vật nhất quán.

Suy luận có thể cấu hình

Kiểm soát temperature, Top-P, Top-K, repeat penalty, GPU layer offload, kích thước ngữ cảnh, seed, số luồng, max tokens và system prompt - cho từng lần tải mô hình.

Nút Blueprint bất đồng bộ

Các nút bất đồng bộ chuyên dụng để tải, gửi tin nhắn và tải xuống - với các pin đầu ra cho token, hoàn thành, tiến trình và lỗi. Không cần gán delegate thủ công.

Đóng gói tự động

Các mô hình trong thư mục Content/RuntimeLocalLLM/Models được tự động đưa vào giai đoạn đóng gói qua NonUFS để chúng được phân phối cùng bản build đã đóng gói. Không cần cấu hình dự án thủ công.

Ví dụ Blueprint - Trò chuyện đơn giản với phản hồi truyền phát

Ví dụ Blueprint trò chuyện đơn giản

Dùng thử Demo

Bản demo Windows có sẵn để bạn có thể trải nghiệm trực tiếp tính năng suy luận trên thiết bị. Bản demo bao gồm giao diện chat với phản hồi truyền phát, tính năng tải mô hình trực tiếp qua URL trong thời gian chạy, và menu cài đặt cho các tham số suy luận - tất cả được xây dựng bằng Blueprints và UMG.

Giao diện trò chuyện với truyền phát token

Gửi tin nhắn và xem phản hồi được tạo ra từng token một trong thời gian thực

Các mô hình được tích hợp sẵn và có thể tải xuống

Các mô hình sẵn sàng sử dụng ngay, cùng với tính năng tải xuống qua URL trong thời gian chạy để bổ sung thêm mô hình.

Các tham số có thể cấu hình

Menu cài đặt trong trò chơi cho temperature, max tokens, kích thước ngữ cảnh và hơn thế nữa

Mã nguồn đi kèm với plugin

Triển khai Blueprint đầy đủ trong thư mục nội dung Demo của plugin, hỗ trợ UE 4.27+

Tải xuống Demo (Windows)

Video hướng dẫn

Xem trước dự án demo

Các trường hợp sử dụng phổ biến

Một vài quy trình làm việc mà plugin hỗ trợ sẵn - tất cả đều chạy cục bộ không cần phụ thuộc bên ngoài.

Hội thoại NPC

Hội thoại do nhân vật dẫn dắt với ngữ cảnh được duy trì - NPC nhớ các trao đổi trước đó và luôn giữ đúng tính cách nhờ lời nhắc hệ thống.

Nội dung động

Tạo văn bản nhiệm vụ, mô tả vật phẩm, đoạn bối cảnh hoặc câu thoại ngắn khi chạy - kết quả thay đổi theo từng phiên mà không cần soạn trước mọi biến thể.

Chatbot ngoại tuyến

Trợ lý trong trò chơi và chatbot hoạt động mà không cần internet - hữu ích cho các trò chơi ngoại tuyến, các bản triển khai trong môi trường cách ly mạng và các ứng dụng nhạy cảm về quyền riêng tư.

Quy trình AI

Kết hợp với Trình nhận dạng giọng nói để nhận đầu vào giọng nói, TTS để tạo phản hồi nói và khớp khẩu hình để tạo hoạt ảnh - xây dựng nhân vật hội thoại hoàn toàn ngoại tuyến.

Hệ sinh thái plugin

Runtime Local LLM là bộ não AI ngoại tuyến của bộ plugin Georgy Dev - kết hợp nó với nhận dạng giọng nói, TTS và khớp khẩu hình để tạo nhân vật hội thoại hoàn toàn trên thiết bị.

Runtime Audio Importer

Xử lý và phát đầu ra âm thanh TTS khi chạy. Là công cụ đồng hành thiết yếu để xử lý dữ liệu âm thanh phát trực tuyến từ bất kỳ nhà cung cấp TTS nào.

Tìm hiểu thêm

Runtime Speech Recognizer

Chuyển giọng nói thành văn bản ngoại tuyến qua Whisper. Chuyển lời nói của người chơi thành văn bản và đưa trực tiếp vào LLM cục bộ.

Tìm hiểu thêm

Runtime Text To Speech

TTS ngoại tuyến với 2800+ giọng đọc trên 51 ngôn ngữ - đọc to phản hồi của LLM ngay trên máy.

Tìm hiểu thêm

Runtime MetaHuman Lip Sync

Khớp khẩu hình thời gian thực cho MetaHuman và các nhân vật tùy chỉnh, được điều khiển bởi đầu ra âm thanh của các phản hồi do LLM tổng hợp.

Tìm hiểu thêm

AI Chatbot Integrator

Giải pháp thay thế AI đám mây - OpenAI, Claude, DeepSeek và các dịch vụ khác. Sử dụng cùng Runtime Local LLM cho các kịch bản kết hợp trực tuyến/ngoại tuyến.

Tìm hiểu thêm

Tài liệu & Hỗ trợ

Tài liệu toàn diện bao gồm trình quản lý mô hình trong editor, runtime API, các tham số suy luận, các ví dụ sẵn sàng sử dụng (trò chuyện đơn giản, hội thoại NPC, tải trước), và dự án demo đi kèm.

Tài liệu đầy đủ

Hướng dẫn từng bước cho mọi tính năng, kèm ví dụ Blueprint và C++

Cộng đồng & Hỗ trợ

Cộng đồng Discord sôi động với sự hỗ trợ từ nhà phát triển

Phát triển tùy chỉnh

Tích hợp hoặc phát triển tính năng theo yêu cầu - [email protected]

Editor - Nhập các mô hình GGUF tùy chỉnh

Sẵn sàng thêm LLM cục bộ vào dự án của bạn?

Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm trình quản lý mô hình trong editor, runtime API, dự án demo và tài liệu đầy đủ.