Runtime Local LLM | Georgy Dev

Runtime Local LLM

Unreal Engine에서 대규모 언어 모델을 완전히 온디바이스로 실행하세요. 토큰 단위 스트리밍, 대화 컨텍스트, 에디터 모델 관리자를 갖춘 오프라인 GGUF 추론과 완전한 Blueprint 및 C++ 지원을 제공합니다.

UE 4.27 – 5.8
Blueprints 및 C++
Windows, Mac, Linux, Android, iOS, Quest
모든 GGUF 모델

온디바이스 LLM 추론

기반: llama.cpp - 모든 GGUF 모델을 로드하고 클라우드 서비스, API 키, 데이터가 기기를 벗어나지 않고도 로컬에서 추론을 실행하세요. 상위 llama.cpp 릴리스를 추적하기 위해 정기적으로 업데이트됩니다.

완전히 오프라인

인터넷 연결, API 키, 원격 측정이 필요 없습니다. 모든 추론은 사용자의 기기에서 로컬로 실행됩니다.

토큰 스트리밍

델리게이트를 통해 생성된 각 토큰을 실시간으로 수신합니다 - 모델이 작성하는 동안 채팅 UI를 업데이트하고 게임플레이 이벤트를 트리거합니다.

GPU 가속

Windows와 Linux에서는 Vulkan, Mac과 iOS에서는 Metal, Android와 Meta Quest에서는 CPU + intrinsics를 사용합니다.

에디터 모델 매니저

프로젝트 설정에서 모델을 직접 탐색, 다운로드, 임포트, 삭제, 테스트할 수 있습니다. 모델은 패키징된 빌드에 자동으로 포함됩니다.

작동 방식

에디터에서 모델을 관리하고, 선택한 추론 매개변수로 런타임에 모델을 로드하고, 메시지를 전송합니다. 모델이 생성하는 동안 토큰이 델리게이트를 통해 다시 스트리밍됩니다 - 모두 백그라운드 스레드에서 처리되며, 콜백은 게임 스레드에서 호출됩니다.

1

모델 관리

카탈로그에서 다운로드하거나, 사용자 지정 GGUF 파일을 임포트하거나, 런타임에 URL에서 가져옵니다.

2

모델 로드

이름, 파일 경로 또는 URL로 선택하고, 추론 매개변수를 구성할 수 있습니다.

3

메시지 전송

사용자 메시지를 전달하고 스트리밍 응답을 수신하며, 대화 컨텍스트가 유지됩니다.

4

출력 사용

NPC 대화를 구동하고, 동적 콘텐츠를 생성하거나, TTS 및 립싱크와 같은 다른 플러그인에 전달합니다.

지원 모델

GGUF 형식의 모든 모델이 작동합니다. 에디터에는 인기 있는 사전 정의 모델 카탈로그가 포함되어 있어 원클릭 다운로드가 가능하며, 사용자 지정 GGUF 파일을 임포트할 수 있습니다.

모델 패밀리

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama 및 기타 모든 GGUF 커뮤니티 모델.

양자화 수준

Q2_K(가장 작고 빠름)부터 Q4_K_M, Q5_K_M, Q8_0을 거쳐 F16 / F32까지 지원합니다. 대상 기기의 RAM과 성능 예산에 맞는 수준을 선택하세요.

최신 llama.cpp

이 플러그인은 업스트림 llama.cpp 릴리스를 추적하기 위해 Fab에서 정기적으로 업데이트되므로, 최신 GGUF 모델 형식이 출시됨에 따라 계속 지원됩니다.

플랫폼 가속

플랫폼별로 조정된 하드웨어 가속 - 사용 가능한 경우 GPU 컴퓨팅, 그렇지 않은 경우 CPU + intrinsics.

플랫폼 가속
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + intrinsics
Meta Quest CPU + intrinsics

모바일 및 VR 기기의 경우 더 작은 양자화(Q2_K~Q4_K_M)와 소형 모델(1B~3B 파라미터)이 권장됩니다. 데스크톱 플랫폼은 더 높은 양자화 수준으로 더 큰 모델을 실행할 수 있습니다.

에디터 모델 관리자

언리얼 에디터 내에서 모델을 탐색, 다운로드, 가져오기, 삭제, 및 테스트할 수 있는 전용 설정 패널입니다. 명령줄 도구나 외부 다운로드가 필요하지 않습니다.

카탈로그 다운로드

인기 모델의 기본 제공 카탈로그를 탐색하고 원클릭으로 다운로드할 수 있습니다. 여러 다운로드를 병렬로 진행할 수 있으며 진행률 표시줄과 취소 기능을 지원합니다.

커스텀 모델 가져오기

디스크 또는 직접 URL에서 모든 GGUF 파일을 가져올 수 있습니다. 커스텀 모델은 카탈로그 모델과 동일하게 처리되며 패키징된 빌드에 포함됩니다.

에디터 내 테스트

기본 제공 테스트 창에서 모델을 선택하고, 파라미터를 구성하고, 프롬프트를 보내고, 응답이 실시간으로 스트리밍되는 것을 확인할 수 있습니다. 모두 Play 모드로 들어가지 않고도 가능합니다.

완전한 기능을 갖춘 런타임 API

기본 로딩 및 추론 외에도 플러그인은 여러 모델 로딩 방법, 비동기 Blueprint 노드, 런타임 다운로드, 대화 컨텍스트 관리, 그리고 구성 가능한 추론 매개변수를 제공합니다.

여러 로딩 방법

모델 이름, 절대 파일 경로, 또는 자동 다운로드가 포함된 URL에서 직접 로드합니다. 로드하지 않고 모델을 사전 캐시할 수 있습니다.

토큰 단위 스트리밍

생성된 각 토큰은 게임 스레드에서 델리게이트를 발생시킵니다. 토큰이 도착하는 즉시 채팅 UI를 업데이트하고, 게임플레이 이벤트를 트리거하거나, 다른 시스템으로 출력을 전달할 수 있습니다.

대화 컨텍스트

다중 턴 대화는 메시지 기록을 자동으로 유지합니다. 언제든지 컨텍스트를 재설정할 수 있으며, 지속적인 캐릭터 동작을 위해 시스템 프롬프트를 선택적으로 유지할 수 있습니다.

구성 가능한 추론

모델 로드별로 온도, Top-P, Top-K, 반복 패널티, GPU 레이어 오프로드, 컨텍스트 크기, 시드, 스레드 수, 최대 토큰 수 및 시스템 프롬프트를 제어하세요.

비동기 Blueprint 노드

로딩, 메시지 전송 및 다운로드를 위한 전용 비동기 노드 - 토큰, 완료, 진행 및 오류에 대한 출력 핀을 제공합니다. 수동 델리게이트 바인딩이 필요 없습니다.

자동 패키징

Content/RuntimeLocalLLM/Models 폴더의 모델은 NonUFS를 통해 자동으로 스테이징되어 패키징 빌드에 포함됩니다. 수동 프로젝트 구성이 필요 없습니다.

Blueprint 예제 - 스트리밍 응답이 포함된 간단한 채팅

간단한 채팅 Blueprint 예제

데모 사용해 보기

Windows 데모를 사용할 수 있으므로 온디바이스 추론을 직접 경험할 수 있습니다. 데모에는 스트리밍 응답이 있는 채팅 인터페이스, URL을 통한 런타임 모델 다운로드, 그리고 추론 매개변수용 설정 메뉴가 포함되어 있습니다. 모두 Blueprints와 UMG로 제작되었습니다.

토큰 스트리밍이 포함된 채팅 인터페이스

메시지를 보내고 응답이 실시간으로 토큰 단위로 생성되는 것을 지켜보세요

사전 번들 및 다운로드 가능한 모델

즉시 사용 가능한 모델과 추가 모델을 위한 런타임 URL 다운로드

구성 가능한 매개변수

온도, 최대 토큰 수, 컨텍스트 크기 등을 설정할 수 있는 게임 내 설정 메뉴

플러그인에 포함된 소스

UE 4.27+를 지원하는 플러그인의 Demo 콘텐츠 폴더에 있는 전체 Blueprint 구현

데모 다운로드 (Windows)

비디오 튜토리얼

데모 프로젝트 미리보기

일반적인 사용 사례

플러그인이 기본 제공하는 몇 가지 워크플로우 - 모두 외부 종속성 없이 로컬에서 실행됩니다.

NPC 대화

캐릭터 중심의 대화와 지속적인 컨텍스트 - NPC는 이전 대화를 기억하고 시스템 프롬프트를 통해 캐릭터를 유지합니다.

동적 콘텐츠

런타임에 퀘스트 텍스트, 아이템 설명, 로어 조각 또는 바크를 생성합니다 - 모든 변형을 직접 작성하지 않고 세션마다 다른 출력을 제공합니다.

오프라인 챗봇

인터넷 없이 작동하는 게임 내 어시스턴트 및 챗봇 - 오프라인 게임, 폐쇄망 배포, 개인정보 보호가 중요한 애플리케이션에 유용합니다.

AI 파이프라인

음성 입력에는 Speech Recognizer, 음성 응답에는 TTS, 애니메이션에는 립싱크를 결합하세요 - 완전히 오프라인으로 작동하는 대화형 캐릭터를 구축할 수 있습니다.

플러그인 생태계

Runtime Local LLM은 Georgy Dev 플러그인 제품군의 오프라인 AI 두뇌입니다 - 음성 인식, TTS, 립싱크와 결합하여 완전히 온디바이스로 작동하는 대화형 캐릭터를 만들 수 있습니다.

Runtime Audio Importer

런타임에 TTS 오디오 출력을 처리하고 재생합니다. 모든 TTS 공급자의 스트리밍 오디오 데이터를 처리하는 데 필수적인 동반자입니다.

자세히 알아보기

Runtime Speech Recognizer

Whisper를 통한 오프라인 음성-텍스트 변환. 플레이어의 음성을 텍스트로 변환하여 로컬 LLM에 직접 전달합니다.

자세히 알아보기

Runtime Text To Speech

51개 언어로 2800개 이상의 음성을 지원하는 오프라인 TTS - LLM 응답을 로컬에서 음성으로 출력합니다.

자세히 알아보기

Runtime MetaHuman Lip Sync

MetaHuman 및 커스텀 캐릭터를 위한 실시간 립싱크 - 합성된 LLM 응답의 오디오 출력으로 구동됩니다.

자세히 알아보기

AI Chatbot Integrator

클라우드 AI 대안 - OpenAI, Claude, DeepSeek 및 기타 모델. 하이브리드 온라인/오프라인 시나리오를 위해 Runtime Local LLM과 함께 사용하세요.

자세히 알아보기

문서 및 지원

포괄적인 문서는 에디터 모델 매니저, 런타임 API, 추론 매개변수, 즉시 사용 가능한 예제(간단한 채팅, NPC 대화, 사전 다운로드) 및 번들 데모 프로젝트를 다룹니다.

전체 문서

모든 기능에 대한 단계별 가이드, Blueprint 및 C++ 예제 포함

커뮤니티 및 지원

개발자 지원이 포함된 활발한 Discord 커뮤니티

맞춤 개발

맞춤형 통합 또는 기능 개발 - [email protected]

에디터 - 사용자 정의 GGUF 모델 가져오기

프로젝트에 로컬 LLM을 추가할 준비가 되셨나요?

UE 4.27 – 5.8용 Fab에서 사용할 수 있습니다. 에디터 모델 매니저, 런타임 API, 데모 프로젝트 및 전체 문서가 포함됩니다.