Runtime Local LLM | Georgy Dev

Runtime Local LLM

Запускайте большие языковые модели полностью на устройстве в Unreal Engine. Автономный инференс GGUF с потоковой передачей токенов по одному, контекстом диалога и менеджером моделей в редакторе — с полной поддержкой Blueprint и C++.

UE 4.27 – 5.8
Blueprints и C++
Windows, Mac, Linux, Android, iOS, Quest
Любая модель GGUF

Инференс LLM на устройстве

Создано на llama.cpp - загружайте любую модель GGUF и выполняйте инференс локально без облачных сервисов, API-ключей и без передачи данных за пределы устройства. Регулярно обновляется для отслеживания выпусков вышестоящего llama.cpp.

Полностью офлайн

Без подключения к интернету, без API-ключей, без телеметрии. Весь инференс выполняется локально на устройстве пользователя.

Потоковая передача токенов

Получайте каждый сгенерированный токен в реальном времени через делегаты — обновляйте чат-интерфейсы и запускайте игровые события по мере генерации модели.

Ускорение GPU

Vulkan на Windows и Linux, Metal на Mac и iOS, CPU + интринсики на Android и Meta Quest.

Менеджер моделей в редакторе

Просматривайте, загружайте, импортируйте, удаляйте и тестируйте модели прямо в настройках проекта. Модели автоматически включаются в пакетированные сборки.

Как это работает

Управляйте моделями в редакторе, загружайте их во время выполнения с выбранными параметрами инференса и отправляйте сообщения. Токены передаются обратно через делегаты по мере генерации модели — всё это происходит в фоновом потоке, с обратными вызовами в игровом потоке.

1

Управление моделями

Загружайте из каталога, импортируйте собственные GGUF-файлы или получайте по URL во время выполнения

2

Загрузка модели

Выбирайте по имени, пути к файлу или URL с настраиваемыми параметрами инференса

3

Отправка сообщений

Передавайте сообщения пользователя и получайте потоковые ответы с сохранением контекста разговора

4

Используйте вывод

Управляйте диалогами NPC, генерируйте динамический контент или передавайте данные в другие плагины, такие как TTS и липсинк

Поддерживаемые модели

Любая модель в формате GGUF работает. В редакторе есть каталог популярных предопределённых моделей для загрузки в один клик, а также вы можете импортировать любой собственный GGUF-файл.

Семейства моделей

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama и любая другая GGUF-модель сообщества.

Уровни квантования

От Q2_K (наименьший, самый быстрый) через Q4_K_M, Q5_K_M, Q8_0 вплоть до F16 / F32. Выберите уровень, который соответствует объёму ОЗУ и бюджету производительности вашего целевого устройства.

Актуальный llama.cpp

Плагин регулярно обновляется на Fab, чтобы отслеживать upstream-релизы llama.cpp, поэтому последние форматы GGUF-моделей остаются поддерживаемыми по мере их выпуска.

Платформенное ускорение

Аппаратное ускорение, настроенное для каждой платформы — GPU-вычисления там, где они доступны, и CPU + интринсики там, где нет.

Платформа Ускорение
Windows GPU Vulkan
Linux GPU Vulkan
Mac GPU Metal
iOS GPU Metal
Android CPU + интринсики
Meta Quest CPU + интринсики

Для мобильных устройств и VR-устройств рекомендуются меньшие квантизации (Q2_K–Q4_K_M) с компактными моделями (1–3 млрд параметров). Десктопные платформы могут запускать более крупные модели с более высокими уровнями квантизации.

Менеджер моделей в редакторе

Выделенная панель настроек внутри Unreal Editor для просмотра, загрузки, импорта, удаления и тестирования моделей — не требуются инструменты командной строки или внешние загрузки.

Загрузки из каталога

Просматривайте встроенный каталог популярных моделей и скачивайте их в один клик. Несколько загрузок одновременно с индикаторами выполнения и поддержкой отмены.

Импорт пользовательских моделей

Импортируйте любой файл GGUF с диска или по прямой ссылке. Пользовательские модели обрабатываются так же, как и модели из каталога, и поставляются с упакованными сборками.

Тестирование в редакторе

Встроенное окно тестирования позволяет выбрать модель, настроить параметры, отправлять промпты и наблюдать за потоком ответов в реальном времени — всё без входа в режим Play.

Полнофункциональный Runtime API

Помимо базовой загрузки и инференса, плагин предоставляет несколько способов загрузки моделей, асинхронные ноды Blueprint, скачивание во время выполнения, управление контекстом разговора и настраиваемые параметры инференса.

Несколько способов загрузки

Загрузка по имени модели, по абсолютному пути к файлу или напрямую по URL с автоматическим скачиванием. Предварительное кэширование моделей без загрузки.

Потоковая генерация токен за токеном

Каждый сгенерированный токен вызывает делегат в игровом потоке — мгновенно обновляйте чат-интерфейсы, запускайте игровые события или передавайте вывод в другие системы по мере его поступления.

Контекст разговора

Многоходовые диалоги автоматически сохраняют историю сообщений. Сбрасывайте контекст в любой момент, при необходимости сохраняя системный промпт для устойчивого поведения персонажа.

Настраиваемый инференс

Управляйте температурой, Top-P, Top-K, штрафом за повторения, выгрузкой слоёв на GPU, размером контекста, сидом, количеством потоков, максимальным числом токенов и системным промптом — для каждой загрузки модели.

Асинхронные ноды Blueprint

Специализированные асинхронные ноды для загрузки, отправки сообщений и скачивания — с выходными пинами для токенов, завершения, прогресса и ошибок. Ручная привязка делегатов не требуется.

Автоматическая упаковка

Модели в Content/RuntimeLocalLLM/Models автоматически подготавливаются через NonUFS, поэтому они поставляются в составе собранных сборок. Ручная настройка проекта не требуется.

Пример на Blueprint — простой чат с потоковыми ответами

Простой пример Blueprint для чата

Попробуйте демо

Доступна демо-версия для Windows, чтобы вы могли лично оценить инференс на устройстве. Демо включает чат-интерфейс с потоковыми ответами, скачивание моделей во время выполнения по URL и меню настроек для параметров инференса — всё создано с помощью Blueprints и UMG.

Чат-интерфейс с потоковой генерацией токенов

Отправляйте сообщения и наблюдайте, как ответы генерируются токен за токеном в реальном времени

Предустановленные и загружаемые модели

Модели готовы к использованию из коробки, плюс скачивание дополнительных моделей по URL во время выполнения

Настраиваемые параметры

Внутриигровое меню настроек для температуры, максимального числа токенов, размера контекста и других параметров

Исходный код входит в состав плагина

Полная реализация на Blueprint в папке Demo контента плагина, с поддержкой UE 4.27+

Скачать демо (Windows)

Видеоурок

Предпросмотр демо-проекта

Типовые сценарии использования

Несколько сценариев работы, которые плагин поддерживает из коробки — всё работает локально, без внешних зависимостей.

Диалоги NPC

Диалоги, управляемые персонажами, с постоянным контекстом — NPC помнят прошлые разговоры и остаются в образе благодаря системному промпту.

Динамический контент

Генерируйте текст квестов, описания предметов, фрагменты лора или короткие реплики в рантайме — с разным результатом для каждой сессии, без ручного написания каждого варианта.

Офлайн-чатботы

Внутриигровые ассистенты и чатботы, работающие без интернета — полезны для офлайн-игр, изолированных развёртываний и приложений, где важна конфиденциальность.

AI-пайплайны

Работает в паре со Speech Recognizer для голосового ввода, TTS для озвученных ответов и синхронизацией губ для анимации — создавая полностью офлайн-диалоговых персонажей.

Экосистема плагинов

Runtime Local LLM — это офлайн-ИИ-мозг набора плагинов Georgy Dev. Объедините его с распознаванием речи, TTS и синхронизацией губ для полностью автономных диалоговых персонажей на устройстве.

Runtime Audio Importer

Обрабатывайте и воспроизводите аудиовыход TTS в рантайме. Незаменимый компаньон для работы с потоковыми аудиоданными от любого TTS-провайдера.

Узнать больше

Runtime Speech Recognizer

Офлайн-распознавание речи через Whisper. Преобразуйте речь игрока в текст и подавайте его напрямую в локальную LLM.

Узнать больше

Runtime Text To Speech

Офлайн-TTS с более чем 2800 голосами на 51 языке — озвучивайте ответы LLM локально.

Узнать больше

Runtime MetaHuman Lip Sync

Синхронизация губ в реальном времени для MetaHumans и пользовательских персонажей, управляемая аудиовыходом синтезированных ответов LLM.

Узнать больше

AI Chatbot Integrator

Облачная AI-альтернатива — OpenAI, Claude, DeepSeek и другие. Используйте вместе с Runtime Local LLM для гибридных онлайн/офлайн-сценариев.

Узнать больше

Документация и поддержка

Полная документация охватывает менеджер моделей в редакторе, runtime API, параметры инференса, готовые к использованию примеры (простой чат, диалоги NPC, предварительная загрузка) и встроенный демонстрационный проект.

Полная документация

Пошаговые руководства для всех функций с примерами на Blueprint и C++

Сообщество и поддержка

Активное сообщество в Discord с поддержкой разработчиков

Индивидуальная разработка

Индивидуальная интеграция или разработка функций - [email protected]

Редактор - импорт пользовательских моделей GGUF

Готовы добавить локальные LLM в ваш проект?

Доступно на Fab для UE 4.27 – 5.8. Включает менеджер моделей в редакторе, runtime API, демонстрационный проект и полную документацию.