
Запускайте большие языковые модели полностью на устройстве в Unreal Engine. Автономный инференс GGUF с потоковой передачей токенов по одному, контекстом диалога и менеджером моделей в редакторе — с полной поддержкой Blueprint и C++.
Создано на llama.cpp - загружайте любую модель GGUF и выполняйте инференс локально без облачных сервисов, API-ключей и без передачи данных за пределы устройства. Регулярно обновляется для отслеживания выпусков вышестоящего llama.cpp.
Без подключения к интернету, без API-ключей, без телеметрии. Весь инференс выполняется локально на устройстве пользователя.
Получайте каждый сгенерированный токен в реальном времени через делегаты — обновляйте чат-интерфейсы и запускайте игровые события по мере генерации модели.
Vulkan на Windows и Linux, Metal на Mac и iOS, CPU + интринсики на Android и Meta Quest.
Просматривайте, загружайте, импортируйте, удаляйте и тестируйте модели прямо в настройках проекта. Модели автоматически включаются в пакетированные сборки.
Управляйте моделями в редакторе, загружайте их во время выполнения с выбранными параметрами инференса и отправляйте сообщения. Токены передаются обратно через делегаты по мере генерации модели — всё это происходит в фоновом потоке, с обратными вызовами в игровом потоке.
Загружайте из каталога, импортируйте собственные GGUF-файлы или получайте по URL во время выполнения
Выбирайте по имени, пути к файлу или URL с настраиваемыми параметрами инференса
Передавайте сообщения пользователя и получайте потоковые ответы с сохранением контекста разговора
Управляйте диалогами NPC, генерируйте динамический контент или передавайте данные в другие плагины, такие как TTS и липсинк
Любая модель в формате GGUF работает. В редакторе есть каталог популярных предопределённых моделей для загрузки в один клик, а также вы можете импортировать любой собственный GGUF-файл.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama и любая другая GGUF-модель сообщества.
От Q2_K (наименьший, самый быстрый) через Q4_K_M, Q5_K_M, Q8_0 вплоть до F16 / F32. Выберите уровень, который соответствует объёму ОЗУ и бюджету производительности вашего целевого устройства.
Плагин регулярно обновляется на Fab, чтобы отслеживать upstream-релизы llama.cpp, поэтому последние форматы GGUF-моделей остаются поддерживаемыми по мере их выпуска.
Аппаратное ускорение, настроенное для каждой платформы — GPU-вычисления там, где они доступны, и CPU + интринсики там, где нет.
| Платформа | Ускорение |
|---|---|
| Windows | GPU Vulkan |
| Linux | GPU Vulkan |
| Mac | GPU Metal |
| iOS | GPU Metal |
| Android | CPU + интринсики |
| Meta Quest | CPU + интринсики |
Для мобильных устройств и VR-устройств рекомендуются меньшие квантизации (Q2_K–Q4_K_M) с компактными моделями (1–3 млрд параметров). Десктопные платформы могут запускать более крупные модели с более высокими уровнями квантизации.
Выделенная панель настроек внутри Unreal Editor для просмотра, загрузки, импорта, удаления и тестирования моделей — не требуются инструменты командной строки или внешние загрузки.
Просматривайте встроенный каталог популярных моделей и скачивайте их в один клик. Несколько загрузок одновременно с индикаторами выполнения и поддержкой отмены.
Импортируйте любой файл GGUF с диска или по прямой ссылке. Пользовательские модели обрабатываются так же, как и модели из каталога, и поставляются с упакованными сборками.
Встроенное окно тестирования позволяет выбрать модель, настроить параметры, отправлять промпты и наблюдать за потоком ответов в реальном времени — всё без входа в режим Play.
Помимо базовой загрузки и инференса, плагин предоставляет несколько способов загрузки моделей, асинхронные ноды Blueprint, скачивание во время выполнения, управление контекстом разговора и настраиваемые параметры инференса.
Загрузка по имени модели, по абсолютному пути к файлу или напрямую по URL с автоматическим скачиванием. Предварительное кэширование моделей без загрузки.
Каждый сгенерированный токен вызывает делегат в игровом потоке — мгновенно обновляйте чат-интерфейсы, запускайте игровые события или передавайте вывод в другие системы по мере его поступления.
Многоходовые диалоги автоматически сохраняют историю сообщений. Сбрасывайте контекст в любой момент, при необходимости сохраняя системный промпт для устойчивого поведения персонажа.
Управляйте температурой, Top-P, Top-K, штрафом за повторения, выгрузкой слоёв на GPU, размером контекста, сидом, количеством потоков, максимальным числом токенов и системным промптом — для каждой загрузки модели.
Специализированные асинхронные ноды для загрузки, отправки сообщений и скачивания — с выходными пинами для токенов, завершения, прогресса и ошибок. Ручная привязка делегатов не требуется.
Модели в Content/RuntimeLocalLLM/Models автоматически подготавливаются через NonUFS, поэтому они поставляются в составе собранных сборок. Ручная настройка проекта не требуется.
Пример на Blueprint — простой чат с потоковыми ответами

Доступна демо-версия для Windows, чтобы вы могли лично оценить инференс на устройстве. Демо включает чат-интерфейс с потоковыми ответами, скачивание моделей во время выполнения по URL и меню настроек для параметров инференса — всё создано с помощью Blueprints и UMG.
Отправляйте сообщения и наблюдайте, как ответы генерируются токен за токеном в реальном времени
Модели готовы к использованию из коробки, плюс скачивание дополнительных моделей по URL во время выполнения
Внутриигровое меню настроек для температуры, максимального числа токенов, размера контекста и других параметров
Полная реализация на Blueprint в папке Demo контента плагина, с поддержкой UE 4.27+
Видеоурок
Предпросмотр демо-проекта
Несколько сценариев работы, которые плагин поддерживает из коробки — всё работает локально, без внешних зависимостей.
Диалоги, управляемые персонажами, с постоянным контекстом — NPC помнят прошлые разговоры и остаются в образе благодаря системному промпту.
Генерируйте текст квестов, описания предметов, фрагменты лора или короткие реплики в рантайме — с разным результатом для каждой сессии, без ручного написания каждого варианта.
Внутриигровые ассистенты и чатботы, работающие без интернета — полезны для офлайн-игр, изолированных развёртываний и приложений, где важна конфиденциальность.
Работает в паре со Speech Recognizer для голосового ввода, TTS для озвученных ответов и синхронизацией губ для анимации — создавая полностью офлайн-диалоговых персонажей.
Runtime Local LLM — это офлайн-ИИ-мозг набора плагинов Georgy Dev. Объедините его с распознаванием речи, TTS и синхронизацией губ для полностью автономных диалоговых персонажей на устройстве.
Обрабатывайте и воспроизводите аудиовыход TTS в рантайме. Незаменимый компаньон для работы с потоковыми аудиоданными от любого TTS-провайдера.
Узнать большеОфлайн-распознавание речи через Whisper. Преобразуйте речь игрока в текст и подавайте его напрямую в локальную LLM.
Узнать большеОфлайн-TTS с более чем 2800 голосами на 51 языке — озвучивайте ответы LLM локально.
Узнать большеСинхронизация губ в реальном времени для MetaHumans и пользовательских персонажей, управляемая аудиовыходом синтезированных ответов LLM.
Узнать большеОблачная AI-альтернатива — OpenAI, Claude, DeepSeek и другие. Используйте вместе с Runtime Local LLM для гибридных онлайн/офлайн-сценариев.
Узнать большеПолная документация охватывает менеджер моделей в редакторе, runtime API, параметры инференса, готовые к использованию примеры (простой чат, диалоги NPC, предварительная загрузка) и встроенный демонстрационный проект.
Пошаговые руководства для всех функций с примерами на Blueprint и C++
Активное сообщество в Discord с поддержкой разработчиков
Индивидуальная интеграция или разработка функций - [email protected]
Редактор - импорт пользовательских моделей GGUF
Доступно на Fab для UE 4.27 – 5.8. Включает менеджер моделей в редакторе, runtime API, демонстрационный проект и полную документацию.