Runtime Local LLM | Georgy Dev

Runtime Local LLM

Exécutez des grands modèles de langage entièrement sur l'appareil dans Unreal Engine. Inférence GGUF hors ligne avec streaming token par token, contexte de conversation, et un gestionnaire de modèles dans l'éditeur - avec prise en charge complète de Blueprint et C++.

UE 4.27 – 5.8
Blueprints & C++
Windows, Mac, Linux, Android, iOS, Quest
N'importe quel modèle GGUF

Inférence LLM sur l'appareil

Construit sur llama.cpp - chargez n'importe quel modèle GGUF et exécutez l'inférence localement, sans services cloud, sans clés API et sans données quittant l'appareil. Mis à jour régulièrement pour suivre les versions en amont de llama.cpp.

Entièrement hors ligne

Aucune connexion Internet, aucune clé API, aucune télémétrie. Toute l'inférence s'exécute localement sur l'appareil de l'utilisateur.

Streaming de jetons

Recevez chaque jeton généré en temps réel via des délégués - mettez à jour les interfaces de chat et déclenchez des événements de gameplay pendant que le modèle écrit.

Accélération GPU

Vulkan sur Windows et Linux, Metal sur Mac et iOS, CPU + intrinsics sur Android et Meta Quest.

Gestionnaire de modèles de l'éditeur

Parcourez, téléchargez, importez, supprimez et testez des modèles directement dans les paramètres du projet. Les modèles sont inclus automatiquement dans les builds packagés.

Comment ça fonctionne

Gérez les modèles dans l'éditeur, chargez-les au runtime avec les paramètres d'inférence de votre choix, et envoyez des messages. Les jetons sont renvoyés en streaming via des délégués pendant que le modèle génère - le tout sur un thread en arrière-plan, avec des callbacks sur le thread de jeu.

1

Gérer les modèles

Téléchargez depuis le catalogue, importez des fichiers GGUF personnalisés, ou récupérez depuis une URL au runtime.

2

Charger un modèle

Choisissez par nom, chemin de fichier, ou URL avec des paramètres d'inférence configurables

3

Envoyer des messages

Transmettez les messages de l'utilisateur et recevez des réponses en streaming, avec le contexte de conversation préservé

4

Utiliser la sortie

Pilotez le dialogue des NPC, générez du contenu dynamique, ou alimentez d'autres plugins comme TTS et la synchro labiale

Modèles pris en charge

Tout modèle au format GGUF fonctionne. L'éditeur inclut un catalogue de modèles prédéfinis populaires pour un téléchargement en un clic, et vous pouvez importer n'importe quel fichier GGUF personnalisé.

Familles de modèles

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama, et tout autre modèle communautaire GGUF.

Niveaux de quantification

De Q2_K (le plus petit, le plus rapide) en passant par Q4_K_M, Q5_K_M, Q8_0, jusqu'à F16 / F32. Choisissez le niveau qui correspond à la RAM et au budget de performances de votre appareil cible.

llama.cpp à jour

Le plugin est mis à jour régulièrement sur Fab pour suivre les versions en amont de llama.cpp, afin que les derniers formats de modèles GGUF restent pris en charge dès leur sortie.

Accélération par plateforme

Accélération matérielle réglée par plateforme - calcul GPU lorsque disponible, CPU + intrinsèques sinon.

Plateforme Accélération
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + intrinsèques
Meta Quest CPU + intrinsèques

Pour les appareils mobiles et de réalité virtuelle, des quantifications plus petites (Q2_K à Q4_K_M) avec des modèles compacts (1B à 3B paramètres) sont recommandées. Les plateformes de bureau peuvent exécuter des modèles plus volumineux avec des niveaux de quantification plus élevés.

Gestionnaire de modèles de l'éditeur

Un panneau de paramètres dédié dans l'Unreal Editor pour parcourir, télécharger, importer, supprimer, et tester des modèles - aucun outil en ligne de commande ni téléchargement externe requis.

Téléchargements du catalogue

Parcourez un catalogue intégré de modèles populaires avec téléchargement en un clic. Plusieurs téléchargements en parallèle, avec barres de progression et prise en charge de l'annulation.

Import de modèle personnalisé

Importez n'importe quel fichier GGUF depuis le disque ou une URL directe. Les modèles personnalisés sont traités de manière identique aux modèles du catalogue et sont inclus dans les builds packagés.

Test dans l'éditeur

Une fenêtre de test intégrée vous permet de sélectionner un modèle, configurer des paramètres, envoyer des prompts et regarder les réponses défiler en temps réel - le tout sans entrer en mode Play.

API Runtime complète

Au-delà du chargement et de l'inférence de base, le plugin offre plusieurs méthodes de chargement de modèles, des nœuds Blueprint asynchrones, le téléchargement à l'exécution, la gestion du contexte de conversation et des paramètres d'inférence configurables.

Plusieurs méthodes de chargement

Chargez par nom de modèle, par chemin de fichier absolu, ou directement depuis une URL avec téléchargement automatique. Mettez les modèles en cache à l'avance sans les charger.

Diffusion en continu token par token

Chaque token généré déclenche un délégué sur le thread de jeu - mettez à jour immédiatement les interfaces de chat, déclenchez des événements de gameplay ou acheminez la sortie vers d'autres systèmes dès qu'elle arrive.

Contexte de conversation

Les conversations multi-tours préservent automatiquement l'historique des messages. Réinitialisez le contexte à tout moment, en conservant éventuellement le prompt système pour un comportement de personnage persistant.

Inférence configurable

Contrôlez la température, Top-P, Top-K, la pénalité de répétition, le déchargement des couches GPU, la taille de contexte, le seed, le nombre de threads, le nombre maximal de tokens et le prompt système - pour chaque chargement de modèle.

Nœuds Blueprint asynchrones

Nœuds asynchrones dédiés au chargement, à l'envoi de messages et au téléchargement - avec des broches de sortie pour les tokens, la complétion, la progression et les erreurs. Aucune liaison manuelle de délégué n'est nécessaire.

Packaging automatique

Les modèles situés dans Content/RuntimeLocalLLM/Models sont automatiquement inclus via NonUFS afin qu'ils accompagnent les builds packagés. Aucune configuration manuelle du projet n'est requise.

Exemple Blueprint - Chat simple avec réponses diffusées en continu

Exemple simple de blueprint de chat

Essayez la démo

Une démo Windows est disponible pour que vous puissiez faire l'expérience directe de l'inférence sur appareil. La démo comprend une interface de chat avec des réponses diffusées en continu, des téléchargements de modèles à l'exécution via URL, et un menu de paramètres pour l'inférence - le tout construit avec Blueprints et UMG.

Interface de chat avec diffusion en continu des tokens

Envoyez des messages et regardez les réponses se générer token par token en temps réel

Modèles pré-inclus et téléchargeables

Des modèles prêts à l'emploi, plus des téléchargements à l'exécution via URL pour des modèles supplémentaires

Paramètres configurables

Menu de paramètres en jeu pour la température, le nombre maximal de tokens, la taille de contexte, et plus encore

Code source inclus avec le plugin

Implémentation Blueprint complète dans le dossier de contenu Demo du plugin, prenant en charge UE 4.27+

Télécharger la démo (Windows)

Tutoriel vidéo

Aperçu du projet de démonstration

Cas d'utilisation courants

Quelques-uns des flux de travail pris en charge par le plugin dès sa sortie - tous exécutés localement, sans dépendances externes.

Dialogue des NPC

Conversations menées par les personnages avec un contexte persistant - les NPC se souviennent des échanges passés et restent dans leur personnage grâce au prompt système.

Contenu dynamique

Générez des textes de quête, des descriptions d'objets, des extraits de lore ou des répliques à l'exécution - en faisant varier la sortie à chaque session sans avoir à écrire chaque variante.

Chatbots hors ligne

Assistants et chatbots intégrés au jeu qui fonctionnent sans internet - utiles pour les jeux hors ligne, les déploiements en réseau isolé et les applications sensibles à la vie privée.

Pipelines d'IA

Associez Speech Recognizer pour l'entrée vocale, TTS pour les réponses parlées et la synchronisation labiale pour l'animation - créez ainsi des personnages conversationnels entièrement hors ligne.

Écosystème de plugins

Runtime Local LLM est le cerveau IA hors ligne de la suite de plugins Georgy Dev - combinez-le avec la reconnaissance vocale, le TTS et la synchronisation labiale pour des personnages conversationnels entièrement sur appareil.

Runtime Audio Importer

Traitez et lisez la sortie audio TTS à l'exécution. Compagnon essentiel pour gérer les données audio en streaming de n'importe quel fournisseur TTS.

En savoir plus

Runtime Speech Recognizer

Transcription vocale hors ligne via Whisper. Convertissez la parole du joueur en texte et transmettez ce texte directement au LLM local.

En savoir plus

Runtime Text To Speech

TTS hors ligne avec plus de 2800 voix dans 51 langues - prononcez les réponses du LLM à voix haute localement.

En savoir plus

Runtime MetaHuman Lip Sync

Synchronisation labiale en temps réel pour les MetaHumans et les personnages personnalisés, pilotée par la sortie audio des réponses synthétisées du LLM.

En savoir plus

AI Chatbot Integrator

Alternative IA cloud - OpenAI, Claude, DeepSeek et d'autres. À utiliser avec Runtime Local LLM pour des scénarios hybrides en ligne/hors ligne.

En savoir plus

Documentation et support

Une documentation complète couvre le gestionnaire de modèles de l'éditeur, l'API d'exécution, les paramètres d'inférence, des exemples prêts à l'emploi (chat simple, dialogue NPC, pré-téléchargement) et le projet de démonstration inclus.

Documentation complète

Guides étape par étape pour toutes les fonctionnalités, avec des exemples en Blueprint et C++

Communauté et support

Communauté Discord active avec le support des développeurs

Développement personnalisé

Intégration sur mesure ou développement de fonctionnalités - [email protected]

Éditeur - Importation de modèles GGUF personnalisés

Prêt à ajouter des LLM locaux à votre projet ?

Disponible sur Fab pour UE 4.27 – 5.8. Comprend le gestionnaire de modèles de l'éditeur, l'API d'exécution, le projet de démonstration et une documentation complète.