
Exécutez des grands modèles de langage entièrement sur l'appareil dans Unreal Engine. Inférence GGUF hors ligne avec streaming token par token, contexte de conversation, et un gestionnaire de modèles dans l'éditeur - avec prise en charge complète de Blueprint et C++.
Construit sur llama.cpp - chargez n'importe quel modèle GGUF et exécutez l'inférence localement, sans services cloud, sans clés API et sans données quittant l'appareil. Mis à jour régulièrement pour suivre les versions en amont de llama.cpp.
Aucune connexion Internet, aucune clé API, aucune télémétrie. Toute l'inférence s'exécute localement sur l'appareil de l'utilisateur.
Recevez chaque jeton généré en temps réel via des délégués - mettez à jour les interfaces de chat et déclenchez des événements de gameplay pendant que le modèle écrit.
Vulkan sur Windows et Linux, Metal sur Mac et iOS, CPU + intrinsics sur Android et Meta Quest.
Parcourez, téléchargez, importez, supprimez et testez des modèles directement dans les paramètres du projet. Les modèles sont inclus automatiquement dans les builds packagés.
Gérez les modèles dans l'éditeur, chargez-les au runtime avec les paramètres d'inférence de votre choix, et envoyez des messages. Les jetons sont renvoyés en streaming via des délégués pendant que le modèle génère - le tout sur un thread en arrière-plan, avec des callbacks sur le thread de jeu.
Téléchargez depuis le catalogue, importez des fichiers GGUF personnalisés, ou récupérez depuis une URL au runtime.
Choisissez par nom, chemin de fichier, ou URL avec des paramètres d'inférence configurables
Transmettez les messages de l'utilisateur et recevez des réponses en streaming, avec le contexte de conversation préservé
Pilotez le dialogue des NPC, générez du contenu dynamique, ou alimentez d'autres plugins comme TTS et la synchro labiale
Tout modèle au format GGUF fonctionne. L'éditeur inclut un catalogue de modèles prédéfinis populaires pour un téléchargement en un clic, et vous pouvez importer n'importe quel fichier GGUF personnalisé.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama, et tout autre modèle communautaire GGUF.
De Q2_K (le plus petit, le plus rapide) en passant par Q4_K_M, Q5_K_M, Q8_0, jusqu'à F16 / F32. Choisissez le niveau qui correspond à la RAM et au budget de performances de votre appareil cible.
Le plugin est mis à jour régulièrement sur Fab pour suivre les versions en amont de llama.cpp, afin que les derniers formats de modèles GGUF restent pris en charge dès leur sortie.
Accélération matérielle réglée par plateforme - calcul GPU lorsque disponible, CPU + intrinsèques sinon.
| Plateforme | Accélération |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + intrinsèques |
| Meta Quest | CPU + intrinsèques |
Pour les appareils mobiles et de réalité virtuelle, des quantifications plus petites (Q2_K à Q4_K_M) avec des modèles compacts (1B à 3B paramètres) sont recommandées. Les plateformes de bureau peuvent exécuter des modèles plus volumineux avec des niveaux de quantification plus élevés.
Un panneau de paramètres dédié dans l'Unreal Editor pour parcourir, télécharger, importer, supprimer, et tester des modèles - aucun outil en ligne de commande ni téléchargement externe requis.
Parcourez un catalogue intégré de modèles populaires avec téléchargement en un clic. Plusieurs téléchargements en parallèle, avec barres de progression et prise en charge de l'annulation.
Importez n'importe quel fichier GGUF depuis le disque ou une URL directe. Les modèles personnalisés sont traités de manière identique aux modèles du catalogue et sont inclus dans les builds packagés.
Une fenêtre de test intégrée vous permet de sélectionner un modèle, configurer des paramètres, envoyer des prompts et regarder les réponses défiler en temps réel - le tout sans entrer en mode Play.
Au-delà du chargement et de l'inférence de base, le plugin offre plusieurs méthodes de chargement de modèles, des nœuds Blueprint asynchrones, le téléchargement à l'exécution, la gestion du contexte de conversation et des paramètres d'inférence configurables.
Chargez par nom de modèle, par chemin de fichier absolu, ou directement depuis une URL avec téléchargement automatique. Mettez les modèles en cache à l'avance sans les charger.
Chaque token généré déclenche un délégué sur le thread de jeu - mettez à jour immédiatement les interfaces de chat, déclenchez des événements de gameplay ou acheminez la sortie vers d'autres systèmes dès qu'elle arrive.
Les conversations multi-tours préservent automatiquement l'historique des messages. Réinitialisez le contexte à tout moment, en conservant éventuellement le prompt système pour un comportement de personnage persistant.
Contrôlez la température, Top-P, Top-K, la pénalité de répétition, le déchargement des couches GPU, la taille de contexte, le seed, le nombre de threads, le nombre maximal de tokens et le prompt système - pour chaque chargement de modèle.
Nœuds asynchrones dédiés au chargement, à l'envoi de messages et au téléchargement - avec des broches de sortie pour les tokens, la complétion, la progression et les erreurs. Aucune liaison manuelle de délégué n'est nécessaire.
Les modèles situés dans Content/RuntimeLocalLLM/Models sont automatiquement inclus via NonUFS afin qu'ils accompagnent les builds packagés. Aucune configuration manuelle du projet n'est requise.
Exemple Blueprint - Chat simple avec réponses diffusées en continu

Une démo Windows est disponible pour que vous puissiez faire l'expérience directe de l'inférence sur appareil. La démo comprend une interface de chat avec des réponses diffusées en continu, des téléchargements de modèles à l'exécution via URL, et un menu de paramètres pour l'inférence - le tout construit avec Blueprints et UMG.
Envoyez des messages et regardez les réponses se générer token par token en temps réel
Des modèles prêts à l'emploi, plus des téléchargements à l'exécution via URL pour des modèles supplémentaires
Menu de paramètres en jeu pour la température, le nombre maximal de tokens, la taille de contexte, et plus encore
Implémentation Blueprint complète dans le dossier de contenu Demo du plugin, prenant en charge UE 4.27+
Tutoriel vidéo
Aperçu du projet de démonstration
Quelques-uns des flux de travail pris en charge par le plugin dès sa sortie - tous exécutés localement, sans dépendances externes.
Conversations menées par les personnages avec un contexte persistant - les NPC se souviennent des échanges passés et restent dans leur personnage grâce au prompt système.
Générez des textes de quête, des descriptions d'objets, des extraits de lore ou des répliques à l'exécution - en faisant varier la sortie à chaque session sans avoir à écrire chaque variante.
Assistants et chatbots intégrés au jeu qui fonctionnent sans internet - utiles pour les jeux hors ligne, les déploiements en réseau isolé et les applications sensibles à la vie privée.
Associez Speech Recognizer pour l'entrée vocale, TTS pour les réponses parlées et la synchronisation labiale pour l'animation - créez ainsi des personnages conversationnels entièrement hors ligne.
Runtime Local LLM est le cerveau IA hors ligne de la suite de plugins Georgy Dev - combinez-le avec la reconnaissance vocale, le TTS et la synchronisation labiale pour des personnages conversationnels entièrement sur appareil.
Traitez et lisez la sortie audio TTS à l'exécution. Compagnon essentiel pour gérer les données audio en streaming de n'importe quel fournisseur TTS.
En savoir plusTranscription vocale hors ligne via Whisper. Convertissez la parole du joueur en texte et transmettez ce texte directement au LLM local.
En savoir plusTTS hors ligne avec plus de 2800 voix dans 51 langues - prononcez les réponses du LLM à voix haute localement.
En savoir plusSynchronisation labiale en temps réel pour les MetaHumans et les personnages personnalisés, pilotée par la sortie audio des réponses synthétisées du LLM.
En savoir plusAlternative IA cloud - OpenAI, Claude, DeepSeek et d'autres. À utiliser avec Runtime Local LLM pour des scénarios hybrides en ligne/hors ligne.
En savoir plusUne documentation complète couvre le gestionnaire de modèles de l'éditeur, l'API d'exécution, les paramètres d'inférence, des exemples prêts à l'emploi (chat simple, dialogue NPC, pré-téléchargement) et le projet de démonstration inclus.
Guides étape par étape pour toutes les fonctionnalités, avec des exemples en Blueprint et C++
Communauté Discord active avec le support des développeurs
Intégration sur mesure ou développement de fonctionnalités - [email protected]
Éditeur - Importation de modèles GGUF personnalisés
Disponible sur Fab pour UE 4.27 – 5.8. Comprend le gestionnaire de modèles de l'éditeur, l'API d'exécution, le projet de démonstration et une documentation complète.