Runtime Local LLM | Georgy Dev

Runtime Local LLM

Führen Sie große Sprachmodelle vollständig auf dem Gerät in Unreal Engine aus. Offline-GGUF-Inferenz mit Token-für-Token-Streaming, Gesprächskontext und einem Editor-Modellmanager – mit vollständiger Blueprint- und C++-Unterstützung.

UE 4.27 – 5.8
Blueprints & C++
Windows, Mac, Linux, Android, iOS, Quest
Jedes GGUF-Modell

LLM-Inferenz auf dem Gerät

Basiert auf llama.cpp - Laden Sie ein beliebiges GGUF-Modell und führen Sie die Inferenz lokal aus, ohne Cloud-Dienste, ohne API-Schlüssel und ohne dass Daten das Gerät verlassen. Regelmäßig aktualisiert, um mit den Upstream-Veröffentlichungen von llama.cpp Schritt zu halten.

Vollständig offline

Keine Internetverbindung, keine API-Schlüssel, keine Telemetrie. Die gesamte Inferenz läuft lokal auf dem Gerät des Benutzers.

Token-Streaming

Empfangen Sie jedes generierte Token in Echtzeit über Delegaten – aktualisieren Sie Chat-Oberflächen und lösen Sie Gameplay-Ereignisse aus, während das Modell schreibt.

GPU-Beschleunigung

Vulkan auf Windows und Linux, Metal auf Mac und iOS, CPU + Intrinsics auf Android und Meta Quest.

Editor-Modellmanager

Durchsuchen, herunterladen, importieren, löschen und testen Sie Modelle direkt in den Projekteinstellungen. Modelle werden automatisch in gepackte Builds aufgenommen.

So funktioniert es

Verwalten Sie Modelle im Editor, laden Sie sie zur Laufzeit mit Ihren gewählten Inferenzparametern und senden Sie Nachrichten. Tokens streamen über Delegaten zurück, während das Modell generiert – alles auf einem Hintergrund-Thread, mit Callbacks auf dem Game-Thread.

1

Modelle verwalten

Laden Sie aus dem Katalog herunter, importieren Sie benutzerdefinierte GGUF-Dateien oder rufen Sie sie zur Laufzeit von einer URL ab

2

Ein Modell laden

Wählen Sie per Name, Dateipfad oder URL mit konfigurierbaren Inferenzparametern

3

Nachrichten senden

Übergeben Sie Benutzernachrichten und empfangen Sie Streaming-Antworten, wobei der Gesprächskontext erhalten bleibt.

4

Ausgabe verwenden

Steuern Sie NPC-Dialoge, erzeugen Sie dynamische Inhalte oder speisen Sie die Ausgabe in andere Plugins wie TTS und Lippensynchronisation ein

Unterstützte Modelle

Jedes Modell im GGUF-Format funktioniert. Der Editor enthält einen Katalog beliebter vordefinierter Modelle für den Ein-Klick-Download, und Sie können jede benutzerdefinierte GGUF-Datei importieren.

Modellfamilien

Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama und jedes andere GGUF-Community-Modell.

Quantisierungsstufen

Von Q2_K (am kleinsten, am schnellsten) über Q4_K_M, Q5_K_M, Q8_0 bis zu F16 / F32. Wählen Sie die Stufe, die zum RAM- und Leistungsbudget Ihres Zielgeräts passt.

Aktuelles llama.cpp

Das Plugin wird regelmäßig auf Fab aktualisiert, um die Upstream-Releases von llama.cpp zu verfolgen, damit die neuesten GGUF-Modellformate unterstützt bleiben, sobald sie veröffentlicht werden.

Plattformbeschleunigung

Hardwarebeschleunigung pro Plattform abgestimmt - GPU-Compute, wo verfügbar, CPU + Intrinsics, wo nicht.

Plattform Beschleunigung
Windows Vulkan GPU
Linux Vulkan GPU
Mac Metal GPU
iOS Metal GPU
Android CPU + Intrinsics
Meta Quest CPU + Intrinsics

Für Mobil- und VR-Geräte werden kleinere Quantisierungen (Q2_K bis Q4_K_M) mit kompakten Modellen (1B–3B Parameter) empfohlen. Desktop-Plattformen können größere Modelle mit höheren Quantisierungsstufen ausführen.

Editor-Modellmanager

Ein eigenes Einstellungsfenster im Unreal Editor zum Durchsuchen, Herunterladen, Importieren, Löschen und Testen von Modellen - keine Befehlszeilenwerkzeuge oder externen Downloads erforderlich.

Katalog-Downloads

Durchsuchen Sie einen integrierten Katalog beliebter Modelle mit Ein-Klick-Download. Mehrere Downloads parallel, mit Fortschrittsbalken und Abbrechen-Unterstützung.

Import benutzerdefinierter Modelle

Importieren Sie eine beliebige GGUF-Datei von der Festplatte oder von einer direkten URL. Benutzerdefinierte Modelle werden genau wie Katalogmodelle behandelt und in gepackten Builds mitgeliefert.

Testen im Editor

Ein integriertes Testfenster ermöglicht es Ihnen, ein Modell auszuwählen, Parameter zu konfigurieren, Prompts zu senden und Antworten in Echtzeit zu streamen - ganz ohne in den Play-Modus zu wechseln.

Voll ausgestattete Runtime-API

Über das grundlegende Laden und die Inferenz hinaus bietet das Plugin mehrere Modell-Lademethoden, asynchrone Blueprint-Knoten, Laufzeit-Downloads, Verwaltung des Gesprächskontexts und konfigurierbare Inferenzparameter.

Mehrere Lademethoden

Laden nach Modellname, absolutem Dateipfad oder direkt von einer URL mit automatischem Download. Modelle ohne Laden vorab zwischenspeichern.

Token-für-Token-Streaming

Jedes generierte Token löst einen Delegate im Game-Thread aus – aktualisieren Sie sofort Chat-Oberflächen, lösen Sie Gameplay-Ereignisse aus oder leiten Sie die Ausgabe bei Eintreffen an andere Systeme weiter.

Gesprächskontext

Mehrrunden-Gespräche bewahren den Nachrichtenverlauf automatisch. Setzen Sie den Kontext jederzeit zurück, wobei Sie optional den System-Prompt für ein konsistentes Charakterverhalten beibehalten können.

Konfigurierbare Inferenz

Steuern Sie Temperatur, Top-P, Top-K, Wiederholungsstrafe, GPU-Layer-Offload, Kontextgröße, Seed, Thread-Anzahl, maximale Tokens und System-Prompt – pro Modell-Ladung.

Asynchrone Blueprint-Knoten

Spezielle asynchrone Knoten zum Laden, Senden von Nachrichten und Herunterladen – mit Ausgabepins für Tokens, Abschluss, Fortschritt und Fehler. Kein manuelles Binden von Delegates erforderlich.

Automatisches Packaging

Modelle unter Content/RuntimeLocalLLM/Models werden automatisch über NonUFS bereitgestellt, sodass sie in gepackten Builds enthalten sind. Keine manuelle Projektkonfiguration erforderlich.

Blueprint-Beispiel – Einfacher Chat mit Streaming-Antworten

Einfaches Chat-Blueprint-Beispiel

Demo ausprobieren

Eine Windows-Demo ist verfügbar, damit Sie die On-Device-Inferenz aus erster Hand erleben können. Die Demo enthält eine Chat-Oberfläche mit Streaming-Antworten, Laufzeit-Downloads von Modellen per URL und ein Einstellungsmenü für Inferenzparameter – alles erstellt mit Blueprints und UMG.

Chat-Oberfläche mit Token-Streaming

Senden Sie Nachrichten und beobachten Sie, wie Antworten in Echtzeit Token für Token generiert werden.

Vorinstallierte und herunterladbare Modelle

Modelle sofort einsatzbereit, plus Laufzeit-Downloads per URL für weitere Modelle

Konfigurierbare Parameter

Einstellungsmenü im Spiel für Temperatur, maximale Tokens, Kontextgröße und mehr

Quellcode im Plugin enthalten

Vollständige Blueprint-Implementierung im Demo-Inhaltsordner des Plugins, unterstützt UE 4.27+

Demo herunterladen (Windows)

Videotutorial

Vorschau des Demo-Projekts

Häufige Anwendungsfälle

Einige der Workflows, die das Plugin von Haus aus unterstützt – alle laufen lokal ohne externe Abhängigkeiten.

NPC-Dialog

Charaktergetriebene Gespräche mit persistentem Kontext – NPCs erinnern sich an frühere Interaktionen und bleiben über den System-Prompt in ihrer Rolle.

Dynamischer Inhalt

Generieren Sie zur Laufzeit Quest-Texte, Gegenstandsbeschreibungen, Lore-Ausschnitte oder Barks – unterschiedliche Ausgaben pro Sitzung, ohne jede Variante manuell zu erstellen.

Offline-Chatbots

In-Game-Assistenten und Chatbots, die ohne Internet funktionieren – nützlich für Offline-Spiele, abgeschottete Bereitstellungen und datenschutzsensible Anwendungen.

AI-Pipelines

Kombinieren Sie es mit Speech Recognizer für Spracheingabe, TTS für gesprochene Antworten und Lippensynchronisation für Animationen – das ermöglicht vollständig offline arbeitende Konversations-Charaktere.

Plugin-Ökosystem

Runtime Local LLM ist das Offline-AI-Gehirn der Georgy Dev Plugin-Suite – kombinieren Sie es mit Spracherkennung, TTS und Lippensynchronisation für vollständig gerätebasierte Konversations-Charaktere.

Runtime Audio Importer

TTS-Audioausgabe zur Laufzeit verarbeiten und abspielen. Essenzieller Begleiter für den Umgang mit Streaming-Audiodaten von jedem TTS-Anbieter.

Mehr erfahren

Runtime Speech Recognizer

Offline-Spracherkennung (Speech-to-Text) über Whisper. Konvertieren Sie die Sprache des Spielers in Text und speisen Sie ihn direkt in das lokale LLM ein.

Mehr erfahren

Runtime Text To Speech

Offline-TTS mit 2800+ Stimmen in 51 Sprachen – sprechen Sie die Antworten des LLM lokal laut aus.

Mehr erfahren

Runtime MetaHuman Lip Sync

Echtzeit-Lippensynchronisation für MetaHumans und benutzerdefinierte Charaktere, angetrieben durch die Audioausgabe synthetisierter LLM-Antworten.

Mehr erfahren

AI-Chatbot-Integrator

Cloud-AI-Alternative – OpenAI, Claude, DeepSeek und andere. Verwenden Sie es neben Runtime Local LLM für hybride Online-/Offline-Szenarien.

Mehr erfahren

Dokumentation & Support

Die umfassende Dokumentation deckt den Editor-Modellmanager, die Runtime-API, Inferenzparameter, sofort einsatzbereite Beispiele (einfacher Chat, NPC-Dialog, Vorab-Download) und das mitgelieferte Demo-Projekt ab.

Vollständige Dokumentation

Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen

Community & Support

Aktive Discord-Community mit Entwickler-Support

Individuelle Entwicklung

Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]

Editor - Import benutzerdefinierter GGUF-Modelle

Bereit, lokale LLMs zu Ihrem Projekt hinzuzufügen?

Verfügbar auf Fab für UE 4.27 – 5.8. Enthält den Editor-Modellmanager, die Runtime-API, das Demo-Projekt und die vollständige Dokumentation.