
Führen Sie große Sprachmodelle vollständig auf dem Gerät in Unreal Engine aus. Offline-GGUF-Inferenz mit Token-für-Token-Streaming, Gesprächskontext und einem Editor-Modellmanager – mit vollständiger Blueprint- und C++-Unterstützung.
Basiert auf llama.cpp - Laden Sie ein beliebiges GGUF-Modell und führen Sie die Inferenz lokal aus, ohne Cloud-Dienste, ohne API-Schlüssel und ohne dass Daten das Gerät verlassen. Regelmäßig aktualisiert, um mit den Upstream-Veröffentlichungen von llama.cpp Schritt zu halten.
Keine Internetverbindung, keine API-Schlüssel, keine Telemetrie. Die gesamte Inferenz läuft lokal auf dem Gerät des Benutzers.
Empfangen Sie jedes generierte Token in Echtzeit über Delegaten – aktualisieren Sie Chat-Oberflächen und lösen Sie Gameplay-Ereignisse aus, während das Modell schreibt.
Vulkan auf Windows und Linux, Metal auf Mac und iOS, CPU + Intrinsics auf Android und Meta Quest.
Durchsuchen, herunterladen, importieren, löschen und testen Sie Modelle direkt in den Projekteinstellungen. Modelle werden automatisch in gepackte Builds aufgenommen.
Verwalten Sie Modelle im Editor, laden Sie sie zur Laufzeit mit Ihren gewählten Inferenzparametern und senden Sie Nachrichten. Tokens streamen über Delegaten zurück, während das Modell generiert – alles auf einem Hintergrund-Thread, mit Callbacks auf dem Game-Thread.
Laden Sie aus dem Katalog herunter, importieren Sie benutzerdefinierte GGUF-Dateien oder rufen Sie sie zur Laufzeit von einer URL ab
Wählen Sie per Name, Dateipfad oder URL mit konfigurierbaren Inferenzparametern
Übergeben Sie Benutzernachrichten und empfangen Sie Streaming-Antworten, wobei der Gesprächskontext erhalten bleibt.
Steuern Sie NPC-Dialoge, erzeugen Sie dynamische Inhalte oder speisen Sie die Ausgabe in andere Plugins wie TTS und Lippensynchronisation ein
Jedes Modell im GGUF-Format funktioniert. Der Editor enthält einen Katalog beliebter vordefinierter Modelle für den Ein-Klick-Download, und Sie können jede benutzerdefinierte GGUF-Datei importieren.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama und jedes andere GGUF-Community-Modell.
Von Q2_K (am kleinsten, am schnellsten) über Q4_K_M, Q5_K_M, Q8_0 bis zu F16 / F32. Wählen Sie die Stufe, die zum RAM- und Leistungsbudget Ihres Zielgeräts passt.
Das Plugin wird regelmäßig auf Fab aktualisiert, um die Upstream-Releases von llama.cpp zu verfolgen, damit die neuesten GGUF-Modellformate unterstützt bleiben, sobald sie veröffentlicht werden.
Hardwarebeschleunigung pro Plattform abgestimmt - GPU-Compute, wo verfügbar, CPU + Intrinsics, wo nicht.
| Plattform | Beschleunigung |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + Intrinsics |
| Meta Quest | CPU + Intrinsics |
Für Mobil- und VR-Geräte werden kleinere Quantisierungen (Q2_K bis Q4_K_M) mit kompakten Modellen (1B–3B Parameter) empfohlen. Desktop-Plattformen können größere Modelle mit höheren Quantisierungsstufen ausführen.
Ein eigenes Einstellungsfenster im Unreal Editor zum Durchsuchen, Herunterladen, Importieren, Löschen und Testen von Modellen - keine Befehlszeilenwerkzeuge oder externen Downloads erforderlich.
Durchsuchen Sie einen integrierten Katalog beliebter Modelle mit Ein-Klick-Download. Mehrere Downloads parallel, mit Fortschrittsbalken und Abbrechen-Unterstützung.
Importieren Sie eine beliebige GGUF-Datei von der Festplatte oder von einer direkten URL. Benutzerdefinierte Modelle werden genau wie Katalogmodelle behandelt und in gepackten Builds mitgeliefert.
Ein integriertes Testfenster ermöglicht es Ihnen, ein Modell auszuwählen, Parameter zu konfigurieren, Prompts zu senden und Antworten in Echtzeit zu streamen - ganz ohne in den Play-Modus zu wechseln.
Über das grundlegende Laden und die Inferenz hinaus bietet das Plugin mehrere Modell-Lademethoden, asynchrone Blueprint-Knoten, Laufzeit-Downloads, Verwaltung des Gesprächskontexts und konfigurierbare Inferenzparameter.
Laden nach Modellname, absolutem Dateipfad oder direkt von einer URL mit automatischem Download. Modelle ohne Laden vorab zwischenspeichern.
Jedes generierte Token löst einen Delegate im Game-Thread aus – aktualisieren Sie sofort Chat-Oberflächen, lösen Sie Gameplay-Ereignisse aus oder leiten Sie die Ausgabe bei Eintreffen an andere Systeme weiter.
Mehrrunden-Gespräche bewahren den Nachrichtenverlauf automatisch. Setzen Sie den Kontext jederzeit zurück, wobei Sie optional den System-Prompt für ein konsistentes Charakterverhalten beibehalten können.
Steuern Sie Temperatur, Top-P, Top-K, Wiederholungsstrafe, GPU-Layer-Offload, Kontextgröße, Seed, Thread-Anzahl, maximale Tokens und System-Prompt – pro Modell-Ladung.
Spezielle asynchrone Knoten zum Laden, Senden von Nachrichten und Herunterladen – mit Ausgabepins für Tokens, Abschluss, Fortschritt und Fehler. Kein manuelles Binden von Delegates erforderlich.
Modelle unter Content/RuntimeLocalLLM/Models werden automatisch über NonUFS bereitgestellt, sodass sie in gepackten Builds enthalten sind. Keine manuelle Projektkonfiguration erforderlich.
Blueprint-Beispiel – Einfacher Chat mit Streaming-Antworten

Eine Windows-Demo ist verfügbar, damit Sie die On-Device-Inferenz aus erster Hand erleben können. Die Demo enthält eine Chat-Oberfläche mit Streaming-Antworten, Laufzeit-Downloads von Modellen per URL und ein Einstellungsmenü für Inferenzparameter – alles erstellt mit Blueprints und UMG.
Senden Sie Nachrichten und beobachten Sie, wie Antworten in Echtzeit Token für Token generiert werden.
Modelle sofort einsatzbereit, plus Laufzeit-Downloads per URL für weitere Modelle
Einstellungsmenü im Spiel für Temperatur, maximale Tokens, Kontextgröße und mehr
Vollständige Blueprint-Implementierung im Demo-Inhaltsordner des Plugins, unterstützt UE 4.27+
Videotutorial
Vorschau des Demo-Projekts
Einige der Workflows, die das Plugin von Haus aus unterstützt – alle laufen lokal ohne externe Abhängigkeiten.
Charaktergetriebene Gespräche mit persistentem Kontext – NPCs erinnern sich an frühere Interaktionen und bleiben über den System-Prompt in ihrer Rolle.
Generieren Sie zur Laufzeit Quest-Texte, Gegenstandsbeschreibungen, Lore-Ausschnitte oder Barks – unterschiedliche Ausgaben pro Sitzung, ohne jede Variante manuell zu erstellen.
In-Game-Assistenten und Chatbots, die ohne Internet funktionieren – nützlich für Offline-Spiele, abgeschottete Bereitstellungen und datenschutzsensible Anwendungen.
Kombinieren Sie es mit Speech Recognizer für Spracheingabe, TTS für gesprochene Antworten und Lippensynchronisation für Animationen – das ermöglicht vollständig offline arbeitende Konversations-Charaktere.
Runtime Local LLM ist das Offline-AI-Gehirn der Georgy Dev Plugin-Suite – kombinieren Sie es mit Spracherkennung, TTS und Lippensynchronisation für vollständig gerätebasierte Konversations-Charaktere.
TTS-Audioausgabe zur Laufzeit verarbeiten und abspielen. Essenzieller Begleiter für den Umgang mit Streaming-Audiodaten von jedem TTS-Anbieter.
Mehr erfahrenOffline-Spracherkennung (Speech-to-Text) über Whisper. Konvertieren Sie die Sprache des Spielers in Text und speisen Sie ihn direkt in das lokale LLM ein.
Mehr erfahrenOffline-TTS mit 2800+ Stimmen in 51 Sprachen – sprechen Sie die Antworten des LLM lokal laut aus.
Mehr erfahrenEchtzeit-Lippensynchronisation für MetaHumans und benutzerdefinierte Charaktere, angetrieben durch die Audioausgabe synthetisierter LLM-Antworten.
Mehr erfahrenCloud-AI-Alternative – OpenAI, Claude, DeepSeek und andere. Verwenden Sie es neben Runtime Local LLM für hybride Online-/Offline-Szenarien.
Mehr erfahrenDie umfassende Dokumentation deckt den Editor-Modellmanager, die Runtime-API, Inferenzparameter, sofort einsatzbereite Beispiele (einfacher Chat, NPC-Dialog, Vorab-Download) und das mitgelieferte Demo-Projekt ab.
Schritt-für-Schritt-Anleitungen für alle Funktionen, mit Blueprint- und C++-Beispielen
Aktive Discord-Community mit Entwickler-Support
Maßgeschneiderte Integration oder Funktionsentwicklung - [email protected]
Editor - Import benutzerdefinierter GGUF-Modelle
Verfügbar auf Fab für UE 4.27 – 5.8. Enthält den Editor-Modellmanager, die Runtime-API, das Demo-Projekt und die vollständige Dokumentation.