
Büyük dil modellerini tamamen cihaz üzerinde Unreal Engine'de çalıştırın. Token bazında akışlı çevrimdışı GGUF çıkarımı, konuşma bağlamı ve bir editör model yöneticisi - tam Blueprint ve C++ desteğiyle.
Temeli llama.cpp - herhangi bir GGUF modelini yükleyin ve bulut hizmeti, API anahtarı ve cihazdan çıkan veri olmadan çıkarımı yerel olarak çalıştırın. Yukarı akıştaki llama.cpp sürümlerini takip etmek için düzenli olarak güncellenir.
İnternet bağlantısı yok, API anahtarı yok, telemetri yok. Tüm çıkarım, kullanıcının cihazında yerel olarak çalışır.
Model yazarken her üretilen token'ı delegeler aracılığıyla gerçek zamanlı alın - sohbet arayüzlerini güncelleyin ve oyun olaylarını tetikleyin.
Windows ve Linux'ta Vulkan, Mac ve iOS'ta Metal, Android ve Meta Quest'te CPU + intrinsics.
Proje ayarlarından modellere göz atın, indirin, içe aktarın, silin ve test edin. Modeller paketlenmiş yapılarla birlikte otomatik olarak dağıtılır.
Modelleri editörde yönetin, seçtiğiniz çıkarım parametreleriyle çalışma zamanında yükleyin ve mesajlar gönderin. Model üretirken token'lar delegeler aracılığıyla geri akar - tümü arka plan iş parçacığında, oyun iş parçacığında geri çağrılarla.
Katalogdan indirin, özel GGUF dosyalarını içe aktarın veya çalışma zamanında URL'den getirin.
Yapılandırılabilir çıkarım parametreleriyle ada, dosya yoluna veya URL'ye göre seçin
Kullanıcı mesajlarını iletin ve akış yanıtlarını alın, konuşma bağlamı korunur.
NPC diyaloglarını yönlendirin, dinamik içerik üretin veya TTS ve dudak senkronizasyonu gibi diğer eklentilere besleyin.
GGUF formatındaki her model çalışır. Editör, tek tıkla indirme için popüler ön tanımlı modellerden oluşan bir katalog içerir ve istediğiniz özel GGUF dosyasını içe aktarabilirsiniz.
Llama (Meta), Mistral / Mixtral, Phi (Microsoft), Gemma (Google), Qwen (Alibaba), TinyLlama ve diğer tüm GGUF topluluk modelleri.
Q2_K'dan (en küçük, en hızlı) Q4_K_M, Q5_K_M, Q8_0 aracılığıyla F16 / F32'ye kadar. Hedef cihazınızın RAM ve performans bütçesine uygun seviyeyi seçin.
Eklenti, yukarı akış llama.cpp sürümlerini takip etmek için Fab'da düzenli olarak güncellenir; böylece en yeni GGUF model formatları yayınlandıkça desteklenmeye devam eder.
Platforma göre ayarlanmış donanım hızlandırması - mevcut olduğunda GPU hesaplama, olmadığında CPU + intrinsics.
| Platform | Hızlandırma |
|---|---|
| Windows | Vulkan GPU |
| Linux | Vulkan GPU |
| Mac | Metal GPU |
| iOS | Metal GPU |
| Android | CPU + intrinsics |
| Meta Quest | CPU + intrinsics |
Mobil ve VR cihazları için, kompakt modellerle (1B–3B parametre) daha küçük kuantizasyon seviyeleri (Q2_K ile Q4_K_M arası) önerilir. Masaüstü platformlar daha yüksek kuantizasyon seviyeleriyle daha büyük modelleri çalıştırabilir.
Unreal Editor içinde, modelleri görüntülemek, indirmek, içe aktarmak, silmek ve test etmek için özel bir ayarlar paneli - komut satırı araçları veya harici indirme gerektirmez.
Yerleşik popüler modeller kataloğuna göz atın ve tek tıkla indirin. Birden fazla indirme paralel olarak yapılır; ilerleme çubukları ve iptal desteği vardır.
Diskten veya doğrudan bir URL'den herhangi bir GGUF dosyası içe aktarın. Özel modeller, katalog modelleriyle aynı şekilde ele alınır ve paketlenmiş derlemelerle birlikte gelir.
Yerleşik test penceresi, model seçmenize, parametreleri yapılandırmanıza, istemler göndermenize ve yanıtları gerçek zamanlı akarken izlemenize olanak tanır - tümü Play moduna girmeden.
Temel yükleme ve çıkarımın ötesinde, eklenti birden fazla model yükleme yöntemi, async Blueprint düğümleri, çalışma zamanında indirme, konuşma bağlamı yönetimi ve yapılandırılabilir çıkarım parametreleri sunar.
Model adına, mutlak dosya yoluna göre veya otomatik indirme ile doğrudan bir URL'den yükleyin. Yüklemeden modelleri ön belleğe alın.
Üretilen her token, oyun iş parçacığında bir delegate tetikler - sohbet arayüzlerini anında güncelleyin, oyun içi olayları tetikleyin veya çıktıyı geldikçe diğer sistemlere aktarın.
Çok turlu konuşmalar mesaj geçmişini otomatik olarak korur. Bağlamı istediğiniz zaman sıfırlayın, isteğe bağlı olarak kalıcı karakter davranışı için sistem istemini koruyun.
Sıcaklığı, Top-P, Top-K, tekrar cezası, GPU katman yükünü boşaltma, bağlam boyutu, seed, iş parçacığı sayısı, maksimum token ve sistem istemini - her model yüklemesi için kontrol edin.
Yükleme, mesaj gönderme ve indirme için özel async düğümleri - token, tamamlama, ilerleme ve hatalar için çıktı pinleri ile. Manuel delegate bağlamaya gerek yoktur.
Content/RuntimeLocalLLM/Models içindeki modeller, paketlenmiş derlemelerle birlikte gönderilmeleri için NonUFS aracılığıyla otomatik olarak hazırlanır. Manuel proje yapılandırması gerekmez.
Blueprint Örneği - Akışlı yanıtlarla basit sohbet

Windows demo mevcuttur, böylece cihaz üzerinde çıkarımı ilk elden deneyimleyebilirsiniz. Demo, akışlı yanıtlara sahip bir sohbet arayüzü, URL üzerinden çalışma zamanında model indirme ve çıkarım parametreleri için bir ayarlar menüsü içerir - tümü Blueprint'ler ve UMG ile oluşturulmuştur.
Mesaj gönderin ve yanıtların gerçek zamanlı olarak token token oluşmasını izleyin
Kullanıma hazır modeller ve ek modeller için çalışma zamanında URL indirmeleri
Sıcaklık, maksimum token, bağlam boyutu ve daha fazlası için oyun içi ayarlar menüsü
Eklentinin Demo içerik klasöründe tam Blueprint uygulaması, UE 4.27+ sürümlerini destekler
Video Eğitimi
Demo Proje Önizlemesi
Eklentinin kutudan çıktığı gibi desteklediği iş akışlarından birkaçı - tümü harici bağımlılıklar olmadan yerel olarak çalışır.
Karakter odaklı, kalıcı bağlamlı sohbetler - NPC'ler önceki konuşmaları hatırlar ve sistem istemi aracılığıyla karakterde kalır.
Görev metinleri, eşya açıklamaları, hikaye parçaları veya kısa replikler oluşturun - her çeşidi yazmadan oturum başına farklı çıktı.
İnternet olmadan çalışan oyun içi asistanlar ve sohbet botları - çevrimdışı oyunlar, ağ bağlantısı olmayan dağıtımlar ve gizliliğe duyarlı uygulamalar için kullanışlıdır.
Ses girişi için Speech Recognizer, sözlü yanıtlar için TTS ve animasyon için Lip Sync ile eşleştirerek tamamen çevrimdışı sohbet eden karakterler oluşturun.
Runtime Local LLM, Georgy Dev eklenti paketinin çevrimdışı yapay zeka beynidir - tamamen cihaz üzerinde sohbet eden karakterler için konuşma tanıma, TTS ve dudak senkronizasyonu ile birleştirin.
TTS ses çıktısını çalışma zamanında işleyin ve oynatın. Herhangi bir TTS sağlayıcısından gelen akış ses verilerini yönetmek için vazgeçilmez bir yardımcıdır.
Daha fazla bilgiWhisper ile çevrimdışı konuşmadan metne. Oyuncu konuşmasını metne dönüştürün ve doğrudan yerel LLM'ye aktarın.
Daha fazla bilgi51 dilde 2800'den fazla ses ile çevrimdışı TTS - LLM'nin yanıtlarını yerel olarak sesli bir şekilde söyler.
Daha fazla bilgiMetaHuman'lar ve özel karakterler için gerçek zamanlı dudak senkronizasyonu - sentezlenmiş LLM yanıtlarının ses çıktısı tarafından yönlendirilir.
Daha fazla bilgiBulut AI alternatifi - OpenAI, Claude, DeepSeek ve diğerleri. Hibrit çevrimiçi/çevrimdışı senaryolar için Runtime Local LLM ile birlikte kullanın.
Daha fazla bilgiKapsamlı dokümantasyon; editör model yöneticisi, çalışma zamanı API'si, çıkarım parametreleri, kullanıma hazır örnekler (basit sohbet, NPC diyaloğu, önceden indirme) ve paketteki demo projesini kapsar.
Tüm özellikler için Blueprint ve C++ örnekleriyle adım adım rehberler
Geliştirici desteği sunan aktif Discord topluluğu
Size özel entegrasyon veya özellik geliştirme - [email protected]
Editör - Özel GGUF modellerini içe aktarma
UE 4.27 – 5.8 için Fab'da mevcuttur. Editör model yöneticisi, çalışma zamanı API'si, demo projesi ve tam dokümantasyon içerir.