Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Unreal Engine için platformlar arası çevrimdışı konuşma tanıma. Whisper AI destekli - konuşmayı tamamen cihaz üzerinde, tüm platformlarda, internet bağlantısı gerektirmeden metne dönüştürün.

UE 4.27 – 5.8
Blueprints ve C++
Tüm platformlar desteklenir
95+ dil

Çevrimdışı Konuşma Tanıma, Her Platform

Üzerine inşa edilmiştir: whisper.cpp , OpenAI'nin Whisper modelinin uygulaması - tamamen cihaz üzerinde çalışan, harici sunuculara hiçbir veri göndermeyen son teknoloji doğruluk.

Gerçek Zamanlı Tanıma

Ses alındıkça gerçek zamanlı olarak işleyin - canlı sesli komutlar ve etkileşimli uygulamalar için idealdir.

Akışsız Tanıma

En yüksek transkripsiyon doğruluğu için tüm ses dosyalarını veya tamponları tek geçişte işleyin.

95+ Dil

Otomatik dil algılama veya açık seçim. İngilizceye çeviri de desteklenir.

GPU Hızlandırma

Windows'ta önemli ölçüde daha hızlı tanıma için Vulkan tabanlı GPU hızlandırması. Diğer tüm platformlarda CPU + intrinsics.

Nasıl Çalışır

Ses, Whisper modeli kullanılarak tamamen cihaz üzerinde işlenir. İnternet bağlantısı yok, harici API çağrısı yok, cihazdan hiçbir veri çıkmaz.

1

Ses Girişi

Mikrofon yakalama, ses dosyaları veya herhangi bir PCM kaynağı - Runtime Audio Importer dahil

2

Cihaz Üzerinde İşleme

Whisper modeli yerel olarak çalışır - akış veya tam tampon, isteğe bağlı VAD ön filtreleme ile

3

Transkripsiyon

Segment zaman damgaları, dil algılama sonucu ve güven verisi içeren metin çıktısı

4

Oyun Mantığınız

Blueprint veya C++ içindeki sonuç temsilcilerine bağlanın ve tanınan metne anında tepki verin

Modelinizi Seçin

Beş model boyutu, hedef platformunuz için transkripsiyon doğruluğu ile bellek ayak izi ve işlem hızı arasında denge kurmanızı sağlar.

Model Boyut Diller En uygun
Tiny 75 MB Multi / EN Mobil, Quest
Temel 142 MB Çoklu / EN Düşük donanımlı cihazlar
Küçük 466 MB Çoklu / EN Dengeli
Orta 1.5 GB Çoklu / EN Yüksek doğruluk
Büyük 3 GB Çoklu Maksimum doğruluk

Kuantize edilmiş sürümler, daha az bellek kullanımı için de mevcuttur. Özel modeller desteklenir.

Evrensel Dil Desteği

Otomatik algılama ile 95'ten fazla dilde konuşmayı tanır; en iyi performans için dili açıkça belirtebilirsiniz. İngilizceye çeviri de desteklenir.

İngilizce
Çince
İspanyolca
Fransızca
Almanca
Japonca
Korece
Rusça
Arapça
Hintçe
Portekizce
+ 84 daha fazla
Tam dil listesini görüntüle

Tam Tanıma Kontrolü

Tanıma parametreleri, performans ayarı ve çıktı filtreleme üzerinde ayrıntılı kontrol - tümüne Blueprint'lerden veya C++'tan erişilebilir.

Tanıma Parametreleri

İş parçacığı sayısını, adım boyutunu, ışın boyutunu, ses bağlam boyutunu ve bağlamsız / tek parçalı modları yapılandırın. Akışlı ve akışsız modlar için ayrı varsayılanlar.

Performans Ayarı

Hızlandırma modunu etkinleştirin, çoklu GPU sistemleri için GPU cihaz kimliğini seçin ve kısıtlı donanımda doğruluktan ödün vererek hız kazanmak için ses bağlam boyutunu ayarlayın.

İstem ve Çıktı Kontrolü

Transkripsiyon stilini yönlendirmek için bir başlangıç istemi sağlayın. Çıktıyı temiz ve yapılandırılmış tutmak için boş parçaları ve konuşma dışı belirteçleri bastırın.

VAD Entegrasyonu

Runtime Audio Importer'ın Ses Etkinliği Algılama özelliğiyle birleştirerek tanıyıcıya yalnızca konuşma parçalarını besleyin - doğruluğu artırır ve boşa harcanan hesaplamayı azaltır.

Çeviri

Tanınan konuşmayı desteklenen herhangi bir dilden doğrudan İngilizceye tek geçişte çevirin - ayrı bir çeviri adımı gerekmez.

Tamamen Cihaz İçi

İnternet bağlantısı gerekmez, API anahtarı gerekmez, cihazdan veri çıkmaz. Gizliliğe duyarlı uygulamalar ve internet bağlantısı olmayan ortamlar için uygundur.

Blueprint Örneği - Ses Etkinliği Algılama ile Akışlı Tanıma

VAD blueprint örneğiyle gerçek zamanlı konuşma tanıma

Tüm Platformlar Desteklenir

Aynı Blueprint ve C++ API'si, Unreal Engine'in desteklediği her platformda çalışır - masaüstünden mobil cihazlara ve konsollara kadar.

Windows'ta Vulkan ile GPU hızlandırma. Android, iOS ve konsollar dahil diğer tüm platformlarda CPU + intrinsics hızlandırma.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Eklenti Ekosistemi

Runtime Speech Recognizer, Georgy Dev eklenti paketine doğal olarak uyar - ses yakalama, TTS ve AI sohbet ile birleştirerek eksiksiz ses tabanlı karakter işlem hatları oluşturun.

Runtime Audio Importer

Ses Etkinliği Algılama ile mikrofon yakalama - temiz konuşma bölümlerini doğrudan tanıyıcıya iletin.

Daha fazla bilgi edinin

Runtime MetaHuman Lip Sync

MetaHuman ve özel karakterler için gerçek zamanlı dudak senkronizasyonu - tanınan konuşmaya yanıtları canlandırın.

Daha fazla bilgi edinin

Runtime Text To Speech

Tamamen çevrimdışı konuşma sentezi - yanıtları kullanıcıya söyleyerek ses döngüsünü kapatın.

Daha fazla bilgi edinin

AI Chatbot Integrator

Tanınan konuşmayı çeşitli AI sağlayıcılarıyla (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud ve Azure) işleyerek akıllı sohbet NPC'lerine güç verin.

Daha fazla bilgi edinin

Runtime Local LLM

Cihaz içi LLM'lerle çevrimdışı diyalog oluşturun, ardından dudak senkronizasyonunu sentezlenen konuşmadan tamamen çevrimdışı karakter etkileşimleri için sürün.

Daha fazla bilgi edinin

Dokümantasyon ve Destek

Kapsamlı dokümantasyon; akışlı ve akışsız iş akışlarını, model seçimini, dil yapılandırmasını, VAD entegrasyonunu ve platforma özel rehberliği kapsar.

Tam Dokümantasyon

Tüm özellikler için adım adım kılavuzlar, Blueprint ve C++ örnekleriyle

Video Eğitimi

Kurulum, akış tanıma ve VAD entegrasyonunu kapsayan eksiksiz anlatım

Topluluk ve Destek

Geliştirici desteğiyle aktif Discord topluluğu

Özel Geliştirme

Size özel entegrasyon veya özellik geliştirme - [email protected]

Projenize Konuşma Tanıma Eklemeye Hazır mısınız?

UE 4.27 – 5.8 için Fab üzerinde mevcuttur. Tüm model boyutlarını, eksiksiz dokümantasyonu ve bir demo projesini içerir.