Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Reconnaissance vocale hors ligne multiplateforme pour Unreal Engine. Propulsé par Whisper AI - convertissez la parole en texte entièrement sur l'appareil, sur toutes les plateformes, sans connexion Internet requise.

UE 4.27 – 5.8
Blueprints & C++
Toutes les plateformes prises en charge
95+ langues

Reconnaissance vocale hors ligne, sur n'importe quelle plateforme

Basé sur l'implémentation whisper.cpp du modèle Whisper d'OpenAI - précision de pointe fonctionnant entièrement sur l'appareil, sans aucune donnée envoyée à des serveurs externes.

Reconnaissance en streaming

Traiter l'audio en temps réel dès sa capture - idéal pour les commandes vocales en direct et les applications interactives.

Reconnaissance non streaming

Traitez des fichiers audio complets ou des tampons en une seule passe pour une précision de transcription maximale.

95+ langues

Détection automatique de la langue ou sélection explicite. La traduction vers l'anglais est également prise en charge.

Accélération GPU

Accélération GPU basée sur Vulkan sous Windows pour une reconnaissance nettement plus rapide. CPU + intrinsics sur toutes les autres plateformes.

Comment ça fonctionne

L'audio est traité entièrement sur l'appareil à l'aide du modèle Whisper. Aucune connexion Internet, aucun appel API externe, aucune donnée quittant l'appareil.

1

Entrée audio

Capture par microphone, fichiers audio ou toute source PCM - y compris Runtime Audio Importer

2

Traitement sur l'appareil

Le modèle Whisper s'exécute localement - en streaming ou en tampon complet, avec préfiltrage VAD facultatif

3

Transcription

Sortie de texte avec horodatages de segment, résultat de détection de langue et données de confiance

4

Votre logique de jeu

Liez-vous aux délégués de résultat dans Blueprint ou C++ et agissez immédiatement sur le texte reconnu

Choisissez votre modèle

Cinq tailles de modèle vous permettent d'équilibrer la précision de transcription, l'empreinte mémoire et la vitesse de traitement pour votre plateforme cible.

Modèle Taille Langues Idéal pour
Tiny 75 Mo Multilingue / EN Mobile, Quest
Base 142 MB Multi / EN Appareils d’entrée de gamme
Petit 466 MB Multi / EN Équilibré
Moyen 1,5 Go Multi / EN Haute précision
Grand 3 Go Multi Précision maximale.

Des variantes quantifiées sont également disponibles pour réduire l'utilisation de la mémoire. Modèles personnalisés pris en charge.

Support linguistique universel

Reconnaît la parole dans plus de 95 langues avec détection automatique, ou spécifiez la langue explicitement pour des performances optimales. La traduction vers l'anglais est également prise en charge.

Anglais
chinois
espagnol
français
Allemand
Japonais
Coréen
Russe
Arabe
Hindi
Portugais
+ 84 autres
Voir la liste complète des langues

Contrôle complet de la reconnaissance

Contrôle fin des paramètres de reconnaissance, de l'optimisation des performances et du filtrage de sortie - le tout accessible depuis les Blueprints ou le C++.

Paramètres de reconnaissance

Configurez le nombre de threads, la taille du pas, la taille du faisceau, la taille du contexte audio, ainsi que les modes sans contexte / à segment unique. Des valeurs par défaut distinctes pour les modes streaming et non-streaming.

Optimisation des performances

Activez le mode accéléré, sélectionnez l'ID du périphérique GPU pour les systèmes multi-GPU, et ajustez la taille du contexte audio pour échanger la précision contre la vitesse sur du matériel contraint.

Contrôle de l'invite et de la sortie

Fournissez une invite initiale pour guider le style de transcription. Supprimez les segments vides et les jetons non vocaux afin de garder une sortie propre et structurée.

Intégration VAD

Combinez la détection d'activité vocale de Runtime Audio Importer pour ne fournir au reconnaisseur que les segments de parole - améliorant ainsi la précision et réduisant le gaspillage de calcul.

Traduction

Traduisez la parole reconnue de n'importe quelle langue prise en charge directement en anglais en une seule passe - aucune étape de traduction distincte n'est requise.

Entièrement sur l'appareil

Aucune connexion Internet requise, aucune clé API, aucune donnée ne quitte l'appareil. Convient aux applications sensibles à la confidentialité et aux environnements isolés.

Exemple de Blueprint - Reconnaissance en streaming avec détection d'activité vocale

Reconnaissance vocale en streaming avec exemple de Blueprint VAD

Toutes les plateformes prises en charge

La même API Blueprint et C++ fonctionne sur toutes les plateformes prises en charge par Unreal Engine - des ordinateurs de bureau aux mobiles et aux consoles.

Accélération GPU via Vulkan sur Windows. Accélération CPU + intrinsics sur toutes les autres plateformes, y compris Android, iOS et les consoles.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Écosystème de plugins

Runtime Speech Recognizer s'intègre naturellement dans la suite de plugins Georgy Dev - combinez-le avec la capture audio, la TTS et le chat IA pour créer des pipelines complets de personnages pilotés par la voix.

Runtime Audio Importer

Capture microphone avec détection d'activité vocale - transmettez des segments de parole propres directement au reconnaisseur.

En savoir plus

Runtime MetaHuman Lip Sync

Synchro labiale en temps réel pour MetaHuman et personnages personnalisés - animez les réponses à la parole reconnue.

En savoir plus

Runtime Text To Speech

Synthèse vocale entièrement hors ligne - complétez la boucle vocale en répondant à l'utilisateur.

En savoir plus

AI Chatbot Integrator

Traitez la parole reconnue avec divers fournisseurs d'IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud et Azure) pour alimenter des NPC conversationnels intelligents.

En savoir plus

Runtime Local LLM

Générez des dialogues avec des LLM locaux hors ligne, puis pilotez la synchro labiale à partir de la parole synthétisée pour des interactions de personnages entièrement hors ligne.

En savoir plus

Documentation et support

Une documentation complète couvre les flux de travail en streaming et non-streaming, la sélection de modèles, la configuration linguistique, l'intégration de la VAD et des conseils spécifiques à chaque plateforme.

Documentation complète

Guides pas à pas pour toutes les fonctionnalités, avec des exemples Blueprint et C++

Tutoriel vidéo

Procédure complète couvrant la configuration, la reconnaissance en streaming et l'intégration VAD

Communauté et support

Communauté Discord active avec support aux développeurs

Développement personnalisé

Intégration sur mesure ou développement de fonctionnalités - [email protected]

Prêt à ajouter la reconnaissance vocale à votre projet ?

Disponible sur Fab pour UE 4.27 – 5.8. Inclut toutes les tailles de modèles, une documentation complète et un projet de démonstration.