
Reconnaissance vocale hors ligne multiplateforme pour Unreal Engine. Propulsé par Whisper AI - convertissez la parole en texte entièrement sur l'appareil, sur toutes les plateformes, sans connexion Internet requise.
Basé sur l'implémentation whisper.cpp du modèle Whisper d'OpenAI - précision de pointe fonctionnant entièrement sur l'appareil, sans aucune donnée envoyée à des serveurs externes.
Traiter l'audio en temps réel dès sa capture - idéal pour les commandes vocales en direct et les applications interactives.
Traitez des fichiers audio complets ou des tampons en une seule passe pour une précision de transcription maximale.
Détection automatique de la langue ou sélection explicite. La traduction vers l'anglais est également prise en charge.
Accélération GPU basée sur Vulkan sous Windows pour une reconnaissance nettement plus rapide. CPU + intrinsics sur toutes les autres plateformes.
L'audio est traité entièrement sur l'appareil à l'aide du modèle Whisper. Aucune connexion Internet, aucun appel API externe, aucune donnée quittant l'appareil.
Capture par microphone, fichiers audio ou toute source PCM - y compris Runtime Audio Importer
Le modèle Whisper s'exécute localement - en streaming ou en tampon complet, avec préfiltrage VAD facultatif
Sortie de texte avec horodatages de segment, résultat de détection de langue et données de confiance
Liez-vous aux délégués de résultat dans Blueprint ou C++ et agissez immédiatement sur le texte reconnu
Cinq tailles de modèle vous permettent d'équilibrer la précision de transcription, l'empreinte mémoire et la vitesse de traitement pour votre plateforme cible.
| Modèle | Taille | Langues | Idéal pour |
|---|---|---|---|
| Tiny | 75 Mo | Multilingue / EN | Mobile, Quest |
| Base | 142 MB | Multi / EN | Appareils d’entrée de gamme |
| Petit | 466 MB | Multi / EN | Équilibré |
| Moyen | 1,5 Go | Multi / EN | Haute précision |
| Grand | 3 Go | Multi | Précision maximale. |
Des variantes quantifiées sont également disponibles pour réduire l'utilisation de la mémoire. Modèles personnalisés pris en charge.
Reconnaît la parole dans plus de 95 langues avec détection automatique, ou spécifiez la langue explicitement pour des performances optimales. La traduction vers l'anglais est également prise en charge.
Contrôle fin des paramètres de reconnaissance, de l'optimisation des performances et du filtrage de sortie - le tout accessible depuis les Blueprints ou le C++.
Configurez le nombre de threads, la taille du pas, la taille du faisceau, la taille du contexte audio, ainsi que les modes sans contexte / à segment unique. Des valeurs par défaut distinctes pour les modes streaming et non-streaming.
Activez le mode accéléré, sélectionnez l'ID du périphérique GPU pour les systèmes multi-GPU, et ajustez la taille du contexte audio pour échanger la précision contre la vitesse sur du matériel contraint.
Fournissez une invite initiale pour guider le style de transcription. Supprimez les segments vides et les jetons non vocaux afin de garder une sortie propre et structurée.
Combinez la détection d'activité vocale de Runtime Audio Importer pour ne fournir au reconnaisseur que les segments de parole - améliorant ainsi la précision et réduisant le gaspillage de calcul.
Traduisez la parole reconnue de n'importe quelle langue prise en charge directement en anglais en une seule passe - aucune étape de traduction distincte n'est requise.
Aucune connexion Internet requise, aucune clé API, aucune donnée ne quitte l'appareil. Convient aux applications sensibles à la confidentialité et aux environnements isolés.
Exemple de Blueprint - Reconnaissance en streaming avec détection d'activité vocale

La même API Blueprint et C++ fonctionne sur toutes les plateformes prises en charge par Unreal Engine - des ordinateurs de bureau aux mobiles et aux consoles.
Accélération GPU via Vulkan sur Windows. Accélération CPU + intrinsics sur toutes les autres plateformes, y compris Android, iOS et les consoles.
Runtime Speech Recognizer s'intègre naturellement dans la suite de plugins Georgy Dev - combinez-le avec la capture audio, la TTS et le chat IA pour créer des pipelines complets de personnages pilotés par la voix.
Capture microphone avec détection d'activité vocale - transmettez des segments de parole propres directement au reconnaisseur.
En savoir plusSynchro labiale en temps réel pour MetaHuman et personnages personnalisés - animez les réponses à la parole reconnue.
En savoir plusSynthèse vocale entièrement hors ligne - complétez la boucle vocale en répondant à l'utilisateur.
En savoir plusTraitez la parole reconnue avec divers fournisseurs d'IA (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud et Azure) pour alimenter des NPC conversationnels intelligents.
En savoir plusGénérez des dialogues avec des LLM locaux hors ligne, puis pilotez la synchro labiale à partir de la parole synthétisée pour des interactions de personnages entièrement hors ligne.
En savoir plusUne documentation complète couvre les flux de travail en streaming et non-streaming, la sélection de modèles, la configuration linguistique, l'intégration de la VAD et des conseils spécifiques à chaque plateforme.
Guides pas à pas pour toutes les fonctionnalités, avec des exemples Blueprint et C++
Procédure complète couvrant la configuration, la reconnaissance en streaming et l'intégration VAD
Communauté Discord active avec support aux développeurs
Intégration sur mesure ou développement de fonctionnalités - [email protected]
Disponible sur Fab pour UE 4.27 – 5.8. Inclut toutes les tailles de modèles, une documentation complète et un projet de démonstration.