Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Unreal Engine용 크로스 플랫폼 오프라인 음성 인식. Whisper AI 기반 - 음성을 전적으로 기기 내에서, 인터넷 연결 없이 모든 플랫폼에서 텍스트로 변환합니다.

UE 4.27 – 5.8
Blueprints 및 C++
모든 플랫폼 지원
95개 이상의 언어

오프라인 음성 인식, 모든 플랫폼

다음을 기반으로 제작: whisper.cpp (OpenAI의 Whisper 모델 구현) - 최첨단 정확도로 전적으로 기기 내에서 실행되며, 외부 서버로 데이터가 전송되지 않습니다.

스트리밍 인식

캡처되는 즉시 오디오를 실시간으로 처리합니다 - 실시간 음성 명령 및 인터랙티브 애플리케이션에 적합합니다.

비스트리밍 인식

전체 오디오 파일 또는 버퍼를 단일 패스로 처리하여 최대 전사 정확도를 제공합니다.

95개 이상의 언어

자동 언어 감지 또는 명시적 선택. 영어로의 번역도 지원됩니다.

GPU 가속

Windows에서 Vulkan 기반 GPU 가속을 통해 인식 속도를 대폭 향상시킵니다. 다른 모든 플랫폼에서는 CPU + intrinsics를 사용합니다.

작동 방식

오디오는 Whisper 모델을 사용하여 전적으로 기기 내에서 처리됩니다. 인터넷 연결, 외부 API 호출, 기기 밖으로의 데이터 전송이 없습니다.

1

오디오 입력

마이크 캡처, 오디오 파일 또는 모든 PCM 소스 - Runtime Audio Importer 포함

2

기기 내 처리

Whisper 모델이 로컬에서 실행됩니다 - 스트리밍 또는 전체 버퍼, 선택적 VAD 사전 필터링 포함

3

전사

세그먼트 타임스탬프, 언어 감지 결과 및 신뢰도 데이터가 포함된 텍스트 출력

4

게임 로직

Blueprint 또는 C++에서 결과 델리게이트를 바인딩하고 인식된 텍스트에 즉시 대응합니다

모델 선택

다섯 가지 모델 크기로 대상 플랫폼에 맞게 전사 정확도와 메모리 사용량 및 처리 속도의 균형을 조정할 수 있습니다.

모델 크기 언어 최적 사용
Tiny 75MB 다국어 / 영어 모바일, Quest
기본 142 MB 다국어 / EN 저사양 기기
소형 466 MB 다국어 / EN 균형
중형 1.5 GB 다국어 / EN 높은 정확도
대형 3 GB 다국어 최대 정확도

양자화 변형을 사용하면 메모리 사용량을 줄일 수 있습니다. 사용자 지정 모델이 지원됩니다.

전 세계 언어 지원

95개 이상의 언어로 음성을 인식하며 자동 감지가 지원됩니다. 최상의 성능을 위해 언어를 명시적으로 지정할 수도 있습니다. 영어 번역도 지원됩니다.

영어
중국어
스페인어
프랑스어
독일어
일본어
한국어
러시아어
아랍어
힌디어
포르투갈어
+ 84개 더
전체 언어 목록 보기

전체 인식 제어

인식 매개변수, 성능 튜닝, 출력 필터링에 대한 세밀한 제어 - Blueprint 또는 C++에서 모두 액세스할 수 있습니다.

인식 매개변수

스레드 수, 스텝 크기, 빔 크기, 오디오 컨텍스트 크기, 노컨텍스트/단일 세그먼트 모드를 구성합니다. 스트리밍 및 비스트리밍 모드에 대한 별도의 기본값이 있습니다.

성능 튜닝

속도 향상 모드를 활성화하고, 다중 GPU 시스템의 GPU 장치 ID를 선택하며, 제한된 하드웨어에서 정확도와 속도를 맞바꾸기 위해 오디오 컨텍스트 크기를 조정합니다.

프롬프트 및 출력 제어

전사 스타일을 안내하는 초기 프롬프트를 제공합니다. 빈 세그먼트와 비음성 토큰을 억제하여 출력을 깔끔하고 구조적으로 유지합니다.

VAD 통합

Runtime Audio Importer의 음성 활동 감지와 결합하여 인식기에 음성 세그먼트만 공급하면 정확도가 향상되고 불필요한 연산이 줄어듭니다.

번역

지원되는 모든 언어의 인식된 음성을 단일 패스로 영어로 직접 번역합니다. 별도의 번역 단계가 필요하지 않습니다.

완전 온디바이스

인터넷 연결이 필요 없고, API 키가 없으며, 기기에서 데이터가 나가지 않습니다. 개인 정보 보호가 중요한 애플리케이션과 폐쇄망 환경에 적합합니다.

Blueprint 예제 - 음성 활동 감지를 이용한 스트리밍 인식

VAD Blueprint 예제를 사용한 스트리밍 음성 인식

모든 플랫폼 지원

동일한 Blueprint 및 C++ API가 Unreal Engine이 지원하는 모든 플랫폼에서 작동합니다 - 데스크톱에서 모바일, 콘솔까지.

Windows에서는 Vulkan을 통한 GPU 가속. Android, iOS 및 콘솔을 포함한 기타 모든 플랫폼에서는 CPU + 인트린식 가속.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

플러그인 생태계

Runtime Speech Recognizer는 Georgy Dev 플러그인 제품군에 자연스럽게 통합됩니다 - 오디오 캡처, TTS, AI 채팅과 결합하여 완전한 음성 기반 캐릭터 파이프라인을 구축하세요.

Runtime Audio Importer

음성 활동 감지 기능을 통한 마이크 캡처 - 깨끗한 음성 세그먼트를 인식기에 직접 전달합니다.

자세히 알아보기

Runtime MetaHuman Lip Sync

MetaHuman 및 커스텀 캐릭터를 위한 실시간 립싱크 - 인식된 음성에 대한 응답을 애니메이션화합니다.

자세히 알아보기

Runtime Text To Speech

완전한 오프라인 음성 합성 - 사용자에게 응답을 다시 말함으로써 음성 루프를 닫습니다.

자세히 알아보기

AI Chatbot Integrator

인식된 음성을 다양한 AI 제공업체(OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud 및 Azure)로 처리하여 지능형 대화형 NPC를 구동합니다.

자세히 알아보기

Runtime Local LLM

온디바이스 LLM으로 오프라인에서 대화를 생성한 다음, 합성된 음성에서 립싱크를 구동하여 완전히 오프라인인 캐릭터 상호작용을 구현합니다.

자세히 알아보기

문서 및 지원

포괄적인 문서는 스트리밍 및 비스트리밍 워크플로우, 모델 선택, 언어 구성, VAD 통합, 플랫폼별 가이드를 다룹니다.

전체 문서

Blueprint 및 C++ 예제를 포함한 모든 기능에 대한 단계별 가이드

비디오 튜토리얼

설정, 스트리밍 인식 및 VAD 통합을 다루는 전체 둘러보기

커뮤니티 및 지원

개발자 지원이 제공되는 활발한 Discord 커뮤니티

맞춤 개발

맞춤형 통합 또는 기능 개발 - [email protected]

프로젝트에 음성 인식을 추가할 준비가 되셨나요?

UE 4.27 – 5.8용 Fab에서 사용할 수 있습니다. 모든 모델 크기, 전체 문서, 데모 프로젝트가 포함됩니다.