Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Unreal Engine을 위한 크로스 플랫폼, 오프라인 음성 합성. 자연스러운 음성을 생성하세요. 51개 언어, 2800개 이상의 음성 - Kokoro 스튜디오 품질 음성 모델 및 스트리밍 TTS 포함 - Blueprint 및 C++ 전체 지원.

UE 4.27 – 5.8
Blueprints 및 C++
모든 플랫폼 지원
51개 언어, 2800개 이상의 음성

작동 방식

텍스트는 ONNX Runtime을 통해 Piper 또는 Kokoro 음성 모델을 사용하여 전적으로 온디바이스에서 합성됩니다 - 표준 또는 스트리밍 - 인터넷 연결, API 키, 외부 데이터 전송이 필요 없습니다. 생성된 PCM 오디오는 Runtime Audio Importer와 직접 통합되어 즉시 재생할 수 있습니다.

1

텍스트 입력

Blueprint, C++ 또는 AI 챗봇 응답에서 전달되는 모든 문자열

2

음성 모델

이름 또는 객체로 Piper 또는 Kokoro 모델을 선택하고, 선택적으로 화자 및 품질 설정을 지정합니다.

3

기기 내 합성

ONNX Runtime이 텍스트를 로컬에서 처리합니다 - 표준 또는 스트리밍 방식 - 외부로 데이터가 전송되지 않습니다.

4

PCM 오디오 출력

재생, 저장, 립싱크 또는 모든 다운스트림 오디오 처리를 위한 Float32 PCM 데이터

음성 모델 유형

광범위한 언어 지원부터 스튜디오 품질 출력까지 다양한 사용 사례를 포괄하는 두 가지 모델 아키텍처입니다.

Piper 음성 모델

ONNX 기반 모델로 51개 언어, 166개의 음성 모델, 2800개 이상의 고유 화자를 지원합니다. 사용자 지정 학습 ONNX 모델을 허용합니다.

Kokoro 스튜디오 품질 모델

8개 언어로 제공되는 151개의 고품질 오픈소스 음성 모델: 영어(미국 및 영국), 중국어 간체, 스페인어, 포르투갈어, 힌디어, 프랑스어, 이탈리아어. 사용 가능한 최고 품질의 오픈소스 TTS 솔루션 중 하나입니다.

사용자 지정 음성 모델

플러그인 설정을 통해 자신만의 Piper(ONNX + JSON) 또는 Kokoro(BIN + JSON) 음성 모델을 직접 가져와 특수 음성 또는 언어에 사용할 수 있습니다.

언어 및 플랫폼 지원

광범위한 언어 지원과 Unreal Engine이 대상으로 하는 모든 주요 플랫폼에 대한 최고 수준의 지원을 제공합니다.

언어 지원 범위

영어(미국 및 영국)
독일어
스페인어
프랑스어
중국어 간체
러시아어
포르투갈어
힌디어
이탈리아어
폴란드어
41개 더 - 아랍어, 네덜란드어, 터키어, 한국어, 베트남어, 우크라이나어, 카탈루냐어...

플랫폼 지원

Windows
Mac
Linux
Android
iOS
Meta Quest

완전한 기능의 음성 제어

기본 합성 외에도, 플러그인은 스트리밍 출력, 다중 스피커 선택, 취소 가능한 작업 및 모델 관리 유틸리티를 제공합니다 - 모두 Blueprints 또는 C++에서 접근할 수 있습니다.

표준 및 스트리밍 합성

두 가지 합성 모드: 전체 텍스트를 완성한 후 오디오를 반환하거나, 생성되는 대로 PCM 청크를 실시간으로 스트리밍하여 긴 텍스트를 즉시 재생할 수 있습니다.

다중 스피커 선택

많은 모델이 다중 스피커를 지원합니다 - 영어 LibriTTS에는 900개 이상의 개별 음성이 포함됩니다. 합성 시 모델별 스피커 수를 조회하고 인덱스로 선택할 수 있습니다.

취소 가능한 작업

언제든지 진행 중인 합성을 취소할 수 있습니다 - 생성 중에 음성을 중단하고 다시 시작해야 하는 응답성 높은 애플리케이션에 필수적입니다.

에디터 내 모델 관리

Unreal Editor에서 직접 음성 모델을 다운로드, 미리 보기, 관리할 수 있습니다. 엔진을 떠나지 않고 사용 가능한 모델을 나열하고, 메타데이터를 조회하고, 저장 공간을 제어할 수 있습니다.

음성 메타데이터 및 유틸리티

이름이나 객체 참조로 모델 메타데이터, 언어, 품질 등급, 스피커 수를 검색할 수 있습니다. 런타임 중 언어 또는 기타 기준에 따라 모델을 동적으로 선택할 수 있습니다.

완전 온디바이스

인터넷 연결이 필요 없고, API 키가 없으며, 기기에서 데이터가 나가지 않습니다. 프라이버시가 중요한 애플리케이션, 네트워크 분리 환경, 오프라인 게임에 적합합니다.

Blueprint 예제 - 실시간 재생을 지원하는 스트리밍 TTS

Runtime Audio Importer 블루프린트 예제를 통한 스트리밍 TTS

데모 사용해 보기

플러그인의 음질을 직접 체험할 수 있는 Windows 데모가 제공됩니다. 데모는 다양한 언어, 화자 수, 합성 모드를 보여주는 Piper 및 Kokoro 음성 모델의 엄선된 컬렉션을 포함하고 있습니다.

다중 음성 모델 유형

표준, 다중 화자 및 Kokoro 스튜디오 품질 모델

표준 및 스트리밍 합성

사용자 지정 텍스트 입력으로 두 합성 모드를 나란히 비교

Blueprint 소스 포함

참조용 데모 프로젝트에 포함된 전체 Blueprint 구현

데모 다운로드 (Windows)

동영상 튜토리얼

플러그인 생태계

Runtime Text To Speech는 Georgy Dev 플러그인 제품군의 음성 출력 계층으로, 립싱크를 구동하고 AI 캐릭터 파이프라인을 지원하며 음성 인식 루프를 완성합니다.

Runtime Audio Importer

TTS 합성에서 PCM 오디오 출력을 수신하고 재생하거나, 스트리밍하거나, 런타임에서 추가로 처리합니다.

더 알아보기

Runtime MetaHuman Lip Sync

MetaHuman 및 사용자 지정 캐릭터의 실시간 립싱크 애니메이션을 TTS 오디오 출력에서 직접 구동합니다.

더 알아보기

Runtime Speech Recognizer

음성 루프를 완성하세요. 오프라인 음성 인식을 오프라인 TTS와 결합하여 완전한 온디바이스 대화 경험을 제공합니다.

더 알아보기

AI Chatbot Integrator

여러 공급자의 AI 생성 텍스트를 TTS 합성에 직접 연결하여 완전한 음성 NPC 응답을 생성합니다.

더 알아보기

Runtime Local LLM

온디바이스 LLM으로 오프라인에서 대화를 생성한 다음, 합성 음성에서 립싱크를 구동하여 완전한 오프라인 캐릭터 상호 작용을 구현합니다.

더 알아보기

문서 및 지원

포괄적인 문서는 모든 합성 모드, 모델 관리, 다중 화자 구성, 스트리밍 워크플로우 및 플랫폼별 가이드를 다룹니다.

전체 문서

모든 기능에 대한 단계별 가이드, Blueprint 및 C++ 예제 포함

커뮤니티 및 지원

개발자 지원이 포함된 활발한 Discord 커뮤니티

맞춤 개발

맞춤형 통합 또는 기능 개발 - [email protected]

데모 - 음성 모델 다운로드 및 에디터에서 미리 보기

편집기에서 음성 모델 다운로드 및 미리 보기

프로젝트에 텍스트 음성 변환을 추가할 준비가 되셨나요?

Fab에서 UE 4.27 – 5.8용으로 제공됩니다. 모든 음성 모델, 전체 문서, 스트리밍 TTS 및 Kokoro 음성을 보여주는 데모 프로젝트가 포함됩니다.