Runtime Text To Speech | Georgy Dev

Runtime Text To Speech

Кросс-платформенный офлайн-синтез речи для Unreal Engine. Генерируйте естественно звучащую речь с 2800+ голосами на 51 языке — включая студийные голосовые модели Kokoro и потоковый TTS — с полной поддержкой Blueprint и C++.

UE 4.27 – 5.8
Blueprints и C++
Поддерживаются все платформы
51 язык, 2800+ голосов

Как это работает

Текст синтезируется полностью на устройстве с использованием голосовых моделей Piper или Kokoro через ONNX Runtime — стандартно или в потоковом режиме — без подключения к интернету, без API-ключей и без отправки данных наружу. Полученное PCM-аудио напрямую интегрируется с Runtime Audio Importer для мгновенного воспроизведения.

1

Ввод текста

Любая строка из Blueprint, C++ или переданная из ответа AI-чатбота

2

Голосовая модель

Выберите модель Piper или Kokoro по имени или объекту, с дополнительными настройками диктора и качества

3

Синтез на устройстве

ONNX Runtime обрабатывает текст локально — стандартно или потоково — без отправки данных вовне

4

Выход PCM-аудио

Данные PCM Float32, готовые для воспроизведения, сохранения, синхронизации губ или любой последующей обработки аудио

Типы голосовых моделей

Две архитектуры моделей, охватывающие широкий спектр вариантов использования — от обширного языкового покрытия до вывода студийного качества.

Голосовые модели Piper

Модели на основе ONNX, охватывающие 51 язык, с 166 голосовыми моделями и более 2800 уникальных дикторов. Принимаются модели ONNX, обученные пользователем.

Модели Kokoro студийного качества

151 высококачественная модель с открытым исходным кодом на 8 языках: английский (США и Великобритания), упрощённый китайский, испанский, португальский, хинди, французский и итальянский. Одно из самых качественных открытых TTS-решений из доступных.

Пользовательские голосовые модели

Импортируйте собственные голосовые модели Piper (ONNX + JSON) или Kokoro (BIN + JSON) напрямую через настройки плагина для специализированных голосов или языков.

Языки и поддержка платформ

Широкое языковое покрытие и первоклассная поддержка всех основных платформ, на которые нацелен Unreal Engine.

Языковое покрытие

Английский (США и Великобритания)
Немецкий
Испанский
Французский
Упрощённый китайский
Русский
Португальский
Хинди
Итальянский
Польский
Ещё 41 — арабский, нидерландский, турецкий, корейский, вьетнамский, украинский, каталанский...

Поддержка платформ

Windows
Mac
Linux
Android
iOS
Meta Quest

Полнофункциональное управление речью

Помимо базового синтеза, плагин предоставляет потоковый вывод, выбор нескольких дикторов, отменяемые операции и утилиты управления моделями — всё доступно из Blueprints или C++.

Стандартный и потоковый синтез

Два режима синтеза: можно полностью обработать текст перед возвратом аудио или потоково передавать PCM-чанки в реальном времени по мере их генерации для немедленного воспроизведения длинных текстов.

Выбор нескольких дикторов

Многие модели поддерживают несколько дикторов — англоязычная LibriTTS включает более 900 различных голосов. Запрашивайте количество дикторов для каждой модели и выбирайте по индексу во время синтеза.

Отменяемые операции

Отменяйте любой выполняющийся синтез в любой момент — это важно для отзывчивых приложений, которым требуется прерывать и перезапускать речь в середине генерации.

Управление моделями в редакторе

Загружайте, прослушивайте и управляйте голосовыми моделями прямо из Unreal Editor. Просматривайте список доступных моделей, запрашивайте метаданные и управляйте хранилищем, не выходя из движка.

Метаданные голоса и утилиты

Получайте метаданные модели, язык, уровень качества и количество дикторов по имени или ссылке на объект. Выбирайте модели динамически во время выполнения на основе языка или других критериев.

Полностью на устройстве

Никакого подключения к интернету, никаких API-ключей, никакой передачи данных с устройства. Подходит для приложений, чувствительных к конфиденциальности, изолированных сред и офлайн-игр.

Пример Blueprint — потоковый TTS с воспроизведением в реальном времени

Потоковый TTS с примером Blueprint для Runtime Audio Importer

Попробуйте демо

Доступна демоверсия для Windows, чтобы лично оценить качество голоса плагина. Демо-версия включает подобранный набор голосовых моделей Piper и Kokoro, демонстрирующих разные языки, количество дикторов и режимы синтеза.

Несколько типов голосовых моделей

Стандартные модели, модели с несколькими дикторами и модели студийного качества Kokoro

Стандартный и потоковый синтез

Сравните оба режима синтеза бок о бок с помощью пользовательского текстового ввода

Исходный код Blueprint включен

Полная реализация Blueprint в демонстрационном проекте для справки

Скачать демо (Windows)

Видеоурок

Экосистема плагинов

Runtime Text To Speech - это слой голосового вывода в наборе плагинов Georgy Dev: он управляет синхронизацией губ, обеспечивает работу конвейеров AI-персонажей и замыкает цикл распознавания речи.

Runtime Audio Importer

Получайте аудиовыход PCM из синтеза TTS и воспроизводите его, передавайте в потоковом режиме или обрабатывайте дальше во время выполнения.

Узнать больше

Runtime MetaHuman Lip Sync

Управляйте анимациями синхронизации губ в реальном времени на MetaHuman и пользовательских персонажах напрямую из аудиовыхода TTS.

Узнать больше

Runtime Speech Recognizer

Замкните голосовой цикл - объедините офлайн-распознавание речи с офлайн-TTS для полностью автономных разговорных сценариев на устройстве.

Узнать больше

AI Chatbot Integrator

Направляйте текст, сгенерированный ИИ от различных провайдеров, напрямую в синтез TTS для полностью озвученных ответов NPC.

Узнать больше

Runtime Local LLM

Генерируйте диалоги офлайн с помощью локальных LLM, затем управляйте синхронизацией губ на основе синтезированной речи для полностью офлайн-взаимодействий персонажей.

Узнать больше

Документация и поддержка

Подробная документация охватывает все режимы синтеза, управление моделями, конфигурацию с несколькими дикторами, потоковые сценарии работы и рекомендации для конкретных платформ.

Полная документация

Пошаговые руководства для всех функций, с примерами на Blueprint и C++

Сообщество и поддержка

Активное Discord-сообщество с поддержкой разработчиков

Индивидуальная разработка

Индивидуальная интеграция или разработка функций - [email protected]

Демо - загрузка голосовой модели и предпросмотр в редакторе

Скачивайте и прослушивайте голосовые модели в редакторе

Готовы добавить синтез речи в ваш проект?

Доступен на Fab для UE 4.27 – 5.8. Включает все голосовые модели, полную документацию и демонстрационный проект, демонстрирующий потоковый TTS и голоса Kokoro.