
Кросс-платформенный офлайн-синтез речи для Unreal Engine. Генерируйте естественно звучащую речь с 2800+ голосами на 51 языке — включая студийные голосовые модели Kokoro и потоковый TTS — с полной поддержкой Blueprint и C++.
Текст синтезируется полностью на устройстве с использованием голосовых моделей Piper или Kokoro через ONNX Runtime — стандартно или в потоковом режиме — без подключения к интернету, без API-ключей и без отправки данных наружу. Полученное PCM-аудио напрямую интегрируется с Runtime Audio Importer для мгновенного воспроизведения.
Любая строка из Blueprint, C++ или переданная из ответа AI-чатбота
Выберите модель Piper или Kokoro по имени или объекту, с дополнительными настройками диктора и качества
ONNX Runtime обрабатывает текст локально — стандартно или потоково — без отправки данных вовне
Данные PCM Float32, готовые для воспроизведения, сохранения, синхронизации губ или любой последующей обработки аудио
Две архитектуры моделей, охватывающие широкий спектр вариантов использования — от обширного языкового покрытия до вывода студийного качества.
Модели на основе ONNX, охватывающие 51 язык, с 166 голосовыми моделями и более 2800 уникальных дикторов. Принимаются модели ONNX, обученные пользователем.
151 высококачественная модель с открытым исходным кодом на 8 языках: английский (США и Великобритания), упрощённый китайский, испанский, португальский, хинди, французский и итальянский. Одно из самых качественных открытых TTS-решений из доступных.
Импортируйте собственные голосовые модели Piper (ONNX + JSON) или Kokoro (BIN + JSON) напрямую через настройки плагина для специализированных голосов или языков.
Широкое языковое покрытие и первоклассная поддержка всех основных платформ, на которые нацелен Unreal Engine.
Помимо базового синтеза, плагин предоставляет потоковый вывод, выбор нескольких дикторов, отменяемые операции и утилиты управления моделями — всё доступно из Blueprints или C++.
Два режима синтеза: можно полностью обработать текст перед возвратом аудио или потоково передавать PCM-чанки в реальном времени по мере их генерации для немедленного воспроизведения длинных текстов.
Многие модели поддерживают несколько дикторов — англоязычная LibriTTS включает более 900 различных голосов. Запрашивайте количество дикторов для каждой модели и выбирайте по индексу во время синтеза.
Отменяйте любой выполняющийся синтез в любой момент — это важно для отзывчивых приложений, которым требуется прерывать и перезапускать речь в середине генерации.
Загружайте, прослушивайте и управляйте голосовыми моделями прямо из Unreal Editor. Просматривайте список доступных моделей, запрашивайте метаданные и управляйте хранилищем, не выходя из движка.
Получайте метаданные модели, язык, уровень качества и количество дикторов по имени или ссылке на объект. Выбирайте модели динамически во время выполнения на основе языка или других критериев.
Никакого подключения к интернету, никаких API-ключей, никакой передачи данных с устройства. Подходит для приложений, чувствительных к конфиденциальности, изолированных сред и офлайн-игр.
Пример Blueprint — потоковый TTS с воспроизведением в реальном времени

Доступна демоверсия для Windows, чтобы лично оценить качество голоса плагина. Демо-версия включает подобранный набор голосовых моделей Piper и Kokoro, демонстрирующих разные языки, количество дикторов и режимы синтеза.
Стандартные модели, модели с несколькими дикторами и модели студийного качества Kokoro
Сравните оба режима синтеза бок о бок с помощью пользовательского текстового ввода
Полная реализация Blueprint в демонстрационном проекте для справки
Видеоурок
Runtime Text To Speech - это слой голосового вывода в наборе плагинов Georgy Dev: он управляет синхронизацией губ, обеспечивает работу конвейеров AI-персонажей и замыкает цикл распознавания речи.
Получайте аудиовыход PCM из синтеза TTS и воспроизводите его, передавайте в потоковом режиме или обрабатывайте дальше во время выполнения.
Узнать большеУправляйте анимациями синхронизации губ в реальном времени на MetaHuman и пользовательских персонажах напрямую из аудиовыхода TTS.
Узнать большеЗамкните голосовой цикл - объедините офлайн-распознавание речи с офлайн-TTS для полностью автономных разговорных сценариев на устройстве.
Узнать большеНаправляйте текст, сгенерированный ИИ от различных провайдеров, напрямую в синтез TTS для полностью озвученных ответов NPC.
Узнать большеГенерируйте диалоги офлайн с помощью локальных LLM, затем управляйте синхронизацией губ на основе синтезированной речи для полностью офлайн-взаимодействий персонажей.
Узнать большеПодробная документация охватывает все режимы синтеза, управление моделями, конфигурацию с несколькими дикторами, потоковые сценарии работы и рекомендации для конкретных платформ.
Пошаговые руководства для всех функций, с примерами на Blueprint и C++
Активное Discord-сообщество с поддержкой разработчиков
Индивидуальная интеграция или разработка функций - [email protected]
Демо - загрузка голосовой модели и предпросмотр в редакторе

Доступен на Fab для UE 4.27 – 5.8. Включает все голосовые модели, полную документацию и демонстрационный проект, демонстрирующий потоковый TTS и голоса Kokoro.