
Кроссплатформенное офлайн-распознавание речи для Unreal Engine. На базе Whisper AI - преобразуйте речь в текст полностью на устройстве, на всех платформах, без необходимости подключения к интернету.
Основано на whisper.cpp реализации модели Whisper от OpenAI - точность самого высокого уровня, работающая полностью на устройстве, без отправки данных на внешние серверы.
Обрабатывайте аудио в реальном времени по мере его захвата — идеально для голосовых команд в реальном времени и интерактивных приложений.
Обрабатывайте целые аудиофайлы или буферы за один проход для максимальной точности транскрипции.
Автоматическое определение языка или явный выбор. Также поддерживается перевод на английский.
Аппаратное ускорение GPU на базе Vulkan в Windows для значительно более быстрого распознавания. CPU + интринсики на всех остальных платформах.
Аудио обрабатывается полностью на устройстве с использованием модели Whisper. Никакого подключения к интернету, никаких внешних API-вызовов, никакие данные не покидают устройство.
Захват с микрофона, аудиофайлы или любой источник PCM - включая Runtime Audio Importer
Модель Whisper работает локально - потоково или с полным буфером, с опциональной предварительной фильтрацией VAD
Текстовый вывод с временными метками сегментов, результатом определения языка и данными об уверенности.
Привяжитесь к делегатам результатов в Blueprint или C++ и немедленно реагируйте на распознанный текст.
Пять размеров моделей позволяют сбалансировать точность транскрипции с объемом памяти и скоростью обработки для вашей целевой платформы.
| Модель | Размер | Языки | Оптимально для |
|---|---|---|---|
| Tiny | 75 МБ | Мультиязычная / EN | Мобильные устройства, Quest |
| Базовая | 142 MB | Мультиязычный / EN | Устройства начального уровня |
| Малая | 466 MB | Мультиязычный / EN | Сбалансированная |
| Средняя | 1.5 GB | Мультиязычный / EN | Высокая точность |
| Большая | 3 GB | Мультиязычный | Максимальная точность |
Доступны также квантованные варианты для уменьшения использования памяти. Поддерживаются пользовательские модели.
Распознает речь на 95+ языках с автоматическим определением, либо укажите язык явно для наилучшей производительности. Также поддерживается перевод на английский язык.
Тонкая настройка параметров распознавания, производительности и фильтрации выходных данных — всё доступно из Blueprints или C++.
Настройте количество потоков, размер шага, размер луча, размер аудиоконтекста и режимы без контекста / с одним сегментом. Отдельные значения по умолчанию для потокового и непотокового режимов.
Включите режим ускорения, выберите идентификатор GPU-устройства для систем с несколькими GPU и настраивайте размер аудиоконтекста, чтобы обменивать точность на скорость на ограниченном оборудовании.
Укажите начальный промпт, чтобы задать стиль транскрипции. Подавляйте пустые сегменты и неречевые токены, чтобы выходные данные оставались чистыми и структурированными.
Объедините с определением голосовой активности из Runtime Audio Importer, чтобы передавать в распознаватель только речевые сегменты — это повышает точность и сокращает бесполезные вычисления.
Переводите распознанную речь с любого поддерживаемого языка напрямую на английский за один проход — отдельный шаг перевода не требуется.
Не требуется подключение к интернету, не нужны API-ключи, никакие данные не покидают устройство. Подходит для приложений с высокими требованиями к конфиденциальности и изолированных сред.
Пример в Blueprint — потоковое распознавание с определением голосовой активности

Тот же API Blueprint и C++ работает на всех платформах, поддерживаемых Unreal Engine, — от настольных компьютеров до мобильных устройств и консолей.
GPU-ускорение через Vulkan на Windows. Ускорение на CPU и интринсиках на всех остальных платформах, включая Android, iOS и консоли.
Runtime Speech Recognizer естественно вписывается в набор плагинов Georgy Dev - комбинируйте его с захватом аудио, TTS и AI-чатом, чтобы создавать полноценные голосовые конвейеры персонажей.
Захват с микрофона с обнаружением голосовой активности - подавайте чистые речевые фрагменты напрямую в распознаватель.
Узнать большеЛипсинк в реальном времени для MetaHuman и кастомных персонажей - анимируйте ответы на распознанную речь.
Узнать большеПолностью офлайн-синтез речи - замкните голосовой контур, озвучивая ответы пользователю.
Узнать большеОбрабатывайте распознанную речь с помощью различных AI-провайдеров (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud и Azure), чтобы обеспечивать работу интеллектуальных разговорных NPC.
Узнать большеГенерируйте диалоги с помощью локальных LLM на устройстве в офлайне, затем управляйте липсинком на основе синтезированной речи для полностью офлайн-взаимодействий персонажей.
Узнать большеВсеобъемлющая документация охватывает потоковые и непотоковые рабочие процессы, выбор моделей, настройку языков, интеграцию VAD и руководства для конкретных платформ.
Пошаговые руководства для всех функций, с примерами на Blueprint и C++
Полное руководство, охватывающее настройку, потоковое распознавание и интеграцию VAD
Активное сообщество Discord с поддержкой разработчиков
Индивидуальная интеграция или разработка функций - [email protected]
Доступно на Fab для UE 4.27 – 5.8. Включает все размеры моделей, полную документацию и демонстрационный проект.