Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Кроссплатформенное офлайн-распознавание речи для Unreal Engine. На базе Whisper AI - преобразуйте речь в текст полностью на устройстве, на всех платформах, без необходимости подключения к интернету.

UE 4.27 – 5.8
Blueprints и C++
Поддерживаются все платформы
95+ языков

Офлайн-распознавание речи — на любой платформе

Основано на whisper.cpp реализации модели Whisper от OpenAI - точность самого высокого уровня, работающая полностью на устройстве, без отправки данных на внешние серверы.

Потоковое распознавание

Обрабатывайте аудио в реальном времени по мере его захвата — идеально для голосовых команд в реальном времени и интерактивных приложений.

Непотоковое распознавание

Обрабатывайте целые аудиофайлы или буферы за один проход для максимальной точности транскрипции.

95+ языков

Автоматическое определение языка или явный выбор. Также поддерживается перевод на английский.

Ускорение GPU

Аппаратное ускорение GPU на базе Vulkan в Windows для значительно более быстрого распознавания. CPU + интринсики на всех остальных платформах.

Как это работает

Аудио обрабатывается полностью на устройстве с использованием модели Whisper. Никакого подключения к интернету, никаких внешних API-вызовов, никакие данные не покидают устройство.

1

Ввод аудио

Захват с микрофона, аудиофайлы или любой источник PCM - включая Runtime Audio Importer

2

Обработка на устройстве

Модель Whisper работает локально - потоково или с полным буфером, с опциональной предварительной фильтрацией VAD

3

Транскрипция

Текстовый вывод с временными метками сегментов, результатом определения языка и данными об уверенности.

4

Ваша игровая логика

Привяжитесь к делегатам результатов в Blueprint или C++ и немедленно реагируйте на распознанный текст.

Выберите модель

Пять размеров моделей позволяют сбалансировать точность транскрипции с объемом памяти и скоростью обработки для вашей целевой платформы.

Модель Размер Языки Оптимально для
Tiny 75 МБ Мультиязычная / EN Мобильные устройства, Quest
Базовая 142 MB Мультиязычный / EN Устройства начального уровня
Малая 466 MB Мультиязычный / EN Сбалансированная
Средняя 1.5 GB Мультиязычный / EN Высокая точность
Большая 3 GB Мультиязычный Максимальная точность

Доступны также квантованные варианты для уменьшения использования памяти. Поддерживаются пользовательские модели.

Универсальная поддержка языков

Распознает речь на 95+ языках с автоматическим определением, либо укажите язык явно для наилучшей производительности. Также поддерживается перевод на английский язык.

Английский
Китайский
Испанский
Французский
Немецкий
Японский
Корейский
Русский
Арабский
Хинди
Португальский
+ ещё 84
Просмотреть полный список языков

Полный контроль распознавания

Тонкая настройка параметров распознавания, производительности и фильтрации выходных данных — всё доступно из Blueprints или C++.

Параметры распознавания

Настройте количество потоков, размер шага, размер луча, размер аудиоконтекста и режимы без контекста / с одним сегментом. Отдельные значения по умолчанию для потокового и непотокового режимов.

Настройка производительности

Включите режим ускорения, выберите идентификатор GPU-устройства для систем с несколькими GPU и настраивайте размер аудиоконтекста, чтобы обменивать точность на скорость на ограниченном оборудовании.

Управление промптом и выходными данными

Укажите начальный промпт, чтобы задать стиль транскрипции. Подавляйте пустые сегменты и неречевые токены, чтобы выходные данные оставались чистыми и структурированными.

Интеграция VAD

Объедините с определением голосовой активности из Runtime Audio Importer, чтобы передавать в распознаватель только речевые сегменты — это повышает точность и сокращает бесполезные вычисления.

Перевод

Переводите распознанную речь с любого поддерживаемого языка напрямую на английский за один проход — отдельный шаг перевода не требуется.

Полностью на устройстве

Не требуется подключение к интернету, не нужны API-ключи, никакие данные не покидают устройство. Подходит для приложений с высокими требованиями к конфиденциальности и изолированных сред.

Пример в Blueprint — потоковое распознавание с определением голосовой активности

Потоковое распознавание речи: пример Blueprint с VAD

Поддерживаются все платформы

Тот же API Blueprint и C++ работает на всех платформах, поддерживаемых Unreal Engine, — от настольных компьютеров до мобильных устройств и консолей.

GPU-ускорение через Vulkan на Windows. Ускорение на CPU и интринсиках на всех остальных платформах, включая Android, iOS и консоли.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Экосистема плагинов

Runtime Speech Recognizer естественно вписывается в набор плагинов Georgy Dev - комбинируйте его с захватом аудио, TTS и AI-чатом, чтобы создавать полноценные голосовые конвейеры персонажей.

Runtime Audio Importer

Захват с микрофона с обнаружением голосовой активности - подавайте чистые речевые фрагменты напрямую в распознаватель.

Узнать больше

Runtime MetaHuman Lip Sync

Липсинк в реальном времени для MetaHuman и кастомных персонажей - анимируйте ответы на распознанную речь.

Узнать больше

Runtime Text To Speech

Полностью офлайн-синтез речи - замкните голосовой контур, озвучивая ответы пользователю.

Узнать больше

AI Chatbot Integrator

Обрабатывайте распознанную речь с помощью различных AI-провайдеров (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud и Azure), чтобы обеспечивать работу интеллектуальных разговорных NPC.

Узнать больше

Runtime Local LLM

Генерируйте диалоги с помощью локальных LLM на устройстве в офлайне, затем управляйте липсинком на основе синтезированной речи для полностью офлайн-взаимодействий персонажей.

Узнать больше

Документация и поддержка

Всеобъемлющая документация охватывает потоковые и непотоковые рабочие процессы, выбор моделей, настройку языков, интеграцию VAD и руководства для конкретных платформ.

Полная документация

Пошаговые руководства для всех функций, с примерами на Blueprint и C++

Видеоурок

Полное руководство, охватывающее настройку, потоковое распознавание и интеграцию VAD

Сообщество и поддержка

Активное сообщество Discord с поддержкой разработчиков

Индивидуальная разработка

Индивидуальная интеграция или разработка функций - [email protected]

Готовы добавить распознавание речи в ваш проект?

Доступно на Fab для UE 4.27 – 5.8. Включает все размеры моделей, полную документацию и демонстрационный проект.