Runtime MetaHuman Lip Sync | Georgy Dev

Runtime MetaHuman Lip Sync

Липсинк в реальном времени, офлайн и кроссплатформенный для MetaHuman и пользовательских персонажей. Универсальная поддержка языков — работает с любым разговорным языком на любой платформе. Подходит для игр, интерактивных киосков, виртуального производства, цифровых ассистентов, обучающих симуляций и многого другого.

UE 5.0 – 5.8
Blueprint и C++
Windows, Mac, iOS, Linux, Android, Quest
MetaHuman и пользовательские персонажи

Выберите модель

Выберите модель, которая соответствует требованиям вашего проекта — от широкой совместимости с платформами до лицевой анимации кинематографического качества с эмоциональной выразительностью.

Стандартный

Универсальная совместимость

Оптимизирован для производительности в реальном времени на всех поддерживаемых платформах. Работает с MetaHuman и любым персонажем с морф-таргетами.

Предпросмотр стандартной модели
  • 14 визем с гибким сопоставлением
  • Работает со всеми системами персонажей
  • Распознавание смеха
  • Windows, Android, Quest
Реалистичный

Повышенная визуальная точность

81 элемент управления мимикой для естественного движения рта высокого качества — для MetaHuman и персонажей, совместимых с ARKit. Доступно в двух вариантах: стандартный «Реалистичный» и «С поддержкой настроения» для эмоциональной выразительности.

Предпросмотр реалистичной модели
  • 81 элемент управления мимикой
  • MetaHuman и персонажи, совместимые с ARKit
  • Режимы «Всё лицо» или «Только рот»
  • Все платформы, включая Mac и iOS

Вариант с поддержкой настроения

  • 12 типов настроения с настраиваемой интенсивностью
  • Радость, грусть, злость, уверенность, воодушевление и многое другое

Как это работает

Плагин анализирует фонемы исходного аудио напрямую — без транскрипции текста — что делает его полностью независимым от языка и подходящим для любого разговорного языка.

1

Аудиовход

Микрофон, TTS или аудиофайлы — любой источник аудиоданных

2

Анализ фонем

Не зависящая от языка обработка аудио, на устройстве

3

Данные анимации

Виземы или контролы лица, генерируемые с опциональным контекстом настроения

4

Воспроизведение в реальном времени

Применяется к персонажу с плавными переходами смешивания

Источники аудио

Поддерживается любой источник аудио, предоставляющий PCM-данные.

Ввод с микрофона

Липсинк в реальном времени по захвату с микрофона с использованием захватываемой звуковой волны из Runtime Audio Importer.

Синтез речи

Совместимо с локальным офлайн-TTS и внешними сервисами, включая ElevenLabs, OpenAI, Azure, Google Cloud и другие.

Аудиофайлы и потоки

Обрабатывайте заранее записанные аудиофайлы, потоковые источники или любого пользовательского поставщика PCM.

Поддержка персонажей

Несмотря на название, плагин работает далеко не только с MetaHuman.

Unreal MetaHuman

Все три модели поддерживают MetaHuman, а для Realistic и Mood-Enabled предусмотрен прямой вывод контролов лица.

Коммерческие системы персонажей

Стандартная модель поддерживает Daz Genesis 8/9, Reallusion CC3/CC4/CC5, Mixamo и другие благодаря гибкому сопоставлению визем. Реалистичная модель и модель с поддержкой настроения также поддерживают их через ARKit, например, CC3/CC4/CC5, конвертированные в ARKit при экспорте.

Пользовательские персонажи

Можно настроить любого персонажа с морф-таргетами. Поддерживает FACS, Apple ARKit, Preston Blair и фонемные системы 3ds Max.

Стандартная модель — примеры пользовательских персонажей

Пример пользовательского персонажа
Пример пользовательского персонажа

Универсальная языковая поддержка

Плагин обрабатывает фонемы сырого аудио напрямую, вместо того чтобы полагаться на текстовую транскрипцию, что делает его по своей сути независимым от языка.

Английский, испанский, французский, немецкий, японский, китайский, корейский, русский, арабский, хинди, португальский — и любой другой разговорный язык.

Английский
Испанский
Французский
Немецкий
Японский
Китайский
Корейский
+ Любой

Справочник по платформам и моделям

Краткий справочник по поддержке платформ и возможностям моделей.

Возможность Стандартная Реалистичная С поддержкой настроения
Контролы анимации 14 визем 81 контрол 81 + 12 настроений
MetaHuman
Пользовательские персонажи Через ARKit Через ARKit
Обнаружение смеха
Windows
Mac / Linux / iOS
Android / Quest

Видео

Демо, руководства и пошаговые обзоры, охватывающие все модели, источники аудио и рабочие процессы интеграции. Весь контент совместим с Unreal Engine 5.0 – 5.8.

Демо Speech-to-Speech AI

Полный рабочий процесс: распознавание речи, AI-чатбот, TTS и липсинк в реальном времени.

Настройка пользовательского персонажа MetaHuman

Как добавить собственного персонажа MetaHuman в демонстрационный проект.

Липсинк для персонажей ARKit

Полная настройка Animation Blueprint для персонажей ARKit, с примерами аудиофайлов и потоковой передачи ElevenLabs.

Моргание глаз и отслеживание взгляда

Автоматическое моргание и динамичный взгляд, следующий за камерой игрока или любой движущейся целью, настраивается в Face Animation Blueprint.

Разговорный AI-аватар в реальном времени

Голос, липсинк и лицевая анимация, работающие в реальном времени в Unreal Engine 5.

Базовое демо липсинка

Демонстрация модели Realistic с микрофоном, локальным TTS, ElevenLabs и несколькими языками.

Липсинк из аудиофайла/буфера

Настройте реалистичный липсинк, воспроизводя аудиофайл на вашем MetaHuman; также работает с аудиобуферами.

Синхронизация губ с удалённого сервера

Управляйте синхронизацией губ в реальном времени из потокового аудиоисточника через WebSocket, при этом аудио импортируется и обрабатывается по частям.

Локальный TTS с моделью, поддерживающей настроения

Автономный синтез речи с высококачественной синхронизацией губ с учётом эмоций, 12 настроений с настраиваемой интенсивностью.

Интеграция внешнего TTS

Модель Realistic с ElevenLabs и OpenAI для вывода премиум-качества.

Микрофон в реальном времени (Realistic)

Синхронизация губ в реальном времени по входу с микрофона с использованием модели Realistic.

Локальный синтез речи

Полностью автономная синхронизация губ с локальным TTS, интернет не требуется.

Экосистема плагинов

Runtime MetaHuman Lip Sync интегрируется с более широким набором плагинов Georgy Dev для создания полноценных интерактивных пайплайнов персонажей.

Runtime Audio Importer

Импортируйте, передавайте потоком и захватывайте аудио во время выполнения, чтобы управлять анимациями синхронизации губ из любого источника.

Узнать больше

Runtime Speech Recognizer

Добавьте распознавание речи для интерактивных персонажей, которые реагируют на голосовые команды.

Узнать больше

Runtime Text To Speech

Автономный синтез речи с более чем 2800 голосами, полностью совместимый со всеми моделями синхронизации губ.

Узнать больше

Интегратор AI-чат-ботов

Диалоги на основе AI с ответами на естественном языке и синхронизированной анимацией губ.

Узнать больше

Runtime Local LLM

Генерируйте диалоги с помощью локальных LLM в офлайн-режиме, затем управляйте синхронизацией губ на основе синтезированной речи для полностью офлайн-взаимодействий с персонажами.

Узнать больше

Документация и поддержка

Комплексная документация охватывает все три модели — от первоначальной настройки до продвинутой конфигурации персонажей, эмоциональной анимации и пользовательского сопоставления визем.

Полная документация

Пошаговые руководства для всех моделей, интеграции с MetaHuman и пользовательских персонажей

Сообщество и поддержка

Активное сообщество Discord с поддержкой разработчиков

Индивидуальная разработка

Интеграция или разработка функций под ваши задачи - [email protected]

Готовы добавить синхронизацию губ в свой проект?

Доступно на Fab для UE 5.0 – 5.8. Включает все три модели, полную документацию и демонстрационные проекты.