Runtime MetaHuman Lip Sync | Georgy Dev

Runtime MetaHuman Lip Sync

为 MetaHuman 和自定义角色提供实时、离线、跨平台的口型同步。 通用语言支持——适用于任何平台上的任何口语。 适用于游戏、交互式信息亭、虚拟制作、数字助手、培训模拟等。

UE 5.0 – 5.8
Blueprints 与 C++
Windows、Mac、iOS、Linux、Android、Quest
MetaHuman 与自定义角色

选择你的模型

选择符合你项目需求的模型——从广泛的平台兼容性 到具有情感表现的电影级面部动画。

标准

通用兼容性

针对所有受支持平台上的实时性能进行了优化。可与 MetaHuman 以及任何具有变形目标的角色配合使用。

标准模型预览
  • 14 个视素,支持灵活的 映射
  • 适用于所有角色 系统
  • 笑声检测
  • Windows、Android、Quest
写实

增强的视觉保真度

81 个面部控制项,为 MetaHuman 和兼容 ARKit 的角色带来自然、高质量的嘴部动作。 提供两种变体:标准写实版和用于情感表达的情绪模式版。

逼真模型预览
  • 81 个面部控制项
  • MetaHuman 与兼容 ARKit 的角色
  • 全脸或仅嘴部 模式
  • 所有平台,包括 Mac 与 iOS

Mood-Enabled 变体

  • 12 种情绪类型, 强度可配置
  • 开心、悲伤、愤怒、 自信、兴奋及更多

工作原理

该插件直接分析原始音频音素——无需文本转录——因此完全与语言无关,适用于任何口语。

1

音频输入

麦克风、TTS 或音频文件——任何音频数据源

2

音素分析

与语言无关的设备端音频处理

3

动画数据

视位或面部控制器,并可选择附带情绪上下文生成

4

实时播放

应用于角色,并带有平滑的混合过渡

音频源

支持任何提供 PCM 数据的音频源。

麦克风输入

使用 Runtime Audio Importer 的可捕获声波,从实时麦克风采集实现实时口型同步。

文本转语音

兼容本地离线 TTS 以及 ElevenLabs、OpenAI、Azure、Google Cloud 等外部服务。

音频文件与流

处理预先录制的音频文件、流媒体源或任何自定义 PCM 提供程序。

角色支持

尽管名称如此,该插件的适用范围远不止 MetaHuman。

Unreal MetaHuman

全部三种模型都支持 MetaHuman,其中 Realistic 和 Mood-Enabled 可输出直接的面部控制。

商业角色系统

Standard 模型通过灵活的视位映射支持 Daz Genesis 8/9、Reallusion CC3/CC4/CC5、Mixamo 等。Realistic 和 Mood-Enabled 也可通过 ARKit 支持这些,例如在导出时将 CC3/CC4/CC5 转换为 ARKit。

自定义角色

任何带有变形目标的角色均可配置。支持 FACS、Apple ARKit、Preston Blair 以及 3ds Max 音素系统。

Standard 模型 - 自定义角色示例

自定义角色示例
自定义角色示例

通用语言支持

该插件直接处理原始音频音素,而不依赖文本转录, 因此天生与语言无关。

英语、西班牙语、法语、德语、日语、中文、韩语、俄语、阿拉伯语、印地语、 葡萄牙语——以及任何其他口语。

英语
西班牙语
法语
德语
日语
中文
韩语
+ 任意语言

平台与模型参考

平台支持与模型功能的快速参考。

功能 Standard Realistic Mood-Enabled
动画控制项 14 个视位 81 个控制项 81 + 12 种情绪
MetaHuman
自定义角色 通过 ARKit 通过 ARKit
笑声检测
Windows
Mac / Linux / iOS
Android / Quest

视频

演示、教程和逐步讲解,涵盖所有模型、音频源和 集成工作流程。所有内容均兼容 Unreal Engine 5.0 至 5.8。

语音到语音 AI 演示

完整工作流程:语音识别、AI 聊天机器人、TTS 和实时 唇形同步。

自定义 MetaHuman 角色设置

如何将自己的 MetaHuman 角色添加到演示项目。

为 ARKit 角色进行唇形同步

为 ARKit 角色提供完整的动画蓝图设置,包含音频 文件和 ElevenLabs 流式传输示例。

眨眼与视线追踪

自动眨眼和动态视线,可跟随玩家摄像机 或任意 移动目标,可在面部动画蓝图中配置。

实时对话 AI 虚拟形象

语音、唇形同步和面部动画在 Unreal Engine 5 中实时运行。

基础唇形同步演示

展示 Realistic 模型在麦克风、本地 TTS、 ElevenLabs 和 多种语言下的效果。

从音频文件/缓冲区进行唇形同步

通过在你的 MetaHuman 上播放音频文件来设置逼真的唇形同步,也 适用于音频缓冲区。

来自远程服务器的唇形同步

通过 WebSocket 从流式音频源驱动实时唇形同步,音频以逐个数据块的方式导入和处理。

支持情绪模型的本地 TTS

离线文本转语音,具备情感感知的高质量唇形同步,12 种情绪,强度可调。

外部 TTS 集成

搭配 ElevenLabs 和 OpenAI 的 Realistic 模型,实现高品质输出。

实时麦克风(Realistic)

使用 Realistic 模型,从麦克风输入实现实时唇形同步。

本地文本转语音

使用本地 TTS 实现完全离线的唇形同步,无需互联网。

插件生态系统

Runtime MetaHuman Lip Sync 可与更广泛的 Georgy Dev 插件套件集成,构建完整的交互式角色工作流。

Runtime Audio Importer

在运行时导入、流式传输和采集音频,从任意来源驱动唇形同步动画。

了解更多

Runtime Speech Recognizer

添加语音识别,让交互式角色能够响应语音指令。

了解更多

Runtime Text To Speech

离线语音合成,提供 2800+ 种声音,与所有唇形同步模型完全兼容。

了解更多

AI 聊天机器人集成器

AI 驱动的对话,具备自然语言回复和同步的唇形动画。

了解更多

Runtime Local LLM

离线使用设备端 LLM 生成对话,然后通过合成的语音驱动唇形同步,实现完全离线的角色互动。

了解更多

文档与支持

全面的文档涵盖全部三种模型——从初始设置到高级角色配置、情感动画以及自定义视位映射。

完整文档

适用于所有模型、MetaHuman 集成和自定义角色的分步指南

社区与支持

活跃的 Discord 社区,提供开发者支持

定制开发

量身定制的集成或功能开发 - [email protected]

准备为你的项目添加口型同步了吗?

已在 Fab 上推出,支持 UE 5.0 – 5.8。包含全部三个模型、完整文档和演示项目。