Runtime MetaHuman Lip Sync | Georgy Dev

Runtime MetaHuman Lip Sync

Khớp khẩu hình thời gian thực, ngoại tuyến và đa nền tảng cho MetaHuman và nhân vật tùy chỉnh. Hỗ trợ ngôn ngữ phổ quát - hoạt động với mọi ngôn ngữ nói, trên mọi nền tảng. Phù hợp cho trò chơi, ki-ốt tương tác, sản xuất ảo, trợ lý kỹ thuật số, mô phỏng đào tạo và hơn thế nữa.

UE 5.0 – 5.8
Blueprints & C++
Windows, Mac, iOS, Linux, Android, Quest
MetaHuman và nhân vật tùy chỉnh

Chọn mô hình của bạn

Chọn mô hình phù hợp với yêu cầu của dự án - từ khả năng tương thích nền tảng rộng rãi đến hoạt hình khuôn mặt chất lượng điện ảnh với biểu cảm cảm xúc.

Tiêu chuẩn

Tương thích toàn diện

Được tối ưu hóa cho hiệu suất thời gian thực trên mọi nền tảng được hỗ trợ. Hoạt động với MetaHuman và bất kỳ nhân vật nào có morph target.

Xem trước mô hình Standard
  • 14 viseme với ánh xạ linh hoạt
  • Hoạt động với mọi hệ thống nhân vật
  • Phát hiện tiếng cười
  • Windows, Android, Quest
Chân thực

Độ trung thực hình ảnh nâng cao

81 bộ điều khiển khuôn mặt cho chuyển động miệng tự nhiên, chất lượng cao, dành cho MetaHuman và nhân vật tương thích ARKit. Có sẵn hai biến thể: Chân thực tiêu chuẩn và Mood-Enabled dành cho biểu cảm cảm xúc.

Xem trước mô hình Realistic
  • 81 bộ điều khiển khuôn mặt
  • MetaHuman và nhân vật tương thích ARKit
  • Chế độ toàn khuôn mặt hoặc chỉ miệng
  • Tất cả nền tảng bao gồm Mac và iOS

Biến thể Mood-Enabled

  • 12 loại tâm trạng với cường độ có thể tùy chỉnh
  • Vui, Buồn, Giận dữ, Tự tin, Phấn khích và hơn thế nữa

Cách hoạt động

Plugin phân tích trực tiếp các âm vị từ âm thanh thô - không yêu cầu phiên âm văn bản - khiến nó hoàn toàn độc lập với ngôn ngữ và phù hợp với mọi ngôn ngữ nói.

1

Đầu vào âm thanh

Micrô, TTS hoặc tệp âm thanh - bất kỳ nguồn dữ liệu âm thanh nào

2

Phân tích âm vị

Xử lý âm thanh độc lập với ngôn ngữ, trên thiết bị

3

Dữ liệu hoạt ảnh

Viseme hoặc các điều khiển khuôn mặt được tạo ra với ngữ cảnh tâm trạng tùy chọn

4

Phát lại thời gian thực

Được áp dụng cho nhân vật với các chuyển tiếp hòa trộn mượt mà

Nguồn âm thanh

Mọi nguồn âm thanh cung cấp dữ liệu PCM đều được hỗ trợ.

Đầu vào micrô

Khớp khẩu hình thời gian thực từ bản ghi micrô trực tiếp sử dụng sóng âm có thể thu được của Runtime Audio Importer.

Chuyển văn bản thành giọng nói

Tương thích với TTS ngoại tuyến cục bộ và các dịch vụ bên ngoài bao gồm ElevenLabs, OpenAI, Azure, Google Cloud và hơn thế nữa.

Tệp âm thanh và luồng

Xử lý các tệp âm thanh được ghi trước, các nguồn phát trực tiếp hoặc bất kỳ nhà cung cấp PCM tùy chỉnh nào.

Hỗ trợ nhân vật

Mặc dù tên gọi như vậy, plugin hoạt động tốt vượt ra ngoài phạm vi MetaHumans.

Unreal MetaHuman

Cả ba mô hình đều hỗ trợ MetaHumans, với đầu ra điều khiển khuôn mặt trực tiếp cho Realistic và Mood-Enabled.

Hệ thống nhân vật thương mại

Mô hình Standard hỗ trợ Daz Genesis 8/9, Reallusion CC3/CC4, Mixamo, ReadyPlayerMe, và hơn thế nữa thông qua ánh xạ viseme linh hoạt. Realistic và Mood-Enabled cũng hỗ trợ các hệ nhân vật này qua ARKit, ví dụ: CC3/CC4 được chuyển đổi sang ARKit khi xuất.

Nhân vật tùy chỉnh

Bất kỳ nhân vật nào có morph target đều có thể được cấu hình. Hỗ trợ các hệ thống âm vị FACS, Apple ARKit, Preston Blair và 3ds Max.

Mô hình Standard - Ví dụ nhân vật tùy chỉnh

Ví dụ về nhân vật tùy chỉnh
Ví dụ về nhân vật tùy chỉnh

Hỗ trợ mọi ngôn ngữ

Plugin xử lý trực tiếp các âm vị từ âm thanh thô thay vì dựa vào phiên âm văn bản, do đó về bản chất nó không phụ thuộc ngôn ngữ.

Tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Trung, tiếng Hàn, tiếng Nga, tiếng Ả Rập, tiếng Hindi, tiếng Bồ Đào Nha - và bất kỳ ngôn ngữ nói nào khác.

Tiếng Anh
Tiếng Tây Ban Nha
Tiếng Pháp
Tiếng Đức
Tiếng Nhật
Tiếng Trung
Tiếng Hàn
+ Bất kỳ

Tham chiếu nền tảng & mô hình

Tham chiếu nhanh về hỗ trợ nền tảng và khả năng của các mô hình.

Khả năng Standard Realistic Mood-Enabled
Bộ điều khiển hoạt ảnh 14 viseme 81 bộ điều khiển 81 + 12 trạng thái
MetaHuman
Nhân vật tùy chỉnh Thông qua ARKit Thông qua ARKit
Phát hiện tiếng cười
Windows
Mac / Linux / iOS
Android / Quest

Video

Các bản demo, hướng dẫn và video minh họa bao gồm tất cả các mô hình, nguồn âm thanh và quy trình tích hợp. Toàn bộ nội dung tương thích với Unreal Engine 5.0 đến 5.8.

Bản demo AI Speech-to-Speech

Quy trình hoàn chỉnh: nhận dạng giọng nói, chatbot AI, TTS và khớp môi thời gian thực.

Thiết lập nhân vật MetaHuman tùy chỉnh

Cách thêm nhân vật MetaHuman của riêng bạn vào dự án demo.

Khớp môi cho nhân vật ARKit

Thiết lập Animation Blueprint hoàn chỉnh cho nhân vật ARKit, với tệp âm thanh và ví dụ phát trực tuyến ElevenLabs.

Chớp mắt và theo dõi ánh nhìn

Chớp mắt tự động và ánh nhìn động bám theo camera của người chơi hoặc bất kỳ mục tiêu chuyển động nào, có thể cấu hình trong Face Animation Blueprint.

Avatar AI hội thoại thời gian thực

Giọng nói, khớp môi và hoạt họa khuôn mặt chạy trực tiếp trong Unreal Engine 5.

Bản demo mô hình Realistic

Trình diễn mô hình Realistic trên micro, TTS cục bộ, ElevenLabs và nhiều ngôn ngữ.

Khớp môi từ tệp/bộ đệm âm thanh

Thiết lập khớp môi chân thực bằng cách phát tệp âm thanh trên MetaHuman của bạn, cũng hoạt động với bộ đệm âm thanh.

TTS cục bộ với mô hình hỗ trợ cảm xúc

Chuyển văn bản thành giọng nói ngoại tuyến với khớp môi chất lượng cao nhận biết cảm xúc, 12 trạng thái cảm xúc với cường độ điều chỉnh được.

Tích hợp TTS bên ngoài

Mô hình Realistic với ElevenLabs & OpenAI để tạo đầu ra chất lượng cao cấp.

Micrô trực tiếp (Realistic)

Khớp môi thời gian thực từ đầu vào micrô sử dụng mô hình Realistic.

Micrô trực tiếp (Standard)

Khớp môi thời gian thực hiệu quả sử dụng mô hình Standard.

Chuyển văn bản thành giọng nói cục bộ

Khớp môi hoàn toàn ngoại tuyến với TTS cục bộ, không cần internet.

Hệ sinh thái plugin

Runtime MetaHuman Lip Sync tích hợp với bộ plugin Georgy Dev rộng hơn để xây dựng các pipeline nhân vật tương tác hoàn chỉnh.

Runtime Audio Importer

Nhập, phát trực tuyến và ghi âm thanh trong thời gian chạy để điều khiển hoạt ảnh khớp môi từ bất kỳ nguồn nào.

Tìm hiểu thêm

Runtime Speech Recognizer

Thêm nhận dạng giọng nói cho các nhân vật tương tác phản hồi lệnh thoại.

Tìm hiểu thêm

Runtime Text To Speech

Tổng hợp giọng nói ngoại tuyến với hơn 2800 giọng, tương thích hoàn toàn với mọi mô hình khớp môi.

Tìm hiểu thêm

Bộ tích hợp AI Chatbot

Hội thoại điều khiển bởi AI với phản hồi ngôn ngữ tự nhiên và hoạt ảnh môi được đồng bộ hóa.

Tìm hiểu thêm

Runtime Local LLM

Tạo hội thoại bằng LLM trên thiết bị ngoại tuyến, sau đó điều khiển khớp môi từ giọng nói tổng hợp để có tương tác nhân vật hoàn toàn ngoại tuyến.

Tìm hiểu thêm

Tài liệu & Hỗ trợ

Tài liệu toàn diện bao gồm cả ba mô hình - từ thiết lập ban đầu đến cấu hình nhân vật nâng cao, hoạt ảnh cảm xúc và ánh xạ viseme tùy chỉnh.

Tài liệu đầy đủ

Hướng dẫn từng bước cho tất cả các mô hình, tích hợp MetaHuman và nhân vật tùy chỉnh

Cộng đồng & Hỗ trợ

Cộng đồng Discord sôi nổi với sự hỗ trợ từ nhà phát triển

Phát triển tùy chỉnh

Tích hợp theo yêu cầu hoặc phát triển tính năng - [email protected]

Sẵn sàng thêm khớp môi vào dự án của bạn?

Có sẵn trên Fab cho UE 5.0 – 5.8. Bao gồm cả ba mô hình, tài liệu đầy đủ và các dự án demo.