Runtime Speech Recognizer | Georgy Dev

Runtime Speech Recognizer

Nhận dạng giọng nói ngoại tuyến đa nền tảng cho Unreal Engine. Hỗ trợ bởi Whisper AI - chuyển đổi giọng nói thành văn bản hoàn toàn trên thiết bị, trên mọi nền tảng, không cần kết nối internet.

UE 4.27 – 5.8
Blueprints và C++
Hỗ trợ mọi nền tảng
95+ ngôn ngữ

Nhận dạng giọng nói ngoại tuyến, mọi nền tảng

Được xây dựng trên whisper.cpp bản triển khai của mô hình Whisper của OpenAI - độ chính xác tiên tiến nhất chạy hoàn toàn trên thiết bị, không gửi dữ liệu đến máy chủ bên ngoài.

Nhận dạng phát trực tuyến

Xử lý âm thanh theo thời gian thực ngay khi được ghi lại - lý tưởng cho các lệnh thoại trực tiếp và các ứng dụng tương tác.

Nhận dạng không theo luồng

Xử lý toàn bộ tệp âm thanh hoặc bộ đệm trong một lần để đạt độ chính xác phiên âm tối đa.

95+ ngôn ngữ

Tự động phát hiện ngôn ngữ hoặc lựa chọn thủ công. Cũng hỗ trợ dịch sang tiếng Anh.

Tăng tốc GPU

Tăng tốc GPU dựa trên Vulkan trên Windows để nhận dạng nhanh hơn đáng kể. CPU + intrinsics trên tất cả các nền tảng khác.

Cách thức hoạt động

Âm thanh được xử lý hoàn toàn trên thiết bị bằng mô hình Whisper. Không cần kết nối internet, không gọi API bên ngoài, không dữ liệu nào rời khỏi thiết bị.

1

Đầu vào âm thanh

Thu từ micrô, tệp âm thanh hoặc bất kỳ nguồn PCM nào - bao gồm Runtime Audio Importer

2

Xử lý trên thiết bị

Mô hình Whisper chạy cục bộ - theo luồng hoặc toàn bộ bộ đệm, có tùy chọn lọc trước bằng VAD

3

Phiên âm

Đầu ra văn bản kèm mốc thời gian phân đoạn, kết quả phát hiện ngôn ngữ và dữ liệu độ tin cậy

4

Logic trò chơi của bạn

Liên kết với các delegate kết quả trong Blueprint hoặc C++ và xử lý văn bản đã nhận dạng ngay lập tức

Chọn mô hình của bạn

Năm kích thước mô hình cho phép bạn cân bằng độ chính xác phiên âm với dung lượng bộ nhớ và tốc độ xử lý cho nền tảng mục tiêu của mình.

Mô hình Kích thước Ngôn ngữ Tốt nhất cho
Tiny 75 MB Đa ngôn ngữ / EN Di động, Quest
Cơ bản 142 MB Đa ngôn ngữ / EN Thiết bị cấu hình thấp
Nhỏ 466 MB Đa ngôn ngữ / EN Cân bằng
Trung bình 1.5 GB Đa ngôn ngữ / EN Độ chính xác cao
Lớn 3 GB Đa ngôn ngữ Độ chính xác tối đa

Các phiên bản lượng tử hóa cũng có sẵn để giảm mức sử dụng bộ nhớ. Hỗ trợ các mô hình tùy chỉnh.

Hỗ trợ ngôn ngữ phổ quát

Nhận dạng giọng nói bằng hơn 95 ngôn ngữ với tính năng tự động phát hiện, hoặc chỉ định ngôn ngữ cụ thể để có hiệu suất tốt nhất. Cũng hỗ trợ dịch sang tiếng Anh.

Tiếng Anh
Tiếng Trung
Tiếng Tây Ban Nha
Tiếng Pháp
Tiếng Đức
Tiếng Nhật
Tiếng Hàn
Tiếng Nga
Tiếng Ả Rập
Tiếng Hindi
Tiếng Bồ Đào Nha
+ 84 ngôn ngữ nữa
Xem danh sách ngôn ngữ đầy đủ

Kiểm soát nhận dạng đầy đủ

Kiểm soát chi tiết các tham số nhận dạng, tinh chỉnh hiệu suất và lọc đầu ra - tất cả đều có thể truy cập từ Blueprints hoặc C++.

Tham số nhận dạng

Định cấu hình số luồng, kích thước bước, kích thước beam, kích thước ngữ cảnh âm thanh và các chế độ không ngữ cảnh / một phân đoạn. Có các mặc định riêng cho chế độ phát trực tuyến và không phát trực tuyến.

Tinh chỉnh hiệu suất

Bật chế độ tăng tốc, chọn ID thiết bị GPU cho hệ thống nhiều GPU và điều chỉnh kích thước ngữ cảnh âm thanh để đánh đổi độ chính xác lấy tốc độ trên phần cứng hạn chế.

Kiểm soát Prompt & Đầu ra

Cung cấp prompt ban đầu để định hướng phong cách phiên âm. Loại bỏ các phân đoạn trống và token không phải lời nói để giữ đầu ra sạch và có cấu trúc.

Tích hợp VAD

Kết hợp với Voice Activity Detection của Runtime Audio Importer để chỉ đưa các phân đoạn lời nói vào bộ nhận dạng - cải thiện độ chính xác và giảm chi phí tính toán lãng phí.

Dịch

Dịch lời nói được nhận dạng từ bất kỳ ngôn ngữ được hỗ trợ nào trực tiếp sang tiếng Anh trong một lần xử lý - không cần bước dịch riêng biệt.

Hoàn toàn trên thiết bị

Không cần kết nối internet, không cần khóa API, không có dữ liệu rời khỏi thiết bị. Phù hợp cho các ứng dụng nhạy cảm về quyền riêng tư và môi trường cách ly mạng.

Ví dụ Blueprint - Nhận dạng phát trực tuyến với phát hiện hoạt động giọng nói

Nhận dạng giọng nói phát trực tuyến với ví dụ blueprint VAD

Hỗ trợ tất cả các nền tảng

Cùng một API Blueprint và C++ hoạt động trên mọi nền tảng mà Unreal Engine hỗ trợ - từ máy tính để bàn đến thiết bị di động và console.

Tăng tốc GPU qua Vulkan trên Windows. Tăng tốc CPU + intrinsics trên tất cả các nền tảng khác bao gồm Android, iOS và console.

Windows
Mac
Linux
Android
iOS
Meta Quest
PlayStation
Xbox
Nintendo Switch

Hệ sinh thái Plugin

Runtime Speech Recognizer phù hợp tự nhiên trong bộ plugin Georgy Dev - kết hợp nó với thu âm, TTS và trò chuyện AI để xây dựng các quy trình nhân vật điều khiển bằng giọng nói hoàn chỉnh.

Runtime Audio Importer

Thu âm micrô với phát hiện hoạt động giọng nói - đưa các đoạn giọng nói sạch trực tiếp vào bộ nhận dạng.

Tìm hiểu thêm

Runtime MetaHuman Lip Sync

Khớp khẩu hình thời gian thực cho MetaHuman và nhân vật tùy chỉnh - tạo hoạt ảnh phản hồi cho giọng nói được nhận dạng.

Tìm hiểu thêm

Runtime Text To Speech

Tổng hợp giọng nói hoàn toàn ngoại tuyến - khép kín vòng lặp giọng nói bằng cách nói phản hồi lại cho người dùng.

Tìm hiểu thêm

AI Chatbot Integrator

Xử lý giọng nói được nhận dạng với nhiều nhà cung cấp AI khác nhau (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud và Azure) để hỗ trợ các NPC trò chuyện thông minh.

Tìm hiểu thêm

Runtime Local LLM

Tạo đối thoại với LLM trên thiết bị ngoại tuyến, sau đó điều khiển khớp khẩu hình từ giọng nói tổng hợp để có các tương tác nhân vật hoàn toàn ngoại tuyến.

Tìm hiểu thêm

Tài liệu & Hỗ trợ

Tài liệu toàn diện bao gồm các quy trình phát trực tuyến và không phát trực tuyến, lựa chọn mô hình, cấu hình ngôn ngữ, tích hợp VAD và hướng dẫn theo nền tảng.

Tài liệu đầy đủ

Hướng dẫn từng bước cho mọi tính năng, kèm ví dụ Blueprint và C++

Video hướng dẫn

Hướng dẫn chi tiết bao gồm thiết lập, nhận dạng phát trực tuyến và tích hợp VAD

Cộng đồng & Hỗ trợ

Cộng đồng Discord sôi động với sự hỗ trợ từ nhà phát triển

Phát triển tùy chỉnh

Tích hợp tùy chỉnh hoặc phát triển tính năng - [email protected]

Sẵn sàng thêm nhận dạng giọng nói vào dự án của bạn?

Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm mọi kích thước mô hình, tài liệu đầy đủ và một dự án demo.