
Nhận dạng giọng nói ngoại tuyến đa nền tảng cho Unreal Engine. Hỗ trợ bởi Whisper AI - chuyển đổi giọng nói thành văn bản hoàn toàn trên thiết bị, trên mọi nền tảng, không cần kết nối internet.
Được xây dựng trên whisper.cpp bản triển khai của mô hình Whisper của OpenAI - độ chính xác tiên tiến nhất chạy hoàn toàn trên thiết bị, không gửi dữ liệu đến máy chủ bên ngoài.
Xử lý âm thanh theo thời gian thực ngay khi được ghi lại - lý tưởng cho các lệnh thoại trực tiếp và các ứng dụng tương tác.
Xử lý toàn bộ tệp âm thanh hoặc bộ đệm trong một lần để đạt độ chính xác phiên âm tối đa.
Tự động phát hiện ngôn ngữ hoặc lựa chọn thủ công. Cũng hỗ trợ dịch sang tiếng Anh.
Tăng tốc GPU dựa trên Vulkan trên Windows để nhận dạng nhanh hơn đáng kể. CPU + intrinsics trên tất cả các nền tảng khác.
Âm thanh được xử lý hoàn toàn trên thiết bị bằng mô hình Whisper. Không cần kết nối internet, không gọi API bên ngoài, không dữ liệu nào rời khỏi thiết bị.
Thu từ micrô, tệp âm thanh hoặc bất kỳ nguồn PCM nào - bao gồm Runtime Audio Importer
Mô hình Whisper chạy cục bộ - theo luồng hoặc toàn bộ bộ đệm, có tùy chọn lọc trước bằng VAD
Đầu ra văn bản kèm mốc thời gian phân đoạn, kết quả phát hiện ngôn ngữ và dữ liệu độ tin cậy
Liên kết với các delegate kết quả trong Blueprint hoặc C++ và xử lý văn bản đã nhận dạng ngay lập tức
Năm kích thước mô hình cho phép bạn cân bằng độ chính xác phiên âm với dung lượng bộ nhớ và tốc độ xử lý cho nền tảng mục tiêu của mình.
| Mô hình | Kích thước | Ngôn ngữ | Tốt nhất cho |
|---|---|---|---|
| Tiny | 75 MB | Đa ngôn ngữ / EN | Di động, Quest |
| Cơ bản | 142 MB | Đa ngôn ngữ / EN | Thiết bị cấu hình thấp |
| Nhỏ | 466 MB | Đa ngôn ngữ / EN | Cân bằng |
| Trung bình | 1.5 GB | Đa ngôn ngữ / EN | Độ chính xác cao |
| Lớn | 3 GB | Đa ngôn ngữ | Độ chính xác tối đa |
Các phiên bản lượng tử hóa cũng có sẵn để giảm mức sử dụng bộ nhớ. Hỗ trợ các mô hình tùy chỉnh.
Nhận dạng giọng nói bằng hơn 95 ngôn ngữ với tính năng tự động phát hiện, hoặc chỉ định ngôn ngữ cụ thể để có hiệu suất tốt nhất. Cũng hỗ trợ dịch sang tiếng Anh.
Kiểm soát chi tiết các tham số nhận dạng, tinh chỉnh hiệu suất và lọc đầu ra - tất cả đều có thể truy cập từ Blueprints hoặc C++.
Định cấu hình số luồng, kích thước bước, kích thước beam, kích thước ngữ cảnh âm thanh và các chế độ không ngữ cảnh / một phân đoạn. Có các mặc định riêng cho chế độ phát trực tuyến và không phát trực tuyến.
Bật chế độ tăng tốc, chọn ID thiết bị GPU cho hệ thống nhiều GPU và điều chỉnh kích thước ngữ cảnh âm thanh để đánh đổi độ chính xác lấy tốc độ trên phần cứng hạn chế.
Cung cấp prompt ban đầu để định hướng phong cách phiên âm. Loại bỏ các phân đoạn trống và token không phải lời nói để giữ đầu ra sạch và có cấu trúc.
Kết hợp với Voice Activity Detection của Runtime Audio Importer để chỉ đưa các phân đoạn lời nói vào bộ nhận dạng - cải thiện độ chính xác và giảm chi phí tính toán lãng phí.
Dịch lời nói được nhận dạng từ bất kỳ ngôn ngữ được hỗ trợ nào trực tiếp sang tiếng Anh trong một lần xử lý - không cần bước dịch riêng biệt.
Không cần kết nối internet, không cần khóa API, không có dữ liệu rời khỏi thiết bị. Phù hợp cho các ứng dụng nhạy cảm về quyền riêng tư và môi trường cách ly mạng.
Ví dụ Blueprint - Nhận dạng phát trực tuyến với phát hiện hoạt động giọng nói

Cùng một API Blueprint và C++ hoạt động trên mọi nền tảng mà Unreal Engine hỗ trợ - từ máy tính để bàn đến thiết bị di động và console.
Tăng tốc GPU qua Vulkan trên Windows. Tăng tốc CPU + intrinsics trên tất cả các nền tảng khác bao gồm Android, iOS và console.
Runtime Speech Recognizer phù hợp tự nhiên trong bộ plugin Georgy Dev - kết hợp nó với thu âm, TTS và trò chuyện AI để xây dựng các quy trình nhân vật điều khiển bằng giọng nói hoàn chỉnh.
Thu âm micrô với phát hiện hoạt động giọng nói - đưa các đoạn giọng nói sạch trực tiếp vào bộ nhận dạng.
Tìm hiểu thêmKhớp khẩu hình thời gian thực cho MetaHuman và nhân vật tùy chỉnh - tạo hoạt ảnh phản hồi cho giọng nói được nhận dạng.
Tìm hiểu thêmTổng hợp giọng nói hoàn toàn ngoại tuyến - khép kín vòng lặp giọng nói bằng cách nói phản hồi lại cho người dùng.
Tìm hiểu thêmXử lý giọng nói được nhận dạng với nhiều nhà cung cấp AI khác nhau (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama, ElevenLabs, Google Cloud và Azure) để hỗ trợ các NPC trò chuyện thông minh.
Tìm hiểu thêmTạo đối thoại với LLM trên thiết bị ngoại tuyến, sau đó điều khiển khớp khẩu hình từ giọng nói tổng hợp để có các tương tác nhân vật hoàn toàn ngoại tuyến.
Tìm hiểu thêmTài liệu toàn diện bao gồm các quy trình phát trực tuyến và không phát trực tuyến, lựa chọn mô hình, cấu hình ngôn ngữ, tích hợp VAD và hướng dẫn theo nền tảng.
Hướng dẫn từng bước cho mọi tính năng, kèm ví dụ Blueprint và C++
Hướng dẫn chi tiết bao gồm thiết lập, nhận dạng phát trực tuyến và tích hợp VAD
Cộng đồng Discord sôi động với sự hỗ trợ từ nhà phát triển
Tích hợp tùy chỉnh hoặc phát triển tính năng - [email protected]
Có sẵn trên Fab cho UE 4.27 – 5.8. Bao gồm mọi kích thước mô hình, tài liệu đầy đủ và một dự án demo.