Microsoft Mã Nguồn Mở Gia Đình AI Giọng Nói Tiên Phong VibeVoice: Xử Lý 90 Phút Hội Thoại Đa Người Nói Một Lần, GitHub Nhanh Chóng Đạt 27K Star
Microsoft vừa ra mắt bộ mô hình AI xử lý giọng nói mã nguồn mở VibeVoice, bao gồm nhận dạng giọng nói (ASR) và chuyển văn bản thành giọng nói (TTS). Dự án thu hút 27K sao trên GitHub nhờ khả năng xử lý đoạn hội thoại dài đa người nói, độ trễ thấp và hoạt động cục bộ không cần kết nối đám mây.
VibeVoice-ASR-7B xử lý audio dài tới 60 phút, xuất kết quả có cấu trúc với nhận diện người nói, dấu thời gian và hỗ trợ 50+ ngôn ngữ. VibeVoice-TTS-1.5B tạo audio dài 90 phút với tối đa 4 giọng nói tự nhiên, phù hợp cho podcast và sách nói. VibeVoice-Realtime-0.5B có độ trễ chỉ 300ms, thích hợp cho trợ lý ảo.
Dự án tích hợp cơ chế bảo mật như watermark và được phân phối trên GitHub và Hugging Face.
marsbit03/30 07:17