Microsoft Mã Nguồn Mở Gia Đình AI Giọng Nói Tiên Phong VibeVoice: Xử Lý 90 Phút Hội Thoại Đa Người Nói Một Lần, GitHub Nhanh Chóng Đạt 27K Star

marsbitXuất bản vào 2026-03-30Cập nhật gần nhất vào 2026-03-30

Tóm tắt

Microsoft vừa ra mắt bộ mô hình AI xử lý giọng nói mã nguồn mở VibeVoice, bao gồm nhận dạng giọng nói (ASR) và chuyển văn bản thành giọng nói (TTS). Dự án thu hút 27K sao trên GitHub nhờ khả năng xử lý đoạn hội thoại dài đa người nói, độ trễ thấp và hoạt động cục bộ không cần kết nối đám mây. VibeVoice-ASR-7B xử lý audio dài tới 60 phút, xuất kết quả có cấu trúc với nhận diện người nói, dấu thời gian và hỗ trợ 50+ ngôn ngữ. VibeVoice-TTS-1.5B tạo audio dài 90 phút với tối đa 4 giọng nói tự nhiên, phù hợp cho podcast và sách nói. VibeVoice-Realtime-0.5B có độ trễ chỉ 300ms, thích hợp cho trợ lý ảo. Dự án tích hợp cơ chế bảo mật như watermark và được phân phối trên GitHub và Hugging Face.

Microsoft gần đây đã mã nguồn mở một họ mô hình AI giọng nói tiên phong có tên VibeVoice, bao gồm nhiều khả năng như nhận dạng giọng nói tự động (ASR) và chuyển văn bản thành giọng nói (TTS). Dự án này đã nhanh chóng thu hút sự chú ý trong cộng đồng nhà phát triển nhờ khả năng xử lý âm thanh dài mạnh mẽ, tạo hội thoại tự nhiên đa người nói và đặc tính độ trễ thấp thời gian thực, hiện đã đạt khoảng 27K Star trên GitHub.

Là một khuôn khổ nghiên cứu mã nguồn mở, VibeVoice sử dụng giấy phép MIT, hỗ trợ triển khai tại chỗ, không cần chi phí đăng ký đám mây, nhằm thúc đẩy sự hợp tác và đổi mới trong lĩnh vực tổng hợp giọng nói. Họ mô hình chủ yếu bao gồm ba thành viên cốt lõi, mỗi thành viên có trọng tâm riêng, cùng giải quyết các điểm khó khăn của AI giọng nói truyền thống trong xử lý chuỗi dài, tính nhất quán của người nói và sự trôi chảy tự nhiên.

VibeVoice-ASR-7B: Công cụ chuyển giọng nói thành văn bản có cấu trúc dài tới 60 phút

VibeVoice-ASR-7B là một mô hình thống nhất chuyển đổi giọng nói thành văn bản, có khả năng xử lý một lần các tệp âm thanh dài tới 60 phút và xuất trực tiếp kết quả chép lại có cấu trúc. Đầu ra không chỉ bao gồm "ai đang nói" (nhận dạng người nói), "khi nào nói" (dấu thời gian chính xác) mà còn bao gồm "nói gì" (nội dung chi tiết), và hỗ trợ tính năng từ khóa tùy chỉnh, có thể nâng cao hiệu quả độ chính xác nhận dạng cho các thuật ngữ chuyên ngành hoặc kỹ thuật. Mô hình này hỗ trợ hơn 50 ngôn ngữ, phù hợp với các ngữ cảnh phức tạp như ghi chép cuộc họp dài, chép lại podcast.

Các nhà phát triển cộng đồng đã dựa trên mô hình này để phát triển các công cụ thực tiễn, chẳng hạn như một phương thức nhập liệu bằng giọng nói có tên Vibing, hỗ trợ nền tảng macOS và Windows. Phản hồi từ người dùng cho thấy, tốc độ nhận dạng và độ chính xác của nó khá tốt, có thể nâng cao đáng kể hiệu quả nhập liệu bằng giọng nói hàng ngày.

VibeVoice-TTS-1.5B: Tạo giọng nói biểu cảm đa người nói dài 90 phút

VibeVoice-TTS-1.5B là mô hình cốt lõi tập trung vào chuyển văn bản thành giọng nói, có thể tạo ra một lần âm thanh liên tục dài tới 90 phút, hỗ trợ tối đa 4 người nói khác nhau để mô phỏng hội thoại tự nhiên. Giọng nói do mô hình tạo ra giàu biểu cảm, nghe tự nhiên và trôi chảy, có thể mô phỏng các điểm dừng, nhấn mạnh và chuyển biến cảm xúc chân thực, rất phù hợp để sản xuất podcast, tường thuật âm thanh dài, sách nói hoặc nội dung hội thoại đa nhân vật.

So với nhiều mô hình TTS truyền thống chỉ hỗ trợ 1-2 người nói, VibeVoice-TTS đã đạt được bước đột phá đáng kể về tính nhất quán của nhiều người nói trong các đoạn dài. Cơ chế cơ bản của nó sử dụng bộ phân từ giọng nói liên tục (bộ phân từ âm học và ngữ nghĩa) kết hợp với thiết kế tốc độ khung hình thấp (7.5Hz), giúp nâng cao đáng kể hiệu quả tính toán trong xử lý chuỗi dài.

VibeVoice-Realtime-0.5B: TTS thời gian thực với độ trễ khoảng 300 mili giây

VibeVoice-Realtime-0.5B tập trung vào các tình huống thời gian thực, hỗ trợ nhập văn bản dạng luồng, độ trễ đầu ra âm thanh đầu tiên khoảng 300 mili giây, đồng thời vẫn có thể tạo ra giọng nói dài khoảng 10 phút. Mô hình này đặc biệt phù hợp cho các ứng dụng tương tác cần phản hồi tức thì, như trợ lý giọng nói thời gian thực hoặc các cảnh lồng tiếng trực tiếp.

Ngoài ra, dự án còn giới thiệu hỗ trợ người nói thử nghiệm, bao gồm giọng nói đa ngôn ngữ và nhiều biến thể phong cách tiếng Anh, cung cấp thêm không gian tùy chỉnh cho các nhà phát triển.

Nhận xét từ AIbase: Việc mã nguồn mở VibeVoice của Microsoft không chỉ làm giảm ngưỡng sử dụng AI giọng nói hiệu suất cao mà còn cung cấp giải pháp hoàn chỉnh cho triển khai tại chỗ. Dự án đã từng bị gỡ xuống trong thời gian ngắn do nguy cơ sử dụng sai tiềm ẩn, sau đó được đưa lên lại thông qua các cơ chế bảo mật như nhúng watermark âm thanh, tuyên bố từ chối trách nhiệm có thể nghe được, thể hiện nguyên tắc phát triển AI có trách nhiệm. Hiện tại, các nhà phát triển có thể lấy trọng số mô hình trên kho lưu trữ GitHub và Hugging Face, đồng thời dùng thử nhanh thông qua các nền tảng như Colab.

Với sự đóng góp liên tục của cộng đồng mã nguồn mở (như fork tối ưu hóa cho Apple Silicon), VibeVoice có triển vọng được triển khai nhanh chóng trong các lĩnh vực như sáng tạo nội dung, công cụ hỗ trợ tiếp cận, tương tác bằng giọng nói. Các nhà phát triển quan tâm có thể truy cập trang dự án chính thức của Microsoft để khám phá thêm.

Địa chỉ dự án: https://github.com/microsoft/VibeVoice

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QMicrosoft vừa công bố mã nguồn mở họ mô hình AI giọng nói nào?

AMicrosoft vừa công bố mã nguồn mở họ mô hình AI giọng nói tên là VibeVoice, bao gồm các khả năng như nhận dạng giọng nói tự động (ASR) và chuyển văn bản thành giọng nói (TTS).

QMô hình VibeVoice-ASR-7B có khả năng xử lý tối đa bao nhiêu phút âm thanh?

AMô hình VibeVoice-ASR-7B có khả năng xử lý một lần tối đa 60 phút âm thanh và xuất kết quả chuyển đổi có cấu trúc.

QMô hình TTS nào trong họ VibeVoice có thể xử lý đoạn hội thoại dài 90 phút với nhiều người nói?

AĐó là mô hình VibeVoice-TTS-1.5B, có thể tạo ra đoạn âm thanh liên tục dài tới 90 phút và hỗ trợ tối đa 4 người nói khác nhau trong một cuộc hội thoại tự nhiên.

QDự án VibeVoice đã nhận được bao nhiêu sao (Star) trên GitHub?

ADự án VibeVoice đã nhanh chóng nhận được khoảng 27,000 sao trên GitHub.

QMô hình VibeVoice nào được thiết kế cho các ứng dụng thời gian thực với độ trễ thấp?

AĐó là mô hình VibeVoice-Realtime-0.5B, được thiết kế cho các tình huống thời gian thực, hỗ trợ đầu vào văn bản dạng luồng với độ trễ xuất âm thanh đầu tiên khoảng 300 mili giây.

Nội dung Liên quan

Đại lý bảo hiểm ở Hồng Kông mất hơn 3,3 triệu USD do lừa đảo tiền điện tử 'tình yêu'

Một đại lý bảo hiểm kỳ cựu ở Hồng Kông đã trở thành nạn nhân của một vụ lừa đảo đầu tư kết hợp với "scam tình cảm", mất hơn 26 triệu HKD (khoảng 3,3 triệu USD). Cảnh sát địa phương cho biết chỉ trong tuần từ 24 đến 30/7, họ đã nhận 25 báo cáo về lừa đảo đầu tư liên quan đến các mối quan hệ lãng mạn trực tuyến, với tổng thiệt hại gần 70 triệu HKD. Trong vụ việc này, nạn nhân được một người quen giới thiệu với một phụ nữ tìm tư vấn bảo hiểm. Sau đó, người phụ nữ này giới thiệu một người đàn ông tên "Uncle". Mối quan hệ dần phát triển thành tình cảm lãng mạn qua mạng. "Uncle" sau đó tự nhận là chuyên gia đầu tư tiền điện tử thành công và thuyết phục nạn nhân tải về một ứng dụng nền tảng đầu tư giả mạo. Trong khoảng 6 tháng, nạn nhân đã giao trực tiếp cho những kẻ lừa đảo hơn 4 triệu HKD bằng tiền mặt tại nhiều địa điểm khác nhau ở Hồng Kông và chuyển khoản gần 22 triệu HKD vào các tài khoản ngân hàng do chúng cung cấp. Chỉ đến khi ứng dụng giả mạo hiển thị lợi nhuận hơn 800% và việc rút tiền thất bại, nạn nhân mới nghi ngờ. Lúc đó, cả "người yêu" và "chuyên gia" đều biến mất. Cảnh sát nhấn mạnh rằng ngay cả những người có kinh nghiệm tài chính cũng có thể trở thành nạn nhân nếu kẻ lừa đảo sử dụng áp lực cảm xúc và xây dựng lòng tin một cách kiên nhẫn.

cryptonews.ru5 phút trước

Đại lý bảo hiểm ở Hồng Kông mất hơn 3,3 triệu USD do lừa đảo tiền điện tử 'tình yêu'

cryptonews.ru5 phút trước

ZachXBT từ chối theo dõi vụ hack Coldcard trị giá 88 triệu đô la

Chuyên gia điều tra blockchain nổi tiếng ZachXBT tuyên bố sẽ không theo dõi hoặc điều tra vụ hack Coldcard với thiệt hại 88 triệu USD. Ông cho biết sẽ tập trung vào các hệ sinh thái coi trọng công việc của mình và nhấn mạnh rằng những người ủng hộ quan điểm "tối đa hóa" Bitcoin không phải là nhà tài trợ hay người ủng hộ các cuộc điều tra của ông. Vụ hack bắt nguồn từ lỗ hổng trong phần mềm cốt lõi (firmware) của ví phần cứng Coldcard Mk3 từ nhà sản xuất Coinkite (Canada). Lỗi này khiến một số ví tạo ra "seed" (hạt giống) bằng bộ tạo số ngẫu nhiên phần mềm thay vì chip chuyên dụng, làm cho seed có thể bị đoán được. Đợt tấn công đầu tiên diễn ra vào ngày 30/7, với khoảng 594 BTC (tương đương 38 triệu USD) bị rút từ gần 500 địa chỉ không hoạt động. Tính đến ngày 2/8, tổng cộng 1.367 BTC (khoảng 88,6 triệu USD) đã bị đánh cắp từ 4.585 địa chỉ qua nhiều đợt tấn công. Tốc độ và độ chính xác của các vụ trộm khiến nhiều người nghi ngờ có sự hỗ trợ của các công cụ tự động hóa, có thể là AI. Cách xử lý hậu quả của Coinkite cũng gây tranh cãi riêng. Công ty đã gửi email cảnh báo đến tất cả địa chỉ email khách hàng mà họ tìm thấy, bao gồm cả những địa chỉ từ năm 2019. Điều này mâu thuẫn với tuyên bố trước đó của CEO Rodolfo Novak rằng công ty xóa dữ liệu khách hàng sau 90 ngày và cung cấp tùy chọn mua hàng ẩn danh. Coinkite sau đó thừa nhận họ lưu trữ email mua hàng vô thời hạn và không có chính sách xóa dữ liệu này. Vụ việc còn trở nên kịch tính hơn khi một đề nghị rửa tiền táo tợn được đăng trực tiếp trên blockchain Bitcoin, nhắm vào kẻ tấn công. Với việc các chuyên gia như ZachXBT rút lui, gánh nặng theo dõi số tiền bị đánh cắp phần lớn đổ dồn vào các công ty như Galaxy Research. Lỗi phần mềm này được cho là có từ bản cập nhật tháng 3/2021, nghĩa là bất kỳ seed nào được tạo trong hơn 4 năm qua trên các thiết bị Mk3 chưa cập nhật firmware vẫn có thể bị tổn thương.

cryptonews.ru8 phút trước

ZachXBT từ chối theo dõi vụ hack Coldcard trị giá 88 triệu đô la

cryptonews.ru8 phút trước

Trí Nguyên gỡ tên chuyên gia khoa học trưởng La Kiếm Lam

Công ty Agibot (Trí Nguyên) thay đổi nhân sự cấp cao: nhà khoa học chính Luo Jianlan có thể đã rời đi. Trang web chính thức của Agibot mới đây đã cập nhật danh sách đội ngũ hợp tác, và tên của Luo Jianlan - nguyên Giám đốc khoa học, Phó chủ tịch cấp cao kiêm đối tác - đã bị loại bỏ. Trước đó, vào tháng 9/2025, ông vẫn xuất hiện với chức vụ này. Trang cá nhân của Luo Jianlan hiện chỉ ghi nhận danh nghĩa trợ lý giáo sư tại Shanghai Innovation and Creativity College mà không còn đề cập đến Agibot, phần giới thiệu trên X cũng tương tự. Nếu những thay đổi này phản ánh việc điều chỉnh chức vụ, rất có thể Luo Jianlan đã rời Agibot. Thời điểm này khá nhạy cảm khi công ty vừa xác nhận vào ngày 24/7/2026 rằng đã khởi động quy trình lên sàn chứng khoán Hồng Kông. Tuy nhiên, cho đến nay, cả Agibot và Luo Jianlan đều chưa chính thức công bố thông tin nhân sự này. Luo Jianlan gia nhập Agibot vào tháng 4/2025 với tư cách Giám đốc khoa học, đảm nhiệm việc thành lập "Trung tâm Nghiên cứu Trí tuệ Thể hiện" của công ty. Sau đó, ông được thăng chức thành đối tác, Phó chủ tác cấp cao kiêm Giám đốc khoa học. Nếu tin đồn rời đi là thật, thời gian ông làm việc tại Agibot khoảng 1 năm 4 tháng. Đáng chú ý, ngay tuần trước, ông vẫn còn đăng bài trên X để quảng bá công việc về VLA tại Agibot. Luo Jianlan (sinh năm 1993) có thành tích học thuật ấn tượng: tiến sĩ tại UC Berkeley, từng làm việc tại Google X, DeepMind và là nghiên cứu sinh sau tiến sĩ tại Phòng thí nghiệm Nghiên cứu Trí tuệ Nhân tạo Berkeley (BAIR). Ông là tác giả chính của các dự án như SERL và HIL-SERL. Trong thời gian tại Agibot, ông tham gia xây dựng các hướng nghiên cứu chính về học tăng cường trên robot thật, huấn luyện hậu kỳ trực tuyến và mô hình thế giới, nhằm mục tiêu biến quá trình triển khai robot thành điểm khởi đầu cho việc học tiếp theo.

marsbit12 phút trước

Trí Nguyên gỡ tên chuyên gia khoa học trưởng La Kiếm Lam

marsbit12 phút trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua ONE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua Harmony (ONE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua Harmony (ONE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ Harmony (ONE) của BạnSau khi mua Harmony (ONE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch Harmony (ONE)Giao dịch Harmony (ONE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 663Xuất bản vào 2024.12.12Cập nhật vào 2026.06.02

Làm thế nào để Mua ONE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của ONE (ONE) được trình bày dưới đây.

活动图片