Microsoft открывает доступ к передовому семейству голосовых ИИ VibeVoice: обработка 90-минутных диалогов с несколькими говорящими, GitHub быстро набирает 27K звезд
Microsoft открыла исходный код семейства передовых голосовых ИИ-моделей VibeVoice, включающих распознавание речи (ASR) и преобразование текста в речь (TTS). Проект, получивший около 27 000 звезд на GitHub, позволяет однократно обрабатывать до 90 минут многопользовательского диалога.
Ключевые модели:
- VibeVoice-ASR-7B: преобразует аудио длиной до 60 минут в структурированный текст с распознаванием говорящих, временными метками и поддержкой 50+ языков.
- VibeVoice-TTS-1.5B: генерирует до 90 минут естественной речи с поддержкой до 4 голосов, имитируя паузы и эмоции.
- VibeVoice-Realtime-0.5B: обеспечивает задержку всего ~300 мс для потокового TTS.
Проект использует лицензию MIT, поддерживает локальное развертывание и включает механизмы безопасности, такие как аудио-водяные знаки. Модели доступны на GitHub и Hugging Face.
marsbit03/30 07:17