Microsoft abre en código abierto la familia de IA de voz VibeVoice: procesa 90 minutos de diálogo con múltiples hablantes de una sola vez, alcanza rápidamente 27K estrellas en GitHub
Microsoft ha lanzado como código abierto su familia de modelos de IA de voz VibeVoice, que incluye capacidades de reconocimiento de voz (ASR) y síntesis de voz (TTS). El proyecto, que ya cuenta con 27K estrellas en GitHub, destaca por procesar hasta 90 minutos de audio con múltiples hablantes, baja latencia y soporte para más de 50 idiomas.
Los modelos principales son:
- VibeVoice-ASR-7B: Transcribe audio de 60 minutos con identificación de hablantes y marcas de tiempo.
- VibeVoice-TTS-1.5B: Genera 90 minutos de audio con hasta 4 voces distintas y expresividad natural.
- VibeVoice-Realtime-0.5B: Ofrece síntesis en tiempo real con apenas 300 ms de delay.
El framework, bajo licencia MIT, permite despliegue local sin costes de suscripción e incluye medidas de seguridad como marcas de agua. Ya se han desarrollado herramientas prácticas como un teclado de voz para macOS y Windows.
marsbit03/30 07:18