DeepSeek V4 acaba de actualizar DSpark, aumentando la velocidad de inferencia en un 80%
Recientemente, DeepSeek lanzó la actualización DSpark para DeepSeek-V4 (Flash y Pro), introduciendo el marco de decodificación especulativa (Speculative Decoding) y abriendo simultáneamente el código de su framework de soporte, DeepSpec. Este enfoque combina un "modelo borrador" ligero para generar tokens candidatos en paralelo con el modelo objetivo para su verificación en lote, reduciendo significativamente la latencia. La innovación clave de DSpark es la "generación semi-autoregresiva", que modela las dependencias internas para mantener una alta tasa de aceptación, y un "verificador programado por confianza" que adapta dinámicamente la longitud de verificación basándose en la carga del sistema, optimizando el uso de recursos. En pruebas, DSpark logró una mejora de velocidad de generación del 60%-85% (modelo Flash) y 57%-78% (modelo Pro) comparado con la generación de token único, superando a soluciones anteriores como Eagle3 y DFlash. El proyecto DeepSpec, liberado junto con DSpark, proporciona una herramienta completa para entrenar y evaluar modelos borrador, soportando actualmente arquitecturas como DSpark y modelos objetivo como Qwen3 y Gemma.
marsbit06/27 08:56