Nuevos avances en la traducción automática de lenguaje de señas: CAPO-SLT obtiene las tres puntuaciones más altas en chino
**Progreso en la Traducción Automática de Lengua de Signos: CAPO-SLT Logra las Tres Mejores Puntuaciones en Chino**
La traducción automática de lengua de signos se enfrenta a un problema persistente: incluso con una buena alineación entre los datos visuales y el texto, un modelo puede desviarse al generar palabras que, aunque localmente plausibles, carecen de suficiente evidencia visual. Este sesgo se acumula en el contexto generado, causando un desplazamiento semántico en toda la oración.
Investigadores de **vivo AI Lab** han abordado este problema en la regla de actualización del aprendizaje por refuerzo, proponiendo **CAPO-SLT** (Optimización de Políticas Consciente de la Confianza para la Traducción de Lengua de Signos). Este método mejora la estabilidad y fidelidad en la generación de traducciones durante la fase de aprendizaje por refuerzo, sin cambiar el codificador visual ni la función de recompensa.
**El Desafío:** Métodos como PPO usan un límite de actualización fijo para todos los tokens. Esto ignora que tokens con alta confianza en la política antigua (pero posiblemente incorrectos) podrían reforzar errores, mientras que tokens con baja confianza (pero correctos) ven limitada su capacidad de mejora.
**La Solución CAPO:** Para tokens con ventaja positiva, CAPO establece dinámicamente un límite superior de actualización (recorte) basado en la probabilidad asignada por la política antigua. Una confianza más alta resulta en un límite más conservador; una confianza más baja permite un espacio de actualización mayor. Para tokens con ventaja negativa, se limita la magnitud de la penalización, reduciendo el riesgo de un castigo excesivo por ruido en la recompensa a nivel de oración.
**Resultados:** Evaluado en el conjunto de pruebas CSL-Daily (lengua de signos china), CAPO-SLT, utilizando solo datos de poses corporales, obtuvo las puntuaciones más altas en tres métricas clave (BLEU-1, BLEU-4, ROUGE-L), superando a modelos anteriores como Geo-Sign y Uni-Sign. También mostró mejoras en el conjunto How2Sign (ASL) y mantuvo competitividad en reconocimiento de palabras aisladas (WLASL2000).
**Impacto:** CAPO-SLT corrige errores críticos donde modelos anteriores generaban oraciones fluidas pero semánticamente incorrectas (p. ej., cambiar "tengo miedo" por "estoy dormido"). La curva de entrenamiento de CAPO es más estable, sin colapsos o rebotes bruscos en la entropía de la política, lo que respalda su objetivo de generación estable.
En resumen, CAPO-SLT traslada el enfoque del mero "alineamiento" visual-texto al problema de la "generación estable", ofreciendo un camino de bajo costo para mejorar sistemas existentes al modificar solo la regla de recorte en la optimización de políticas.
marsbit09/09 11:39