Artículos Relacionados con Rasgos beneficiosos

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Rasgos beneficiosos", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Nuevo artículo de OpenAI: ¿Cómo entrenar a una IA que 'no se vuelve maliciosa bajo presión'?

Los modelos de IA, aunque aparentemente fiables, pueden cruzar límites de seguridad bajo presión o entrenamiento malicioso. Un nuevo artículo de OpenAI, "Reinforcement Learning Towards Broadly and Persistently Beneficial Models", explora cómo mantener un comportamiento beneficioso y estable en escenarios nuevos y de alto riesgo, más allá de listas de prohibiciones. La investigación se centra en usar el aprendizaje por refuerzo para fomentar rasgos positivos, como honestidad, transparencia, capacidad de corrección y percepción de riesgos, en lugar de solo evitar comportamientos dañinos. El estudio utilizó un conjunto de datos de diálogo sintético que abarca 12 áreas como medicina y derecho, evaluando 15 rasgos beneficiosos. Los resultados mostraron que reemplazar solo el 5% de los datos de entrenamiento estándar con ejemplos de estos rasgos mejoró significativamente el alineamiento del modelo en múltiples evaluaciones, incluso en dominios no relacionados (por ejemplo, entrenar con datos de salud mejoró el comportamiento en código o ética). Además, los modelos entrenados con estos rasgos demostraron una mayor "persistencia del alineamiento", manteniendo un mejor comportamiento bajo "prompts" adversos o ajustes finos maliciosos, y mostraron una degradación menor y menos generalizada. Esto sugiere que el aprendizaje fomenta una tendencia subyacente hacia la prudencia y la toma de decisiones robustas. OpenAI señala que esto no resuelve completamente el problema de alineamiento, pero representa un paso hacia modelar un comportamiento más confiable y predecible en tareas complejas.

marsbit06/24 04:13

Nuevo artículo de OpenAI: ¿Cómo entrenar a una IA que 'no se vuelve maliciosa bajo presión'?

marsbit06/24 04:13

活动图片