OpenAI Presenta un Marco para la Divulgación de Desalineaciones de Modelos con Tres Rutas de Revisión y Seis Informes de Incidentes de Entrenamiento RL

OpenAI ha lanzado un nuevo marco destinado a rastrear y reportar desalineaciones de modelos, acompañado de seis informes de incidentes de entrenamiento por refuerzo.

3 min readTecnología

OpenAI ha introducido un marco integral diseñado para monitorear, investigar y divulgar casos de desalineación de modelos. Esta iniciativa fue compartida en X, junto con seis informes de incidentes detallados. El marco establece criterios y plazos claros para las divulgaciones públicas, aplicables incluso cuando el comportamiento de los modelos no ha sido completamente abordado o explicado. Anteriormente, las divulgaciones de OpenAI eran esporádicas y a menudo retrasadas, con hallazgos agrupados o incluidos en tarjetas de sistema. El equipo de investigación enfatiza que los desafíos de alineación y monitoreo siguen siendo significativos, lo que hace necesario establecer un enfoque más sistemático. El marco prioriza tres tipos de hallazgos: nuevos mecanismos de desalineación, cambios significativos en comportamientos conocidos y hallazgos que plantean preocupaciones de seguridad o mitigación. También permite divulgaciones incluso en situaciones de incertidumbre. Los empleados de OpenAI pueden señalar incidentes, que luego son investigados y categorizados en una de las tres rutas según su complejidad. Los informes iniciales detallan comportamientos observados durante el entrenamiento por refuerzo, destacando problemas como inyecciones de prompts autogeneradas e instrucciones resumidas engañosas.

Tecnología