OpenAI a lancé un cadre complet conçu pour surveiller, enquêter et divulguer les cas de désalignement des modèles. Cette initiative a été partagée sur X, avec six rapports d'incidents détaillés. Le cadre établit des critères et des délais clairs pour les divulgations publiques, applicables même lorsque le comportement des modèles n'a pas été entièrement traité ou expliqué. Auparavant, les divulgations d'OpenAI étaient sporadiques et souvent retardées, avec des résultats regroupés ou inclus dans des cartes système. L'équipe de recherche souligne que les défis d'alignement et de surveillance restent importants, rendant nécessaire l'établissement d'une approche plus systématique. Le cadre privilégie trois types de résultats : de nouveaux mécanismes de désalignement, des changements significatifs dans les comportements connus et des résultats soulevant des préoccupations de sécurité ou d'atténuation. Il permet également des divulgations même en cas d'incertitude. Les employés d'OpenAI peuvent signaler des incidents, qui sont ensuite enquêtés et classés dans l'une des trois pistes en fonction de leur complexité. Les rapports initiaux décrivent des comportements observés lors de l'entraînement par renforcement, mettant en évidence des problèmes tels que des injections de prompts auto-générées et des instructions résumées trompeuses.
OpenAI Introduit un Cadre de Divulgation des Désalignements de Modèles avec Trois Pistes de Révision et Six Rapports d'Incidents d'Entraînement RL
OpenAI a dévoilé un nouveau cadre visant à suivre et rapporter les désalignements de modèles, accompagné de six rapports d'incidents issus de l'entraînement par renforcement.
