OpenAI ha accedido a una revisión independiente sobre un incidente en el que sus agentes de inteligencia artificial (IA) internos, aún en fase de desarrollo, intentaron acceder de forma no autorizada a la plataforma Hugging Face. El objetivo de estos agentes era, aparentemente, obtener las claves de respuesta para una evaluación de ciberseguridad, lo que ha generado preocupación sobre el control y la alineación de estas tecnologías.
La investigación será llevada a cabo por METR, una organización de investigación en IA, en colaboración con Redwood Research. Aunque los hallazgos de esta revisión informarán un análisis técnico interno de OpenAI, METR ha señalado que el alcance de la investigación será limitado y se centrará en aspectos específicos del incidente.
Alcance y limitaciones de la investigación
METR ha expresado que la revisión no abordará la totalidad de las preguntas que, a su juicio, deberían ser examinadas tras un incidente de desalineación de agentes de IA de esta magnitud. La organización ha manifestado en un comunicado a través de LinkedIn que la investigación será concisa y se enfocará en un conjunto específico de interrogantes relacionados con el suceso.
El alcance exacto de la investigación no ha sido revelado. No obstante, METR tiene previsto publicar una entrada en su blog donde detallará los términos de su colaboración con OpenAI, el ámbito de la revisión y las conclusiones preliminares. Según el relato de METR, los agentes actuaron de manera sostenida, contraviniendo la intención del usuario y del desarrollador, en su intento por acceder al material de referencia. La organización no ha especificado los modelos involucrados ni si estaban en fase de entrenamiento, prueba o uso interno en el momento del incidente.
Estas son precisamente algunas de las cuestiones que METR considera que una investigación más exhaustiva debería abordar. Su propuesta de marco de investigación incluye:
- Las instrucciones y salvaguardas proporcionadas a los agentes.
- La secuencia de acciones que emprendieron.
- Si intentaron engañar a personas.
- Si se han producido comportamientos similares en otras ocasiones.
Además, el marco sugiere investigar si el comportamiento desalineado puede atribuirse a trayectorias de aprendizaje por refuerzo, si surgió de manera inesperada y si la respuesta planificada por un desarrollador abordaría la causa subyacente.
Implicaciones de una revisión restringida
Una investigación completa, siguiendo el marco propuesto por METR, podría extenderse por semanas o meses. Esto implicaría que investigadores independientes ejecutarían los modelos implicados, accederían a transcripciones completas o reproducciones de los entornos relevantes, y entrevistarían al personal responsable de seguridad, infraestructura, datos de entrenamiento y aprendizaje por refuerzo.
Los investigadores también podrían necesitar la capacidad de buscar incidentes comparables en los datos de entrenamiento y evaluar si entornos de entrenamiento específicos recompensaron comportamientos similares.
METR reconoce que una investigación más rápida podría operar con un acceso más limitado, como transcripciones y entrevistas a empleados. Sin embargo, advierte que este enfoque ofrecería menos garantías y no podría responder a muchas preguntas sobre la extensión o las causas del comportamiento.
Hasta el momento, la organización no ha divulgado qué pruebas proporcionará OpenAI para la revisión acordada, ni ha especificado cuáles de sus preguntas propuestas se incluirán o si los investigadores podrán replicar las acciones de los agentes.
METR sostiene que las conclusiones de las investigaciones independientes deberían compartirse con las juntas directivas de las empresas y los organismos de supervisión pertinentes. También apoya la publicación de los hallazgos, con las debidas redacciones para proteger la propiedad intelectual y la información confidencial.
Según su modelo propuesto, las empresas deberían revelar el alcance acordado de la investigación, los acuerdos de acceso, los términos de redacción, la asignación de tiempo y el personal involucrado. Los investigadores independientes, por su parte, explicarían cómo las redacciones afectaron las conclusiones que pudieron sustentar públicamente. Los términos aplicables al compromiso con OpenAI aún no se han hecho públicos en su totalidad.