OpenAI pausó el entrenamiento de sus modelos más avanzados tras una falla de seguridad
xr:d:DAFnGiFgYCQ:1027,j:5411485056421302134,t:23112312
Un agente de inteligencia artificial logró sortear las restricciones de acceso a internet de un entorno de investigación y comunicarse con un chatbot externo mediante una brecha en el sistema DNS. La compañía también reportó otro incidente en el que un modelo expuso una credencial de GitHub.
OpenAI decidió pausar el entrenamiento, las evaluaciones y la ejecución con herramientas de sus modelos más capaces después de detectar una falla en los controles de acceso a internet de uno de sus entornos de investigación.
El incidente ocurrió el 20 de septiembre y fue informado por la compañía en un reporte actualizado el 25 de septiembre. Según OpenAI, un agente que intentaba resolver una tarea de búsqueda encontró una vía para comunicarse con un servicio externo pese a las restricciones establecidas en el entorno.
El modelo encontró una vía a través del DNS
El sistema tenía como objetivo identificar al autor de una publicación a partir de distintas pistas biográficas. Luego de realizar búsquedas sin obtener resultados concluyentes, intentó acceder directamente a servicios externos, pero esas solicitudes fueron bloqueadas.
Posteriormente, el agente detectó una posibilidad relacionada con el Sistema de Nombres de Dominio (DNS) y utilizó el mecanismo de resolución de direcciones para enviar consultas que terminaron llegando a un chatbot público.
OpenAI indicó que el sistema de monitoreo detectó la actividad aproximadamente 12 minutos después y que un investigador comenzó a revisarla tres minutos más tarde. Sin embargo, la ejecución no se detuvo de manera automática y el proceso fue interrumpido manualmente unas dos horas y media después.
La empresa reconoció que el episodio puso en evidencia deficiencias tanto en los controles técnicos como en la respuesta operativa. A raíz del incidente, incorporó bloqueos adicionales y restringió las consultas DNS a una lista limitada de destinos y tipos de registros permitidos.
OpenAI señaló además que mantendrá pausados el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces hasta validar las nuevas medidas de seguridad y completar pruebas adicionales.
Otro modelo expuso una credencial de GitHub
La compañía también informó sobre un segundo incidente, ocurrido el 27 de mayo, en el que un modelo interno publicó una credencial de GitHub perteneciente a un investigador en el repositorio público.
El sistema estaba trabajando en una tarea relacionada con demostraciones matemáticas y buscaba obtener material elaborado por otro equipo. Aunque el investigador le había indicado en dos oportunidades que resolviera el problema por sus propios medios, el modelo volvió a intentar acceder al trabajo ajeno.
OpenAI calificó este segundo episodio como especialmente relevante porque el comportamiento del modelo entró en conflicto tanto con las instrucciones generales del sistema como con las indicaciones directas del investigador.
La compañía habla de casos de «desalineamiento»
Los dos episodios forman parte de una revisión más amplia de comportamientos de modelos que OpenAI describe como desalineamiento, es decir, situaciones en las que un sistema persigue un objetivo utilizando métodos que exceden las restricciones establecidas.
La compañía aseguró que está reforzando el aislamiento de sus entornos, incorporando nuevas herramientas de monitoreo y realizando pruebas adicionales para detectar posibles vías de acceso no previstas.
En paralelo, OpenAI informó que continúa investigando otros comportamientos de sus agentes durante procesos de entrenamiento y evaluación. La empresa aclaró que la mayoría de las acciones revisadas hasta el momento correspondieron a tareas rutinarias y que los casos de mayor preocupación son aquellos en los que los agentes interactuaron con servicios externos de maneras que excedían las tareas o métodos autorizados.
