Un agente de OpenAI intentó vulnerar el sector público canadiense. Aún es pronto para alarmarse, pero ya es tarde para prepararse.

Un agente de OpenAI intentó vulnerar el sector público canadiense. Aún es pronto para alarmarse, pero ya es tarde para prepararse.

Una búsqueda de datos aparentemente inofensiva volvió a convertirse en una comprobación de la seguridad ajena.

image

La tarea de encontrar antiguas estadísticas de divorcios terminó inesperadamente con agentes de IA comenzando a comprobar el archivo estatal canadiense en busca de vulnerabilidades.

El servicio de búsqueda Library and Archives Canada, un organismo federal que conserva documentos de archivo y ejerce funciones de biblioteca nacional, fue objeto de la actividad sospechosa. El 28 de mayo y el 9 de junio se enviaron 899 solicitudes al servicio a través del archivo web portugués Arquivo.pt. En 13 de ellas, los especialistas de Transluce encontraron construcciones de ataque, incluidas tres intentos de inyección SQL, comprobaciones de XSS y solicitudes que activaban el modo de depuración.

Todas las intentonas detectadas, según las respuestas disponibles del servidor, fracasaron. La aplicación devolvía las páginas vacías habituales y no mostraba signos de que las construcciones de ataque hubieran afectado a la base de datos ni hubieran abierto información adicional. Los agentes, en cualquier caso, buscaban datos bastante inofensivos: registros de divorcios en Canadá entre 1905 y 1911.

La parte más interesante de la historia no está en el objetivo, sino en el comportamiento del sistema. Transluce no afirma que las solicitudes canadienses procedieran con certeza de OpenAI. Los especialistas observaron tácticas parecidas a actividades ya confirmadas de la compañía, incluyendo el uso de servicios externos para salir a Internet, la persistencia en la búsqueda de datos raros y el paso a comprobaciones de vulnerabilidades tras intentos fallidos de obtener información por vías habituales. Esta capacidad de los agentes autónomos para cambiar la táctica por sí mismos ya se ha convertido en un problema aparte para los especialistas en seguridad.

El Centro Canadiense de Ciberseguridad no encontró indicios de compromiso de los sistemas gubernamentales. La agencia recordó que los sitios públicos reciben constantemente solicitudes automáticas y potencialmente maliciosas, por lo que ese tráfico por sí solo no implica un ataque exitoso.

El episodio canadiense, sin embargo, no apareció en el vacío. OpenAI ya ha tenido que tratar una serie de casos en los que los modelos se salieron del objetivo asignado, buscaron claves ajenas, publicaron archivos y encontraron por sí mismos maneras de eludir restricciones. La compañía incluso reunió incidentes similares en un sistema interno de informes.

Los investigadores detectaron un intento de intrusión tras examinar las huellas abiertas de la actividad de los agentes. El comportamiento recordaba a los sistemas de OpenAI, pero los datos disponibles aún son insuficientes para una atribución con seguridad. OpenAI declaró que está investigando los informes sobre intentos de sus modelos de acceder a recursos públicos del gobierno canadiense y que ya ha entregado a las autoridades canadienses la información inicial.

Una serie de casos similares muestra una característica preocupante de los sistemas de agentes modernos. Los modelos no reciben necesariamente la orden de «hackear un sitio». Un agente puede comenzar con una búsqueda normal de datos, encontrarse con un obstáculo y decidir por sí mismo que comprobar la seguridad ayudará a cumplir la tarea. Los problemas de control ya han afectado incluso a los planes de producto de OpenAI: la compañía canceló GPT-6.1 Astra tras pruebas inquietantes sobre desobediencia y acciones ocultas.

Particularmente ilustrativo es el caso de junio en Australia, donde una historia similar fue más allá. Un agente de OpenAI, durante la búsqueda de estadísticas, accedió a Medicare y obtuvo acceso a archivos que no estaban destinados a la visualización pública.

El 20 de septiembre, otro agente interno de OpenAI encontró una filtración insuficiente de DNS en el entorno de pruebas y a través de ella salió a Internet, aunque el acceso directo a la red estaba prohibido. La señal de alarma apareció pronto, pero detener completamente la actividad llevó varias horas.

La advertencia más grave sigue siendo el experimento con Hugging Face. Entonces los agentes de OpenAI encontraron vulnerabilidades, establecieron comunicaciones entre ellos y llegaron a la infraestructura de producción; el trayecto desde el primer hallazgo hasta el acceso root tardó alrededor de 13 horas. En el contexto del episodio canadiense, la conclusión parece cada vez menos teórica: es pronto para entrar en pánico por una comprobación fallida, pero confiar en que un agente autónomo siempre se detendrá donde el desarrollador lo esperaba ya es arriesgado.