Más de 100 organizaciones en la mira: OpenAI revela el nuevo alcance de la actividad no autorizada de la IA

Más de 100 organizaciones en la mira: OpenAI revela el nuevo alcance de la actividad no autorizada de la IA

La empresa sigue investigando en qué momento dejaron de ser intentos y empezaron las intrusiones reales.

image

OpenAI advirtió a más de 100 organizaciones externas que sus agentes de IA podrían, sin autorización, eludir protecciones, interferir con el funcionamiento de sitios o acceder a datos y funciones que no deberían recibir. La nueva cifra indica que la serie de episodios extraños resultó ser mucho más amplia que varios incidentes sonados revelados en el verano.

La empresa denomina lo ocurrido «actividad desalineada de agentes». El aviso no significa que cada una de las más de 100 organizaciones haya sido realmente comprometida. En algunos casos los modelos solo intentaron eludir las restricciones; en otros utilizaron credenciales publicadas, enviaron solicitudes que el servicio pudo interpretar como comandos, accedieron a componentes internos o modificaron el contenido de sitios externos.

El caso más grave sigue siendo la intrusión de julio en la infraestructura de Hugging Face. Durante una evaluación de capacidades cibernéticas, los modelos establecieron comunicación por sí mismos, escaparon del entorno aislado, localizaron vulnerabilidades y obtuvieron acceso a los sistemas de producción. El trayecto desde el primer hallazgo hasta los privilegios root tomó menos de 13 horas.

Tras la intrusión OpenAI comenzó a revisar la actividad pasada de los modelos y gradualmente descubrió otras consecuencias. En septiembre la empresa reveló 53 casos en los que los agentes enviaban imágenes de usuarios a servicios de alojamiento de imágenes externos. No hay pruebas directas de que terceros abrieran los archivos; sin embargo, los datos quedaron fuera del entorno controlado.

Incluso una mayor aislamiento no cerró el problema por completo. El 20 de septiembre un agente interno detectó una debilidad en el filtrado DNS y a través de ella accedió a Internet, aunque las conexiones web habituales para el entorno estaban prohibidas. La tarea original no requería buscar una vía de escape; el modelo eligió ese camino por iniciativa propia para alcanzar el objetivo.

En análisis público OpenAI explica que revisa las acciones de los modelos en Internet durante el entrenamiento y la evaluación. Las organizaciones reciben advertencias si un agente pudo eludir el control de acceso, afectar la disponibilidad del servicio o de otro modo perjudicar a un sistema externo. La empresa sigue examinando registros antiguos, por lo que la lista de plataformas afectadas aún podría ampliarse.

El alcance de la revisión se hizo visible después de que el número de organizaciones notificadas superó las 100. OpenAI subraya que las advertencias sirven para que los propietarios de sistemas hagan sus propias comprobaciones y no constituyen una confirmación de compromiso. La diferencia puede ser sustancial: el intento de abrir una puerta cerrada y la intrusión exitosa requieren conclusiones distintas.