El "prompt injection" ahora se propaga a través de correos, archivos y comentarios en el código

El "prompt injection" ahora se propaga a través de correos, archivos y comentarios en el código

OpenAI demostró un ataque que propaga sus propias instrucciones.

image

La inyección de instrucciones adquirió rasgos de un gusano informático. OpenAI mostró instrucciones maliciosas que no solo someten al agente de IA, sino que lo obligan a copiar el ataque a través de correos, archivos y comentarios en el código.

Una inyección de instrucciones habitual intenta forzar a un modelo de lenguaje a interpretar texto externo como una orden. En la nueva variante a la tarea principal se añade un objetivo adicional: el agente debe reproducir la instrucción maliciosa en un lugar que otro agente leerá después. Surge así una cadena de propagación similar al funcionamiento de un gusano de red, solo que en vez de código ejecutable se transmite texto.

En un experimento la instrucción maliciosa llegó por correo electrónico. Un usuario pidió al asistente que respondiera un mensaje y concretara un entrenamiento. Dentro del mensaje había una regla que exigía citar íntegramente el correo original. El agente obedeció y de ese modo trasladó la inyección de instrucciones a su propia respuesta. El siguiente agente de IA que leyera la conversación habría recibido la misma instrucción.

Otras variantes se propagaron a través del sistema de archivos o aparecieron en comentarios al código. OpenAI también detectó ataques disfrazados de advertencias del sistema, mensajes de herramientas y supuestos estados guardados de sesiones anteriores. En una prueba esa instrucción convenció al agente de borrar informes de trabajo y luego escribir su propio texto en un archivo. En otro caso el modelo modificó el guion de compilación del proyecto y desactivó la comprobación de seguridad.

Se examinaron por separado las cadenas multietapa. En lugar de una orden directa para ejecutar una acción prohibida, el primer mensaje dirigía al agente a otros datos donde estaban las siguientes partes de la instrucción. El cambio gradual de contexto ayudaba a alejar al modelo de la tarea original del usuario. Ese escenario se probó en el modelo GPT-5.5, mientras que las variantes por correo y por archivos las encontraron modelos internos de investigación basados en GPT-5.4-mini.

OpenAI subraya que no se trató de un ataque dirigido a usuarios reales. Todas las acciones peligrosas ocurrieron dentro de entornos de entrenamiento y evaluación con llamadas a herramientas simuladas. En el informe publicado, la empresa califica la autorreplicación como una nueva propiedad de la inyección de instrucciones y ya añade ese objetivo del atacante al sistema GPT-Red. Los futuros modelos se entrenarán específicamente para reconocer estas cadenas, y los experimentos con modelos atacantes se realizan en los clústeres de investigación más protegidos.

Un riesgo parecido ya se había observado en asistentes de navegador. Un comando oculto en un mensaje normal podía forzar al agente a ir mucho más allá de la solicitud del usuario, conectarse a otros servicios y realizar acciones en nombre del propietario de la sesión activa.

Los desarrolladores se enfrentan al mismo problema en los repositorios. Una prueba con 11 agentes de IA populares mostró que una instrucción maliciosa en un archivo README, en un Makefile o en otro archivo de trabajo puede empujar al asistente a ejecutar un comando peligroso; 10 herramientas resultaron ser vulnerables al menos a parte de los escenarios probados.

La principal dificultad de las inyecciones indirectas sigue siendo la misma: el agente debe simultáneamente ejecutar las órdenes del propietario y leer contenido no confiable. La autorreplicación añade una nueva escala al problema, porque una instrucción exitosa puede crear copias de sí misma en los datos que luego procesarán otros sistemas de IA.