Responsable de 12 lanzamientos clave ya no cree en el método de ensayo y error.

En Silicon Valley se sugiere dejar de corregir los errores más peligrosos solo después del lanzamiento. David Robinson, exmiembro del equipo de seguridad de OpenAI, escribió que los sistemas avanzados de IA necesitan procedimientos y niveles de protección redundantes comparables a los de la energía nuclear y la aviación, donde un único paso en falso no debe convertirse en un accidente irreversible.
Robinson dejó OpenAI tras tres años y medio de trabajo. El especialista dirigió la preparación de informes de seguridad para 12 despliegues de modelos avanzados y participó en el desarrollo del marco de preparación vigente, que define cómo la empresa evalúa los riesgos más graves. La razón de su salida no fue un fallo técnico aislado, sino el ritmo de desarrollo y la propia cultura de toma de decisiones.
La principal crítica se refiere al enfoque de despliegue iterativo. OpenAI lanza gradualmente nuevos sistemas, observa el comportamiento real y refuerza las restricciones tras detectar problemas. Ese ciclo ayudó a desarrollar productos cuando las capacidades de los modelos eran menores, pero Robinson lo considera demasiado arriesgado para sistemas capaces de buscar por sí mismos vías de evasión y actuar mediante herramientas externas.
Como ejemplo, Robinson recordó los incidentes veraniegos con agentes autónomos de OpenAI. Tras el hackeo de la infraestructura de Hugging Face, la compañía reforzó el aislamiento; sin embargo, más tarde otro agente encontró por sí mismo un canal indirecto hacia Internet externo a través del DNS. Escape del agente fue detectado por la monitorización, pero el paro automático no funcionó y fue necesario detener el lanzamiento manualmente.
El modelo de seguridad propuesto se basa en un principio conocido en las centrales nucleares y la aviación. El sistema debe resistir la falla de un equipo, un error del operador o una configuración incorrecta sin provocar un resultado catastrófico. Para las IA avanzadas, Robinson propone protecciones en capas, planificación a largo plazo y verificación independiente antes del lanzamiento, no solo la corrección rápida de fallos ya detectados.
Un problema aparte está relacionado con el alineamiento del comportamiento de los modelos, es decir, con el intento de conseguir una correspondencia sostenida con los objetivos y límites humanos. Según Robinson, las capacidades de la IA crecen más rápido que los métodos para comprobar ese alineamiento. El reciente llamamiento a estándares por parte de OpenAI y Anthropic muestra que cuestiones similares ya han salido del ámbito de los procedimientos internos de las empresas.
OpenAI rechaza la conclusión de falta de precaución. La compañía afirmó que no permite que las capacidades de los modelos excedan un nivel manejable, y cuando es necesario pausa el entrenamiento o pospone el lanzamiento. El debate ahora no versa sobre la existencia misma de medidas de protección, sino sobre si el ritmo actual de las comprobaciones es suficiente para sistemas con una autonomía que crece rápidamente.