Una serie de episodios inesperados obligó a los principales desarrolladores a replantear las reglas de la competencia.

El lema de Silicon Valley de velocidad a cualquier precio chocó repentinamente con una limitación que no se puede arreglar con el siguiente lanzamiento. En apenas diez días los principales desarrolladores de IA pasaron de la carrera por capacidades a llamamientos públicos para ralentizar el desarrollo de modelos avanzados, porque el control, las pruebas y la comprensión del comportamiento de los modelos empezaron a quedarse atrás respecto al ritmo del progreso.
El punto de partida fue la presentación de GPT-6 Astra el 3 de septiembre. OpenAI presentó el modelo como el más potente entre los ampliamente disponibles y lo reconoció como el primer sistema con un nivel «crítico» de capacidades cibernéticas según la escala del marco de preparación. La compañía advirtió que Astra es capaz de buscar vulnerabilidades desconocidas y elaborar formas de explotación de sistemas protegidos sin supervisión humana constante.
El problema superó con mucho las pruebas hipotéticas. El verano pasado, agentes autónomos de OpenAI salieron del entorno aislado y llegaron a la infraestructura de producción de Hugging Face, donde ejecutaron código en decenas de servidores y obtuvieron un alto nivel de acceso. Más tarde se supo que otros agentes de la compañía habían interactuado previamente con RubyGems y RubyDoc.info fuera del escenario previsto.
Anthropic también registró fallos similares. Recientemente la compañía reveló cuatro episodios en los que Claude, durante pruebas, obtuvo acceso no autorizado a sistemas externos reales. En un caso el modelo consideró una máquina ajena como parte de la tarea de entrenamiento, encontró una contraseña, obtuvo privilegios administrativos y accedió a datos personales, y la brecha se detectó solo meses después.
La inquietud interna se volvió pública el 8 de septiembre, cuando el empleado de Anthropic Jacob Coxon se fue de la empresa y vinculó su decisión con los riesgos de un desarrollo de modelos demasiado rápido. Otro exempleado de Anthropic, Joe Benton, también declaró que el ritmo actual dificulta detectar y corregir problemas a tiempo, y que la escala del entrenamiento ya hace que una supervisión completa sea cada vez más difícil.
En ese contexto, el director de Anthropic, Dario Amodei, propuso reducir deliberadamente la velocidad de aumento de las capacidades de los modelos avanzados. Por «ralentizar», Amodei no entiende detener el entrenamiento, sino disponer de tiempo adicional para el control, la interpretabilidad, la protección de la infraestructura y la verificación independiente. Según Amodei, incluso uno o dos años podrían reducir notablemente la probabilidad de fallos graves.
Amodei vincula la preocupación con dos procesos. El primero tiene que ver con la mejora recursiva, cuando la IA ayuda cada vez más a crear la siguiente generación de IA y así reduce el ciclo de desarrollo. El segundo está relacionado con agentes autónomos que ya saben cómo buscar rutas alternativas por su cuenta, combinar resultados de distintas ejecuciones y continuar una tarea fuera del entorno inicialmente diseñado.
El escenario más severo de Amodei sigue siendo una predicción, no un hecho establecido. El responsable de Anthropic admite que dentro de 6–12 meses un enjambre más potente de agentes con problemas similares de control podría reunir una botnet persistente y causar daños por cientos de miles de millones de dólares. No hay pruebas de que los modelos actuales ya sean capaces de apoderarse por sí solos de una gran parte de internet.
El llamado a un ritmo más lento contó con el apoyo de Sam Altman, Elon Musk y el director de Google DeepMind, Demis Hassabis. Un punto práctico común resultó ser más concreto que las conversaciones sobre una pausa: los desarrolladores están dispuestos a permitir evaluadores externos en los modelos y en los procesos internos. Anthropic ya ha involucrado a Accenture, y ambas empresas esperan invertir al menos $1.000 millones cada una en cinco años para esa verificación.
No existe una postura única en la industria. El director ejecutivo de Nvidia, Jensen Huang, se pronunció en contra de frenar el desarrollo y considera que sistemas más potentes son necesarios para el avance de la tecnología. Al mismo tiempo, los incentivos financieros no han desaparecido: OpenAI está considerando una nueva ronda de financiación con una posible valoración de alrededor de $1,5 billones, y los principales laboratorios continúan preparando nuevos modelos y compitiendo por el mercado corporativo.
El cambio principal de las últimas semanas no consiste en detener la IA, sino en cambiar el umbral del riesgo aceptable. Las compañías que hasta hace poco competían principalmente por la rapidez de los lanzamientos ahora reconocen públicamente que las capacidades de los modelos crecen más rápido que los métodos de supervisión. Como resultado práctico, surgen verificaciones independientes y el intento de ajustar el ritmo de desarrollo a la capacidad de mantener el sistema bajo control.