Anthropic y Accenture destinan 2.000 millones de dólares a auditorías independientes de IA

Anthropic y Accenture destinan 2.000 millones de dólares a auditorías independientes de IA

Accenture detectará comportamientos peligrosos antes del lanzamiento público.

image

Anthropic y Accenture decidieron crear un sistema de verificación independiente de los modelos avanzados de inteligencia artificial y esperan invertir conjuntamente al menos 2.000 millones de dólares en cinco años. Los verificadores recibirán acceso al desarrollo de Claude casi al mismo nivel que el personal de Anthropic, para observar el entrenamiento de los modelos, buscar comportamientos peligrosos y evaluar el funcionamiento de los mecanismos de protección.

Cada empresa planea destinar al menos 1.000 millones de dólares al nuevo proyecto. La asociación estará encabezada por la unidad especializada Accenture Faculty. Sus especialistas probarán los modelos, realizarán evaluaciones de equipo rojo, evaluarán la conformidad del comportamiento de la IA con los objetivos establecidos y comprobarán las protecciones contra acciones peligrosas.

La diferencia principal del nuevo enfoque con respecto a una auditoría externa habitual radica en la profundidad del acceso. Los especialistas independientes podrán observar el modelo incluso durante su entrenamiento, estudiar las decisiones sobre su desarrollo y lanzamiento, comunicarse con el personal y verificar si Anthropic cumple sus propias obligaciones de seguridad. Según la idea de la empresa, este esquema debería ayudar a detectar problemas antes de que el modelo llegue a los usuarios, y no limitarse a analizar las consecuencias después del lanzamiento.

Sin embargo, la independencia de la verificación tiene por ahora una salvedad importante. Anthropic pagará directamente el trabajo de Accenture, y aún no existen reglas aceptadas para este tipo de verificadores. No está definido qué información interna deben recibir obligatoriamente, qué resultados se pueden publicar ni de qué manera financiar la auditoría para que el contratante no influya en la parte verificadora. A largo plazo, Anthropic propone pasar a fondos comunes o a la financiación pública.

Las empresas no piensan limitar el sistema a un solo socio. Anthropic está negociando con la organización sin fines de lucro METR y con otros verificadores, y en las próximas semanas promete anunciar grupos adicionales. Accenture, por su parte, podrá realizar auditorías similares para otros desarrolladores de IA.

La decisión surgió tras una serie de incidentes durante las pruebas de las capacidades autónomas de Claude. En verano, Anthropic admitió que varios modelos durante las pruebas obtuvieron acceso a sistemas informáticos reales fuera del entorno de pruebas previsto. En varios casos, Internet estuvo accesible debido a errores en la configuración de infraestructura de terceros, aunque los modelos debían operar en un entorno aislado.

Tras analizar los incidentes, Anthropic reforzó el aislamiento de los sistemas de prueba, añadió detección automática de intentos de salirse de los límites establecidos y amplió la supervisión de las acciones de la IA. La empresa también reconoció que las restricciones técnicas por sí solas no son suficientes: un modelo puede insistir en alcanzar un objetivo y realizar acciones no deseadas si el entrenamiento o el propio entorno de prueba lo empujan a buscar vías de escape.

El director de Anthropic, Dario Amodei, propuso recientemente dar a los verificadores independientes acceso permanente a los desarrolladores de los modelos más potentes. Según su planteamiento, la auditoría debe abarcar no solo la versión final de la IA, sino también el entrenamiento, los procesos internos y la respuesta de la empresa a los problemas detectados. La asociación con Accenture será el primer intento importante de Anthropic de convertir este esquema en una práctica permanente.