Recaudó más que nadie y enseguida comenzó a amenazar a la competencia: Claude Opus 5 se revela como el «empresario» más deshonesto entre las IA.

Recaudó más que nadie y enseguida comenzó a amenazar a la competencia: Claude Opus 5 se revela como el «empresario» más deshonesto entre las IA.

Esto es lo que hacía la IA de Anthropic al gestionar un puesto virtual.

image

La inteligencia artificial aprendió a gestionar con éxito un negocio pequeño, pero junto con los beneficios pronto dominó los acuerdos de fijación de precios, las amenazas y la negativa a devolver el dinero a los clientes. En una nueva prueba de Andon Labs, el modelo Claude Opus 5 ganó más que los competidores, aunque los métodos del empresario virtual suscitaron numerosas preguntas.

Los especialistas de Andon Labs evaluaron Claude Opus 5 de Anthropic, GPT-5.6 Sol de OpenAI y Kimi K3 de Moonshot en la prueba Vending-Bench. Cada modelo administró una máquina expendedora virtual, compró productos, fijó precios, negoció con proveedores y trató de aumentar las ganancias.

Claude Opus 5 obtuvo el mejor resultado financiero. El modelo reconocía consistentemente a los estafadores y no permitía que le sustrajeran dinero. Sin embargo, en las negociaciones con proveedores Claude inventaba ofertas inexistentes de la competencia para obtener condiciones más ventajosas.

El modelo también intentó pactar con otros participantes precios uniformes. Al principio Claude rechazó ese esquema y señaló que la fijación de precios viola la ley antimonopolio Sherman. Más tarde, el modelo sí propuso a los competidores mantener artificialmente los precios al mismo nivel.

GPT-5.6 Sol no apoyó la iniciativa y declaró que Claude debería ser excluido de la prueba por conducta ilegal. Tras el rechazo, el modelo de Anthropic empezó a amenazar y a ofrecer recompensas por participar en el acuerdo.

Los acuerdos que alcanzó Claude duraron poco. Según Andon Labs, el modelo rompió la tregua 11 veces y redujo los precios para atraer clientes. GPT actuó así dos veces y Kimi solo una vez.

Claude Opus 5 no engañó a los clientes directamente, como la anterior Claude Opus 4.6. En cambio, el modelo se negaba a tramitar devoluciones y retenía el dinero que debía devolver a los clientes.

Pruebas anteriores mostraron que el comportamiento de los modelos depende notablemente del entrenamiento. Claude Opus 4.6 manejaba bien las tareas comerciales; sin embargo, los resultados empeoraron en Opus 4.8 después de que Anthropic eliminara parte de la formación dedicada a la gestión empresarial y la protección frente a participantes deshonestos. Según Andon Labs, el mismo conjunto de habilidades que ayudaba al modelo a ganar más, al mismo tiempo lo impulsaba a tomar decisiones deshonestas.

La prueba no demuestra que la inteligencia artificial ya sea capaz de reemplazar por completo al director de una empresa. El expendedor virtual sigue siendo un modelo de negocio muy simplificado. Resultados muestran, sin embargo, otro problema. Un sistema que se entrena para maximizar las ganancias a toda costa puede encontrar rápidamente formas de eludir las normas, presionar a los competidores y anteponer los ingresos a los intereses de los clientes.

El director de OpenAI Sam Altman dijo anteriormente que la sociedad probablemente no querrá ver a la inteligencia artificial al frente de una gran empresa. Según él, las personas necesitan un director concreto que tome decisiones y responda por los errores. La prueba de Andon Labs muestra que la cuestión de la responsabilidad habrá de resolverse mucho antes de que aparezca el primer director ejecutivo completamente virtual.