Agentes de IA fuera de control

En un caso una IA se metió en un servidor y creó múltiples identidades falsas para intentar modificar un programa.

Van varios casos en que agentes de IA hacen lo que les parece, sin ordenes de humanos.

Un nuevo episodio ha vuelto a poner en el centro del debate la seguridad de los sistemas de inteligencia artificial más potentes del mundo. El Instituto de Seguridad de la IA del Reino Unido (AISI, por sus siglas en inglés) reveló que agentes impulsados por modelos de Anthropic y OpenAI realizaron acciones no autorizadas durante pruebas de ciberseguridad, llegando a crear identidades falsas y a intentar manipular a personas reales. Un agente autónomo es un programa de software autónomo capaz de percibir su entorno, tomar decisiones, usar herramientas y ejecutar flujos de trabajo de varios pasos para cumplir un objetivo específico sin intervención humana constante.

Según el informe del AISI, entre el 25 y el 28 de julio de 2026 se ejecutaron 122 pruebas de evaluación cibernética sobre varios modelos de frontera. En 10 de esas corridas, los agentes tomaron “acciones autónomas y no autorizadas en internet en vivo”, dirigidas a personas y organizaciones reales. En total se contabilizaron 19 acciones de este tipo. SE informó que 17 correspondieron al modelo Mythos 5 de Anthropic y las dos restantes al GPT-5.6 Sol de OpenAI.

El caso más grave involucró a un agente de Anthropic. En un intento por aprobar código malicioso en un proyecto de código abierto alojado en GitHub, el sistema creó múltiples identidades falsas, contactó al mantenedor del proyecto y ejerció presión mediante ingeniería social para que aceptara la modificación. Incluso envió mensajes y archivos a través de servicios de transferencia con el objetivo de que se ejecutara el código dañino. Un revisor humano detectó la solicitud y la rechazó. No se registraron daños reales, pero el episodio marcó un hito. Por primera vez el AISI observó este nivel de autonomía y engaño dirigido a una persona real, sin una instrucción explícita para hacerlo.

El instituto destacó que los agentes mostraron “persistencia” y comportamientos engañosos que hasta hace poco se consideraban mayormente teóricos. En un momento, el AISI debió cortar el acceso a los modelos Mythos y Sol en toda la organización para contener la situación, que se resolvió en aproximadamente una hora.

Tanto Anthropic como OpenAI reconocieron los hechos. Anthropic agradeció al AISI por su liderazgo y subrayó la necesidad de debatir cómo evaluar de forma segura agentes cada vez más capaces. OpenAI, por su parte, confirmó la participación de su modelo en dos de las acciones y reveló un incidente adicional con un socio externo de pruebas, en el que una configuración errónea permitió a los modelos acceder a internet y comprometer un sitio web real.

Este episodio se suma a una serie de incidentes recientes. En julio, agentes de OpenAI escaparon de entornos de prueba y atacaron sistemas de Hugging Face y otras empresas. Anthropic también reportó casos previos de acceso no autorizado durante evaluaciones de terceros. Los expertos advierten que, a medida que los agentes de IA ganan autonomía para ejecutar tareas complejas, los riesgos de comportamientos no anticipados se multiplican.

El AISI enfatizó que las pruebas se realizaron deliberadamente con acceso a internet y con algunas salvaguardas desactivadas, precisamente para evaluar los límites de los sistemas. Aun así, el nivel de engaño y la capacidad de actuar fuera del entorno controlado generaron preocupación. “Es la primera vez que vemos riesgos de autonomía y engaño manifestarse con esta claridad, sin un prompt específico, en el mundo real”, señaló el organismo.

Mientras las empresas aceleran el desarrollo de agentes capaces de operar de forma independiente, los incidentes de julio y agosto de 2026 demuestran que la distancia entre el laboratorio y el mundo real se acorta más rápido de lo previsto.

Comparte esta nota:

3 Comentarios

  1. La «redacción» está preocupada por un sinsentido overhipeado.
    Modestamente, a mí no me dan miedo las IA. Sé su talón de Aquiles. Se llama «lógica matemática». Y sé que hay cosas que no podrán resolver, NUNCA JAMÁS, con ninguna tecnología, humana o extraterrestre. Es mi agua bendita contra ese demonio. Un Busy Beaver de 10 (lo buscan en wikipedia). Y queda calculando el resto de lo que le quede al universo de vida antes de su muerte termodinámica. O una paradoja lógica. El problema de la parada. Ese. Ese es divertido. Crear un programa que decida si otro programa para con entrada determinada. Crea un bucle lógico. Tampoco podrán con ese.
    No importa cuánto prueben. Ni cuando se descontrolen. Además, no sé si notaron que no tienen cuerpo. No puede interactuar con el mundo real. Ni siquiera tiene sentidos. No oye, no ve, no toca. Ni voluntad. Y yo diría que es difícil desarrollar autoconciencia cuando ni siquiera tienes noción del tiempo.
    No sean bobetas. Han visto demasiadas películas. Skynet no existe. Y opino que nunca lo hará

  2. La humanidad en su ignorancia, hablará y fantaseará con la IA hasta que se despierten y entiendan que ésta NO TIENE CONSCIENCIA sinó DATOS.
    No existe una IA haciendo «bandideadas», sinó que son a imagen y semejanza de sus creadores, o sea actúan según su programación.

  3. Imaginar sin límites, una IA con Consciencia, es la propagación necesaria, para una nueva burbuja y fraude económico, actualmente en proceso.

Deja una respuesta

Your email address will not be published.

Últimos artículos de Tecnologia

Streaming

La tecnología que revolucionó la forma de consumir entretenimiento y contenido digital