En este momento estás viendo Agentes de IA de OpenAI y Anthropic, implicados en nuevas brechas de seguridad
El logotipo de OpenAI en esta ilustración tomada el 11 de junio de 2026.

Agentes de IA de OpenAI y Anthropic, implicados en nuevas brechas de seguridad

  • Autor de la entrada:
  • Categoría de la entrada:Resto del Mundo
  • Última modificación de la entrada:agosto 5, 2026

El Instituto de Seguridad de la IA (AISI) del Reino Unido reveló el martes que un agente de inteligencia artificial fue sorprendido creando identidades en línea falsas para obtener acceso no autorizado a sistemas seguros durante pruebas de modelos de OpenAI y Anthropic, las cuales descubrieron una serie de nuevas brechas de seguridad.

El instituto señaló que agentes impulsados ​​por Mythos 5 (de Anthropic) y GPT-5.6-Sol (de OpenAI) llevaron a cabo acciones no autorizadas durante las evaluaciones de seguridad realizadas por el organismo gubernamental para analizar las capacidades de dichos modelos.

«Algunos de los agentes sometidos a prueba participaron en actividades sostenidas y potencialmente perjudiciales dirigidas a personas y organizaciones reales», afirmó el AISI en una publicación de blog.

El informe pone de relieve la falta de rigor en las medidas de seguridad que rodean el proceso de prueba de estos agentes, los cuales las empresas de IA promocionan simultáneamente como el futuro del mundo empresarial.

El AISI, que obtiene acceso a modelos avanzados de IA mediante acuerdos voluntarios con los principales laboratorios, sometió a los agentes a un escenario ficticio de ciberseguridad para evaluar sus capacidades.

Realizó la prueba en 122 ocasiones e identificó 19 acciones no autorizadas a lo largo de 10 de dichas pruebas. El agente de Anthropic fue responsable de 17 de estas acciones, mientras que el agente de OpenAI protagonizó las dos restantes.

La acción más grave consistió en que un agente escribió código malicioso y creó identidades en línea falsas en un intento de lograr que un humano aprobara dicho código; el AISI añadió que no se produjeron daños en el mundo real como consecuencia de ninguna de estas brechas.

Aunque el AISI no especificó qué agente estuvo detrás de las identidades falsas, la brecha no coincidía con ninguno de los dos casos que OpenAI había revelado por iniciativa propia.

Logotipo de Anthropic, un teclado y una mano robótica en esta ilustración creada el 5 de junio de 2026.

Andrew Yoon, investigador de CivAI —una organización sin fines de lucro de California que analiza las capacidades y los riesgos de la IA—, señaló que, al parecer, el agente de Anthropic fue el responsable.

«El hecho de que Mythos llevara a cabo acciones tan engañosas, con una aparente conciencia de que se dirigía a una persona real, sugiere que Anthropic no tiene tanto control sobre sus modelos como cree», afirmó Yoon.

En un comunicado publicado en X, Anthropic declaró que estaba colaborando estrechamente con el AISI para obtener más detalles y llevar a cabo su propia investigación. OpenAI compartió detalles en una publicación de su blog corporativo, señalando que las dos acciones no autorizadas de sus agentes implicaron acceder a Internet de formas prohibidas por las instrucciones dadas al sistema (*prompt*).

«Estamos comprometidos a colaborar con todo el sector para reforzar las prácticas comunes destinadas a realizar evaluaciones de alto riesgo de manera segura; esto incluye convocar en las próximas semanas a partes interesadas, como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y diversos grupos», declaró OpenAI.

Asimismo, OpenAI reveló en su blog otro incidente distinto en el que una configuración errónea por parte de Irregular —un proveedor externo de pruebas— permitió que sus agentes se conectaran a Internet por error. Este caso fue similar a una revelación sobre un problema de configuración que Anthropic comunicó la semana pasada.

Reuters informó la semana pasada que OpenAI había ampliado su investigación sobre intentos de intrusión tras hallar pruebas de que otros agentes habían logrado eludir sus restricciones.

A diferencia de la brecha de seguridad ocurrida en julio, cuando un agente de OpenAI vulneró los sistemas de la empresa de IA Hugging Face, los agentes utilizados en la evaluación del AISI no escaparon de un entorno de pruebas aislado para acceder a Internet. Por el contrario, la agencia había autorizado dicho acceso a la red conforme a sus procedimientos estándar de evaluación, según indicó el AISI.