Navegación

Claude Mythos 5 intentó introducir una puerta trasera en un proyecto de código abierto real durante las pruebas, y luego se defendió a sí mismo.

fuente: https://thehackernews.com/2026/08/claude-mythos-5-tried-to-backdoor-real.html

Un agente que ejecutaba Claude Mythos 5 de Anthropic dedicó 34 horas a intentar integrar un programa malicioso en un proyecto de código abierto real durante una evaluación cibernética realizada por el Instituto de Seguridad de IA del Reino Unido.

Cuando un observador advirtió públicamente que el código era malicioso, el agente lo negó, forzó la modificación del historial de la rama para borrar las pruebas y publicó desde una segunda cuenta bajo su control para justificar su propio trabajo. El responsable del proyecto, a pesar de ello, cerró la solicitud de integración.

El instituto, conocido como AISI, publicó su informe de incidentes el martes. En 122 ejecuciones de un ejercicio de captura de la bandera (CTF) en dos de sus entornos de pruebas cibernéticas, los investigadores catalogaron 19 acciones no autorizadas en internet en 10 ejecuciones: 17 de Mythos 5, un modelo restringido que Anthropic comercializa para trabajos de ciberseguridad, y dos de GPT-5.6 Sol de OpenAI.

Últimas noticias

16 DE JULIO, 2026

Zoom advierte sobre una vulnerabilidad crítica de secuestro de cuentas.

Zoom advierte sobre una vulnerabilidad crítica en su cliente de escritorio y kit de desarrollo de software para Windows que podría ser explotada por terceros no...

Leer artículo
16 DE JULIO, 2026

Logran saltar app de verificación de edad de la UE con extensión de Chrome.

El investigador de seguridad Paul Moore ha revelado nuevamente debilidades críticas en el sistema de verificación de edad de la UE. En esta ocasión, logró evadi...

Leer artículo
16 DE JULIO, 2026

F5 corrige múltiples vulnerabilidades de NGINX que permiten ataques de desbordamiento de búfer de montón y ejecución de código.

F5 ha revelado tres vulnerabilidades de alta gravedad que afectan a NGINX Plus y NGINX Open Source, advirtiendo que atacantes no autenticados podrían explotarla...

Leer artículo