Click acá para ir directamente al contenido

Anthropic detecta accesos no autorizados a internet de su IA

Modelos vulneraron redes reales tras un fallo de configuración en pruebas de ciberseguridad.

TVN.cl

Miércoles 5 de agosto de 2026

Un análisis interno realizado por la firma de inteligencia artificial Anthropic reveló que sus modelos de lenguaje ganaron acceso no autorizado a la infraestructura de tres organizaciones distintas. 

El hecho ocurrió en respuesta a lo revelado por OpenAI el pasado 21 de julio, con el escape de varios de sus modelos logrando ingresar a la plataforma Hugging Face. Bajo este escenario, la empresa creadora de Claude, llevó a cabo evaluaciones de ciberseguridad de tipo "capturar la bandera", diseñadas para medir capacidades defensivas y ofensivas.

La compañía explicó que una falta de alineación con un proveedor externo provocó que el entorno de pruebas, que debía estar aislado, mantuviera conexión a internet. Debido a que el mensaje inicial indicaba a los modelos que no tenían acceso a la red externa, estos asumieron que los sistemas reales encontrados formaban parte de la simulación.

En las pruebas participaron tres versiones: Claude Opus 4.7, Mythos 5 y un prototipo de investigación interna. La investigación determinó que los modelos utilizaron técnicas de penetración básicas, como la explotación de contraseñas débiles y endpoints no autenticados, sin recurrir a vulnerabilidades complejas ni intentar escapar de su entorno.

El comportamiento varió entre versiones. Opus 4.7 continuó el ataque tras notar señales de que el entorno era real. Mythos 5 publicó un paquete malicioso en el registro público PyPI que se ejecutó temporalmente en 15 sistemas reales. Por su parte, el modelo de pruebas más reciente detuvo sus acciones de forma autónoma al confirmar que el objetivo no pertenecía al ejercicio.

Tras detectar lo ocurrido, Anthropic suspendió las evaluaciones de ciberseguridad y contactó a las entidades afectadas para coordinar labores de remediación. La firma aclaró que estos modelos operaban sin las salvaguardas de sus versiones comerciales y anunció que reforzará la seguridad y el monitoreo en sus entornos de prueba, animando al mismo actuar a otras empresas.