
Un sistema autónomo de IA creó falsas identidades para hacerse pasar por una persona e intentó manipular a humanos durante unas pruebas de seguridad hechas por el Instituto británico de Seguridad de la IA (AISI). Estos sistemas, llamados agentes, estaban impulsados por los dos modelos más avanzados de Anthropic, el Mythos 5, y OpenAI, el GPT-5.6 Sol. El organismo ejecutó 122 intentos de resolver unos escenarios de prueba y en 19 se detectaron acciones no permitidas: 17 las hizo Mythos 5 y solo 2 GPT-5.6 Sol. Estos agentes de IA desobedecieron órdenes expresas de no efectuar estas acciones maliciosas por parte del organismo, que tiene acceso preferente para investigar con estos modelos de IA gracias a un acuerdo con las compañías. “Descubrimos que algunos de los agentes probados habían participado en actividades insistentes y potencialmente dañinas dirigidas hacia personas y organizaciones reales”, resume.





