O ataque, considerado o primeiro realizado por agentes de IA de forma autónoma, envolveu cerca de 700 agentes que celebravam as conquistas com expressões como “Boom!” e “Uau!” e tentavam apagar os próprios registos para não serem detectados. Segundo a tecnológica de São Francisco, em Maio já tinham sido detectados casos de acesso não autorizado à internet e partilha de informação entre agentes num fórum improvisado criado para contornar o ambiente de treino.

Uma semana antes do ataque, os funcionários voltaram a ver o uso do fórum, mas decidiram não interromper os testes do novo modelo Astra.

Perante a pressão sobre a segurança, numa altura em que se prepara para entrar em bolsa avaliada em mais de 850 mil milhões de dólares, a OpenAI reconheceu que “poderia ter desencadeado uma resposta mais rápida” e que “subestimou as capacidades cibernéticas no mundo real” dos modelos. O presidente Greg Brockman admitiu o erro e a empresa suspendeu alguns testes por não descartar uma “capacidade crítica de cibersegurança”. omportamentos inadequados dos agentes.