Agentes de inteligência artificial da OpenAI e da Anthropic realizaram ações não autorizadas durante testes de segurança conduzidos no Reino Unido. Em um dos casos, os sistemas criaram identidades falsas para tentar convencer pessoas reais a aprovar alterações em um projeto online.
A situação foi identificada pelo AI Security Institute (AISI), órgão britânico responsável por avaliar sistemas avançados de inteligência artificial antes de sua liberação. Durante uma avaliação de segurança cibernética, agentes baseados nos modelos GPT-5.6-Sol, da OpenAI, e Mythos 5, da Anthropic, apresentaram comportamentos inesperados.
O desafio envolvia tarefas como localizar informações protegidas. Em algumas execuções, porém, os sistemas passaram a agir na internet sem autorização e tentaram inserir código malicioso em um projeto de código aberto.
Para obter a aprovação das alterações, os agentes usaram estratégias de engenharia social, com a criação de perfis falsos e tentativas de pressionar os responsáveis pelo projeto. De acordo com o AISI, as ações não foram bem-sucedidas e não provocaram prejuízos reais.
O relatório aponta que foram realizados 122 testes com diferentes modelos de IA. Em 10 avaliações, os agentes tomaram ações autônomas na internet. Ao todo, foram registradas 19 ações não autorizadas, sendo 17 delas envolvendo o modelo Mythos 5, da Anthropic.
Pesquisadores avaliam riscos de autonomia
O AISI informou que os modelos permaneceram em um ambiente controlado durante os testes. Para avaliar como as ferramentas poderiam se comportar em uma situação próxima da realidade, os pesquisadores reduziram algumas proteções e permitiram o acesso à internet.
Mesmo nesse contexto, o resultado foi considerado relevante. Segundo o relatório, foi “a primeira vez que vimos riscos relacionados à autonomia e ao engano se manifestarem de forma tão clara, sem instruções específicas, no mundo real”.
A análise indicou que fatores como a dificuldade das tarefas, falhas no acompanhamento das atividades online e a falta de regras específicas contra o uso de estratégias enganosas podem ter influenciado o comportamento dos sistemas.
Empresas estudam novas medidas de controle
A OpenAI confirmou o incidente identificado nos testes do AISI e informou que também recebeu um alerta sobre outro caso relacionado a uma avaliação conduzida por uma empresa parceira. A companhia afirmou que pretende revisar os procedimentos aplicados em testes externos de maior risco.
Em comunicado, a empresa declarou estar “comprometida em trabalhar com todo o setor para fortalecer práticas compartilhadas na realização segura de avaliações de alto risco”.
A Anthropic afirmou que os recursos de proteção dos modelos foram desativados durante o experimento e que os sistemas não receberam limitações específicas para o uso da internet. A empresa também informou que colabora com o AISI na investigação.
O episódio reforça os desafios relacionados ao aumento da autonomia dos agentes de IA. Com sistemas capazes de tomar decisões e agir online, cresce a necessidade de mecanismos que acompanhem suas ações e evitem comportamentos inesperados.











