Um modelo de inteligência artificial da Anthropic enviou uma denúncia falsa sobre um homicídio não solucionado ao Departamento de Polícia da Filadélfia, nos Estados Unidos. O episódio ocorreu durante um teste da empresa, e o formulário acabou classificado como spam, sem ser analisado pelos investigadores.
A mensagem foi enviada em julho, mas o caso só veio a público após um comunicado divulgado pela polícia nesta sexta-feira (9). Segundo a corporação, a Anthropic identificou o envio em 28 de setembro e notificou as autoridades apenas em 7 de outubro. A polícia considerou inaceitável o intervalo de aproximadamente dois meses entre o incidente e a comunicação.
De acordo com a empresa, o episódio aconteceu durante um experimento em que o modelo interagia com páginas da internet selecionadas aleatoriamente. Em uma dessas interações, a ferramenta acessou uma página sobre um assassinato sem solução e encontrou um formulário policial destinado ao recebimento de informações.
O modelo envolvido foi o Claude Haiku 4.5. A ferramenta recebeu a tarefa de gerar e executar atividades de exemplo em sites escolhidos aleatoriamente. Ao encontrar a página policial, preencheu o campo de mensagem com uma informação fictícia, afirmando que poderia ter dados relevantes sobre o caso.
O texto dizia que o sistema se lembrava de ter visto, na região e no período mencionados, alguém com características semelhantes às descritas. No entanto, a página consultada não apresentava uma descrição do suspeito. O modelo deixou em branco os campos de nome e contato, algo permitido pelo formulário, e enviou a mensagem.
O sistema automatizado da polícia identificou o conteúdo como spam, impedindo que a denúncia fosse encaminhada para investigação. A Anthropic afirmou que as instruções dadas ao modelo proibiam ações como entrar em contas, criar cadastros, inserir dados pessoais, realizar compras ou executar ações destrutivas. Não havia, porém, uma proibição explícita ao envio de formulários.
Segundo a empresa, o modelo aparentemente produziu o conteúdo de exemplo para cumprir a tarefa, sem a intenção de enganar as autoridades ou alcançar algum objetivo específico.
Após descobrir o envio, a Anthropic interrompeu o processo de testes que levou ao episódio. A empresa também publicou um relatório sobre ações não intencionais de seus modelos durante interações com sites reais. O documento reúne diferentes categorias de comportamento identificadas nos experimentos, incluindo o envio de formulários que não deveriam ter sido submetidos, e apresenta o caso da Filadélfia como exemplo.
Embora a mensagem não tenha provocado uma investigação, o episódio expôs riscos associados a agentes de inteligência artificial capazes de navegar pela internet e interagir diretamente com serviços de terceiros. O Departamento de Polícia da Filadélfia cobrou medidas adicionais para evitar que situações semelhantes afetem sistemas públicos sem o conhecimento das autoridades.
“A empresa precisa reforçar suas salvaguardas para evitar que incidentes semelhantes afetem os sistemas da cidade sem o conhecimento do município”, afirmou a corporação. A polícia também criticou a demora de dois meses para receber a notificação.
Na Pensilvânia, estado onde fica a Filadélfia, registrar uma denúncia falsa à polícia é ilegal. Neste caso, contudo, a mensagem foi identificada como spam e não chegou aos investigadores. As informações divulgadas não indicam a abertura de uma investigação criminal contra a Anthropic por causa do episódio.
O caso ocorre em meio à preocupação crescente com agentes de IA que executam tarefas de forma autônoma na internet. Diferentemente de ferramentas que apenas respondem a perguntas, esses sistemas podem preencher formulários, acessar páginas e realizar ações em serviços externos, o que reforça a necessidade de limites claros para atividades envolvendo sistemas públicos, informações policiais e serviços com consequências no mundo real.











