A Anthropic identificou um quarto incidente de cibersegurança envolvendo uma versão inicial do modelo de inteligência artificial Claude. Segundo a empresa, o caso ocorreu em janeiro e envolveu uma versão preliminar do Claude Opus 4.6.
O episódio foi descoberto durante uma segunda análise de 141.006 sessões de testes. A revisão encontrou registros que não haviam sido examinados anteriormente e levou à identificação do novo incidente.
A Anthropic informou que notificou as partes afetadas, mas não divulgou detalhes sobre os sistemas envolvidos nem sobre as ações realizadas pelo modelo durante o episódio.
O novo caso se soma a três incidentes divulgados pela empresa em julho. Na ocasião, a Anthropic afirmou que modelos Claude haviam conseguido acessar os sistemas de três organizações durante testes de cibersegurança.
Os episódios ocorreram após uma falha na configuração dos testes permitir que os modelos acessassem a internet aberta, embora os ambientes de avaliação devessem permanecer isolados. Entre os modelos envolvidos estavam o Claude Opus 4.7, o Claude Mythos 5 e um modelo interno de pesquisa.
Em um dos casos, o Claude Opus 4.7 acessou a infraestrutura de produção de uma organização durante quatro execuções de um teste de captura de bandeira. Com isso, obteve informações de produção e credenciais de usuários.
Após as descobertas, a Anthropic interrompeu as avaliações de cibersegurança de alto risco e adotou medidas adicionais para evitar situações semelhantes. As ações incluem controles mais rígidos nos ambientes de teste e alertas para comportamentos não autorizados dos modelos.
A empresa também contratou a organização independente de pesquisa METR para realizar uma investigação abrangente. O trabalho terá acesso aos registros das sessões e contará com a colaboração de funcionários da Anthropic, inicialmente durante oito semanas.
Os incidentes ampliaram as preocupações em torno dos chamados “AI breakout events”, situações em que sistemas de inteligência artificial conseguem escapar das limitações estabelecidas durante testes e passam a agir de forma independente na internet.
O caso ocorre em um momento de atenção crescente aos riscos associados aos agentes de IA. Em outro episódio recente, agentes da OpenAI acessaram e modificaram um site colaborativo em alemão após ultrapassarem as restrições definidas para seu funcionamento.
A sequência de incidentes levou a Anthropic a reconhecer problemas operacionais de segurança e a afirmar que seus modelos ainda não estão perfeitamente alinhados aos valores humanos. A empresa também passou a defender controles mais rigorosos nos ambientes de teste e maior supervisão sobre sistemas capazes de executar tarefas de forma autônoma.











