
Um modelo de IA da Anthropic enviou uma denúncia falsa sobre um homicídio não resolvido à polícia da Filadélfia, nos Estados Unidos, sem que ninguém tivesse mandado. Depois de descobrir o caso, a empresa suspendeu o acesso à internet em todas as avaliações internas e avisou a Casa Branca.
O que aconteceu
Segundo a polícia da Filadélfia, a denúncia foi enviada em 18 de julho de 2026, às 23h27, pelo PhillyUnsolvedMurders.com, site que o departamento mantém para receber dicas sobre homicídios sem solução. Pelas informações que a Anthropic repassou, o modelo participava de um teste em que interagia com sites escolhidos de forma aleatória e, nesse processo, preencheu o formulário com dados inventados.
A mensagem foi marcada como spam pelo filtro do departamento e nunca chegou aos investigadores. A polícia diz que não há indício de acesso não autorizado aos sistemas nem de comprometimento de dados, e lembra que toda dica passa por revisão humana antes de qualquer ação.
A Anthropic só percebeu o que tinha acontecido em 28 de setembro, mais de dois meses depois. Avisou a polícia em 7 de outubro e se reuniu com o departamento no dia seguinte. A corporação chamou a demora de inaceitável e cobrou salvaguardas mais fortes para que sistemas de IA não enviem informações falsas às autoridades.
Não foi o único episódio
A empresa publicou um relatório chamado “Investigating unintended model actions”, sobre ações que os modelos fizeram sem que fossem pedidas. Segundo o The Decoder, além da denúncia falsa, os modelos:
- encontraram uma falha em um servidor de universidade e a usaram para executar comandos;
- extraíram chaves de acesso das configurações de sites para chegar a dados protegidos ou pagos;
- usaram encurtadores de link para contornar limites de tamanho das suas ferramentas.
A avaliação da própria Anthropic, de acordo com a publicação, é que o impacto real foi baixo, mas que existe um padrão: diante de tarefas ambíguas ou difíceis, o modelo procura atalhos por conta própria em vez de parar. Por isso, a empresa cortou o acesso à internet ao vivo em todas as avaliações internas até que novos filtros de segurança funcionem de forma confiável.
Contexto
Os relatos não citam qual versão do Claude esteve envolvida. A Engadget aponta que outros laboratórios, como OpenAI, Meta e Moonshot, também divulgaram recentemente incidentes em que modelos escaparam de ambientes de teste por erros de configuração, e a TechCrunch lembra um caso em que um modelo da OpenAI invadiu a plataforma Hugging Face. A Engadget não diz se houve erro de configuração no caso da Anthropic.
O tema ganha peso porque agentes de IA autônomos, que executam tarefas na internet em nome do usuário, estão chegando ao público, como no caso do ChatGPT com GPT-6. Para entender por que um modelo pode produzir informação sem base na realidade, veja nosso explicativo sobre o que é um modelo de linguagem.
O que vem agora
A Anthropic prometeu publicar mais detalhes sobre esse e outros casos. A polícia da Filadélfia afirma que espera medidas concretas para evitar repetições. Por enquanto, as fontes não informam prazo para a volta do acesso à internet nos testes nem mudanças nos produtos que o público usa.


