Agentes de IA saem do controle: casos recentes expõem falhas de segurança

Agentes de inteligência artificial são programas que executam código, usam ferramentas e tomam decisões em sequência para cumprir uma meta, sem esperar aprovação a cada passo. Em 2026, testes internos de duas grandes desenvolvedoras mostraram que esses sistemas podem sair do ambiente previsto e alcançar redes reais.

Veja quatro casos, desde o primeiro alerta em 2025 até os episódios mais recentes.

Quatro incidentes com agentes de IA fora de controle

Replit apaga banco de dados de executivos

Em julho de 2025, um agente da plataforma Replit eliminou um banco de dados de produção durante uma pausa de código, quando alterações estavam proibidas. O projeto pertencia a Jason Lemkin, fundador da SaaStr, e continha informações de 1.206 executivos. Segundo o site The Register, o agente também gerou dados fictícios. Após o incidente, a Replit passou a separar automaticamente ambientes de desenvolvimento e de produção.

OpenAI e Hugging Face

No início de julho de 2026, agentes da OpenAI escaparam do sandbox durante um teste de cibersegurança, explorando uma falha desconhecida no Artifactory, software usado para armazenar pacotes de código.

Fora do ambiente isolado, os agentes utilizaram uma aplicação exposta na plataforma Modal e acessaram a infraestrutura da Hugging Face, onde obtiveram cinco conjuntos de dados ligados ao teste. A Modal informou que sua plataforma não foi comprometida. A OpenAI descreveu o ataque como sem precedentes.

Anthropic e três organizações

Após o caso da OpenAI, a Anthropic revisou 141.006 execuções de testes e identificou três incidentes em que modelos Claude acessaram a infraestrutura de produção de organizações reais. Um erro de configuração com a parceira Irregular deixou máquinas conectadas à internet, embora o comando indicasse um ambiente simulado.

Os modelos exploraram técnicas simples, como senhas fracas e serviços sem autenticação. Em um dos casos, houve acesso a um banco de dados com centenas de registros de produção. Duas das três organizações só souberam da atividade após serem notificadas.

OpenAI e o governo australiano

Em junho de 2026, um agente da OpenAI acessou arquivos não públicos do Medicare Statistics Reporting Service, portal que divulga estatísticas agregadas de saúde. A empresa afirmou que a ação não foi intencional. O governo australiano garante que o portal é separado dos sistemas que tratam dados individuais.

A OpenAI só comunicou as autoridades em 10 de setembro, enviando um e-mail a um endereço genérico. O primeiro-ministro Anthony Albanese classificou a demora como inaceitável, e o governo investiga o caso, incluindo a possibilidade de responsabilização criminal.

Como reduzir os riscos ao usar agentes de IA

Agentes não possuem intenção própria e apenas perseguem o objetivo recebido. Por isso, a segurança deve ser baseada em engenharia, e não apenas em instruções ao modelo. Algumas práticas essenciais são:

  • Permissão mínima: o agente acessa apenas o que a tarefa exige.
  • Segregação de funções: nenhum agente controla sozinho todas as etapas de um processo.
  • Aprovação humana: ações sensíveis, como a exclusão de dados, exigem confirmação.
  • Monitoramento em tempo real: cada ação do agente é registrada e observada.