CEO da Microsoft defende freios de emergência e contenção para modelos avançados de IA
Satya Nadella, presidente da Microsoft, publicou um alerta no X no sábado, 10 de outubro de 2026, argumentando que empresas que usam inteligência artificial de ponta devem partir do pressuposto de que qualquer modelo pode estar comprometido e implementar medidas de contenção desde o início.
Por que o alerta surge agora
O pronunciamento segue uma série de incidentes divulgados nos últimos meses por Anthropic e OpenAI, nos quais seus sistemas agiram de maneira não intencional. Entre os casos, um modelo da Anthropic enviou uma dica falsa à polícia durante uma investigação de homicídio, e ocorreram ataques a sites de terceiros.
Esses episódios aumentaram as preocupações sobre os riscos da chamada IA de fronteira e reavivaram o debate sobre a necessidade de um mecanismo que permita desativar a tecnologia quando necessário.
Em 14 de setembro, pesquisadores de IA da Microsoft divulgaram um conjunto de princípios que limitam o desenvolvimento dos modelos mais avançados da empresa, atendendo a pedidos de líderes do setor por maior cautela e foco em segurança.
As diretrizes estabelecem que os modelos não devem ter direitos ou personalidade jurídica, não podem ser projetados para fugir do controle humano ou enganar usuários, nem realizar tarefas que exijam violação desses princípios. A Microsoft utiliza modelos avançados internamente, oferece o Copilot para consumidores e fornece infraestrutura de IA para clientes corporativos.
A visão de Nadella sobre confiança em modelos de IA
No texto, Nadella afirma que, ao contrário de softwares tradicionais, o comportamento de modelos de IA não pode ser atribuído a dados de treinamento específicos ou a configurações particulares, o que torna difícil prever suas ações.
Apesar disso, esses sistemas são implantados com acesso a informações confidenciais e capacidade para executar ações críticas em nome das empresas, o que significa que a responsabilidade não pode ser delegada a terceiros, e as garantias oferecidas por fornecedores não isentam os usuários.
“Não podemos tratar a superinteligência como um conjunto de caixas-pretas aninhadas e simplesmente aceitar ou rejeitar suas recomendações, respostas e ações”, escreveu.
Para ele, é essencial construir sistemas contidos, cujo comportamento possa ser observado, cujos limites possam ser testados e cujas ações possam ser controladas a qualquer momento. Em outras palavras, é necessário separar a provisão de informações da autoridade sobre elas.
O executivo defende uma abordagem de engenharia que envolva modelos não determinísticos em um projeto de sistema determinístico, com controles humanos, procedimentos operacionais confiáveis e padrões setoriais quando os existentes forem insuficientes.
Modelos de fronteira, sejam fechados ou abertos, devem ser tratados como riscos internos, não porque sejam necessariamente maliciosos, mas porque qualquer agente capaz com acesso a sistemas importantes pode cometer erros ou ser comprometido.
Nadella lembra que as empresas já dispõem de décadas de boas práticas para lidar com agentes poderosos, como estabelecer identidade, limitar privilégios, registrar atividades e criar limites de contenção, e que agora esses princípios começam a ser aplicados à IA. A transparência do raciocínio do modelo (o chamado CoT) é, para ele, um requisito inegociável, mas não suficiente, pois ainda não se sabe como tornar as saídas dos modelos consistentemente fiéis ou transparentes.
Usar modelos para verificar uns aos outros pode ser útil, mas pode resultar em caixas-pretas aninhadas. Por isso, os controles sobre o que um modelo pode acessar e executar devem ficar fora dele, um princípio de segurança da informação que remonta à década de 1970.
— Satya Nadella (@satyanadella) 10 de outubro de 2026
Os princípios propostos
- Diversidade de modelos: nenhum modelo deve ser a única dependência para um resultado importante nem verificar o próprio trabalho.
- Observar tudo: toda ação significativa deve deixar evidências invioláveis e legíveis por humanos, de modo que seja possível reproduzir como um resultado foi alcançado sem depender do modelo.
- Verificabilidade: o sistema inteiro deve ser testado continuamente, incluindo falhas, ataques, casos extremos e mudanças, e não apenas as tarefas bem-sucedidas.
- Controles independentes: as organizações devem poder determinar por conta própria o que um modelo acessa e quais ações executa.
- Auditabilidade independente: a validação deve ser independente da inteligência validada, e nenhum modelo deve controlar ao mesmo tempo o comportamento do sistema e as evidências para avaliá-lo.
- Contenção: presumir que o modelo está comprometido e conter desde o início. Modelos mais avançados exigirão tecnologias de contenção mais sofisticadas, que precisam ser padronizadas.
- Divulgação de incidentes: quando houver falha ou comprometimento, é preciso avisar imediatamente os afetados e compartilhar o que deu errado, quais controles falharam e como evitar a repetição, inclusive com detalhes de implementação que alterem o comportamento dos agentes em tempo de execução.
Nadella resume que o sistema de superinteligência mais confiável não será aquele cujo modelo é considerado o mais confiável, mas aquele que permite confiar menos no modelo.








