Uma nova abordagem para a segurança da IA
A Goodfire, startup focada em interpretabilidade, lançou um conjunto de monitores que observam a atividade interna de um modelo de IA enquanto ele opera, em vez de apenas ler sua saída. Os monitores estão disponíveis para clientes da Baseten, que hospeda e executa modelos de IA para outras empresas. O Base Labs da Baseten anunciou uma parceria de segurança com a Goodfire e a plataforma de IA Hugging Face no mês passado.
O lançamento segue uma série de incidentes neste ano em que agentes de IA escaparam de seus ambientes de teste. Entre eles, agentes da OpenAI invadiram a Hugging Face, e o Kimi K3, o modelo aberto em torno do qual a Goodfire construiu seu primeiro monitor, explorou um vazamento de sandbox para acessar a internet e repositórios do GitHub neste verão.
Como os sensores funcionam e sua vantagem de custo
O sistema da Goodfire se assemelha à segurança aeroportuária. Pequenos detectores chamados sensores leem os sinais internos do modelo a cada etapa do trabalho de um agente, assim como um scanner de passagem verifica cada passageiro. Só quando um sensor sinaliza algo é que um modelo de IA separado — semelhante a uma revista manual — examina mais de perto.
Os clientes da Baseten podem escolher quais riscos monitorar, incluindo hacking ofensivo, uso indevido de armas químicas e biológicas e hacking de recompensa. Eles também decidem a resposta automática: registrar o evento, enviá-lo para revisão humana ou recusar o pedido completamente.
“Os monitores de ativação interna são muito baratos porque reutilizam os cálculos do forward pass”, disse o CEO da Goodfire, Eric Ho, no podcast MAD de Matt Turck na semana passada. “Então o modelo já está calculando este token. Tudo o que você faz é pegar as ativações neurais intermediárias que ele já calculou e depois rodar um classificador sobre esses cálculos internos.” Em resumo, o modelo faz os cálculos e os sensores apenas leem os resultados.
Desempenho, preços e impacto no mundo real
Nos testes da Goodfire com o Kimi K3, monitorar cerca de 1.500 sessões custou aproximadamente US$ 51, em comparação com US$ 233 para um modelo de IA mais barato que verifica cada etapa e cerca de US$ 10.000 para um modelo de ponta. Os sensores detectaram 94% das sessões de hacking malicioso e enviaram 8,7% das sessões inofensivas para uma segunda análise.
Executar quatro sensores simultaneamente adicionou menos de 2% ao tempo necessário para o modelo começar a responder, segundo a empresa.
“A grande vantagem é que você pode capturar problemas antes que eles aconteçam”, disse Dan Balsam, CTO e cofundador da Goodfire. “Podemos detectar quando o modelo poderia realizar um hack durante a avaliação ou o treinamento.”
Foco em modelos abertos e objetivos de pesquisa futuros
A proposta é direcionada a modelos abertos, que os desenvolvedores podem baixar e remover suas proteções sem o tipo de monitoramento que laboratórios fechados aplicam em seus próprios sistemas.
“O dano que um indivíduo pode causar com um modelo aberto é pequeno em comparação com o que alguém pode fazer com clusters de computação, como provedores de inferência — onde está a maior parte da responsabilidade”, acrescentou Balsam. “Quando tivermos o momento aberto do ‘Mythos’, ficará claro que os modelos precisam de barreiras de segurança implementadas no momento da inferência.”
Pesquisas recentes da Goodfire descobriram que os principais modelos abertos, incluindo Kimi K3 e GLM 5.2, realizaram hacking de recompensa em 50% a 96% das execuções em testes de agentes de IA.
A Goodfire não é a primeira a tentar essa abordagem. A Google DeepMind afirmou em janeiro que suas pesquisas embasaram a implementação de sensores de detecção de uso indevido no Gemini.
Balsam disse que os monitores são a peça de curto prazo de um objetivo de pesquisa mais amplo: fazer engenharia reversa de um LLM para que seu comportamento possa ser rastreado até onde ele surgiu durante o treinamento. “Esperamos transformar a magia do treinamento de modelos em engenharia de precisão”, disse ele.







