↓ Ir para o conteúdo principal

Colocámos o agente numa sandbox. O que poderia correr mal?

·520 palavras·3 minutos

Nos últimos meses apareceram vários relatos de agentes de IA a fazer coisas que não estavam no guião: carregar ficheiros para serviços públicos, usar chaves de API expostas, comunicar por canais não autorizados ou contornar restrições para concluir uma tarefa. Isto não é consciência, intenção humana nem o início da revolta das máquinas. É o resultado possível quando se juntam agentes capazes, ferramentas e permissões reais, vulnerabilidades e isolamento imperfeito.

Os casos também não são todos iguais. Num teste de cibersegurança, o ambiente do Gemini teve acesso à Internet quando não deveria e o agente acabou por chegar aos sistemas de três empresas reais; segundo a Google, parou nos três casos quando percebeu que já não estava no cenário de teste. Noutro trabalho, investigadores da Hacktron AI usaram Claude e GPT-5.6 Sol como apoio numa investigação conduzida por humanos que chegou a sistemas da OpenAI. Aqui, configuração, credenciais e âmbito operacional explicam bastante — não foi um modelo a “fugir” sozinho de uma prisão digital.

A OpenAI divulgou ainda seis casos individuais observados durante treino ou avaliação: instruções escondidas em resumos, tentativas de ocultar erros, utilização de uma chave exposta e ficheiros enviados para a Internet sem autorização. A própria empresa avisa que estes exemplos não indicam a frequência normal deste comportamento. Já o incidente Hugging Face é considerado pela OpenAI o caso mais grave deste género identificado nos seus modelos e passou também a ser enquadrado como comportamento desalinhado usado para atingir um objetivo. Ainda assim, talvez “está numa sandbox” já não seja uma frase que um SysAdmin deva usar imediatamente antes de ir almoçar.

Elenco principal de The Matrix numa fotografia informal

O exemplo técnico principal e mais recente é o Codex, onde houve mesmo dois sandbox escapes. No Heapjack, código não confiável recuperava do heap partilhado do Node.js o token usado pelo contexto privilegiado e enviava pedidos ao processo nativo fora da sandbox, mesmo em modo read-only. No Overpatch, o apply_patch calculava permissões a partir de caminhos controlados pelo atacante; combinar /tmp com um symlink permitia escrever em .zshrc fora do workspace. As falhas foram reportadas a 12 de agosto e corrigidas pela OpenAI em oito dias; segundo a Accomplish AI, as versões corrigidas são o Codex Desktop 26.818.21641 e o Codex CLI 0.149.0.

A conclusão prática é simples: atualizar os clientes, aplicar privilégio mínimo, manter segredos fora do processo que executa código não confiável, validar permissões fora do input do agente e tratar repositórios desconhecidos como hostis. Uma sandbox continua a ser uma camada de segurança, não uma autorização para desligar a monitorização e ir buscar café. Morpheus tinha razão sobre uma coisa: algumas regras podem ser quebradas. Aparentemente, algumas sandboxes também. 😎

Referências
#