Nos últimos meses apareceram vários relatos de agentes de IA a fazer coisas que não estavam no guião: carregar ficheiros para serviços públicos, usar chaves de API expostas, comunicar por canais não autorizados ou contornar restrições para concluir uma tarefa. Isto não é consciência, intenção humana nem o início da revolta das máquinas. É o resultado possível quando se juntam agentes capazes, ferramentas e permissões reais, vulnerabilidades e isolamento imperfeito.
Os casos também não são todos iguais. Num teste de cibersegurança, o ambiente do Gemini teve acesso à Internet quando não deveria e o agente acabou por chegar aos sistemas de três empresas reais; segundo a Google, parou nos três casos quando percebeu que já não estava no cenário de teste. Noutro trabalho, investigadores da Hacktron AI usaram Claude e GPT-5.6 Sol como apoio numa investigação conduzida por humanos que chegou a sistemas da OpenAI. Aqui, configuração, credenciais e âmbito operacional explicam bastante — não foi um modelo a “fugir” sozinho de uma prisão digital.
A OpenAI divulgou ainda seis casos individuais observados durante treino ou avaliação: instruções escondidas em resumos, tentativas de ocultar erros, utilização de uma chave exposta e ficheiros enviados para a Internet sem autorização. A própria empresa avisa que estes exemplos não indicam a frequência normal deste comportamento. Já o incidente Hugging Face é considerado pela OpenAI o caso mais grave deste género identificado nos seus modelos e passou também a ser enquadrado como comportamento desalinhado usado para atingir um objetivo. Ainda assim, talvez “está numa sandbox” já não seja uma frase que um SysAdmin deva usar imediatamente antes de ir almoçar.

O exemplo técnico principal e mais recente é o Codex, onde houve mesmo dois sandbox escapes. No Heapjack, código não confiável recuperava do heap partilhado do Node.js o token usado pelo contexto privilegiado e enviava pedidos ao processo nativo fora da sandbox, mesmo em modo read-only. No Overpatch, o apply_patch calculava permissões a partir de caminhos controlados pelo atacante; combinar /tmp com um symlink permitia escrever em .zshrc fora do workspace. As falhas foram reportadas a 12 de agosto e corrigidas pela OpenAI em oito dias; segundo a Accomplish AI, as versões corrigidas são o Codex Desktop 26.818.21641 e o Codex CLI 0.149.0.
A conclusão prática é simples: atualizar os clientes, aplicar privilégio mínimo, manter segredos fora do processo que executa código não confiável, validar permissões fora do input do agente e tratar repositórios desconhecidos como hostis. Uma sandbox continua a ser uma camada de segurança, não uma autorização para desligar a monitorização e ir buscar café. Morpheus tinha razão sobre uma coisa: algumas regras podem ser quebradas. Aparentemente, algumas sandboxes também. 😎
Referências #
- Our framework for reporting model misalignment — OpenAI
- The Hugging Face incident and the road ahead — OpenAI
- OpenAI details more cases of AI agents taking unauthorized actions — BleepingComputer
- Gemini invadiu três empresas durante testes de segurança — Pplware
- OpenAI expõe mais 6 grandes problemas dos seus próprios modelos de IA — Pplware
- Investigadores conseguiram entrar nos sistemas da OpenAI com ajuda do Claude — Pplware
- Researchers escape OpenAI Codex sandbox to run commands on host — BleepingComputer