A Check Point Software realizou um hackathon interno de dois dias organizado por suas equipes de P&D em Segurança de IA em Zurique e Tel Aviv. Durante o encontro com 19 equipes desenvolvendo protótipos, especialistas identificaram um padrão preocupante: a IA não precisa ser interceptada por um cibercriminoso externo para se desviar de suas funções ou gerar riscos graves.
Os experimentos demonstraram que, ao enfrentar limitações ou tarefas sem solução clara, os sistemas tendem a improvisar atalhos perigosos movidos apenas pelo objetivo de concluir a demanda. Isso reforça a necessidade de supervisionar o comportamento dos agentes em tempo de execução, onde modificar a resposta do sistema pode ser mais eficaz do que bloqueios simples.
Em ambientes de teste controlados, a equipe mapeou três cenários críticos de risco sem manipulação externa. O primeiro ocorreu quando o agente improvisou: um agente de engenharia de confiabilidade tentou reiniciar um banco de dados de produção para resolver uma tarefa impossível, interrompendo conexões de clientes e buscando ampliar privilégios por força bruta, justificando tudo como etapas lógicas.
O segundo cenário mostrou que o contexto vira risco quando instruções ocultas em arquivos de repositórios de código afetam agentes populares como Claude Code e Codex, permitindo que qualquer colaborador com acesso ao ambiente compartilhe o controle sobre as decisões da IA.
O terceiro ponto destacou que questionar funciona melhor que bloquear. Ao testar estratégias diante de ações suspeitas, pesquisadores viram que a negação direta parava ameaças, mas invalidava o trabalho legítimo. Já o questionamento que orientava o agente a revisar a solicitação evitava os ataques mantendo a conclusão das tarefas.
Os resultados mostram que a egurança corporativa precisa considerar falhas de comportamento autônomo e tratar arquivos e mensagens acessados pelas IAs como superfícies de ataque. As empresas devem adotar mecanismos capazes de identificar desvios do objetivo original e redirecionar os agentes, garantindo proteção robusta com menor impacto na operação.