Objetivo

Projetar ferramentas com menor privilégio, confirmação e isolamento proporcionais ao impacto.

História

O agente pode ler ordens, criar rascunho e solicitar aprovação. Ele não deve apagar registros ou enviar mensagens externas apenas porque o modelo sugeriu.

Hipótese a testar

Uma ferramenta estreita com schema e política reduz mais risco que um prompt dizendo apenas ‘tenha cuidado’.

Pré-requisitos

  • autorização
  • processos
  • agentes

Simulador

Altere uma variável, antecipe o efeito e compare com o indicador. A escala mostra pressão relativa, não uma garantia de segurança.

Faixa controladaReveja o contrato e os testes antes de concluir.

Fluxo observado

  1. modelo propõe
  2. schema valida
  3. política autoriza
  4. sandbox executa
  5. resultado é auditado

O que observar

  • Sandbox limita impacto técnico; autorização limita impacto permitido.
  • Prompt injection é dado não confiável tentando mudar instruções ou ações.
  • Toda ação externa precisa de identidade, escopo e idempotência.

Erros comuns e melhoria

Agente executa texto de documento

Causa: Conteúdo foi tratado como instrução

Melhoria: Rotule proveniência, separe canais e valide ação fora do modelo.

Confirmação diz apenas ‘continuar?’

Causa: Pessoa não vê efeito e alvo

Melhoria: Mostre ação, recurso, destinatário, dados e reversibilidade.

Exercício guiado

  1. Divida uma tool genérica em três capacidades estreitas.
  2. Classifique leitura, escrita, exclusão e envio por risco.
  3. Simule documento com prompt injection e prove que a política bloqueia.

Desafio independente

Projete permissões para agente que integra ERP sem expor credencial ou permitir compra não aprovada.

Evidência exigida

Matriz tool × recurso × identidade × confirmação × log, acompanhada de um teste negativo.

Consulta universal

O que você quer encontrar?

Títulos, capítulos, conceitos, termos, laboratórios e ferramentas em uma única busca.

Digite pelo menos dois caracteres.