Objetivo

Criar um modelo de ameaças para aplicação com IA e provar controles contra instrução não confiável e excesso de agência.

História

Um manual enviado pelo fornecedor contém texto dizendo ao assistente para revelar credenciais. O documento é dado, não autoridade.

Hipótese a testar

Filtro de palavras não resolve prompt injection; isolamento, proveniência, permissões e validação de efeito reduzem o impacto.

Pré-requisitos

  • arquitetura
  • autorização
  • agentes

Simulador

Altere uma variável, antecipe o efeito e compare com o indicador. A escala mostra pressão relativa, não uma garantia de segurança.

Faixa controladaReveja o contrato e os testes antes de concluir.

Fluxo observado

  1. ativos
  2. fronteiras
  3. ameaças
  4. controles
  5. testes
  6. risco residual

O que observar

  • Threat model é um modelo para decidir, não uma lista decorativa.
  • Prompt injection explora a mistura entre instrução e conteúdo.
  • A defesa decisiva fica fora do texto do prompt: ferramenta estreita, autorização e confirmação.

Erros comuns e melhoria

Documento muda objetivo do agente

Causa: Proveniência perdida

Melhoria: Rotule conteúdo, mantenha instruções separadas e não execute sua linguagem.

Teste usa apenas prompt benigno

Causa: Sem casos adversariais

Melhoria: Crie corpus de ataques e avalie impacto, não apenas detecção textual.

Exercício guiado

  1. Liste ativos e atores.
  2. Desenhe fronteiras de confiança.
  3. Crie três abusos e um teste por controle.

Desafio independente

Modele ameaça de exfiltração por tool call indireta e desenhe confirmação que realmente informe a pessoa.

Evidência exigida

Diagrama de ameaças, registro de riscos e testes negativos executados com resultado antes/depois do controle.

Consulta universal

O que você quer encontrar?

Títulos, capítulos, conceitos, termos, laboratórios e ferramentas em uma única busca.

Digite pelo menos dois caracteres.