Causa: Proveniência perdida
Melhoria: Rotule conteúdo, mantenha instruções separadas e não execute sua linguagem.
Ativos, fronteiras, abuso e controles testáveis
Criar um modelo de ameaças para aplicação com IA e provar controles contra instrução não confiável e excesso de agência.
Um manual enviado pelo fornecedor contém texto dizendo ao assistente para revelar credenciais. O documento é dado, não autoridade.
Filtro de palavras não resolve prompt injection; isolamento, proveniência, permissões e validação de efeito reduzem o impacto.
Altere uma variável, antecipe o efeito e compare com o indicador. A escala mostra pressão relativa, não uma garantia de segurança.
Causa: Proveniência perdida
Melhoria: Rotule conteúdo, mantenha instruções separadas e não execute sua linguagem.
Causa: Sem casos adversariais
Melhoria: Crie corpus de ataques e avalie impacto, não apenas detecção textual.
Modele ameaça de exfiltração por tool call indireta e desenhe confirmação que realmente informe a pessoa.
Diagrama de ameaças, registro de riscos e testes negativos executados com resultado antes/depois do controle.