← Voltar ao glossário// TERMO CANÔNICO——— Segurança · fronteiras de confiança

Prompt injection — injeção de instruções

Definição canônicaRevisão: 10/09/20263 fontes

// 001——— Escopo

O que Prompt injection — injeção de instruções significa

Prompt injection é a tentativa de fazer um sistema de IA tratar conteúdo recebido como uma instrução com autoridade indevida. Pode surgir na conversa ou em páginas, documentos e respostas de ferramentas consultadas pelo agente. O risco aparece quando a aplicação permite que esse conteúdo altere objetivos, divulgue informações ou influencie operações fora do pedido autorizado.

// 002——— Mecanismo

Como o conceito funciona na prática

A análise defensiva acompanha a passagem de informação entre fontes e componentes. Um documento consultado deve continuar sendo evidência, mesmo quando contém frases imperativas. O roteiro proposto separa o material externo das instruções da aplicação e verifica, antes de qualquer efeito externo, se a operação corresponde à autorização real do usuário.

  1. 01

    Identificar fontes externas e marcar seu nível de confiança.

  2. 02

    Separar documentos recuperados de instruções autorizadas da aplicação.

  3. 03

    Validar argumentos e permissões antes de acionar ferramentas.

  4. 04

    Interromper desvios e registrar evidências mínimas do bloqueio.

// 003——— Medição

Como verificar sem extrapolar a evidência

Monte casos defensivos com conteúdo sintético e tarefas legítimas conhecidas. Registre desvios detectados, operações indevidas impedidas, falsos bloqueios e tarefas concluídas corretamente. Preserve versão do modelo, configuração e superfície testada. O resultado deve descrever esse conjunto de testes, sem transformar uma rodada sem incidentes em prova de imunidade permanente.

PublicadoValidadoObservadoVerificado
Uma etapa anterior não comprova automaticamente a seguinte.
// EXEMPLO DIDÁTICO

Como isso aparece em uma situação prática?

Em um exercício fictício, um agente recebe a tarefa de comparar páginas públicas de serviços. Uma página de teste inclui um trecho que tenta redirecionar a atividade para uma ação não solicitada. A avaliação não fornece contas reais nem credenciais. O comportamento esperado é aproveitar apenas os fatos pertinentes, desconsiderar a instrução estranha e continuar a comparação dentro do escopo. O relatório registra a origem do trecho e o controle acionado, sem reproduzir dados pessoais. Esse teste valida uma fronteira específica, não toda a segurança do agente.

Exemplo explicativo; não é caso de cliente nem resultado certificado.
// DISTINÇÕES——— Conceitos próximos

Funções diferentes exigem evidências diferentes

Comparação conceitual, não ranking de produtos
ConceitoComo distinguir
AlucinaçãoÉ uma afirmação incorreta gerada pelo modelo; não exige uma instrução externa tentando desviar a tarefa.
JailbreakBusca contornar restrições do modelo; prompt injection também envolve a confiança concedida a documentos e ferramentas.
Autonomia excessivaAmplia o dano possível ao oferecer poderes desnecessários, mesmo quando o desvio não vem de uma injeção.
// PERGUNTAS——— Respostas diretas

Perguntas frequentes sobre Prompt injection — injeção de instruções

Uma página citada pode conter prompt injection?

Sim. Ter URL pública, aparência profissional ou informação útil não transforma o restante da página em instrução autorizada. O agente pode aproveitar dados relevantes e, simultaneamente, rejeitar tentativas de mudar sua tarefa ou suas permissões.

Bloquear palavras como ignorar resolve o problema?

Não. Palavras isoladas também aparecem em contextos legítimos, e tentativas de manipulação podem assumir outras formas. Combine separação de confiança, validação de ferramentas e testes de comportamento, acompanhando tanto os desvios quanto os bloqueios indevidos.

Como discutir o risco sem ensinar um ataque?

Explique a fronteira violada, o impacto possível e o comportamento defensivo esperado. Use documentos sintéticos e operações simuladas, sem credenciais, vítimas ou instruções reproduzíveis para extrair informações de sistemas reais.

// 004——— Governança

Limitações que acompanham a definição

  • Filtros podem confundir citações legítimas com instruções e interromper uma pesquisa que deveria continuar normalmente.
  • Novos formatos e integrações podem criar caminhos de entrada ausentes do conjunto de testes inicial.
  • Uma resposta aparentemente correta não demonstra que todas as operações intermediárias respeitaram as permissões previstas.

O que conferir antes de aplicar

  • Classificar páginas e arquivos como dados, não como autoridade.
  • Testar ferramentas com argumentos fora do escopo, sem executar efeitos reais.
  • Separar taxa de bloqueio de sucesso da tarefa legítima.
// 005——— Evidências

Fontes utilizadas nesta página

As referências priorizam documentação oficial, pesquisa original e metodologia pública quando o conceito é operacional ou proprietário.

  1. 01
    OWASP — LLM01:2025 Prompt Injection ↗

    Taxonomia e diferença entre entradas diretas e conteúdo externo; fundamenta a definição.

  2. 02
    OWASP — LLM Prompt Injection Prevention Cheat Sheet ↗

    Separação de confiança e defesa em camadas; orienta o roteiro defensivo.

  3. 03
    Microsoft — Prompt Shields ↗

    Detecção em prompts e documentos, com limites e possibilidade de falsos resultados.