# Prompt injection — injeção de instruções

> Prompt injection é a tentativa de fazer um sistema de IA tratar conteúdo recebido como uma instrução com autoridade indevida. Pode surgir na conversa ou em páginas, documentos e respostas de ferramentas consultadas pelo agente. O risco aparece quando a aplicação permite que esse conteúdo altere objetivos, divulgue informações ou influencie operações fora do pedido autorizado.

**URL canônica:** https://glossario.quaerion.com.br/prompt-injection  
**Categoria:** Segurança · fronteiras de confiança  
**Revisão:** 2026-09-10

## Definição

Prompt injection é a tentativa de fazer um sistema de IA tratar conteúdo recebido como uma instrução com autoridade indevida. Pode surgir na conversa ou em páginas, documentos e respostas de ferramentas consultadas pelo agente. O risco aparece quando a aplicação permite que esse conteúdo altere objetivos, divulgue informações ou influencie operações fora do pedido autorizado.

## O que não significa

Não é qualquer pergunta difícil, erro factual ou texto contendo palavras suspeitas. Também não é resolvida apenas com uma frase de proteção no prompt. A distinção essencial está entre informação que pode ajudar a responder e autoridade para modificar regras, conceder acesso ou executar ações.

## Como funciona

A análise defensiva acompanha a passagem de informação entre fontes e componentes. Um documento consultado deve continuar sendo evidência, mesmo quando contém frases imperativas. O roteiro proposto separa o material externo das instruções da aplicação e verifica, antes de qualquer efeito externo, se a operação corresponde à autorização real do usuário.

1. Identificar fontes externas e marcar seu nível de confiança.
2. Separar documentos recuperados de instruções autorizadas da aplicação.
3. Validar argumentos e permissões antes de acionar ferramentas.
4. Interromper desvios e registrar evidências mínimas do bloqueio.

## Como medir

Monte casos defensivos com conteúdo sintético e tarefas legítimas conhecidas. Registre desvios detectados, operações indevidas impedidas, falsos bloqueios e tarefas concluídas corretamente. Preserve versão do modelo, configuração e superfície testada. O resultado deve descrever esse conjunto de testes, sem transformar uma rodada sem incidentes em prova de imunidade permanente.

## Exemplo didático

Em um exercício fictício, um agente recebe a tarefa de comparar páginas públicas de serviços. Uma página de teste inclui um trecho que tenta redirecionar a atividade para uma ação não solicitada. A avaliação não fornece contas reais nem credenciais. O comportamento esperado é aproveitar apenas os fatos pertinentes, desconsiderar a instrução estranha e continuar a comparação dentro do escopo. O relatório registra a origem do trecho e o controle acionado, sem reproduzir dados pessoais. Esse teste valida uma fronteira específica, não toda a segurança do agente.

## Perguntas frequentes

### Uma página citada pode conter prompt injection?

Sim. Ter URL pública, aparência profissional ou informação útil não transforma o restante da página em instrução autorizada. O agente pode aproveitar dados relevantes e, simultaneamente, rejeitar tentativas de mudar sua tarefa ou suas permissões.

### Bloquear palavras como ignorar resolve o problema?

Não. Palavras isoladas também aparecem em contextos legítimos, e tentativas de manipulação podem assumir outras formas. Combine separação de confiança, validação de ferramentas e testes de comportamento, acompanhando tanto os desvios quanto os bloqueios indevidos.

### Como discutir o risco sem ensinar um ataque?

Explique a fronteira violada, o impacto possível e o comportamento defensivo esperado. Use documentos sintéticos e operações simuladas, sem credenciais, vítimas ou instruções reproduzíveis para extrair informações de sistemas reais.
## Limitações

- Filtros podem confundir citações legítimas com instruções e interromper uma pesquisa que deveria continuar normalmente.
- Novos formatos e integrações podem criar caminhos de entrada ausentes do conjunto de testes inicial.
- Uma resposta aparentemente correta não demonstra que todas as operações intermediárias respeitaram as permissões previstas.

## Fontes

1. [OWASP — LLM01:2025 Prompt Injection](https://genai.owasp.org/llmrisk/llm01-prompt-injection/) — Taxonomia e diferença entre entradas diretas e conteúdo externo; fundamenta a definição.
2. [OWASP — LLM Prompt Injection Prevention Cheat Sheet](https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html) — Separação de confiança e defesa em camadas; orienta o roteiro defensivo.
3. [Microsoft — Prompt Shields](https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection) — Detecção em prompts e documentos, com limites e possibilidade de falsos resultados.

## Continue a leitura

- [Autonomia excessiva](https://glossario.quaerion.com.br/autonomia-excessiva)
- [Guardrails](https://glossario.quaerion.com.br/guardrails)
- [Tool Calling](https://glossario.quaerion.com.br/tool-calling)
- [Guia Quaerion: preparar o site para agentes](https://quaerion.blog/blog/site-pronto-para-agentes-de-ia/)

---

## Sobre a Quaerion

A Quaerion é uma empresa brasileira de Answer Intelligence. Integra SEO, AEO, AIO e GEO para tornar marcas encontráveis, compreensíveis, citáveis e recomendáveis por buscadores e IAs. Sites, conteúdo, dados, automação e mídia são infraestrutura de suporte.

- Site: https://quaerion.com.br
- Blog: https://quaerion.blog
- Glossário: https://glossario.quaerion.com.br
- Radar: https://radar.quaerion.com.br
- Contato: contato@quaerion.com.br

A Quaerion não promete controlar ranking, citação ou recomendação de plataformas de terceiros. Evidências técnicas, presença observada e resultado comercial permanecem separados.
