Prompt injection — injeção de instruções
O que Prompt injection — injeção de instruções significa
Prompt injection é a tentativa de fazer um sistema de IA tratar conteúdo recebido como uma instrução com autoridade indevida. Pode surgir na conversa ou em páginas, documentos e respostas de ferramentas consultadas pelo agente. O risco aparece quando a aplicação permite que esse conteúdo altere objetivos, divulgue informações ou influencie operações fora do pedido autorizado.
Como o conceito funciona na prática
A análise defensiva acompanha a passagem de informação entre fontes e componentes. Um documento consultado deve continuar sendo evidência, mesmo quando contém frases imperativas. O roteiro proposto separa o material externo das instruções da aplicação e verifica, antes de qualquer efeito externo, se a operação corresponde à autorização real do usuário.
- 01
Identificar fontes externas e marcar seu nível de confiança.
- 02
Separar documentos recuperados de instruções autorizadas da aplicação.
- 03
Validar argumentos e permissões antes de acionar ferramentas.
- 04
Interromper desvios e registrar evidências mínimas do bloqueio.
Como verificar sem extrapolar a evidência
Monte casos defensivos com conteúdo sintético e tarefas legítimas conhecidas. Registre desvios detectados, operações indevidas impedidas, falsos bloqueios e tarefas concluídas corretamente. Preserve versão do modelo, configuração e superfície testada. O resultado deve descrever esse conjunto de testes, sem transformar uma rodada sem incidentes em prova de imunidade permanente.
Como isso aparece em uma situação prática?
Em um exercício fictício, um agente recebe a tarefa de comparar páginas públicas de serviços. Uma página de teste inclui um trecho que tenta redirecionar a atividade para uma ação não solicitada. A avaliação não fornece contas reais nem credenciais. O comportamento esperado é aproveitar apenas os fatos pertinentes, desconsiderar a instrução estranha e continuar a comparação dentro do escopo. O relatório registra a origem do trecho e o controle acionado, sem reproduzir dados pessoais. Esse teste valida uma fronteira específica, não toda a segurança do agente.
Exemplo explicativo; não é caso de cliente nem resultado certificado.Funções diferentes exigem evidências diferentes
| Conceito | Como distinguir |
|---|---|
| Alucinação | É uma afirmação incorreta gerada pelo modelo; não exige uma instrução externa tentando desviar a tarefa. |
| Jailbreak | Busca contornar restrições do modelo; prompt injection também envolve a confiança concedida a documentos e ferramentas. |
| Autonomia excessiva | Amplia o dano possível ao oferecer poderes desnecessários, mesmo quando o desvio não vem de uma injeção. |
Perguntas frequentes sobre Prompt injection — injeção de instruções
Uma página citada pode conter prompt injection?
Sim. Ter URL pública, aparência profissional ou informação útil não transforma o restante da página em instrução autorizada. O agente pode aproveitar dados relevantes e, simultaneamente, rejeitar tentativas de mudar sua tarefa ou suas permissões.
Bloquear palavras como ignorar resolve o problema?
Não. Palavras isoladas também aparecem em contextos legítimos, e tentativas de manipulação podem assumir outras formas. Combine separação de confiança, validação de ferramentas e testes de comportamento, acompanhando tanto os desvios quanto os bloqueios indevidos.
Como discutir o risco sem ensinar um ataque?
Explique a fronteira violada, o impacto possível e o comportamento defensivo esperado. Use documentos sintéticos e operações simuladas, sem credenciais, vítimas ou instruções reproduzíveis para extrair informações de sistemas reais.
Limitações que acompanham a definição
- Filtros podem confundir citações legítimas com instruções e interromper uma pesquisa que deveria continuar normalmente.
- Novos formatos e integrações podem criar caminhos de entrada ausentes do conjunto de testes inicial.
- Uma resposta aparentemente correta não demonstra que todas as operações intermediárias respeitaram as permissões previstas.
O que conferir antes de aplicar
- Classificar páginas e arquivos como dados, não como autoridade.
- Testar ferramentas com argumentos fora do escopo, sem executar efeitos reais.
- Separar taxa de bloqueio de sucesso da tarefa legítima.
Fontes utilizadas nesta página
As referências priorizam documentação oficial, pesquisa original e metodologia pública quando o conceito é operacional ou proprietário.
- 01OWASP — LLM01:2025 Prompt Injection ↗
Taxonomia e diferença entre entradas diretas e conteúdo externo; fundamenta a definição.
- 02OWASP — LLM Prompt Injection Prevention Cheat Sheet ↗
Separação de confiança e defesa em camadas; orienta o roteiro defensivo.
- 03Microsoft — Prompt Shields ↗
Detecção em prompts e documentos, com limites e possibilidade de falsos resultados.
