# Prompt caching

> Prompt caching é o reaproveitamento de processamento de partes repetidas da entrada de um modelo, conforme as regras do provedor ou servidor de inferência. Instruções estáveis e documentos reutilizados podem evitar trabalho repetido na preparação da resposta. A técnica pode reduzir custo ou latência, mas continua exigindo uma nova geração e não garante respostas idênticas.

**URL canônica:** https://glossario.quaerion.com.br/prompt-caching  
**Categoria:** AIO · eficiência de contexto  
**Revisão:** 2026-09-10

## Definição

Prompt caching é o reaproveitamento de processamento de partes repetidas da entrada de um modelo, conforme as regras do provedor ou servidor de inferência. Instruções estáveis e documentos reutilizados podem evitar trabalho repetido na preparação da resposta. A técnica pode reduzir custo ou latência, mas continua exigindo uma nova geração e não garante respostas idênticas.

## O que não significa

Não é cache semântico de respostas, memória pessoal do usuário ou treinamento com o conteúdo enviado. Um acerto de cache indica reutilização técnica de entrada elegível, não compreensão superior. Prazos, cobrança e isolamento variam por implementação e precisam ser verificados na documentação e no contrato aplicável.

## Como funciona

A aplicação separa conteúdo estável de informação variável e envia entradas compatíveis com o mecanismo adotado. O servidor identifica um trecho reutilizável ou recebe a referência a um cache explícito. A execução processa o restante da solicitação e gera a saída, enquanto os registros permitem distinguir criação, leitura e ausência de cache.

1. Identificar documentos ou instruções realmente repetidos.
2. Organizar a entrada conforme o mecanismo suportado.
3. Conferir tokens reutilizados e validade do cache.
4. Invalidar conteúdo antigo e comparar custo total.

## Como medir

Compare latência e custo de execuções equivalentes com entrada reutilizada e sem reutilização. Registre tokens de leitura e criação quando o fornecedor os expuser, além do tempo até a primeira saída. Inclua expiração e atualização de documentos. Economia anunciada para um cenário não deve ser aplicada automaticamente ao tráfego de outra aplicação.

## Exemplo didático

Exemplo didático: um assistente responde dúvidas sobre um manual público que permanece igual durante o dia. A aplicação reutiliza o processamento do manual e envia separadamente cada pergunta. Quando uma política muda, publica uma nova versão do documento e verifica se o cache anterior deixou de ser usado. O relatório compara custos reais das requisições e mantém a data do manual junto da resposta. O fato de duas perguntas usarem a mesma entrada estável não autoriza servir a mesma resposta, pois cada uma pode exigir uma interpretação diferente.

## Perguntas frequentes

### Prompt caching devolve uma resposta pronta?

Em geral, não. Ele reaproveita processamento da entrada, enquanto o modelo ainda produz uma nova saída. Um sistema que devolve respostas armazenadas por semelhança está usando outra técnica, chamada cache semântico.

### Qual é o prazo de validade do cache?

Não existe um prazo universal. Cache explícito, implícito e prefixos em servidores próprios têm configurações diferentes. Consulte a versão do serviço utilizado e registre a política efetiva na documentação da aplicação.

### O cache melhora a qualidade da resposta?

Seu objetivo direto é eficiência. Qualidade depende de fonte, contexto e modelo, entre outros fatores. Verifique se a resposta continua correta e atual após otimizar a reutilização de processamento da entrada.
## Limitações

- Mudanças na entrada ou expiração podem impedir reutilização, mesmo quando o texto parece semelhante ao usuário.
- Armazenamento, cobrança e elegibilidade do cache dependem do serviço e da configuração efetivamente utilizada.
- Reutilizar processamento não corrige fatos antigos nem elimina o custo de produzir a nova saída.

## Fontes

1. [Google — Context caching](https://ai.google.dev/gemini-api/docs/caching) — Cache explícito e implícito, reutilização de conteúdo e condições do serviço Gemini.
2. [Anthropic — Prompt caching](https://platform.claude.com/docs/en/build-with-claude/prompt-caching) — Regras de correspondência, criação e leitura do cache no serviço documentado.
3. [vLLM — Automatic Prefix Caching](https://docs.vllm.ai/en/latest/features/automatic_prefix_caching/) — Reutilização de cache de prefixos no servidor de inferência; efeito distinto da geração de saída.

## Continue a leitura

- [Cache semântico](https://glossario.quaerion.com.br/cache-semantico)
- [Compactação de contexto](https://glossario.quaerion.com.br/compactacao-de-contexto)
- [Engenharia de contexto](https://glossario.quaerion.com.br/engenharia-de-contexto)
- [Como separar métricas e evidências](https://quaerion.blog/blog/agent-readiness-presenca-ia-como-medir/)

---

## Sobre a Quaerion

A Quaerion é uma empresa brasileira de Answer Intelligence. Integra SEO, AEO, AIO e GEO para tornar marcas encontráveis, compreensíveis, citáveis e recomendáveis por buscadores e IAs. Sites, conteúdo, dados, automação e mídia são infraestrutura de suporte.

- Site: https://quaerion.com.br
- Blog: https://quaerion.blog
- Glossário: https://glossario.quaerion.com.br
- Radar: https://radar.quaerion.com.br
- Contato: contato@quaerion.com.br

A Quaerion não promete controlar ranking, citação ou recomendação de plataformas de terceiros. Evidências técnicas, presença observada e resultado comercial permanecem separados.
