O que Prompt caching significa
Prompt caching é o reaproveitamento de processamento de partes repetidas da entrada de um modelo, conforme as regras do provedor ou servidor de inferência. Instruções estáveis e documentos reutilizados podem evitar trabalho repetido na preparação da resposta. A técnica pode reduzir custo ou latência, mas continua exigindo uma nova geração e não garante respostas idênticas.
Como o conceito funciona na prática
A aplicação separa conteúdo estável de informação variável e envia entradas compatíveis com o mecanismo adotado. O servidor identifica um trecho reutilizável ou recebe a referência a um cache explícito. A execução processa o restante da solicitação e gera a saída, enquanto os registros permitem distinguir criação, leitura e ausência de cache.
- 01
Identificar documentos ou instruções realmente repetidos.
- 02
Organizar a entrada conforme o mecanismo suportado.
- 03
Conferir tokens reutilizados e validade do cache.
- 04
Invalidar conteúdo antigo e comparar custo total.
Como verificar sem extrapolar a evidência
Compare latência e custo de execuções equivalentes com entrada reutilizada e sem reutilização. Registre tokens de leitura e criação quando o fornecedor os expuser, além do tempo até a primeira saída. Inclua expiração e atualização de documentos. Economia anunciada para um cenário não deve ser aplicada automaticamente ao tráfego de outra aplicação.
Como isso aparece em uma situação prática?
Exemplo didático: um assistente responde dúvidas sobre um manual público que permanece igual durante o dia. A aplicação reutiliza o processamento do manual e envia separadamente cada pergunta. Quando uma política muda, publica uma nova versão do documento e verifica se o cache anterior deixou de ser usado. O relatório compara custos reais das requisições e mantém a data do manual junto da resposta. O fato de duas perguntas usarem a mesma entrada estável não autoriza servir a mesma resposta, pois cada uma pode exigir uma interpretação diferente.
Exemplo explicativo; não é caso de cliente nem resultado certificado.Funções diferentes exigem evidências diferentes
| Conceito | Como distinguir |
|---|---|
| Cache semântico | Reutiliza uma resposta por similaridade; prompt caching reaproveita processamento de entrada. |
| Compactação | Reduz o contexto ativo; caching pode conservar o mesmo conteúdo lógico. |
| Memória de longo prazo | Seleciona informação persistente para novas tarefas; cache atende uma otimização de execução. |
Perguntas frequentes sobre Prompt caching
Prompt caching devolve uma resposta pronta?
Em geral, não. Ele reaproveita processamento da entrada, enquanto o modelo ainda produz uma nova saída. Um sistema que devolve respostas armazenadas por semelhança está usando outra técnica, chamada cache semântico.
Qual é o prazo de validade do cache?
Não existe um prazo universal. Cache explícito, implícito e prefixos em servidores próprios têm configurações diferentes. Consulte a versão do serviço utilizado e registre a política efetiva na documentação da aplicação.
O cache melhora a qualidade da resposta?
Seu objetivo direto é eficiência. Qualidade depende de fonte, contexto e modelo, entre outros fatores. Verifique se a resposta continua correta e atual após otimizar a reutilização de processamento da entrada.
Limitações que acompanham a definição
- Mudanças na entrada ou expiração podem impedir reutilização, mesmo quando o texto parece semelhante ao usuário.
- Armazenamento, cobrança e elegibilidade do cache dependem do serviço e da configuração efetivamente utilizada.
- Reutilizar processamento não corrige fatos antigos nem elimina o custo de produzir a nova saída.
O que conferir antes de aplicar
- Registrar versão do documento reutilizado.
- Medir criação e leitura de cache separadamente.
- Testar expiração e invalidação após atualização.
Fontes utilizadas nesta página
As referências priorizam documentação oficial, pesquisa original e metodologia pública quando o conceito é operacional ou proprietário.
- 01Google — Context caching ↗
Cache explícito e implícito, reutilização de conteúdo e condições do serviço Gemini.
- 02Anthropic — Prompt caching ↗
Regras de correspondência, criação e leitura do cache no serviço documentado.
- 03vLLM — Automatic Prefix Caching ↗
Reutilização de cache de prefixos no servidor de inferência; efeito distinto da geração de saída.
