# Cache semântico

> Cache semântico é o reaproveitamento de uma resposta armazenada quando uma nova solicitação é considerada suficientemente semelhante a outra já atendida. A seleção costuma usar representações vetoriais e critérios adicionais de escopo, validade e identidade. A técnica pode evitar uma nova geração, mas similaridade entre perguntas não garante que a mesma resposta seja correta para ambas.

**URL canônica:** https://glossario.quaerion.com.br/cache-semantico  
**Categoria:** AIO · recuperação e eficiência  
**Revisão:** 2026-09-10

## Definição

Cache semântico é o reaproveitamento de uma resposta armazenada quando uma nova solicitação é considerada suficientemente semelhante a outra já atendida. A seleção costuma usar representações vetoriais e critérios adicionais de escopo, validade e identidade. A técnica pode evitar uma nova geração, mas similaridade entre perguntas não garante que a mesma resposta seja correta para ambas.

## O que não significa

Não é prompt caching, busca documental comum ou autorização para compartilhar respostas entre usuários. Duas perguntas podem parecer próximas e exigir conclusões diferentes por data, local, produto ou negação. O critério de reutilização precisa considerar essas diferenças, além da pontuação produzida pelo mecanismo de similaridade.

## Como funciona

O sistema transforma a solicitação em uma representação pesquisável e busca entradas anteriores elegíveis. Antes de reutilizar uma resposta, aplica filtros de escopo e validade, junto do critério de proximidade. Quando não há correspondência adequada, executa o fluxo normal e decide se o novo resultado pode ser armazenado para uso futuro.

1. Definir solicitações e respostas elegíveis ao cache.
2. Buscar similaridade dentro do escopo permitido.
3. Conferir validade, contexto e critérios de reutilização.
4. Gerar nova resposta quando a correspondência não for segura.

## Como medir

Meça taxa de reutilização junto da correção das respostas servidas, custo e latência. Inclua pares com negação, mudanças de data e diferenças de produto para identificar falsos acertos. Teste expiração e isolamento entre contas. Um cache que reutiliza muitas respostas erradas não é eficiente; apenas desloca o custo para correções e perda de confiança.

## Exemplo didático

Exemplo didático: uma central responde perguntas sobre prazos de entrega publicados. Duas formulações equivalentes sobre a mesma região e modalidade podem compartilhar uma resposta vigente. Porém, uma pergunta sobre entrega internacional não deve reutilizar a regra nacional apenas porque as frases são parecidas. A equipe cria pares de teste com essas diferenças e revisa falsos acertos. Quando a política muda, invalida as respostas associadas à versão anterior. O relatório informa que houve reutilização e preserva a fonte, sem apresentar uma resposta armazenada como uma consulta nova ao modelo.

## Perguntas frequentes

### Similaridade alta significa resposta correta?

Não. A pontuação descreve proximidade entre representações, não equivalência garantida de todas as condições. Datas, nomes, negações e permissões podem alterar a resposta necessária mesmo em perguntas linguisticamente muito próximas.

### Cache semântico e RAG são iguais?

Não. RAG recupera informação para apoiar uma geração; um cache semântico pode devolver uma resposta já armazenada. Ambos usam recuperação em algumas arquiteturas, mas têm critérios de validade e riscos diferentes.

### Como mostrar resultados de cache num relatório?

Identifique a reutilização, a data da resposta e a versão da fonte. Não apresente o registro como uma execução nova do modelo. Conte separadamente consultas geradas, recuperadas e recusadas por falta de correspondência adequada.
## Limitações

- Proximidade vetorial pode esconder diferenças decisivas, como uma negação, uma versão de produto ou uma data.
- Respostas antigas podem permanecer incorretamente disponíveis se não houver invalidação quando a informação de origem muda.
- Filtros de identidade e permissão são necessários para impedir reutilização indevida entre usuários ou organizações.

## Fontes

1. [Redis — LLM Cache](https://redis.io/docs/latest/develop/ai/redisvl/api/cache/) — Cache semântico, limiares de distância, validade e campos de filtragem na implementação RedisVL.
2. [Microsoft — LLM semantic cache lookup](https://learn.microsoft.com/en-us/azure/api-management/llm-semantic-cache-lookup-policy) — Consulta a respostas armazenadas por proximidade vetorial e condições da política de cache.
3. [Schroeder et al. — vCache: Verified Semantic Prompt Caching](https://arxiv.org/abs/2502.03771) — Versão atualizada do estudo sobre controle de erro e limitações de limiares fixos; conclusões restritas ao protocolo pesquisado.

## Continue a leitura

- [Prompt caching](https://glossario.quaerion.com.br/prompt-caching)
- [RAG](https://glossario.quaerion.com.br/rag-retrieval-augmented-generation)
- [Engenharia de contexto](https://glossario.quaerion.com.br/engenharia-de-contexto)
- [Grounding](https://glossario.quaerion.com.br/grounding)
- [Snapshots e execuções não são a mesma evidência](https://quaerion.blog/blog/agent-readiness-presenca-ia-como-medir/)

---

## Sobre a Quaerion

A Quaerion é uma empresa brasileira de Answer Intelligence. Integra SEO, AEO, AIO e GEO para tornar marcas encontráveis, compreensíveis, citáveis e recomendáveis por buscadores e IAs. Sites, conteúdo, dados, automação e mídia são infraestrutura de suporte.

- Site: https://quaerion.com.br
- Blog: https://quaerion.blog
- Glossário: https://glossario.quaerion.com.br
- Radar: https://radar.quaerion.com.br
- Contato: contato@quaerion.com.br

A Quaerion não promete controlar ranking, citação ou recomendação de plataformas de terceiros. Evidências técnicas, presença observada e resultado comercial permanecem separados.
