← Voltar ao glossário// TERMO CANÔNICO——— Recuperação · infraestrutura

Banco vetorial — Vector Database

Definição canônicaRevisão: 10/09/20263 fontes

// 001——— Escopo

O que Banco vetorial — Vector Database significa

Banco vetorial é um sistema de armazenamento e consulta que permite recuperar registros pela proximidade entre vetores, frequentemente embeddings de textos, imagens ou outros conteúdos. Pode ser um produto especializado ou uma capacidade de um banco existente. Identificadores e metadados ligam as representações às fontes, enquanto índices e filtros influenciam velocidade, cobertura e escopo dos resultados.

// 002——— Mecanismo

Como o conceito funciona na prática

O acervo é transformado em representações compatíveis com o modelo de embeddings escolhido e associado a identificadores persistentes. A consulta usa uma representação no mesmo espaço para buscar vizinhos próximos. Dependendo da implementação, a busca é exata ou aproximada. Metadados permitem restringir o universo pesquisável por atributos, como coleção, versão ou autorização.

  1. 01

    Definir documentos, identificadores, modelo de embeddings e dimensões compatíveis.

  2. 02

    Armazenar vetores, referências aos originais e metadados necessários à consulta.

  3. 03

    Pesquisar similaridade com índice e filtros adequados ao acervo autorizado.

  4. 04

    Recuperar as fontes legíveis e validar atualização, exclusão e isolamento.

// 003——— Medição

Como verificar sem extrapolar a evidência

Compare a busca aproximada com uma referência exata em uma amostra controlada. Registre recall, latência, uso de memória e atraso entre atualização do documento e disponibilidade no índice. Teste exclusões e consultas entre organizações distintas. Uma recuperação rápida que devolve material revogado ou pertencente a outro cliente não atende ao requisito operacional.

PublicadoValidadoObservadoVerificado
Uma etapa anterior não comprova automaticamente a seguinte.
// EXEMPLO DIDÁTICO

Como isso aparece em uma situação prática?

Uma empresa organiza manuais de produtos em um banco com vetores, título, versão e localização do arquivo. Ao perguntar sobre manutenção, o assistente recupera passagens próximas e mostra suas fontes. Se um manual é substituído, a equipe precisa atualizar o índice e impedir que a versão retirada continue alimentando respostas atuais. Em uma plataforma com várias empresas, também testa se uma consulta de um cliente jamais recebe documentos de outro. Essas verificações avaliam o sistema completo, não somente a presença de um banco vetorial.

Exemplo explicativo; não é caso de cliente nem resultado certificado.
// DISTINÇÕES——— Conceitos próximos

Funções diferentes exigem evidências diferentes

Comparação conceitual, não ranking de produtos
ConceitoComo distinguir
EmbeddingÉ a representação numérica gerada para um conteúdo.
Índice vetorialÉ a estrutura usada para acelerar a busca por similaridade.
Banco vetorialAdministra registros, consultas e recursos operacionais além da representação.
// PERGUNTAS——— Respostas diretas

Perguntas frequentes sobre Banco vetorial — Vector Database

Um banco relacional pode fazer busca vetorial?

Sim, quando possui a extensão ou capacidade adequada. O pgvector, por exemplo, acrescenta operações de similaridade ao PostgreSQL. A escolha entre capacidade integrada e produto dedicado depende das necessidades e da operação existente.

Embeddings são dados anônimos por definição?

Não se deve presumir anonimato só porque o conteúdo virou números. Avalie o conteúdo de origem, os vínculos com pessoas, as permissões e o risco de recuperação. Trate também metadados e documentos associados.

Trocar o modelo de embeddings exige cuidado com o índice?

Sim. Versão, dimensões e espaço de representação precisam permanecer compatíveis. Planeje a migração, teste a nova recuperação e mantenha uma forma de retornar à configuração anterior caso a relevância piore.

// 004——— Governança

Limitações que acompanham a definição

  • Vetores produzidos por modelos incompatíveis não devem ser misturados como se compartilhassem o mesmo espaço.
  • Similaridade elevada não comprova exatidão, atualidade nem permissão de uso do documento recuperado.
  • Índices aproximados e filtros podem reduzir cobertura; medir apenas velocidade oculta perdas relevantes.

O que conferir antes de aplicar

  • Versionar o modelo de embeddings.
  • Testar exclusão e isolamento entre coleções.
  • Comparar cobertura, latência e custo de armazenamento.
// 005——— Evidências

Fontes utilizadas nesta página

As referências priorizam documentação oficial, pesquisa original e metodologia pública quando o conceito é operacional ou proprietário.

  1. 01
    Qdrant — Overview ↗

    Vetores, identificadores, coleções, metadados e recuperação por similaridade.

  2. 02
    pgvector — documentação do projeto ↗

    Busca vetorial exata e aproximada integrada ao PostgreSQL.

  3. 03
    Qdrant — Filtering ↗

    Condições sobre metadados para delimitar os resultados pesquisáveis.