# Destilação de modelos — Knowledge Distillation

> Destilação de modelos é uma família de técnicas em que um modelo aluno aprende usando sinais produzidos por um modelo professor, como distribuições de saída, representações ou respostas. Frequentemente busca transferir comportamento útil para uma implementação menor ou mais eficiente. O aluno não recebe automaticamente todas as capacidades do professor, e sua qualidade precisa ser testada independentemente.

**URL canônica:** https://glossario.quaerion.com.br/destilacao-de-modelos  
**Categoria:** Adaptação · transferência  
**Revisão:** 2026-09-10

## Definição

Destilação de modelos é uma família de técnicas em que um modelo aluno aprende usando sinais produzidos por um modelo professor, como distribuições de saída, representações ou respostas. Frequentemente busca transferir comportamento útil para uma implementação menor ou mais eficiente. O aluno não recebe automaticamente todas as capacidades do professor, e sua qualidade precisa ser testada independentemente.

## O que não significa

Não é copiar arquivos de pesos, reduzir a precisão numérica ou resumir um prompt. Também não significa clonar perfeitamente a inteligência de outro sistema. A transferência depende dos exemplos, do objetivo de treinamento e da capacidade do aluno, e não elimina a necessidade de conferir permissões e proveniência dos materiais utilizados.

## Como funciona

O processo escolhe tarefas e entradas, produz sinais de supervisão com o professor e treina o aluno para aproximar o comportamento desejado. Na formulação clássica, distribuições suavizadas revelam relações entre classes além do rótulo final. Outras variantes utilizam representações intermediárias. A avaliação compara aluno e professor sem tratar concordância como sinônimo de resposta correta.

1. Definir tarefa, professor, aluno e dados autorizados para produzir supervisão.
2. Coletar os sinais escolhidos e revisar erros ou exemplos inadequados.
3. Treinar o aluno com objetivo e configuração identificados e reproduzíveis.
4. Comparar qualidade independente, consumo e falhas antes da disponibilização.

## Como medir

Compare o aluno destilado com o mesmo aluno treinado sem destilação, além do professor, em dados separados. Registre qualidade por tarefa, latência, memória e consumo no ambiente pretendido. Examine erros compartilhados: concordar com um professor equivocado não é sucesso. Ganhos descritos por um artigo pertencem às configurações avaliadas, não a qualquer modelo menor.

## Exemplo didático

Um serviço precisa identificar a intenção de mensagens curtas antes de encaminhá-las ao atendimento correto. Um modelo professor ajuda a produzir supervisão para treinar um aluno menor, enquanto uma amostra revisada por pessoas permanece reservada para teste. A comparação inclui mensagens ambíguas e pedidos fora das categorias conhecidas. Se professor e aluno encaminham o mesmo caso para o setor errado, a concordância não conta como acerto. A decisão de implantação considera erros e tempo de resposta medidos no ambiente real, não apenas o tamanho menor do modelo.

## Perguntas frequentes

### Destilação exige que o aluno seja menor?

Não como definição absoluta. A ideia central é aprender com sinais de outro modelo. Reduzir tamanho ou custo é um objetivo comum, mas a arquitetura e a finalidade precisam ser declaradas em cada projeto.

### Destilação e quantização podem ser combinadas?

Sim, pois atuam de maneiras diferentes. Destilação usa treinamento com supervisão do professor; quantização altera a representação numérica. A combinação precisa ser avaliada porque cada mudança pode afetar qualidade e desempenho operacional.

### O aluno deve apenas imitar todas as respostas do professor?

Não se deve aceitar erros automaticamente. Revise a supervisão e avalie com referências independentes. O objetivo útil é atender à tarefa com qualidade demonstrada, não maximizar concordância com respostas potencialmente incorretas.
## Limitações

- Erros, vieses e lacunas do professor podem ser transmitidos ao aluno durante o treinamento.
- Um modelo eficiente em uma tarefa pode perder desempenho em demandas pouco representadas nos exemplos.
- Economia operacional depende também do hardware e do serviço, não apenas do tamanho dos pesos.

## Fontes

1. [Hinton, Vinyals e Dean — Distilling the Knowledge in a Neural Network](https://arxiv.org/abs/1503.02531) — Formulação clássica da destilação e uso de distribuições de saída.
2. [PyTorch — Knowledge Distillation Tutorial](https://docs.pytorch.org/tutorials/beginner/knowledge_distillation_tutorial.html) — Comparação controlada entre aluno sem destilação e aluno treinado com professor.
3. [Sanh e colaboradores — DistilBERT](https://arxiv.org/abs/1910.01108) — Pesquisa original de destilação no pré-treinamento de um modelo de linguagem compacto.

## Continue a leitura

- [Fine-tuning](https://glossario.quaerion.com.br/fine-tuning)
- [LoRA](https://glossario.quaerion.com.br/lora)
- [Benchmark de IA](https://glossario.quaerion.com.br/benchmark-ia)
- [Medição e limites de interpretação](https://quaerion.blog/blog/agent-readiness-presenca-ia-como-medir/)

---

## Sobre a Quaerion

A Quaerion é uma empresa brasileira de Answer Intelligence. Integra SEO, AEO, AIO e GEO para tornar marcas encontráveis, compreensíveis, citáveis e recomendáveis por buscadores e IAs. Sites, conteúdo, dados, automação e mídia são infraestrutura de suporte.

- Site: https://quaerion.com.br
- Blog: https://quaerion.blog
- Glossário: https://glossario.quaerion.com.br
- Radar: https://radar.quaerion.com.br
- Contato: contato@quaerion.com.br

A Quaerion não promete controlar ranking, citação ou recomendação de plataformas de terceiros. Evidências técnicas, presença observada e resultado comercial permanecem separados.
