← Voltar ao glossário// TERMO CANÔNICO——— AIO · orçamento de inferência

Test-time compute

Definição canônicaRevisão: 10/09/20263 fontes

// 001——— Escopo

O que Test-time compute significa

Test-time compute é a computação empregada durante a resolução de uma entrada, depois do treinamento do modelo. Em sistemas de linguagem, pode ser ampliada por processamento sequencial, geração de candidatos, busca e verificação. A estratégia procura melhorar resultados dentro de um orçamento, mas seus benefícios dependem da tarefa, do modelo e do mecanismo de seleção.

// 002——— Mecanismo

Como o conceito funciona na prática

O sistema distribui um orçamento entre produzir alternativas, revisar propostas ou verificar resultados. A decisão pode variar conforme a dificuldade estimada da entrada. Para saber se o gasto adicional ajudou, é necessário comparar configurações sob critérios equivalentes e incluir o custo dos verificadores, das ferramentas e das tentativas descartadas.

  1. 01

    Definir orçamento e critério de sucesso da tarefa.

  2. 02

    Escolher busca, revisão ou geração de candidatos.

  3. 03

    Avaliar alternativas com um verificador adequado.

  4. 04

    Encerrar por sucesso, limite ou necessidade de revisão humana.

// 003——— Medição

Como verificar sem extrapolar a evidência

Construa uma curva entre orçamento e resultado, usando a mesma amostra e o mesmo critério de correção. Registre o custo completo, incluindo candidatos rejeitados e verificação. Compare tarefas simples e difíceis separadamente. Um ganho médio pode esconder regressões ou gastos desnecessários; a escolha útil depende do benefício incremental e das restrições operacionais.

PublicadoValidadoObservadoVerificado
Uma etapa anterior não comprova automaticamente a seguinte.
// EXEMPLO DIDÁTICO

Como isso aparece em uma situação prática?

Exemplo didático: um assistente gera consultas para obter um dado de um conjunto público. A equipe compara uma tentativa direta com um fluxo que propõe alternativas e executa testes de consistência antes de escolher. O orçamento inclui todas as consultas e verificações, não apenas a resposta escolhida. Se o fluxo ampliado acerta mais casos difíceis, o resultado vale para aquela amostra. Para perguntas simples, o custo adicional pode não trazer benefício. Nenhum valor dessa demonstração é apresentado como métrica de cliente ou projeção de avanço rumo à AGI.

Exemplo explicativo; não é caso de cliente nem resultado certificado.
// DISTINÇÕES——— Conceitos próximos

Funções diferentes exigem evidências diferentes

Comparação conceitual, não ranking de produtos
ConceitoComo distinguir
Training computeÉ gasto na aprendizagem dos parâmetros; test-time compute ocorre ao resolver a entrada.
LatênciaMede tempo percebido, incluindo rede e filas; não é uma medida direta de computação útil.
Modelo maiorÉ uma escolha de capacidade; aumentar esforço de inferência é outra dimensão de projeto.
// PERGUNTAS——— Respostas diretas

Perguntas frequentes sobre Test-time compute

Test-time compute é igual a raciocínio longo?

Não. Processamento sequencial é uma opção, mas também existem estratégias que geram alternativas em paralelo ou usam verificadores. O conceito se refere ao trabalho durante a inferência, não apenas ao comprimento de um texto.

Como escolher o orçamento adequado?

Compare ganho de qualidade, custo e prazo em tarefas representativas. Defina limites e critérios de parada antes da execução. Orçamentos diferentes podem ser apropriados para dúvidas simples, reconciliações complexas e casos sem evidência suficiente.

Várias respostas concordando provam que estão certas?

Não. Candidatos podem compartilhar o mesmo erro ou a mesma fonte incorreta. Concordância é um sinal usado por algumas estratégias, mas a validação precisa considerar referências, testes ou critérios externos à votação.

// 004——— Governança

Limitações que acompanham a definição

  • Um verificador fraco pode preferir uma alternativa incorreta, mesmo após o sistema produzir várias candidatas.
  • Mais computação não fornece automaticamente fatos atualizados nem corrige uma fonte externa que esteja errada.
  • Estratégias eficazes em uma amostra podem ter outro comportamento sob tarefas, modelos ou orçamentos diferentes.

O que conferir antes de aplicar

  • Contabilizar candidatos descartados e verificadores.
  • Comparar qualidade no mesmo conjunto de tarefas.
  • Definir parada e tratamento de resultados inconclusivos.
// 005——— Evidências

Fontes utilizadas nesta página

As referências priorizam documentação oficial, pesquisa original e metodologia pública quando o conceito é operacional ou proprietário.

  1. 01
    Snell et al. — Scaling LLM Test-Time Compute Optimally ↗

    Distribuição de computação por problema e dependência da dificuldade nas estratégias avaliadas.

  2. 02
    Wang et al. — Self-Consistency Improves Chain of Thought Reasoning ↗

    Uso de múltiplas trajetórias e agregação de respostas, com resultados específicos dos experimentos.

  3. 03
    Muennighoff et al. — s1: Simple test-time scaling ↗

    Pesquisa sobre controle de orçamento de inferência; não constitui garantia universal de ganho.