# Difusão mascarada no espaço de códigos versus no espaço de tokens: como compará-las

Canonical HTML: https://aogavrilov.com/pt/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: pt

NOTA DE PESQUISA

Um protocolo de comparação coerente entre etapas para modelos de linguagem de difusão mascarada no espaço de códigos e no espaço de tokens quando o codec discreto apresenta perdas.

Publicado 30 de julho de 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

RESPOSTA DIRETA

## Como comparar a modelagem de linguagem por difusão mascarada no espaço de códigos e no espaço de tokens?

Avalie o texto-fonte, as reconstruções pelo codec, as saídas no espaço de tokens e as saídas decodificadas do espaço de códigos com o mesmo avaliador externo e o mesmo pré-processamento. Relate separadamente a diferença de reconstrução pelo codec: a geração no espaço de códigos não pode recuperar informações que o codec já removeu.

## Por que a distinção é importante

O método e a garantia alegada precisam compartilhar o mesmo limite observável.

Um modelo no espaço de tokens gera diretamente tokens de texto. Um modelo no espaço de códigos gera primeiro códigos latentes discretos e então depende de um decodificador para recuperar o texto. Suas saídas finais podem ser comparadas, mas o pipeline no espaço de códigos tem um ponto adicional de falha: a perda de reconstrução pode reduzir o teto de qualidade antes mesmo do início da geração latente.

Uma comparação justa exige, portanto, duas perguntas, e não apenas uma. Primeiro, pergunte quanta qualidade o codec preserva sem qualquer geração. Depois, determine quanta perda adicional cada gerador introduz sob um mesmo protocolo inalterado de avaliação do texto decodificado.

## Um procedimento prático

1. Estabeleça a linha de base do texto-fonte Pontue os textos-fonte reservados com o avaliador e o pré-processamento que serão utilizados em todas as etapas posteriores.
2. Avalie a reconstrução antes da geração Codifique e decodifique os mesmos exemplos sem amostrar novos códigos. Esse procedimento isola o limite superior imposto pelo codec.
3. Avalie ambos os espaços de geração após a decodificação Avalie diretamente as amostras no espaço de tokens e decodifique as amostras no espaço de código antes de avaliá-las. Não compare um indicador indireto latente com uma métrica aplicada ao texto decodificado.
4. Informe as distribuições e a incerteza Apresente a mediana e o comportamento nas caudas, o número de amostras, o pré-processamento e a incerteza entre execuções repetidas. Uma única média pode ocultar falhas graves de reconstrução.

## Evidências necessárias

Uma afirmação é tão sólida quanto a propriedade medida após a geração ou a decodificação.

- O mesmo avaliador externo de texto decodificado e o mesmo pré-processamento são utilizados em todos os pontos de verificação.
- Os resultados da fonte, da reconstrução, do espaço de tokens e do espaço de código decodificado são apresentados separadamente.
- A lacuna na reconstrução do codec não é atribuída ao gerador latente.
- Toda comparação entre médias deve ser acompanhada pela mediana e pelo comportamento nas caudas.
- As sementes ou estimativas de incerteza são apresentadas antes que pequenas diferenças sejam generalizadas.

### O que o estudo vinculado relata

- Na configuração 64-para-16 do TinyStories relatada, somente a reconstrução pelo codec elevou a perplexidade externa mediana de 15.17 para 27.36.
- Sob o mesmo avaliador, o MDLM no espaço de códigos alcançou perplexidade mediana de 26.55, enquanto a linha de base no espaço de tokens atingiu 38.42, o que corresponde a uma redução de 30.9% para a geração no espaço de códigos nesse experimento.
- A regularização sensível à geometria melhorou os diagnósticos latentes locais nas execuções pareadas disponíveis, mas não melhorou as métricas do texto decodificado.

[Ler a visão geral da publicação](https://aogavrilov.com/pt/publications/where-quality-breaks/) [Pesquisar no texto integral do artigo](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Limite do escopo

- Estes números descrevem um regime de compressão do TinyStories, um codec hierárquico e a configuração de avaliação relatada; eles não estabelecem uma ordenação universal entre modelos no espaço de códigos e no espaço de tokens.
- A perplexidade é informativa, mas não constitui uma medida completa da qualidade semântica, da diversidade, da factualidade ou da utilidade.
- As comparações disponíveis devem ser interpretadas à luz dos tamanhos de amostra declarados e das limitações relativas à incerteza.

## Fontes primárias e trabalhos relacionados

Consulte os artigos vinculados para conhecer os métodos originais, as medições e as limitações declaradas.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/pt/publications/where-quality-breaks/) Artigo principal e medições relatadas por etapa.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Formulação de difusão discreta mascarada utilizada pelo gerador latente.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Método fundamental de aprendizagem de representações discretas.

Mantido por Alexey Gavrilov . Esta página sintetiza as evidências existentes e não acrescenta resultados experimentais além dos apresentados nas fontes citadas.
