# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/pt/publications/where-quality-breaks/

Document language: pt

Onde a qualidade se degrada na geração comprimida de textos curtos: localização escalonada de gargalos

Um diagnóstico escalonado da geração comprimida de textos curtos que distingue a perda de reconstrução do codec da perda de geração latente.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, São Petersburgo, Rússia](https://en.itmo.ru/)

[Ler o artigo completo em HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Texto pesquisável com fórmulas, tabelas, figuras e referências.

Manuscrito final aceito (versão disponibilizada pelo autor com DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Termos de publicação e reutilização](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## O artigo em 30 segundos

**Pergunta de pesquisa** Como atribuir separadamente ao codec e ao gerador latente a perda de qualidade em um pipeline de geração de texto comprimido?

### Problema

Na geração de textos curtos comprimidos, a baixa qualidade do texto decodificado pode decorrer de informações perdidas pelo codec ou de uma geração deficiente no espaço latente. Métricas de ponta a ponta confundem esses modos de falha e podem direcionar o esforço de otimização ao componente errado.

### Abordagem

O protocolo por etapas pontua os originais, as reconstruções pareadas pelo codec, as saídas do MDLM no espaço de tokens e as saídas da difusão no espaço de códigos por meio de um avaliador GPT-2 externo. As medidas do dicionário de códigos e da geometria continuam sendo instrumentos de diagnóstico, não substitutos da qualidade do texto decodificado.

### Resultado principal

A reconstrução pelo codec eleva a perplexidade externa mediana de 15.17 para 27.36 e o p95 de 25.10 para 98.91. Ainda assim, o MDLM no espaço de códigos reduz a perplexidade mediana em 30.9% em relação ao MDLM no espaço de tokens.

### Por que isso é importante

O resultado transforma o diagnóstico do gargalo do codec em uma sequência prática de trabalho: primeiro, aprimorar o codec; depois, comparar a geração no espaço de tokens e no espaço de códigos; e só considerar ganhos em métricas substitutas latentes quando o texto decodificado também melhorar.

## Resumo

Geradores de textos curtos comprimidos podem falhar em dois pontos distintos: o codec pode descartar informações antes do início da geração, ou o gerador latente pode produzir códigos de baixa qualidade. Sem separar esses modos de falha, os pesquisadores podem despender recursos computacionais para aprimorar o componente errado. Estudamos esse problema em um estudo de caso controlado TinyStories de 64 para 16, construído com um codec VQ-VAE-2 hierárquico e um gerador de difusão discreta mascarada (MDLM). Empregamos um protocolo de validação por etapas que separa a fidelidade da reconstrução pelo codec, a qualidade da geração latente e os diagnósticos latentes auxiliares sob um mesmo avaliador externo GPT-2, além de relatar métricas semânticas complementares para o estudo da geometria. Na configuração testada, somente a reconstrução pelo codec eleva a perplexidade externa mediana de 15.17 para 27.36 (+80.4%) e o p95 de 25.10 para 98.91 (+294.1%), indicando que a perda de qualidade dominante surge antes do início da geração latente. Sob o mesmo avaliador, o MDLM no espaço de códigos permanece substancialmente superior à difusão no espaço de tokens, reduzindo a média, a mediana e o p95 em 32.9%, 30.9% e 36.6%, respectivamente. A regularização sensível à geometria melhora as métricas substitutas latentes locais, mas não melhora as métricas do texto decodificado nas execuções disponíveis. A contribuição é metodológica, não algorítmica: o artigo apresenta um diagnóstico por etapas reutilizável para um pipeline concreto e mostra que, nesse contexto, é a fidelidade do codec, e não a remoção de ruído latente, que determina o teto prático de qualidade.

Publicado em 2026 39th Conference of Open Innovations Association (FRUCT)

Tipo de contribuição Metodologia de diagnóstico

28 de abril de 2026 número 1 pp. 69–76 Conferência principal

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Conteúdo Nesta página

## Principais resultados

| Ponto de avaliação | n | PPL média | PPL mediana | PPL p95 |
| --- | --- | --- | --- | --- |
| Textos originais | 256 | 16.24 | 15.17 | 25.1 |
| Reconstruções pelo codec | 256 | 37.26 | 27.36 | 98.91 |
| Linha de base AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM no espaço de tokens | 256 | 44.74 | 38.42 | 93.6 |
| MDLM no espaço de códigos | 256 | 30.01 | 26.55 | 59.36 |

**Resultado principal.** A maior parte da perda de qualidade observada é introduzida antes da geração; ainda assim, a difusão no espaço de códigos reduz a perplexidade mediana em 30.9% em comparação com a difusão no espaço de tokens.

Baixar resultados: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Espelho externo: [Ficha do conjunto de dados no Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF e citação

**Citar este artigo** BibTeX é o formato recomendado. Todas as variantes abaixo são geradas a partir do mesmo registro de publicação.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Arquivos de citação: [Texto em formato APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Texto IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [JSON-LD do Schema.org](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [XML OAI-DC](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [XML OpenAIRE v4](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [XML MODS](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML de metadados JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Texto integral em XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Conjunto de links (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Conjunto de links (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Guia completo

## Guia de pesquisa completo

## Método

## 

O artigo utiliza um único avaliador em três etapas de avaliação, permitindo associar cada transformação adicional a uma lacuna de qualidade mensurável.

1. Reconstruir Codifique cada amostra de 64 tokens do TinyStories em 16 códigos de nível superior e decodifique-a imediatamente para medir a perda de reconstrução pelo codec.
2. Gerar Gere tokens de texto ou códigos latentes discretos com o MDLM e, em seguida, decodifique as amostras do espaço de códigos com o mesmo codec treinado.
3. Comparar Pontue os originais, as reconstruções e os textos gerados com o mesmo protocolo externo do GPT-2, incluindo estatísticas da mediana e das caudas.

![Pipeline em etapas para geração de texto comprimido que compara o texto original, a reconstrução do codec, o MDLM no espaço de código e o texto decodificado, a fim de distinguir a perda do codec da perda de geração.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**A localização do gargalo em etapas distingue a perda de reconstrução do codec da perda de geração latente sob um protocolo comum de avaliação do texto decodificado.* Fonte: [Diagrama explicativo criado pelo autor com base no método e nos resultados publicados.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Termos de reutilização: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Atribuição sugerida: Gavrilov, Gazzaev e Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Baixar SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Ideia central

Um gerador a jusante não pode recuperar informações que o codec já descartou. Portanto, a etapa de reconstrução deve ser auditada antes da interpretação dos resultados da geração latente.

### Diferença em relação a abordagens correlatas

Comparações convencionais de ponta a ponta apresentam uma única pontuação final de geração. Este protocolo introduz um ponto de verificação de reconstrução pareada e separa as métricas de integridade no espaço latente das evidências obtidas no texto decodificado.

### O que há de novo

A contribuição consiste em uma metodologia reutilizável de diagnóstico em etapas para um pipeline concreto de texto comprimido, e não em um novo algoritmo de remoção de ruído.

## Perguntas que este artigo ajuda a responder

## 

Abra uma pergunta para obter uma resposta concisa fundamentada no artigo. Os limites detalhados das evidências estão descritos em Limitações.

1. Em que ponto a qualidade se deteriora na geração comprimida de textos curtos? No pipeline 64-para-16 do TinyStories avaliado, a degradação dominante surge na reconstrução pelo codec, antes do início da geração latente. A perplexidade externa mediana do GPT-2 aumenta de 15.17 no texto original para 27.36 após a reconstrução, enquanto o p95 aumenta de 25.10 para 98.91. Trata-se de um resultado referente a uma única configuração, e não de uma classificação universal de codecs.
2. Como separar a perda do codec da perda de geração no espaço latente? O protocolo por etapas avalia os originais, as reconstruções pareadas pelo codec e o texto final gerado com um único avaliador externo compartilhado. A diferença entre o original e a reconstrução estima a contribuição do codec, enquanto a comparação entre a reconstrução e a saída gerada ajuda a localizar a perda adicional da etapa de geração. As métricas de integridade latente são apresentadas separadamente das evidências obtidas no texto decodificado.
3. Como avaliar a geração de texto com representações latentes discretas? O artigo recomenda verificar a fidelidade da reconstrução antes de comparar geradores, aplicar em todas as etapas o mesmo avaliador de texto decodificado e apresentar estatísticas centrais e das caudas. Também trata o uso do livro de códigos, a geometria e outros indicadores indiretos latentes como diagnósticos, e não como substitutos da qualidade do texto decodificado.
4. A difusão no espaço de códigos supera a difusão no espaço de tokens? Sob o avaliador compartilhado e na configuração testada, o MDLM no espaço de códigos reduz a perplexidade média, mediana e p95 em 32.9%, 30.9% e 36.6%, respectivamente, em relação ao MDLM no espaço de tokens. A comparação é descritiva e específica dessa configuração: não estabelece uma classificação universal entre conjuntos de dados, taxas de compressão, codecs ou arquiteturas de difusão.
5. Métricas melhores da geometria latente garantem textos gerados de maior qualidade? Não. Nas execuções pareadas disponíveis, a regularização sensível à geometria melhorou as métricas substitutas locais do espaço latente, mas não melhorou as métricas do texto decodificado. O resultado sustenta a necessidade de verificar cada ganho em métricas substitutas na saída final decodificada e de tratar a ausência de transferência como um resultado negativo útil, e não como evidência de melhoria da geração.

## Comparação com abordagens correlatas

## 

| Abordagem | Representação | Controle / diagnóstico | O que é preservado ou mensurado |
| --- | --- | --- | --- |
| Difusão no espaço de tokens | Tokens de texto | Qualidade da geração no espaço de tokens | Fluência e comportamento do avaliador na geração direta |
| Geração latente comprimida | Códigos latentes discretos obtidos por meio de um codec | Qualidade final da geração de ponta a ponta | Comportamento combinado do codec e do gerador latente |
| Localização do gargalo em etapas | Texto, reconstruções do codec e variáveis latentes discretas | Distinguir a perda do codec da perda de geração | Onde a qualidade se degrada sob um único avaliador compartilhado |

A comparação distingue o escopo da avaliação e as evidências; não constitui uma classificação universal das abordagens.

## Relevância e escopo

## 

O protocolo por etapas é útil quando um pipeline generativo contém tanto um codec aprendido quanto um gerador no espaço latente, mas não está clara a origem da degradação da qualidade da saída.

1. Geração de texto comprimida e com representações latentes discretas
2. Fidelidade da reconstrução pelo codec em pipelines generativos
3. Modelagem de linguagem por difusão mascarada no espaço de códigos
4. Localização de gargalos e avaliação coerente entre etapas
5. Auditoria das melhorias em métricas substitutas do espaço latente em relação ao texto decodificado

## Limitações

## 

- O estudo empírico utiliza apenas TinyStories.
- A análise principal abrange um único regime agressivo de compressão de 64 para 16.
- O sistema avaliado combina uma família de codecs VQ-VAE-2 hierárquicos com um gerador MDLM.
- As comparações baseiam-se em execuções únicas e têm caráter descritivo, não constituindo estimativas estatísticas com múltiplas sementes.
- A perplexidade externa do GPT-2 é um diagnóstico comum, não uma métrica universal de qualidade semântica.
- As conclusões não devem ser transferidas diretamente para todos os conjuntos de dados, arquiteturas de codec ou taxas de compressão.

## Referências citadas pelo artigo

## 

Estas entradas correspondem à seção numerada de Referências no PDF do artigo.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Recursos e reprodutibilidade

## 

### Declaração sobre os dados

## Versões

## 

1. **Versão publicada** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Registro no arXiv** [Abrir o registro da pré-publicação, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Índice de pesquisa em IA** [Página do artigo no Hugging Face com identidade verificada do primeiro autor e resumo dos resultados vinculado](https://huggingface.co/papers/2607.24176)
4. **Manuscrito do autor** [PDF local com texto acessível](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Apresentação em conferência** [Apresentação na FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Índice dos anais da conferência** [Volume oficial da FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF dos anais da conferência** [Texto integral de acesso aberto da FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Abrir o registro acadêmico** [OpenAlex](https://openalex.org/W7160914887)
9. **Registro no grafo de citações** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Texto integral compartilhado pelo autor** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

O DOI publicado é o identificador bibliográfico principal. Esta página continua sendo a única URL canônica do projeto em todas as versões.

## Publicação relacionada

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/pt/publications/inspectable-control/)

Ler o [Diagnóstico do gargalo do codec](https://aogavrilov.com/pt/projects/codec-bottleneck-diagnosis/) guia de pesquisa. [Sobre o autor](https://aogavrilov.com/about/) .

### Notas de pesquisa específicas

Respostas específicas à intenção, com fronteiras de evidência e links para este artigo.

- [Difusão mascarada no espaço de códigos versus no espaço de tokens: como compará-las](https://aogavrilov.com/pt/research-notes/code-space-vs-token-space-masked-diffusion/)
