# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/es/publications/where-quality-breaks/

Document language: es

Dónde se degrada la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella

Un diagnóstico por etapas de la generación comprimida de textos breves que separa la pérdida de reconstrucción del códec de la pérdida de generación latente.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [Universidad ITMO, San Petersburgo, Rusia](https://en.itmo.ru/)

[Leer el artículo completo en HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Texto consultable con fórmulas, tablas, figuras y referencias.

Manuscrito final aceptado (versión publicada por el autor con DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Condiciones de publicación y reutilización](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## El artículo en 30 segundos

**Pregunta de investigación** ¿Cómo se puede atribuir por separado al códec y al generador latente la pérdida de calidad en un proceso de generación de texto comprimido?

### Problema

En la generación comprimida de textos breves, la baja calidad del texto decodificado puede deberse a información perdida por el códec o a una generación deficiente en el espacio latente. Las métricas de extremo a extremo difuminan estos modos de fallo y pueden desviar el esfuerzo de optimización hacia el componente equivocado.

### Enfoque

El protocolo por etapas evalúa los textos originales, las reconstrucciones emparejadas del códec, las salidas del MDLM en el espacio de tokens y las salidas de difusión en el espacio de códigos mediante un único evaluador GPT-2 externo. Las medidas del libro de códigos y de su geometría se mantienen como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.

### Resultado principal

La reconstrucción del códec eleva la mediana de la perplejidad externa de 15.17 a 27.36 y el p95 de 25.10 a 98.91. Aun así, el MDLM en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente al MDLM en el espacio de tokens.

### Por qué es importante

El resultado convierte el diagnóstico del cuello de botella del códec en una secuencia de trabajo práctica: priorizar las mejoras del códec, comparar después la generación en el espacio de tokens y en el espacio de códigos, y aceptar las mejoras en indicadores indirectos del espacio latente solo si también mejora el texto decodificado.

## Resumen

Los generadores comprimidos de textos breves pueden fallar en dos puntos distintos: el códec puede descartar información antes de que comience la generación, o el generador latente puede producir códigos deficientes. Si no se separan estos modos de fallo, los investigadores pueden invertir recursos computacionales en mejorar el componente equivocado. Estudiamos este problema mediante un caso controlado de TinyStories con compresión de 64 a 16, construido a partir de un códec VQ-VAE-2 jerárquico y un generador de difusión discreta enmascarada (MDLM). Empleamos un protocolo de validación por etapas que separa la fidelidad de la reconstrucción del códec, la calidad de la generación latente y los diagnósticos latentes auxiliares, utilizando un mismo evaluador externo GPT-2; además, presentamos métricas semánticas complementarias para el estudio geométrico. En la configuración evaluada, la reconstrucción del códec por sí sola eleva la mediana de la perplejidad externa de 15.17 a 27.36 (+80.4%) y el p95 de 25.10 a 98.91 (+294.1%), lo que indica que la pérdida de calidad dominante aparece antes de iniciarse la generación latente. Con el mismo evaluador, el MDLM en el espacio de códigos sigue siendo considerablemente superior a la difusión en el espacio de tokens y reduce la media, la mediana y el p95 en un 32.9%, un 30.9% y un 36.6%, respectivamente. La regularización sensible a la geometría mejora los indicadores latentes indirectos locales, pero no las métricas del texto decodificado en las ejecuciones disponibles. La contribución es metodológica y no algorítmica: el artículo presenta un diagnóstico por etapas reutilizable para un proceso concreto y muestra que, en este contexto, la fidelidad del códec, más que la eliminación de ruido latente, determina el límite práctico de calidad.

Publicado en 39th Conference of Open Innovations Association (FRUCT), 2026

Tipo de contribución Metodología de diagnóstico

28 de abril de 2026 número 1 pp. 69–76 Conferencia principal

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Contenido En esta página

## Resultados principales

| Punto de evaluación | n | PPL media | PPL mediana | PPL p95 |
| --- | --- | --- | --- | --- |
| Textos originales | 256 | 16.24 | 15.17 | 25.1 |
| Reconstrucciones del códec | 256 | 37.26 | 27.36 | 98.91 |
| Línea base AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM en el espacio de tókenes | 256 | 44.74 | 38.42 | 93.6 |
| MDLM en el espacio de códigos | 256 | 30.01 | 26.55 | 59.36 |

**Resultado principal.** La mayor parte de la pérdida de calidad observada se produce antes de la generación; aun así, la difusión en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente a la difusión en el espacio de tókenes.

Descargar resultados: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Réplica externa: [Ficha del conjunto de datos en Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF y cita

**Citar este artículo** BibTeX es el formato recomendado. Todas las variantes siguientes se generan a partir del mismo registro de publicación.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Archivos de cita: [Texto APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Texto IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [JSON-LD de Schema.org](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [XML OAI-DC](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [XML OpenAIRE v4](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [XML MODS](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML de metadatos JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Texto completo en XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Conjunto de enlaces (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Conjunto de enlaces (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Guía completa

## Guía de investigación completa

## Método

## 

El artículo emplea un único evaluador en tres etapas de evaluación, de modo que cada transformación adicional pueda asociarse con una brecha de calidad cuantificable.

1. Reconstruir Codifique cada muestra de TinyStories de 64 tókenes en 16 códigos de nivel superior y decodifíquela de inmediato para medir la pérdida de reconstrucción del códec.
2. Generar Genere con MDLM tókenes de texto o códigos latentes discretos y, a continuación, decodifique las muestras del espacio de códigos mediante el mismo códec entrenado.
3. Comparar Evaluar los originales, las reconstrucciones y los textos generados con el mismo protocolo externo basado en GPT-2, incluidas las estadísticas de la mediana y de las colas.

![Proceso por etapas de generación de texto comprimido que compara el texto original, la reconstrucción del códec, el MDLM en el espacio de códigos y el texto decodificado para separar la pérdida debida al códec de la pérdida debida a la generación.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**La localización por etapas del cuello de botella separa la pérdida de reconstrucción del códec de la pérdida de generación latente conforme a un mismo protocolo de evaluación del texto decodificado.* Fuente: [Diagrama explicativo elaborado por el autor a partir del método y los resultados publicados.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Condiciones de reutilización: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Atribución sugerida: Gavrilov, Gazzaev y Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Descargar SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Idea principal

Un generador posterior no puede recuperar la información que el códec ya ha descartado. Por tanto, debe auditarse la etapa de reconstrucción antes de interpretar los resultados de generación latente.

### Diferencias respecto de enfoques afines

Las comparaciones integrales convencionales comunican una única puntuación final de generación. Este protocolo incorpora un punto de control de reconstrucción emparejada y separa las métricas de estado del espacio latente de la evidencia obtenida sobre el texto decodificado.

### Novedad

La contribución consiste en una metodología reutilizable de diagnóstico por etapas para un proceso concreto de texto comprimido, y no en un nuevo algoritmo de eliminación de ruido.

## Preguntas que este artículo ayuda a responder

## 

Abra una pregunta para obtener una respuesta concisa fundamentada en el artículo. Los límites detallados de la evidencia figuran en Limitaciones.

1. ¿Dónde se deteriora la calidad en la generación comprimida de textos breves? En el proceso 64-a-16 de TinyStories evaluado, la degradación dominante aparece durante la reconstrucción del códec, antes de que comience la generación latente. La perplejidad externa mediana de GPT-2 aumenta de 15.17 para el texto original a 27.36 tras la reconstrucción, mientras que p95 pasa de 25.10 a 98.91. Este resultado corresponde a una única configuración y no constituye una clasificación universal de códecs.
2. ¿Cómo se puede separar la pérdida del códec de la pérdida de generación latente? El protocolo por etapas evalúa los originales, las reconstrucciones emparejadas del códec y el texto final generado mediante un mismo evaluador externo. La brecha entre el original y la reconstrucción estima la contribución del códec, mientras que la comparación entre la reconstrucción y la salida generada ayuda a localizar la pérdida adicional de la etapa de generación. Las métricas de calidad latente se presentan por separado de la evidencia obtenida del texto decodificado.
3. ¿Cómo debe evaluarse la generación de texto con variables latentes discretas? El artículo recomienda comprobar la fidelidad de la reconstrucción antes de comparar generadores, aplicar en cada etapa el mismo evaluador del texto decodificado y comunicar estadísticas centrales y de las colas. Asimismo, considera el uso del libro de códigos, la geometría y otros indicadores indirectos latentes como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.
4. ¿La difusión en el espacio de códigos supera a la difusión en el espacio de tókenes? Con el evaluador común y la configuración probada, el MDLM en el espacio de códigos reduce la perplejidad media, mediana y p95 en un 32.9%, 30.9% y 36.6%, respectivamente, frente al MDLM en el espacio de tókenes. La comparación es descriptiva y específica de la configuración: no establece una clasificación universal entre conjuntos de datos, relaciones de compresión, códecs o arquitecturas de difusión.
5. ¿Unas métricas mejores de la geometría latente garantizan un texto generado de mayor calidad? No. En las ejecuciones comparables disponibles, la regularización sensible a la geometría mejoró los indicadores indirectos locales del espacio latente, pero no las métricas del texto decodificado. Este resultado aconseja comprobar toda mejora de un indicador indirecto en la salida final decodificada y considerar la ausencia de transferencia un resultado negativo útil, no una prueba de mejora de la generación.

## Comparación con enfoques afines

## 

| Enfoque | Representación | Control / diagnóstico | Qué se preserva o se mide |
| --- | --- | --- | --- |
| Difusión en el espacio de tókenes | Tókenes de texto | Calidad de generación en el espacio de tókenes | Fluidez y comportamiento del evaluador en la generación directa |
| Generación latente comprimida | Códigos latentes discretos mediante un códec | Calidad final de la generación integral | Comportamiento conjunto del códec y el generador latente |
| Localización por etapas del cuello de botella | Texto, reconstrucciones del códec y variables latentes discretas | Separar la pérdida del códec de la pérdida de generación | Dónde se degrada la calidad con un evaluador común |

La comparación distingue el alcance de la evaluación y la evidencia; no constituye una clasificación universal de los enfoques.

## Pertinencia y alcance

## 

El protocolo por etapas resulta útil cuando un flujo generativo contiene tanto un códec aprendido como un generador en el espacio latente, pero no está claro dónde se origina el deterioro de la calidad de salida.

1. Generación comprimida de texto con variables latentes discretas
2. Fidelidad de la reconstrucción del códec en procesos generativos
3. Modelado del lenguaje mediante difusión enmascarada en el espacio de códigos
4. Localización de cuellos de botella y evaluación coherente entre etapas
5. Auditoría de las mejoras en medidas sustitutivas del espacio latente frente al texto decodificado

## Limitaciones

## 

- El estudio empírico utiliza exclusivamente TinyStories.
- El análisis principal abarca un único régimen agresivo de compresión de 64 a 16.
- El sistema evaluado combina una familia de códecs VQ-VAE-2 jerárquicos con un generador MDLM.
- Las comparaciones se basan en ejecuciones únicas y son descriptivas, no estimaciones estadísticas con múltiples semillas.
- La perplejidad externa de GPT-2 es un diagnóstico común, no una métrica universal de calidad semántica.
- Las conclusiones no deben extrapolarse directamente a todos los conjuntos de datos, arquitecturas de códec o tasas de compresión.

## Referencias citadas en el artículo

## 

Estas entradas corresponden a la sección numerada de referencias del PDF del artículo.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Recursos y reproducibilidad

## 

### Declaración sobre los datos

## Versiones

## 

1. **Versión publicada** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Registro de arXiv** [Abrir el registro de la prepublicación, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Índice de investigación en IA** [Página del artículo en Hugging Face con la identidad verificada del primer autor y un resumen enlazado de los resultados](https://huggingface.co/papers/2607.24176)
4. **Manuscrito del autor** [PDF local con texto accesible](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Ponencia en congreso** [Presentación de FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Índice de las actas del congreso** [Volumen oficial de FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF de las actas del congreso** [Texto completo de acceso abierto en FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Abrir el registro académico** [OpenAlex](https://openalex.org/W7160914887)
9. **Registro del grafo de citas** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Texto completo compartido por el autor** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

El DOI publicado es el identificador bibliográfico principal. Esta página sigue siendo la única URL canónica del proyecto en todas sus versiones.

## Publicación relacionada

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/es/publications/inspectable-control/)

Leer la [Diagnóstico del cuello de botella del códec](https://aogavrilov.com/es/projects/codec-bottleneck-diagnosis/) guía de investigación. [Sobre el autor](https://aogavrilov.com/about/) .

### Notas de investigación específicas

Respuestas específicas para cada intención, con límites de evidencia y enlaces a este artículo.

- [Difusión enmascarada en el espacio de códigos frente al espacio de tokens: cómo compararlas](https://aogavrilov.com/es/research-notes/code-space-vs-token-space-masked-diffusion/)
