Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Dónde se degrada la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella
Un diagnóstico por etapas de la generación comprimida de textos breves que separa la pérdida de reconstrucción del códec de la pérdida de generación latente.
Leer el artículo completo en HTMLTexto consultable con fórmulas, tablas, figuras y referencias.
Manuscrito final aceptado (versión publicada por el autor con DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Condiciones de publicación y reutilización.
El artículo en 30 segundos
Pregunta de investigación¿Cómo se puede atribuir por separado al códec y al generador latente la pérdida de calidad en un proceso de generación de texto comprimido?
Problema
En la generación comprimida de textos breves, la baja calidad del texto decodificado puede deberse a información perdida por el códec o a una generación deficiente en el espacio latente. Las métricas de extremo a extremo difuminan estos modos de fallo y pueden desviar el esfuerzo de optimización hacia el componente equivocado.
Enfoque
El protocolo por etapas evalúa los textos originales, las reconstrucciones emparejadas del códec, las salidas del MDLM en el espacio de tokens y las salidas de difusión en el espacio de códigos mediante un único evaluador GPT-2 externo. Las medidas del libro de códigos y de su geometría se mantienen como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.
Resultado principal
La reconstrucción del códec eleva la mediana de la perplejidad externa de 15.17 a 27.36 y el p95 de 25.10 a 98.91. Aun así, el MDLM en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente al MDLM en el espacio de tokens.
Por qué es importante
El resultado convierte el diagnóstico del cuello de botella del códec en una secuencia de trabajo práctica: priorizar las mejoras del códec, comparar después la generación en el espacio de tokens y en el espacio de códigos, y aceptar las mejoras en indicadores indirectos del espacio latente solo si también mejora el texto decodificado.
Resumen
Los generadores comprimidos de textos breves pueden fallar en dos puntos distintos: el códec puede descartar información antes de que comience la generación, o el generador latente puede producir códigos deficientes. Si no se separan estos modos de fallo, los investigadores pueden invertir recursos computacionales en mejorar el componente equivocado. Estudiamos este problema mediante un caso controlado de TinyStories con compresión de 64 a 16, construido a partir de un códec VQ-VAE-2 jerárquico y un generador de difusión discreta enmascarada (MDLM). Empleamos un protocolo de validación por etapas que separa la fidelidad de la reconstrucción del códec, la calidad de la generación latente y los diagnósticos latentes auxiliares, utilizando un mismo evaluador externo GPT-2; además, presentamos métricas semánticas complementarias para el estudio geométrico. En la configuración evaluada, la reconstrucción del códec por sí sola eleva la mediana de la perplejidad externa de 15.17 a 27.36 (+80.4%) y el p95 de 25.10 a 98.91 (+294.1%), lo que indica que la pérdida de calidad dominante aparece antes de iniciarse la generación latente. Con el mismo evaluador, el MDLM en el espacio de códigos sigue siendo considerablemente superior a la difusión en el espacio de tokens y reduce la media, la mediana y el p95 en un 32.9%, un 30.9% y un 36.6%, respectivamente. La regularización sensible a la geometría mejora los indicadores latentes indirectos locales, pero no las métricas del texto decodificado en las ejecuciones disponibles. La contribución es metodológica y no algorítmica: el artículo presenta un diagnóstico por etapas reutilizable para un proceso concreto y muestra que, en este contexto, la fidelidad del códec, más que la eliminación de ruido latente, determina el límite práctico de calidad.
Publicado en 39th Conference of Open Innovations Association (FRUCT), 2026
Tipo de contribución Metodología de diagnóstico
número 1pp. 69–76Conferencia principal
Resultados principales
| Punto de evaluación | n | PPL media | PPL mediana | PPL p95 |
|---|---|---|---|---|
| Textos originales | 256 | 16.24 | 15.17 | 25.1 |
| Reconstrucciones del códec | 256 | 37.26 | 27.36 | 98.91 |
| Línea base AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM en el espacio de tókenes | 256 | 44.74 | 38.42 | 93.6 |
| MDLM en el espacio de códigos | 256 | 30.01 | 26.55 | 59.36 |
Resultado principal. La mayor parte de la pérdida de calidad observada se produce antes de la generación; aun así, la difusión en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente a la difusión en el espacio de tókenes.
- Conjunto de datos
- TinyStories
- Tamaño de la muestra
- 256 muestras de reconstrucción emparejadas; entre 251 y 256 muestras generadas por modo; cuatro configuraciones geométricas equiparadas.
- Métricas
- Perplejidad externa de GPT-2: media, mediana, p95 y máximo; uso del libro de códigos y tamaño del soporte; SBERT, BERTScore, MAUVE y un resumen de un juez LLM para las ejecuciones de geometría
- Incertidumbre
- Las comparaciones presentadas corresponden a ejecuciones únicas descriptivas; no se calcularon intervalos de confianza ni estimaciones de significación con múltiples semillas.
- Condiciones
- Secuencias de tókenes de GPT-2 de longitud 64 comprimidas en 16 códigos de nivel superior mediante un VQ-VAE-2 jerárquico; todos los modos de generación utilizan el mismo evaluador externo.
Descargar resultados:CSVJSONMarkdownRéplica externa:Ficha del conjunto de datos en Hugging Face
PDF y cita
Citar este artículo BibTeX es el formato recomendado. Todas las variantes siguientes se generan a partir del mismo registro de publicación.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Archivos de cita:Texto APATexto IEEERISCSL-JSONJSON-LD de Schema.orgXML OAI-DCXML OpenAIRE v4XML MODSXML de metadatos JATS 1.4Texto completo en XML JATS 1.4RDF TurtleConjunto de enlaces (JSON)Conjunto de enlaces (HTTP)RO-Crate
Guía completa
Guía de investigación completa
Método
El artículo emplea un único evaluador en tres etapas de evaluación, de modo que cada transformación adicional pueda asociarse con una brecha de calidad cuantificable.
Reconstruir
Codifique cada muestra de TinyStories de 64 tókenes en 16 códigos de nivel superior y decodifíquela de inmediato para medir la pérdida de reconstrucción del códec.
Generar
Genere con MDLM tókenes de texto o códigos latentes discretos y, a continuación, decodifique las muestras del espacio de códigos mediante el mismo códec entrenado.
Comparar
Evaluar los originales, las reconstrucciones y los textos generados con el mismo protocolo externo basado en GPT-2, incluidas las estadísticas de la mediana y de las colas.
Idea principal
Un generador posterior no puede recuperar la información que el códec ya ha descartado. Por tanto, debe auditarse la etapa de reconstrucción antes de interpretar los resultados de generación latente.
Diferencias respecto de enfoques afines
Las comparaciones integrales convencionales comunican una única puntuación final de generación. Este protocolo incorpora un punto de control de reconstrucción emparejada y separa las métricas de estado del espacio latente de la evidencia obtenida sobre el texto decodificado.
Novedad
La contribución consiste en una metodología reutilizable de diagnóstico por etapas para un proceso concreto de texto comprimido, y no en un nuevo algoritmo de eliminación de ruido.
Preguntas que este artículo ayuda a responder
Abra una pregunta para obtener una respuesta concisa fundamentada en el artículo. Los límites detallados de la evidencia figuran en Limitaciones.
¿Dónde se deteriora la calidad en la generación comprimida de textos breves?
En el proceso 64-a-16 de TinyStories evaluado, la degradación dominante aparece durante la reconstrucción del códec, antes de que comience la generación latente. La perplejidad externa mediana de GPT-2 aumenta de 15.17 para el texto original a 27.36 tras la reconstrucción, mientras que p95 pasa de 25.10 a 98.91. Este resultado corresponde a una única configuración y no constituye una clasificación universal de códecs.
¿Cómo se puede separar la pérdida del códec de la pérdida de generación latente?
El protocolo por etapas evalúa los originales, las reconstrucciones emparejadas del códec y el texto final generado mediante un mismo evaluador externo. La brecha entre el original y la reconstrucción estima la contribución del códec, mientras que la comparación entre la reconstrucción y la salida generada ayuda a localizar la pérdida adicional de la etapa de generación. Las métricas de calidad latente se presentan por separado de la evidencia obtenida del texto decodificado.
¿Cómo debe evaluarse la generación de texto con variables latentes discretas?
El artículo recomienda comprobar la fidelidad de la reconstrucción antes de comparar generadores, aplicar en cada etapa el mismo evaluador del texto decodificado y comunicar estadísticas centrales y de las colas. Asimismo, considera el uso del libro de códigos, la geometría y otros indicadores indirectos latentes como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.
¿La difusión en el espacio de códigos supera a la difusión en el espacio de tókenes?
Con el evaluador común y la configuración probada, el MDLM en el espacio de códigos reduce la perplejidad media, mediana y p95 en un 32.9%, 30.9% y 36.6%, respectivamente, frente al MDLM en el espacio de tókenes. La comparación es descriptiva y específica de la configuración: no establece una clasificación universal entre conjuntos de datos, relaciones de compresión, códecs o arquitecturas de difusión.
¿Unas métricas mejores de la geometría latente garantizan un texto generado de mayor calidad?
No. En las ejecuciones comparables disponibles, la regularización sensible a la geometría mejoró los indicadores indirectos locales del espacio latente, pero no las métricas del texto decodificado. Este resultado aconseja comprobar toda mejora de un indicador indirecto en la salida final decodificada y considerar la ausencia de transferencia un resultado negativo útil, no una prueba de mejora de la generación.
Comparación con enfoques afines
| Enfoque | Representación | Control / diagnóstico | Qué se preserva o se mide |
|---|---|---|---|
| Difusión en el espacio de tókenes | Tókenes de texto | Calidad de generación en el espacio de tókenes | Fluidez y comportamiento del evaluador en la generación directa |
| Generación latente comprimida | Códigos latentes discretos mediante un códec | Calidad final de la generación integral | Comportamiento conjunto del códec y el generador latente |
| Localización por etapas del cuello de botella | Texto, reconstrucciones del códec y variables latentes discretas | Separar la pérdida del códec de la pérdida de generación | Dónde se degrada la calidad con un evaluador común |
La comparación distingue el alcance de la evaluación y la evidencia; no constituye una clasificación universal de los enfoques.
Pertinencia y alcance
El protocolo por etapas resulta útil cuando un flujo generativo contiene tanto un códec aprendido como un generador en el espacio latente, pero no está claro dónde se origina el deterioro de la calidad de salida.
Generación comprimida de texto con variables latentes discretas
Fidelidad de la reconstrucción del códec en procesos generativos
Modelado del lenguaje mediante difusión enmascarada en el espacio de códigos
Localización de cuellos de botella y evaluación coherente entre etapas
Auditoría de las mejoras en medidas sustitutivas del espacio latente frente al texto decodificado
Limitaciones
- El estudio empírico utiliza exclusivamente TinyStories.
- El análisis principal abarca un único régimen agresivo de compresión de 64 a 16.
- El sistema evaluado combina una familia de códecs VQ-VAE-2 jerárquicos con un generador MDLM.
- Las comparaciones se basan en ejecuciones únicas y son descriptivas, no estimaciones estadísticas con múltiples semillas.
- La perplejidad externa de GPT-2 es un diagnóstico común, no una métrica universal de calidad semántica.
- Las conclusiones no deben extrapolarse directamente a todos los conjuntos de datos, arquitecturas de códec o tasas de compresión.
Referencias citadas en el artículo
Estas entradas corresponden a la sección numerada de referencias del PDF del artículo.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Recursos y reproducibilidad
- Editorial
- IEEE
- PDF local del texto
- Manuscrito final aceptado (versión publicada por el autor con DOI)
- Recursos de la publicación
- Aquí se encuentran disponibles el manuscrito público, las tablas de resultados, la figura explicativa y los archivos de citas. El código de implementación y los puntos de control no se han publicado.
Declaración sobre los datos
- Fuente
- TinyStories, tal como se describe en el artículo.
- Licencia
- El uso de TinyStories sigue sujeto a las condiciones propias del conjunto de datos; este sitio no redistribuye ninguno de sus archivos.
- Preprocesamiento
- Tokenización de GPT-2, entradas fijas de 64 tókenes y compresión temporal jerárquica de 64 a 32 y a 16 posiciones.
- División
- La publicación informa de 256 muestras emparejadas de reconstrucción y 251–256 muestras generadas por modalidad; no publica un manifiesto reutilizable de la partición entre entrenamiento y validación.
- Formato
- Muestras de textos breves, secuencias de tókenes de GPT-2, secuencias de códigos discretos, registros de generación y tablas de síntesis.
- Versión / suma de comprobación
- El artículo no proporciona una suma de comprobación del conjunto de datos ni un identificador inmutable de la instantánea de TinyStories.
- Adquisición
- No se publica un script público de adquisición junto con la página de la publicación.
- Límites de uso
- La evidencia abarca relatos sintéticos breves y no debe considerarse un banco de pruebas para la generación irrestricta de lenguaje natural.
Versiones
- Versión publicadaIEEE / FRUCT, 2026
- Registro de arXivAbrir el registro de la prepublicación, arXiv:2607.24176
- Manuscrito del autorPDF local con texto accesible
- Ponencia en congresoPresentación de FRUCT 39
- Índice de las actas del congresoVolumen oficial de FRUCT 39
- PDF de las actas del congresoTexto completo de acceso abierto en FRUCT
- Abrir el registro académicoOpenAlex
- Registro del grafo de citasSemantic Scholar
- Texto completo compartido por el autorResearchGate
El DOI publicado es el identificador bibliográfico principal. Esta página sigue siendo la única URL canónica del proyecto en todas sus versiones.