Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Dónde se degrada la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella

Un diagnóstico por etapas de la generación comprimida de textos breves que separa la pérdida de reconstrucción del códec de la pérdida de generación latente.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. Universidad ITMO, San Petersburgo, Rusia

Leer el artículo completo en HTMLTexto consultable con fórmulas, tablas, figuras y referencias.

Manuscrito final aceptado (versión publicada por el autor con DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Condiciones de publicación y reutilización.

El artículo en 30 segundos

Pregunta de investigación¿Cómo se puede atribuir por separado al códec y al generador latente la pérdida de calidad en un proceso de generación de texto comprimido?

Problema

En la generación comprimida de textos breves, la baja calidad del texto decodificado puede deberse a información perdida por el códec o a una generación deficiente en el espacio latente. Las métricas de extremo a extremo difuminan estos modos de fallo y pueden desviar el esfuerzo de optimización hacia el componente equivocado.

Enfoque

El protocolo por etapas evalúa los textos originales, las reconstrucciones emparejadas del códec, las salidas del MDLM en el espacio de tokens y las salidas de difusión en el espacio de códigos mediante un único evaluador GPT-2 externo. Las medidas del libro de códigos y de su geometría se mantienen como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.

Resultado principal

La reconstrucción del códec eleva la mediana de la perplejidad externa de 15.17 a 27.36 y el p95 de 25.10 a 98.91. Aun así, el MDLM en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente al MDLM en el espacio de tokens.

Por qué es importante

El resultado convierte el diagnóstico del cuello de botella del códec en una secuencia de trabajo práctica: priorizar las mejoras del códec, comparar después la generación en el espacio de tokens y en el espacio de códigos, y aceptar las mejoras en indicadores indirectos del espacio latente solo si también mejora el texto decodificado.

Resumen

Los generadores comprimidos de textos breves pueden fallar en dos puntos distintos: el códec puede descartar información antes de que comience la generación, o el generador latente puede producir códigos deficientes. Si no se separan estos modos de fallo, los investigadores pueden invertir recursos computacionales en mejorar el componente equivocado. Estudiamos este problema mediante un caso controlado de TinyStories con compresión de 64 a 16, construido a partir de un códec VQ-VAE-2 jerárquico y un generador de difusión discreta enmascarada (MDLM). Empleamos un protocolo de validación por etapas que separa la fidelidad de la reconstrucción del códec, la calidad de la generación latente y los diagnósticos latentes auxiliares, utilizando un mismo evaluador externo GPT-2; además, presentamos métricas semánticas complementarias para el estudio geométrico. En la configuración evaluada, la reconstrucción del códec por sí sola eleva la mediana de la perplejidad externa de 15.17 a 27.36 (+80.4%) y el p95 de 25.10 a 98.91 (+294.1%), lo que indica que la pérdida de calidad dominante aparece antes de iniciarse la generación latente. Con el mismo evaluador, el MDLM en el espacio de códigos sigue siendo considerablemente superior a la difusión en el espacio de tokens y reduce la media, la mediana y el p95 en un 32.9%, un 30.9% y un 36.6%, respectivamente. La regularización sensible a la geometría mejora los indicadores latentes indirectos locales, pero no las métricas del texto decodificado en las ejecuciones disponibles. La contribución es metodológica y no algorítmica: el artículo presenta un diagnóstico por etapas reutilizable para un proceso concreto y muestra que, en este contexto, la fidelidad del códec, más que la eliminación de ruido latente, determina el límite práctico de calidad.

Publicado en 39th Conference of Open Innovations Association (FRUCT), 2026

Tipo de contribución Metodología de diagnóstico

número 1pp. 69–76Conferencia principal

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Compartir este artículoCompartir

Resultados principales

Resultados principales de Dónde se deteriora la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella
Punto de evaluaciónnPPL mediaPPL medianaPPL p95
Textos originales25616.2415.1725.1
Reconstrucciones del códec25637.2627.3698.91
Línea base AR25130.9823.2756.11
MDLM en el espacio de tókenes25644.7438.4293.6
MDLM en el espacio de códigos25630.0126.5559.36

Resultado principal. La mayor parte de la pérdida de calidad observada se produce antes de la generación; aun así, la difusión en el espacio de códigos reduce la perplejidad mediana en un 30.9% frente a la difusión en el espacio de tókenes.

Conjunto de datos
TinyStories
Tamaño de la muestra
256 muestras de reconstrucción emparejadas; entre 251 y 256 muestras generadas por modo; cuatro configuraciones geométricas equiparadas.
Métricas
Perplejidad externa de GPT-2: media, mediana, p95 y máximo; uso del libro de códigos y tamaño del soporte; SBERT, BERTScore, MAUVE y un resumen de un juez LLM para las ejecuciones de geometría
Incertidumbre
Las comparaciones presentadas corresponden a ejecuciones únicas descriptivas; no se calcularon intervalos de confianza ni estimaciones de significación con múltiples semillas.
Condiciones
Secuencias de tókenes de GPT-2 de longitud 64 comprimidas en 16 códigos de nivel superior mediante un VQ-VAE-2 jerárquico; todos los modos de generación utilizan el mismo evaluador externo.

PDF y cita

Citar este artículo BibTeX es el formato recomendado. Todas las variantes siguientes se generan a partir del mismo registro de publicación.

Abrir el PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Descargar .bib

Archivos de cita:Texto APATexto IEEERISCSL-JSONJSON-LD de Schema.orgXML OAI-DCXML OpenAIRE v4XML MODSXML de metadatos JATS 1.4Texto completo en XML JATS 1.4RDF TurtleConjunto de enlaces (JSON)Conjunto de enlaces (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Guía completa

Guía de investigación completa

Método

El artículo emplea un único evaluador en tres etapas de evaluación, de modo que cada transformación adicional pueda asociarse con una brecha de calidad cuantificable.

  1. Reconstruir

    Codifique cada muestra de TinyStories de 64 tókenes en 16 códigos de nivel superior y decodifíquela de inmediato para medir la pérdida de reconstrucción del códec.

  2. Generar

    Genere con MDLM tókenes de texto o códigos latentes discretos y, a continuación, decodifique las muestras del espacio de códigos mediante el mismo códec entrenado.

  3. Comparar

    Evaluar los originales, las reconstrucciones y los textos generados con el mismo protocolo externo basado en GPT-2, incluidas las estadísticas de la mediana y de las colas.

Proceso por etapas de generación de texto comprimido que compara el texto original, la reconstrucción del códec, el MDLM en el espacio de códigos y el texto decodificado para separar la pérdida debida al códec de la pérdida debida a la generación.
La localización por etapas del cuello de botella separa la pérdida de reconstrucción del códec de la pérdida de generación latente conforme a un mismo protocolo de evaluación del texto decodificado.Fuente: Diagrama explicativo elaborado por el autor a partir del método y los resultados publicados..Condiciones de reutilización: CC BY 4.0.Atribución sugerida: Gavrilov, Gazzaev y Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Descargar SVG.

Idea principal

Un generador posterior no puede recuperar la información que el códec ya ha descartado. Por tanto, debe auditarse la etapa de reconstrucción antes de interpretar los resultados de generación latente.

Diferencias respecto de enfoques afines

Las comparaciones integrales convencionales comunican una única puntuación final de generación. Este protocolo incorpora un punto de control de reconstrucción emparejada y separa las métricas de estado del espacio latente de la evidencia obtenida sobre el texto decodificado.

Novedad

La contribución consiste en una metodología reutilizable de diagnóstico por etapas para un proceso concreto de texto comprimido, y no en un nuevo algoritmo de eliminación de ruido.

Preguntas que este artículo ayuda a responder

Abra una pregunta para obtener una respuesta concisa fundamentada en el artículo. Los límites detallados de la evidencia figuran en Limitaciones.

  1. ¿Dónde se deteriora la calidad en la generación comprimida de textos breves?

    En el proceso 64-a-16 de TinyStories evaluado, la degradación dominante aparece durante la reconstrucción del códec, antes de que comience la generación latente. La perplejidad externa mediana de GPT-2 aumenta de 15.17 para el texto original a 27.36 tras la reconstrucción, mientras que p95 pasa de 25.10 a 98.91. Este resultado corresponde a una única configuración y no constituye una clasificación universal de códecs.

  2. ¿Cómo se puede separar la pérdida del códec de la pérdida de generación latente?

    El protocolo por etapas evalúa los originales, las reconstrucciones emparejadas del códec y el texto final generado mediante un mismo evaluador externo. La brecha entre el original y la reconstrucción estima la contribución del códec, mientras que la comparación entre la reconstrucción y la salida generada ayuda a localizar la pérdida adicional de la etapa de generación. Las métricas de calidad latente se presentan por separado de la evidencia obtenida del texto decodificado.

  3. ¿Cómo debe evaluarse la generación de texto con variables latentes discretas?

    El artículo recomienda comprobar la fidelidad de la reconstrucción antes de comparar generadores, aplicar en cada etapa el mismo evaluador del texto decodificado y comunicar estadísticas centrales y de las colas. Asimismo, considera el uso del libro de códigos, la geometría y otros indicadores indirectos latentes como herramientas de diagnóstico, no como sustitutos de la calidad del texto decodificado.

  4. ¿La difusión en el espacio de códigos supera a la difusión en el espacio de tókenes?

    Con el evaluador común y la configuración probada, el MDLM en el espacio de códigos reduce la perplejidad media, mediana y p95 en un 32.9%, 30.9% y 36.6%, respectivamente, frente al MDLM en el espacio de tókenes. La comparación es descriptiva y específica de la configuración: no establece una clasificación universal entre conjuntos de datos, relaciones de compresión, códecs o arquitecturas de difusión.

  5. ¿Unas métricas mejores de la geometría latente garantizan un texto generado de mayor calidad?

    No. En las ejecuciones comparables disponibles, la regularización sensible a la geometría mejoró los indicadores indirectos locales del espacio latente, pero no las métricas del texto decodificado. Este resultado aconseja comprobar toda mejora de un indicador indirecto en la salida final decodificada y considerar la ausencia de transferencia un resultado negativo útil, no una prueba de mejora de la generación.

Comparación con enfoques afines

Comparación factual de Dónde se deteriora la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella con enfoques afines
EnfoqueRepresentaciónControl / diagnósticoQué se preserva o se mide
Difusión en el espacio de tókenesTókenes de textoCalidad de generación en el espacio de tókenesFluidez y comportamiento del evaluador en la generación directa
Generación latente comprimidaCódigos latentes discretos mediante un códecCalidad final de la generación integralComportamiento conjunto del códec y el generador latente
Localización por etapas del cuello de botellaTexto, reconstrucciones del códec y variables latentes discretasSeparar la pérdida del códec de la pérdida de generaciónDónde se degrada la calidad con un evaluador común

La comparación distingue el alcance de la evaluación y la evidencia; no constituye una clasificación universal de los enfoques.

Pertinencia y alcance

El protocolo por etapas resulta útil cuando un flujo generativo contiene tanto un códec aprendido como un generador en el espacio latente, pero no está claro dónde se origina el deterioro de la calidad de salida.

  1. Generación comprimida de texto con variables latentes discretas

  2. Fidelidad de la reconstrucción del códec en procesos generativos

  3. Modelado del lenguaje mediante difusión enmascarada en el espacio de códigos

  4. Localización de cuellos de botella y evaluación coherente entre etapas

  5. Auditoría de las mejoras en medidas sustitutivas del espacio latente frente al texto decodificado

Véanse las limitaciones y los límites de la evidencia

Limitaciones

  • El estudio empírico utiliza exclusivamente TinyStories.
  • El análisis principal abarca un único régimen agresivo de compresión de 64 a 16.
  • El sistema evaluado combina una familia de códecs VQ-VAE-2 jerárquicos con un generador MDLM.
  • Las comparaciones se basan en ejecuciones únicas y son descriptivas, no estimaciones estadísticas con múltiples semillas.
  • La perplejidad externa de GPT-2 es un diagnóstico común, no una métrica universal de calidad semántica.
  • Las conclusiones no deben extrapolarse directamente a todos los conjuntos de datos, arquitecturas de códec o tasas de compresión.

Referencias citadas en el artículo

Estas entradas corresponden a la sección numerada de referencias del PDF del artículo.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Recursos y reproducibilidad

Editorial
IEEE
Recursos de la publicación
Aquí se encuentran disponibles el manuscrito público, las tablas de resultados, la figura explicativa y los archivos de citas. El código de implementación y los puntos de control no se han publicado.

Declaración sobre los datos

Fuente
TinyStories, tal como se describe en el artículo.
Licencia
El uso de TinyStories sigue sujeto a las condiciones propias del conjunto de datos; este sitio no redistribuye ninguno de sus archivos.
Preprocesamiento
Tokenización de GPT-2, entradas fijas de 64 tókenes y compresión temporal jerárquica de 64 a 32 y a 16 posiciones.
División
La publicación informa de 256 muestras emparejadas de reconstrucción y 251–256 muestras generadas por modalidad; no publica un manifiesto reutilizable de la partición entre entrenamiento y validación.
Formato
Muestras de textos breves, secuencias de tókenes de GPT-2, secuencias de códigos discretos, registros de generación y tablas de síntesis.
Versión / suma de comprobación
El artículo no proporciona una suma de comprobación del conjunto de datos ni un identificador inmutable de la instantánea de TinyStories.
Adquisición
No se publica un script público de adquisición junto con la página de la publicación.
Límites de uso
La evidencia abarca relatos sintéticos breves y no debe considerarse un banco de pruebas para la generación irrestricta de lenguaje natural.

Versiones

  1. Versión publicadaIEEE / FRUCT, 2026
  2. Manuscrito del autorPDF local con texto accesible
  3. Ponencia en congresoPresentación de FRUCT 39
  4. Índice de las actas del congresoVolumen oficial de FRUCT 39
  5. PDF de las actas del congresoTexto completo de acceso abierto en FRUCT
  6. Abrir el registro académicoOpenAlex
  7. Registro del grafo de citasSemantic Scholar
  8. Texto completo compartido por el autorResearchGate

El DOI publicado es el identificador bibliográfico principal. Esta página sigue siendo la única URL canónica del proyecto en todas sus versiones.