# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/da/publications/where-quality-breaks/

Document language: da

Hvor kvaliteten svigter i komprimeret korttekstgenerering: trinvis lokalisering af flaskehalse

En trinvis diagnose af komprimeret korttekstgenerering, der adskiller tab ved codec-rekonstruktion fra tab ved latent generering.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Sankt Petersborg, Rusland](https://en.itmo.ru/)

[Læs hele artiklen i HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Søgbar tekst med formler, tabeller, figurer og referencer.

Endeligt accepteret manuskript (forfatterpubliceret version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Vilkår for offentliggørelse og genbrug](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Artiklen på 30 sekunder

**Forskningsspørgsmål** Hvordan kan kvalitetstab i en pipeline til komprimeret tekstgenerering henføres særskilt til codec'et og den latente generator?

### Problemstilling

Ved generering af komprimerede korte tekster kan mangelfuld afkodet tekst skyldes informationstab i codec'et eller utilstrækkelig generering i det latente rum. Samlede end-to-end-målinger udvisker forskellen mellem fejltyperne og kan lede optimeringsindsatsen mod den forkerte komponent.

### Tilgang

Den trinvise protokol evaluerer originaltekster, parrede codec-rekonstruktioner, MDLM-output i tokenrummet og diffusionsoutput i koderummet med den samme eksterne GPT-2-evaluator. Mål for kodebog og geometri bruges som diagnostik og ikke som erstatning for kvaliteten af den afkodede tekst.

### Hovedresultat

Codec-rekonstruktion øger den eksterne medianperpleksitet fra 15.17 til 27.36 og p95 fra 25.10 til 98.91. MDLM i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med MDLM i tokenrummet.

### Hvorfor det er vigtigt

Resultatet omsætter diagnosticering af codec-flaskehalse til en konkret arbejdsrækkefølge: Forbedr først codec'et, sammenlign derefter generering i tokenrummet og koderummet, og tillæg kun forbedringer i latente proxymål betydning, når den afkodede tekst også bliver bedre.

## Resumé

Generatorer af komprimerede korte tekster kan svigte to forskellige steder: Codec'et kan kassere information, før genereringen begynder, eller den latente generator kan frembringe mangelfulde koder. Uden en adskillelse af disse fejltyper risikerer forskere at bruge beregningsressourcer på den forkerte komponent. Vi undersøger problemet i et kontrolleret TinyStories-casestudie med komprimering fra 64 til 16, baseret på et hierarkisk VQ-VAE-2-codec og en generator med maskeret diskret diffusion (MDLM). En trinvis valideringsprotokol adskiller codec-rekonstruktionens kvalitet, kvaliteten af den latente generering og supplerende diagnostik af de latente repræsentationer under den samme eksterne GPT-2-evaluator; desuden rapporterer vi supplerende semantiske mål i geometriundersøgelsen. I den afprøvede konfiguration øger codec-rekonstruktionen alene den eksterne medianperpleksitet fra 15.17 til 27.36 (+80.4%) og p95 fra 25.10 til 98.91 (+294.1%). Det dominerende kvalitetstab opstår således, før den latente generering begynder. Med den samme evaluator er MDLM i koderummet fortsat markant bedre end diffusion i tokenrummet og reducerer henholdsvis gennemsnit, median og p95 med 32.9%, 30.9% og 36.6%. Geometribevidst regularisering forbedrer lokale proxymål i det latente rum, men ikke målene for afkodet tekst i de tilgængelige kørsler. Bidraget er metodisk snarere end algoritmisk: Artiklen præsenterer en genanvendelig, trinvis diagnose af én konkret pipeline og viser, at det praktiske kvalitetsloft i denne konfiguration bestemmes af codec'ets rekonstruktionskvalitet snarere end af den latente afstøjning.

Udgivet på 2026 39th Conference of Open Innovations Association (FRUCT)

Bidragstype Diagnostisk metodik

28. april 2026 nummer 1 s. 69–76 Hovedkonference

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Indhold På denne side

## Hovedresultater

| Evalueringspunkt | n | Gennemsnitlig PPL | Median-PPL | p95-PPL |
| --- | --- | --- | --- | --- |
| Originaltekster | 256 | 16.24 | 15.17 | 25.1 |
| Kodekrekonstruktioner | 256 | 37.26 | 27.36 | 98.91 |
| AR-baseline | 251 | 30.98 | 23.27 | 56.11 |
| MDLM i tokenrummet | 256 | 44.74 | 38.42 | 93.6 |
| MDLM i koderummet | 256 | 30.01 | 26.55 | 59.36 |

**Hovedresultat.** Størstedelen af det observerede kvalitetstab opstår før genereringen; diffusion i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med diffusion i tokenrummet.

Hent resultater: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Eksternt spejl: [Hugging Face-datasætkort](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF og citation

**Citér artiklen** BibTeX er det anbefalede format. Alle varianter nedenfor genereres ud fra den samme publikationspost.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Citationsfiler: [APA-tekst](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [IEEE-tekst](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [JATS 1.4-metadata-XML](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Fuldtekst i JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Linksæt (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Linksæt (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Komplet vejledning

## Komplet forskningsvejledning

## Metode

## 

Artiklen anvender én evaluator på tværs af tre evalueringstrin, så hver yderligere transformation kan forbindes med en målbar kvalitetsforskel.

1. Rekonstruér Indkod hver TinyStories-prøve på 64 tokens som 16 koder på øverste niveau, og afkod den straks for at måle codec-rekonstruktionstabet.
2. Generér Generér enten teksttokens eller diskrete latente koder med MDLM, og afkod derefter prøver fra koderummet gennem den samme trænede codec.
3. Sammenlign Bedøm originaler, rekonstruktioner og genererede tekster med den samme eksterne GPT-2-protokol, herunder statistik for median og fordelingshaler.

![Trinvis pipeline til komprimeret tekstgenerering, der sammenligner originaltekst, codec-rekonstruktion, MDLM i koderummet og afkodet tekst for at adskille codec-tab fra genereringstab.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Trinvis lokalisering af flaskehalse adskiller tab ved codec-rekonstruktion fra tab ved latent generering under én fælles evalueringsprotokol for afkodet tekst.* Kilde: [Forklarende diagram udarbejdet af forfatteren på grundlag af den publicerede metode og resultaterne.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Vilkår for genbrug: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Foreslået kreditering: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Hent SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Hovedidé

En efterfølgende generator kan ikke genskabe information, som codec'et allerede har kasseret. Rekonstruktionstrinnet skal derfor undersøges, før resultaterne af den latente generering fortolkes.

### Forskel fra beslægtede tilgange

Standardiserede end-to-end-sammenligninger rapporterer én afsluttende genereringsscore. Denne protokol indfører et parvist kontrolpunkt for rekonstruktion og adskiller tilstandsmål i det latente rum fra evidens baseret på afkodet tekst.

### Hvad er nyt?

Bidraget er en genanvendelig, trinvis diagnostisk metode til én konkret pipeline for komprimeret tekst, ikke en ny afstøjningsalgoritme.

## Spørgsmål, som denne artikel bidrager til at besvare

## 

Åbn et spørgsmål for at få et kort svar med grundlag i artiklen. De detaljerede evidensgrænser fremgår af Begrænsninger.

1. Hvor opstår kvalitetstabet ved generering af komprimeret korttekst? I den afprøvede TinyStories-pipeline med komprimering fra 64 til 16 optræder den dominerende forringelse ved codec-rekonstruktionen, før den latente generering begynder. Den eksterne GPT-2-medianperpleksitet stiger fra 15.17 for originalteksten til 27.36 efter rekonstruktion, mens p95 stiger fra 25.10 til 98.91. Dette resultat gælder én konfiguration og udgør ikke en universel rangordning af codecs.
2. Hvordan kan codec-tab adskilles fra tab ved generering i det latente rum? Den trinvise protokol evaluerer originaler, parrede codec-rekonstruktioner og den endeligt genererede tekst med én fælles ekstern evaluator. Forskellen mellem original og rekonstruktion estimerer codec'ets bidrag, mens sammenligningen mellem rekonstruktion og genereret output bidrager til at lokalisere det yderligere genereringstab. Metrikker for det latente rums tilstand rapporteres adskilt fra evidensen i den afkodede tekst.
3. Hvordan bør tekstgenerering med diskrete latente repræsentationer evalueres? Artiklen anbefaler at kontrollere rekonstruktionsnøjagtigheden, før generatorer sammenlignes, at anvende den samme evaluator for afkodet tekst på hvert trin og at rapportere central- og halestatistik. Den behandler desuden brug af kodebog, geometri og andre latente proxymål som diagnostik frem for erstatninger for kvaliteten af den afkodede tekst.
4. Klarer diffusion i koderummet sig bedre end diffusion i tokenrummet? Med den fælles evaluator og den afprøvede opsætning reducerer MDLM i koderummet henholdsvis gennemsnitlig, median og p95-perpleksitet med 32.9%, 30.9% og 36.6% sammenlignet med MDLM i tokenrummet. Sammenligningen er deskriptiv og konfigurationsspecifik: Den fastslår ikke en universel rangordning på tværs af datasæt, komprimeringsforhold, codecs eller diffusionsarkitekturer.
5. Garanterer bedre mål for latent geometri bedre genereret tekst? Nej. I de tilgængelige matchede kørsler forbedrede geometribevidst regularisering lokale proxyer i det latente rum, men ikke metrikkerne for afkodet tekst. Resultatet taler for, at enhver proxyforbedring efterprøves på det endelige afkodede output, og at manglende overførsel betragtes som et nyttigt negativt resultat frem for som evidens for bedre generering.

## Sammenligning med beslægtede tilgange

## 

| Tilgang | Repræsentation | Styring/diagnose | Hvad bevares eller måles? |
| --- | --- | --- | --- |
| Diffusion i tokenrummet | Teksttokens | Genereringskvalitet i tokenrummet | Flydende sprog og bedømmerens adfærd ved direkte generering |
| Komprimeret latent generering | Diskrete latente koder via en codec | Endelig ende-til-ende-kvalitet af genereringen | Samspillet mellem kodekken og den latente generator |
| Trinvis lokalisering af flaskehalse | Tekst, codec-rekonstruktioner og diskrete latente repræsentationer | Adskil codec-tab fra genereringstab | Hvor kvaliteten forringes under én fælles evaluator |

Sammenligningen skelner mellem evalueringsomfang og evidens; den udgør ikke en universel rangordning af tilgangene.

## Relevans og afgrænsning

## 

Den trinvise protokol er nyttig, når en generativ pipeline både indeholder et indlært codec og en generator i det latente rum, men årsagen til den forringede outputkvalitet er uklar.

1. Komprimeret tekstgenerering med diskrete latente repræsentationer
2. Kvaliteten af codec-rekonstruktion i generative pipelines
3. Maskeret diffusionssprogmodellering i kode-rummet
4. Lokalisering af flaskehalse og trinkonsistent evaluering
5. Revision af forbedringer i proxy-mål i latentrummet op imod afkodet tekst

## Begrænsninger

## 

- Den empiriske undersøgelse omfatter kun TinyStories.
- Hovedanalysen omfatter ét aggressivt kompressionsregime fra 64 til 16.
- Det evaluerede system kombinerer én hierarkisk VQ-VAE-2-codecfamilie med én MDLM-generator.
- Sammenligningerne bygger på enkeltkørsler og er deskriptive snarere end statistiske estimater baseret på flere randomiseringsfrø.
- Ekstern GPT-2-perpleksitet er et fælles diagnostisk mål, ikke en universel metrik for semantisk kvalitet.
- Konklusionerne kan ikke uden videre overføres til andre datasæt, codec-arkitekturer eller komprimeringsforhold.

## Referencer citeret i artiklen

## 

Disse poster svarer til den nummererede referenceliste i artiklens PDF.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Ressourcer og reproducerbarhed

## 

### Dataerklæring

## Versioner

## 

1. **Udgivet version** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **arXiv-post** [Åbn preprintposten, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Indeks over AI-forskning** [Hugging Face-paperside med verificeret identitet på førsteforfatteren og link til et resumé af resultaterne](https://huggingface.co/papers/2607.24176)
4. **Forfattermanuskript** [Lokal PDF med tekstadgang](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Konferenceforedrag** [FRUCT 39-præsentation](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Indeks over konferenceartikler** [Officielt FRUCT 39-bind](https://fruct.org/publications/volume-39/fruct39)
7. **PDF med konferenceartikler** [FRUCT-fuldtekst med fri adgang](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Åbn den videnskabelige post** [OpenAlex](https://openalex.org/W7160914887)
9. **Post i citationsgrafen** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Fuldtekst delt af forfatteren** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Den offentliggjorte DOI er den primære bibliografiske identifikator. Denne side forbliver projektets eneste kanoniske URL på tværs af versioner.

## Relateret publikation

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/da/publications/inspectable-control/)

Læs [Diagnosticering af kodekflaskehalse](https://aogavrilov.com/da/projects/codec-bottleneck-diagnosis/) forskningsvejledning. [Om forfatteren](https://aogavrilov.com/about/) .

### Fokuserede forskningsnoter

Intentspecifikke svar med tydelige evidensgrænser og links tilbage til denne artikel.

- [Maskeret diffusion i kode- kontra tokenrummet: Sådan sammenlignes de](https://aogavrilov.com/da/research-notes/code-space-vs-token-space-masked-diffusion/)
