# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/sv/publications/where-quality-breaks/

Document language: sv

Var kvalitetsbristerna uppstår vid komprimerad generering av korta texter: stegvis lokalisering av flaskhalsar

En stegvis diagnos av komprimerad generering av korta texter som skiljer kodekens rekonstruktionsförlust från förlusten vid latent generering.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Läs hela artikeln i HTML-format](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Sökbar text med formler, tabeller, figurer och referenser.

Slutligt accepterat manuskript (författarpublicerad version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Villkor för publicering och återanvändning](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Artikeln på 30 sekunder

**Forskningsfråga** Hur kan kvalitetsförlust i en komprimerad pipeline för textgenerering hänföras separat till kodeken respektive latentgeneratorn?

### Problem

Vid generering av komprimerad korttext kan bristfällig avkodad text bero på information som kodeken har förlorat eller på svag generering i latentutrymmet. Mätvärden för hela kedjan suddar ut skillnaden mellan dessa feltyper och kan styra optimeringsarbetet mot fel komponent.

### Metod

Det stegvisa protokollet poängsätter original, parade kodekrekonstruktioner, MDLM-utdata i tokenrymden och diffusionsutdata i kodrymden med en extern GPT-2-bedömare. Mått på kodbok och geometri förblir diagnostiska verktyg och ersätter inte kvaliteten hos avkodad text.

### Huvudresultat

Kodekrekonstruktion höjer den externa medianperplexiteten från 15.17 till 27.36 och p95 från 25.10 till 98.91. MDLM i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med MDLM i tokenrummet.

### Varför det är viktigt

Resultatet omsätter diagnos av kodekflaskhalsar i en handlingsinriktad arbetsordning: prioritera kodekförbättringar, jämför därefter generering i token- och kodrymden och lita på förbättringar i latenta proxymått endast när även den avkodade texten förbättras.

## Sammanfattning

Generatorer för komprimerad korttext kan fallera i två olika led: kodeken kan förlora information innan genereringen börjar, eller så kan generatorn i latentutrymmet producera bristfälliga koder. Om felkällorna inte särskiljs riskerar forskare att lägga beräkningsresurser på fel komponent. Vi undersöker problemet i en kontrollerad TinyStories-fallstudie med komprimering från 64 till 16, baserad på en hierarkisk VQ-VAE-2-kodek och en generator med maskerad diskret diffusion (MDLM). Med en gemensam extern GPT-2-bedömare tillämpar vi ett stegvis valideringsprotokoll som skiljer mellan kodekrekonstruktionens trohet, kvaliteten på den latenta genereringen och kompletterande diagnostik i latentutrymmet; för geometristudien redovisar vi även kompletterande semantiska mått. I den testade konfigurationen höjer enbart kodekrekonstruktionen den externa medianperplexiteten från 15.17 till 27.36 (+80.4%) och p95 från 25.10 till 98.91 (+294.1%). Den dominerande kvalitetsförlusten uppstår alltså innan den latenta genereringen börjar. Med samma bedömare är MDLM i kodrymden fortfarande påtagligt starkare än diffusion i tokenrymden och minskar medelvärdet, medianen och p95 med 32.9%, 30.9% respektive 36.6%. Geometrimedveten regularisering förbättrar lokala proxymått i latentutrymmet, men inte måtten för avkodad text i de tillgängliga körningarna. Bidraget är metodologiskt snarare än algoritmiskt: artikeln presenterar en återanvändbar stegvis diagnos för en konkret pipeline och visar att kodekens rekonstruktionstrohet, inte brusreduceringen i latentutrymmet, sätter det praktiska kvalitetstaket i denna konfiguration.

Publicerad vid 2026 39th Conference of Open Innovations Association (FRUCT)

Typ av bidrag Diagnostisk metodik

28 april 2026 nummer 1 s. 69–76 Huvudkonferens

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Innehåll På denna sida

## Centrala resultat

| Utvärderingspunkt | n | Genomsnittlig PPL | Median-PPL | p95-PPL |
| --- | --- | --- | --- | --- |
| Originaltexter | 256 | 16.24 | 15.17 | 25.1 |
| Kodekrekonstruktioner | 256 | 37.26 | 27.36 | 98.91 |
| AR-baslinje | 251 | 30.98 | 23.27 | 56.11 |
| MDLM i tokenrymden | 256 | 44.74 | 38.42 | 93.6 |
| MDLM i kodrummet | 256 | 30.01 | 26.55 | 59.36 |

**Huvudresultat.** Merparten av den observerade kvalitetsförlusten uppstår före genereringen; diffusion i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med diffusion i tokenrummet.

Ladda ned resultat: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Extern spegel: [Hugging Face-datasetkort](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF och citering

**Citera denna artikel** BibTeX är det rekommenderade formatet. Varje variant nedan genereras från samma publikationspost.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Citeringsfiler: [APA-text](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [IEEE-text](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [JATS 1.4-metadata i XML](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Fulltext i JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Länkuppsättning (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Länkuppsättning (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Fullständig guide

## Fullständig forskningsguide

## Metod

## 

Artikeln använder en och samma poängfunktion i tre utvärderingssteg, så att varje ytterligare transformation kan förknippas med ett mätbart kvalitetsgap.

1. Rekonstruera Koda varje TinyStories-exempel med 64 token till 16 koder på den översta nivån och avkoda det omedelbart för att mäta rekonstruktionsförlusten för kodeken.
2. Generera Generera antingen texttoken eller diskreta latenta koder med MDLM och avkoda sedan exempel från kodutrymmet med samma tränade kodek.
3. Jämför Poängsätt original, rekonstruktioner och genererade texter med samma externa GPT-2-protokoll, inklusive statistik över median och fördelningssvansar.

![Stegvis pipeline för generering av komprimerad text som jämför originaltext, kodekrekonstruktion, MDLM i kodrymden och avkodad text för att särskilja kodekförlust från genereringsförlust.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Stegvis lokalisering av flaskhalsar särskiljer kodekens rekonstruktionsförlust från förlusten vid latent generering inom ett gemensamt utvärderingsprotokoll för avkodad text.* Källa: [Författarskapat förklarande diagram baserat på den publicerade metoden och resultaten.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Villkor för återanvändning: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Föreslagen attribuering: Gavrilov, Gazzaev och Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Ladda ned SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Grundidé

En efterföljande generator kan inte återvinna information som kodeken redan har kastat bort. Rekonstruktionssteget måste därför granskas innan resultat från latent generering tolkas.

### Skillnad mot närliggande angreppssätt

Standardjämförelser från början till slut redovisar ett enda slutligt genereringsmått. Detta protokoll inför en parad kontrollpunkt för rekonstruktion och skiljer hälsomått i latentrum från evidens för avkodad text.

### Vad är nytt?

Bidraget är en återanvändbar, stegvis diagnostisk metodik för en konkret pipeline för komprimerad text, snarare än en ny algoritm för brusreducering.

## Frågor som artikeln bidrar till att besvara

## 

Öppna en fråga för ett kortfattat svar med stöd i artikeln. Detaljerade gränser för evidensen anges under Begränsningar.

1. Var uppstår kvalitetsbrister vid generering av komprimerad korttext? I den testade TinyStories-pipelinen med komprimering från 64 till 16 uppträder den dominerande försämringen vid kodekrekonstruktionen, innan genereringen i latentutrymmet börjar. Den externa medianperplexiteten enligt GPT-2 ökar från 15.17 för originaltext till 27.36 efter rekonstruktion, medan p95 ökar från 25.10 till 98.91. Detta är ett resultat för en enskild konfiguration, inte en universell rangordning av kodekar.
2. Hur kan kodekförlust särskiljas från förlust vid generering i latentutrymmet? Det stegvisa protokollet utvärderar original, parade kodekrekonstruktioner och slutlig genererad text med en gemensam extern bedömare. Skillnaden mellan original och rekonstruktion skattar kodekens bidrag, medan jämförelsen mellan rekonstruktion och genererad utdata hjälper till att lokalisera den ytterligare genereringsförlusten. Mått på latentrepräsentationens kvalitet rapporteras åtskilda från evidens baserad på avkodad text.
3. Hur bör textgenerering med diskreta latenta representationer utvärderas? Artikeln rekommenderar att rekonstruktionens trohet kontrolleras innan generatorer jämförs, att samma poängfunktion för avkodad text används i varje steg samt att central- och svansstatistik redovisas. Den behandlar också kodboksanvändning, geometri och andra latenta proxymått som diagnostik, inte som ersättning för den avkodade textens kvalitet.
4. Överträffar diffusion i kodutrymmet diffusion i tokenutrymmet? Med den gemensamma bedömaren och den testade konfigurationen minskar MDLM i kodrymden medelvärdet, medianen och p95 för perplexitet med 32.9%, 30.9% respektive 36.6% jämfört med MDLM i tokenrymden. Jämförelsen är deskriptiv och konfigurationsspecifik; den fastställer ingen universell rangordning över datamängder, komprimeringsgrader, kodekar eller diffusionsarkitekturer.
5. Garanterar bättre mått på latent geometri bättre genererad text? Nej. I de tillgängliga matchade körningarna förbättrade geometrimedveten regularisering lokala proxymått i latentrummet, men inte måtten för avkodad text. Resultatet talar för att varje förbättring av proxymått bör granskas i den slutliga avkodade utdatan och att utebliven överföring bör behandlas som ett användbart negativt resultat, inte som belägg för förbättrad generering.

## Jämförelse med närliggande angreppssätt

## 

| Metod | Representation | Styrning/diagnos | Vad bevaras eller mäts? |
| --- | --- | --- | --- |
| Diffusion i tokenrymden | Texttoken | Genereringskvalitet i tokenutrymmet | Språkligt flyt och poängsättarens beteende vid direkt generering |
| Komprimerad latent generering | Diskreta latenta koder via en kodek | Slutlig kvalitet på genereringen från början till slut | Kodekens och latentgeneratorns kombinerade beteende |
| Stegvis lokalisering av flaskhalsar | Text, kodekrekonstruktioner och diskreta latenta representationer | Särskilj kodekförlust från genereringsförlust | Var kvaliteten försämras med en gemensam bedömare |

Jämförelsen skiljer mellan utvärderingens omfattning och evidens; den är ingen universell rangordning av metoderna.

## Relevans och avgränsning

## 

Det stegvisa protokollet är användbart när ett generativt arbetsflöde innehåller både en inlärd kodek och en generator i latentrummet, men orsaken till försämrad utdatakvalitet är oklar.

1. Komprimerad textgenerering med diskreta latenta representationer
2. Kodekrekonstruktionens trohet i generativa pipelines
3. Språkmodellering med maskerad diffusion i kodrum
4. Lokalisering av flaskhalsar och stegkonsistent utvärdering
5. Granskning av förbättrade proxymått i det latenta rummet mot avkodad text

## Begränsningar

## 

- Den empiriska studien använder endast TinyStories.
- Huvudanalysen omfattar en aggressiv kompressionsregim från 64 till 16.
- Det utvärderade systemet kombinerar en hierarkisk kodekfamilj av typen VQ-VAE-2 med en MDLM-generator.
- Jämförelserna bygger på enskilda körningar och är deskriptiva snarare än statistiska skattningar över flera slumpfrön.
- Extern GPT-2-perplexitet är ett gemensamt diagnostiskt mått, inte ett universellt mått på semantisk kvalitet.
- Slutsatserna bör inte överföras direkt till alla datamängder, kodekarkitekturer eller kompressionsgrader.

## Referenser som citeras i artikeln

## 

Dessa poster motsvarar den numrerade referensförteckningen i artikelns PDF-version.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Resurser och reproducerbarhet

## 

### Dataredogörelse

## Versioner

## 

1. **Publicerad version** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **arXiv-post** [Öppna preprintposten, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Index över AI-forskning** [Hugging Face Paper Page med verifierad identitet för förstaförfattaren och länkad resultatsammanfattning](https://huggingface.co/papers/2607.24176)
4. **Författarmanuskript** [Textåtkomlig lokal PDF](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Konferensföredrag** [FRUCT 39-presentation](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Index över konferenshandlingar** [Officiell FRUCT 39-volym](https://fruct.org/publications/volume-39/fruct39)
7. **Konferenshandlingar som PDF** [FRUCT-fulltext med öppen åtkomst](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Öppna den vetenskapliga posten** [OpenAlex](https://openalex.org/W7160914887)
9. **Post i citeringsgraf** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Fulltext delad av författaren** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Den publicerade DOI:n är den primära bibliografiska identifieraren. Denna sida förblir projektets enda kanoniska URL i samtliga versioner.

## Relaterad publikation

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/sv/publications/inspectable-control/)

Läs [Diagnos av kodekflaskhalsen](https://aogavrilov.com/sv/projects/codec-bottleneck-diagnosis/) forskningsguide. [Om författaren](https://aogavrilov.com/about/) .

### Fokuserade forskningsanteckningar

Avsiktsspecifika svar med tydligt avgränsat evidensstöd och länkar tillbaka till denna artikel.

- [Maskerad diffusion i kodrummet kontra tokenrummet: hur de bör jämföras](https://aogavrilov.com/sv/research-notes/code-space-vs-token-space-masked-diffusion/)
