# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/sk/publications/where-quality-breaks/

Document language: sk

Kde sa stráca kvalita pri generovaní komprimovaných krátkych textov: etapová lokalizácia úzkeho miesta

Etapová diagnostika generovania komprimovaných krátkych textov, ktorá oddeľuje stratu pri rekonštrukcii kodekom od straty pri generovaní latentných reprezentácií.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Petrohrad, Rusko](https://en.itmo.ru/)

[Prečítať celý článok vo formáte HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Prehľadávateľný text so vzorcami, tabuľkami, obrázkami a bibliografickými odkazmi.

Konečný prijatý rukopis (verzia zverejnená autorom s DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Podmienky zverejnenia a opätovného použitia](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Článok za 30 sekúnd

**Výskumná otázka** Ako možno pokles kvality v procese generovania komprimovaného textu samostatne pripísať kodeku a latentnému generátoru?

### Problém

Pri generovaní komprimovaného krátkeho textu môže nízka kvalita dekódovaného textu vyplývať zo straty informácií v kodeku alebo zo slabého generovania v latentnom priestore. Celkové metriky tieto režimy zlyhania stierajú a môžu nasmerovať optimalizačné úsilie na nesprávny komponent.

### Prístup

Etapový protokol hodnotí originály, párové rekonštrukcie kodekom, výstupy MDLM v priestore tokenov a výstupy difúzie v priestore kódov pomocou jedného externého hodnotiteľa GPT-2. Miery kódovej knihy a geometrie zostávajú diagnostickými ukazovateľmi, nie náhradou za kvalitu dekódovaného textu.

### Hlavný výsledok

Rekonštrukcia kodeku zvyšuje medián externej perplexity z 15.17 na 27.36 a p95 z 25.10 na 98.91. MDLM v priestore kódov napriek tomu znižuje medián perplexity o 30.9% oproti MDLM v priestore tokenov.

### Prečo je to dôležité

Výsledok premieňa diagnostiku úzkeho miesta kodeku na praktické poradie krokov: najprv zlepšiť kodek, potom porovnať generovanie v priestore tokenov a v priestore kódov a zlepšeniam zástupných ukazovateľov v latentnom priestore dôverovať iba vtedy, keď sa zlepší aj dekódovaný text.

## Abstrakt

Generátory komprimovaných krátkych textov môžu zlyhať na dvoch rôznych miestach: kodek môže zahodiť informácie ešte pred začiatkom generovania alebo latentný generátor môže vytvárať nekvalitné kódy. Bez oddelenia týchto spôsobov zlyhania môžu výskumníci vynakladať výpočtové zdroje na zlepšovanie nesprávneho komponentu. Tento problém skúmame v kontrolovanej prípadovej štúdii TinyStories s kompresiou zo 64 na 16, založenej na hierarchickom kodeku VQ-VAE-2 a generátore s maskovanou diskrétnou difúziou (MDLM). Používame etapový validačný protokol, ktorý pri jednom spoločnom externom hodnotiacom modeli GPT-2 oddeľuje vernosť rekonštrukcie kodeku, kvalitu generovania latentných reprezentácií a pomocnú diagnostiku latentných reprezentácií; zároveň uvádzame doplnkové sémantické metriky pre štúdium geometrie. V testovanej konfigurácii samotná rekonštrukcia kodeku zvyšuje medián externej perplexity z 15.17 na 27.36 (+80.4%) a p95 z 25.10 na 98.91 (+294.1%), čo naznačuje, že dominantná strata kvality vzniká ešte pred začiatkom latentného generovania. Pri rovnakom hodnotiacom modeli zostáva MDLM v priestore kódov výrazne lepší než difúzia v priestore tokenov a znižuje priemer, medián a p95 postupne o 32.9%, 30.9% a 36.6%. Regularizácia zohľadňujúca geometriu zlepšuje lokálne zástupné ukazovatele latentných reprezentácií, no v dostupných behoch nezlepšuje metriky dekódovaného textu. Prínos je skôr metodologický než algoritmický: práca predstavuje opakovane použiteľnú etapovú diagnostiku jedného konkrétneho postupu a ukazuje, že v tomto prostredí určuje praktický strop kvality skôr vernosť kodeku než odšumovanie latentných reprezentácií.

Miesto publikovania 2026 39th Conference of Open Innovations Association (FRUCT)

Typ prínosu Diagnostická metodika

28. apríla 2026 číslo 1 s. 69–76 Hlavná konferencia

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Obsah Na tejto stránke

## Kľúčové výsledky

| Bod hodnotenia | n | Priemerná PPL | Medián PPL | p95 PPL |
| --- | --- | --- | --- | --- |
| Pôvodné texty | 256 | 16.24 | 15.17 | 25.1 |
| Rekonštrukcie kodeku | 256 | 37.26 | 27.36 | 98.91 |
| Referenčný model AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM v priestore tokenov | 256 | 44.74 | 38.42 | 93.6 |
| MDLM v priestore kódov | 256 | 30.01 | 26.55 | 59.36 |

**Kľúčový výsledok.** Väčšina pozorovanej straty kvality vzniká pred generovaním; difúzia v priestore kódov napriek tomu znižuje medián perplexity o 30.9% v porovnaní s difúziou v priestore tokenov.

Stiahnuť výsledky: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Externé zrkadlo: [Karta dátového súboru Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF a citácia

**Citovať túto prácu** Odporúčaným formátom je BibTeX. Všetky nižšie uvedené varianty sa generujú z rovnakého publikačného záznamu.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Citačné súbory: [Text podľa APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Text podľa normy IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [Metadáta XML podľa JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Plný text vo formáte JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Súbor odkazov (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Súbor odkazov (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Úplná príručka

## Úplná výskumná príručka

## Metóda

## 

Článok používa vo všetkých troch fázach hodnotenia jediný hodnotiaci nástroj, aby bolo možné každú ďalšiu transformáciu spojiť s merateľným rozdielom v kvalite.

1. Rekonštruovať Každú 64-tokenovú vzorku TinyStories zakódujte do 16 kódov najvyššej úrovne a ihneď ju dekódujte, aby ste zmerali stratu pri rekonštrukcii kodekom.
2. Generovať Pomocou MDLM vygenerujte buď textové tokeny, alebo diskrétne latentné kódy a vzorky z priestoru kódov následne dekódujte tým istým natrénovaným kodekom.
3. Porovnať Vyhodnotiť pôvodné texty, rekonštrukcie a generované texty rovnakým externým protokolom GPT-2 vrátane mediánu a štatistík chvostov rozdelenia.

![Etapový postup generovania komprimovaného textu porovnáva pôvodný text, rekonštrukciu kodekom, MDLM v priestore kódov a dekódovaný text, aby oddelil stratu spôsobenú kodekom od straty pri generovaní.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Etapová lokalizácia úzkeho miesta oddeľuje stratu pri rekonštrukcii kodekom od straty pri generovaní v latentnom priestore pomocou jednotného protokolu hodnotenia dekódovaného textu.* Zdroj: [Vysvetľujúci diagram vytvorený autorom na základe publikovanej metódy a výsledkov.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Podmienky opätovného použitia: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Odporúčaná citácia: Gavrilov, Gazzaev a Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Stiahnuť SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Kľúčová myšlienka

Nadväzujúci generátor nedokáže obnoviť informácie, ktoré kodek už zahodil. Pred interpretáciou výsledkov generovania latentných reprezentácií preto treba preveriť fázu rekonštrukcie.

### Odlišnosť od príbuzných prístupov

Štandardné porovnania celého reťazca uvádzajú jediné konečné skóre generovania. Tento protokol pridáva párový kontrolný bod rekonštrukcie a oddeľuje diagnostické metriky v latentnom priestore od dôkazov získaných z dekódovaného textu.

### Čo je nové

Prínosom je opakovane použiteľná viacfázová diagnostická metodika pre jeden konkrétny reťazec spracovania komprimovaného textu, nie nový algoritmus odstraňovania šumu.

## Otázky, na ktoré tento článok pomáha odpovedať

## 

Otvorte otázku a získajte stručnú odpoveď podloženú článkom. Podrobné hranice dôkazov sú uvedené v časti Obmedzenia.

1. Kde sa pri generovaní komprimovaného krátkeho textu zhoršuje kvalita? V testovanom procese TinyStories s kompresiou zo 64 na 16 sa hlavné zhoršenie objavuje pri rekonštrukcii kodekom, ešte pred začiatkom generovania v latentnom priestore. Medián externej perplexity modelu GPT-2 sa zvyšuje z 15.17 pri pôvodnom texte na 27.36 po rekonštrukcii, zatiaľ čo p95 rastie z 25.10 na 98.91. Ide o výsledok jednej konfigurácie, nie o všeobecné poradie kodekov.
2. Ako možno oddeliť stratu spôsobenú kodekom od straty pri generovaní v latentnom priestore? Etapový protokol hodnotí originály, párové rekonštrukcie kodekom a výsledný vygenerovaný text pomocou jedného spoločného externého hodnotiteľa. Rozdiel medzi originálom a rekonštrukciou odhaduje podiel kodeku, zatiaľ čo porovnanie rekonštrukcie s vygenerovaným výstupom pomáha lokalizovať dodatočnú stratu pri generovaní. Metriky kvality latentnej reprezentácie sa uvádzajú oddelene od dôkazov získaných z dekódovaného textu.
3. Ako hodnotiť generovanie textu s diskrétnymi latentnými reprezentáciami? Článok odporúča pred porovnaním generátorov skontrolovať vernosť rekonštrukcie, v každej fáze používať rovnaký hodnotiaci nástroj pre dekódovaný text a uvádzať centrálne aj chvostové štatistiky. Využitie kódovej knihy, geometriu a ďalšie latentné zástupné ukazovatele zároveň chápe ako diagnostiku, nie ako náhradu kvality dekódovaného textu.
4. Prekonáva difúzia v priestore kódov difúziu v priestore tokenov? Pri spoločnom hodnotiteľovi a testovanom nastavení znižuje MDLM v priestore kódov priemer, medián a p95 perplexity o 32.9 %, 30.9 % a 36.6 % oproti MDLM v priestore tokenov. Porovnanie je opisné a špecifické pre danú konfiguráciu: neurčuje univerzálne poradie naprieč súbormi údajov, kompresnými pomermi, kodekmi ani architektúrami difúzie.
5. Zaručujú lepšie metriky geometrie latentného priestoru kvalitnejší generovaný text? Nie. V dostupných párovaných behoch regularizácia zohľadňujúca geometriu zlepšila lokálne zástupné ukazovatele latentného priestoru, nezlepšila však metriky dekódovaného textu. Výsledok podporuje overovanie každého zlepšenia zástupného ukazovateľa na konečnom dekódovanom výstupe a interpretáciu neprítomnosti prenosu ako užitočného negatívneho výsledku, nie ako dôkazu zlepšenia generovania.

## Porovnanie s príbuznými prístupmi

## 

| Prístup | Reprezentácia | Kontrola / diagnostika | Čo sa zachováva alebo meria |
| --- | --- | --- | --- |
| Difúzia v priestore tokenov | Textové tokeny | Kvalita generovania v priestore tokenov | Plynulosť priameho generovania a správanie hodnotiaceho nástroja |
| Generovanie komprimovaných latentných reprezentácií | Diskrétne latentné kódy získané pomocou kodeku | Konečná kvalita generovania od vstupu po výstup | Spoločné správanie kodeku a latentného generátora |
| Viacfázová lokalizácia úzkych miest | Text, rekonštrukcie kodekom a diskrétne latentné reprezentácie | Oddeľte stratu kodeku od straty pri generovaní | Kde sa pri jednom spoločnom hodnotiteľovi zhoršuje kvalita |

Porovnanie rozlišuje rozsah hodnotenia a dôkazov; nejde o univerzálne poradie prístupov.

## Relevantnosť a rozsah

## 

Etapový protokol je užitočný vtedy, keď generatívny postup zahŕňa naučený kodek aj generátor v latentnom priestore, no príčina zníženej kvality výstupu nie je zrejmá.

1. Generovanie textu s komprimovanými a diskrétnymi latentnými reprezentáciami
2. Vernosť rekonštrukcie kodeku v generatívnych postupoch
3. Jazykové modelovanie pomocou maskovanej difúzie v priestore kódov
4. Lokalizácia úzkeho miesta a etapovo konzistentné hodnotenie
5. Overovanie zlepšení zástupných metrík latentného priestoru voči dekódovanému textu

## Obmedzenia

## 

- Empirická štúdia používa výlučne TinyStories.
- Hlavná analýza zahŕňa jediný agresívny režim kompresie 64 na 16.
- Hodnotený systém kombinuje jednu rodinu hierarchických kodekov VQ-VAE-2 s jedným generátorom MDLM.
- Porovnania vychádzajú z jednotlivých behov a majú opisný charakter; nejde o štatistické odhady založené na viacerých inicializáciách.
- Externá perplexita GPT-2 je spoločným diagnostickým ukazovateľom, nie univerzálnou metrikou sémantickej kvality.
- Závery nemožno bezprostredne prenášať na všetky dátové množiny, architektúry kodekov ani kompresné pomery.

## Literatúra citovaná v článku

## 

Tieto položky zodpovedajú číslovanému zoznamu literatúry v dokumente PDF.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Zdroje a reprodukovateľnosť

## 

### Vyhlásenie o údajoch

## Verzie

## 

1. **Publikovaná verzia** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Záznam v arXiv** [Otvoriť záznam preprintu, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Register výskumu umelej inteligencie** [Stránka článku na Hugging Face s overenou totožnosťou prvého autora a prepojeným súhrnom výsledkov](https://huggingface.co/papers/2607.24176)
4. **Autorský rukopis** [Lokálny dokument PDF s prístupným textom](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Konferenčná prednáška** [Prezentácia FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Register konferenčného zborníka** [Oficiálny zväzok FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF konferenčného zborníka** [Voľne dostupný plný text FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Otvoriť odborný záznam** [OpenAlex](https://openalex.org/W7160914887)
9. **Záznam citačného grafu** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Plný text sprístupnený autorom** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Publikované DOI je primárnym bibliografickým identifikátorom. Táto stránka zostáva jedinou kanonickou adresou URL projektu naprieč verziami.

## Súvisiaca publikácia

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/sk/publications/inspectable-control/)

Prečítať [Diagnostika úzkeho miesta kodeku](https://aogavrilov.com/sk/projects/codec-bottleneck-diagnosis/) výskumného sprievodcu. [O autorovi](https://aogavrilov.com/about/) .

### Cielené výskumné poznámky

Odpovede prispôsobené zámeru s jasne vymedzenou dôkaznou oporou a odkazmi na tento článok.

- [Maskovaná difúzia v priestore kódov oproti priestoru tokenov: ako ich porovnávať](https://aogavrilov.com/sk/research-notes/code-space-vs-token-space-masked-diffusion/)
