# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/cs/publications/where-quality-breaks/

Document language: cs

Kde se láme kvalita při generování komprimovaných krátkých textů: vícefázová lokalizace úzkého hrdla

Vícefázová diagnostika generování komprimovaných krátkých textů, která odděluje ztrátu při rekonstrukci kodeku od ztráty při generování v latentním prostoru.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Přečíst celý článek v HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Prohledávatelný text se vzorci, tabulkami, obrázky a bibliografickými odkazy.

Konečná přijatá verze rukopisu (verze zveřejněná autorem s DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Podmínky zveřejnění a opětovného použití](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Článek ve 30 sekundách

**Výzkumná otázka** Jak v řetězci generování komprimovaného textu samostatně přisoudit pokles kvality kodeku a latentnímu generátoru?

### Problém

Při generování komprimovaných krátkých textů může nízká kvalita dekódovaného textu pramenit buď z informací ztracených kodekem, nebo z nedostatečného generování v latentním prostoru. Hodnocení celého řetězce tyto způsoby selhání zastírá, a optimalizační úsilí tak může být zaměřeno na nesprávnou komponentu.

### Přístup

Vícefázový protokol hodnotí originály, odpovídající rekonstrukce kodekem, výstupy MDLM v prostoru tokenů a výstupy difuze v prostoru kódů jediným externím hodnotitelem GPT-2. Metriky číselníku kódů a geometrie slouží jako diagnostické ukazatele, nikoli jako náhrada hodnocení kvality dekódovaného textu.

### Hlavní výsledek

Rekonstrukce kodeku zvyšuje medián externí perplexity z 15.17 na 27.36 a p95 z 25.10 na 98.91. MDLM v prostoru kódů přesto snižuje medián perplexity o 30.9 % oproti MDLM v prostoru tokenů.

### Proč je to důležité

Výsledek převádí diagnostiku úzkého hrdla kodeku do praktického pořadí práce: nejprve zlepšit kodek, poté porovnat generování v prostoru tokenů a v prostoru kódů a zlepšení zástupných metrik v latentním prostoru považovat za přínos pouze tehdy, zlepší-li se i dekódovaný text.

## Abstrakt

Generátory komprimovaných krátkých textů mohou selhávat ve dvou různých fázích: kodek může zahodit informace ještě před zahájením generování, nebo latentní generátor může vytvářet nekvalitní kódy. Bez rozlišení těchto režimů selhání mohou výzkumníci vynakládat výpočetní prostředky na zlepšování nesprávné komponenty. Tento problém zkoumáme v kontrolované případové studii TinyStories s kompresí z 64 na 16, založené na hierarchickém kodeku VQ-VAE-2 a generátoru s maskovanou diskrétní difuzí (MDLM). Používáme vícefázový validační protokol, který s jedním společným externím hodnotitelem GPT-2 odděluje věrnost rekonstrukce kodeku, kvalitu generování v latentním prostoru a pomocné diagnostické metriky latentních reprezentací; pro studii geometrie zároveň uvádíme doplňkové sémantické metriky. V testované konfiguraci zvyšuje samotná rekonstrukce kodekem medián externí perplexity z 15.17 na 27.36 (+80.4 %) a p95 z 25.10 na 98.91 (+294.1 %), což ukazuje, že dominantní ztráta kvality nastává ještě před zahájením generování v latentním prostoru. Při hodnocení týmž modelem si MDLM v prostoru kódů vede podstatně lépe než difuze v prostoru tokenů: snižuje průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Regularizace zohledňující geometrii zlepšuje lokální zástupné metriky v latentním prostoru, avšak v dostupných bězích nezlepšuje metriky dekódovaného textu. Přínos je metodologický, nikoli algoritmický: článek představuje opakovaně použitelnou vícefázovou diagnostiku jednoho konkrétního řetězce a ukazuje, že v tomto uspořádání určuje praktický strop kvality věrnost kodeku, nikoli latentní odšumování.

Publikováno na 2026 39th Conference of Open Innovations Association (FRUCT)

Typ přínosu Diagnostická metodologie

28. dubna 2026 číslo 1 s. 69–76 Hlavní konference

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Obsah Na této stránce

## Klíčové výsledky

| Bod evaluace | n | Průměrná PPL | Medián PPL | PPL na 95. percentilu |
| --- | --- | --- | --- | --- |
| Původní texty | 256 | 16.24 | 15.17 | 25.1 |
| Rekonstrukce kodeku | 256 | 37.26 | 27.36 | 98.91 |
| Výchozí model AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM v prostoru tokenů | 256 | 44.74 | 38.42 | 93.6 |
| MDLM v prostoru kódů | 256 | 30.01 | 26.55 | 59.36 |

**Klíčový výsledek.** Většina pozorovaného poklesu kvality vzniká před generováním; difuze v prostoru kódů přesto snižuje medián perplexity o 30.9% oproti difuzi v prostoru tokenů.

Stáhnout výsledky: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Externí zrcadlová kopie: [Karta datové sady na Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF a citace

**Jak citovat tento článek** Doporučeným formátem je BibTeX. Všechny níže uvedené varianty pocházejí z téhož záznamu o publikaci.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Citační soubory: [Text citace podle APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Text ve formátu IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [Metadata XML ve formátu JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Plný text ve formátu JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Sada odkazů (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Sada odkazů (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Úplný průvodce

## Úplný výzkumný průvodce

## Metoda

## 

Článek používá ve třech fázích hodnocení tutéž hodnoticí funkci, aby bylo možné každé další transformaci přiřadit měřitelný rozdíl v kvalitě.

1. Rekonstrukce Každý 64tokenový vzorek TinyStories zakódujte do 16 kódů nejvyšší úrovně a bezprostředně jej dekódujte, abyste změřili ztrátu rekonstrukce kodekem.
2. Generování Pomocí MDLM vygenerujte buď textové tokeny, nebo diskrétní latentní kódy a vzorky z prostoru kódů následně dekódujte týmž natrénovaným kodekem.
3. Porovnání Ohodnoťte původní texty, rekonstrukce i generované texty stejným externím protokolem GPT-2 včetně mediánu a statistik chvostů rozdělení.

![Vícefázový řetězec generování komprimovaného textu porovnává původní text, rekonstrukci kodekem, MDLM v prostoru kódů a dekódovaný text, aby oddělil ztrátu způsobenou kodekem od ztráty při generování.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Vícefázová lokalizace úzkého hrdla odděluje ztrátu při rekonstrukci kodekem od ztráty při generování v latentním prostoru pomocí jediného společného protokolu hodnocení dekódovaného textu.* Zdroj: [Vysvětlující schéma vytvořené autorem na základě publikované metody a výsledků.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Podmínky opětovného užití: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Doporučená citace: Gavrilov, Gazzaev a Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Stáhnout SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Hlavní myšlenka

Navazující generátor nedokáže obnovit informace, které kodek již zahodil. Před interpretací výsledků generování v latentním prostoru je proto nutné prověřit fázi rekonstrukce.

### Rozdíl oproti příbuzným přístupům

Standardní porovnání typu end-to-end uvádějí jediné konečné skóre generování. Tento protokol zavádí párový kontrolní bod rekonstrukce a odděluje diagnostické metriky v latentním prostoru od důkazů získaných z dekódovaného textu.

### Co je nové

Přínosem je opakovaně použitelná metodika postupné diagnostiky jedné konkrétní pipeline komprimovaného textu, nikoli nový algoritmus odstraňování šumu.

## Otázky, na které článek pomáhá odpovědět

## 

Otevřete otázku a zobrazte stručnou odpověď opřenou o článek. Podrobné hranice důkazní platnosti jsou uvedeny v části Omezení.

1. Ve které fázi se při generování komprimovaného krátkého textu zhoršuje kvalita? V testovaném řetězci TinyStories s kompresí 64 na 16 dochází k hlavnímu zhoršení již při rekonstrukci kodekem, tedy před zahájením generování v latentním prostoru. Medián externí perplexity podle GPT-2 roste z 15.17 u původního textu na 27.36 po rekonstrukci, zatímco p95 vzroste z 25.10 na 98.91. Jde o výsledek jediné konfigurace, nikoli o obecně platné pořadí kodeků.
2. Jak lze oddělit ztrátu způsobenou kodekem od ztráty při generování v latentním prostoru? Etapový protokol hodnotí originály, odpovídající rekonstrukce kodekem a výsledný generovaný text pomocí jediného společného externího hodnotitele. Rozdíl mezi originálem a rekonstrukcí odhaduje příspěvek kodeku, zatímco srovnání rekonstrukce s generovaným výstupem pomáhá lokalizovat dodatečnou ztrátu při generování. Metriky stavu latentní reprezentace se uvádějí odděleně od dokladů založených na dekódovaném textu.
3. Jak hodnotit generování textu s diskrétními latentními reprezentacemi? Článek doporučuje před porovnáváním generátorů ověřit věrnost rekonstrukce, v každé fázi použít stejnou hodnoticí funkci pro dekódovaný text a uvádět centrální statistiky i statistiky chvostů rozdělení. Využití číselníku kódů, geometrii a další latentní zástupné metriky zároveň chápe jako diagnostické ukazatele, nikoli jako náhradu hodnocení kvality dekódovaného textu.
4. Překonává difuze v prostoru kódů difuzi v prostoru tokenů? Při společném hodnotiteli a testovaném uspořádání snižuje MDLM v prostoru kódů oproti MDLM v prostoru tokenů průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Srovnání je popisné a specifické pro danou konfiguraci: neurčuje univerzální pořadí napříč datovými sadami, kompresními poměry, kodeky ani difuzními architekturami.
5. Zaručují lepší metriky latentní geometrie kvalitnější generovaný text? Ne. V dostupných párově srovnatelných bězích regularizace zohledňující geometrii zlepšila lokální zástupné ukazatele v latentním prostoru, nikoli však metriky dekódovaného textu. Výsledek podporuje ověřování každého zlepšení zástupného ukazatele na konečném dekódovaném výstupu a chápání nepřeneseného zlepšení jako užitečného negativního výsledku, nikoli jako dokladu lepšího generování.

## Porovnání s příbuznými přístupy

## 

| Přístup | Reprezentace | Kontrola / diagnostika | Co se zachovává nebo měří |
| --- | --- | --- | --- |
| Difuze v prostoru tokenů | Textové tokeny | Kvalita generování v prostoru tokenů | Plynulost přímého generování a chování hodnotitele |
| Komprimované latentní generování | Diskrétní latentní kódy získané pomocí kodeku | Výsledná kvalita generování v celém řetězci | Kombinované chování kodeku a latentního generátoru |
| Postupná lokalizace úzkých míst | Text, rekonstrukce kodekem a diskrétní latentní reprezentace | Oddělte ztrátu kodeku od ztráty při generování | Kde se při společném hodnotiteli zhoršuje kvalita |

Porovnání rozlišuje rozsah hodnocení a průkaznost důkazů; nejde o univerzální pořadí přístupů.

## Relevance a rozsah

## 

Etapový protokol je užitečný tehdy, když generativní řetězec obsahuje naučený kodek i generátor v latentním prostoru, ale příčina zhoršené kvality výstupu není zřejmá.

1. Generování textu s komprimovanými a diskrétními latentními reprezentacemi
2. Věrnost rekonstrukce kodeku v generativních pipeline
3. Jazykové modelování pomocí maskované difuze v prostoru kódů
4. Lokalizace úzkého hrdla a hodnocení konzistentní napříč fázemi
5. Ověřování zlepšení zástupných metrik v latentním prostoru na dekódovaném textu

## Omezení

## 

- Empirická studie používá výhradně TinyStories.
- Hlavní analýza zahrnuje jediný agresivní kompresní režim 64 ku 16.
- Hodnocený systém kombinuje jednu rodinu hierarchických kodeků VQ-VAE-2 s jedním generátorem MDLM.
- Porovnání vycházejí z jednotlivých běhů a mají popisný charakter; nejde o statistické odhady založené na více náhodných inicializacích.
- Externě měřená perplexita GPT-2 je společným diagnostickým ukazatelem, nikoli univerzální metrikou sémantické kvality.
- Závěry nelze bezprostředně přenášet na všechny datové sady, architektury kodeků ani kompresní poměry.

## Literatura citovaná v článku

## 

Tyto položky odpovídají číslovanému oddílu References v PDF článku.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Zdroje a reprodukovatelnost

## 

### Prohlášení o datech

## Verze

## 

1. **Publikovaná verze** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Záznam na arXiv** [Otevřít záznam preprintu, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Rejstřík výzkumu AI** [Stránka článku na Hugging Face s ověřenou totožností prvního autora a odkazovaným souhrnem výsledků](https://huggingface.co/papers/2607.24176)
4. **Autorský rukopis** [Lokální PDF s textovou vrstvou](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Konferenční přednáška** [Prezentace na FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Rejstřík konferenčního sborníku** [Oficiální svazek FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF konferenčního sborníku** [Volně dostupný plný text FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Otevřít odborný záznam** [OpenAlex](https://openalex.org/W7160914887)
9. **Záznam v citačním grafu** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Plný text zpřístupněný autorem** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Publikované DOI je primárním bibliografickým identifikátorem. Tato stránka zůstává napříč verzemi jedinou kanonickou adresou URL projektu.

## Související publikace

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/cs/publications/inspectable-control/)

Přečíst [Diagnostika úzkého hrdla kodeku](https://aogavrilov.com/cs/projects/codec-bottleneck-diagnosis/) průvodce výzkumem. [O autorovi](https://aogavrilov.com/about/) .

### Cílené výzkumné poznámky

Odpovědi přizpůsobené konkrétnímu záměru, s vymezením důkazní opory a odkazy zpět na tento článek.

- [Maskovaná difuze v prostoru kódů oproti prostoru tokenů: jak je porovnávat](https://aogavrilov.com/cs/research-notes/code-space-vs-token-space-masked-diffusion/)
