# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/ro/publications/where-quality-breaks/

Document language: ro

Unde se degradează calitatea în generarea comprimată de texte scurte: localizarea etapizată a blocajelor

Un diagnostic etapizat al generării comprimate de texte scurte, care separă pierderea de reconstrucție introdusă de codec de pierderea introdusă de generarea latentă.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Citiți articolul integral în format HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Text interogabil cu formule, tabele, figuri și referințe.

Manuscrisul final acceptat (versiune publicată de autor, cu DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Condiții de publicare și reutilizare](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Lucrarea în 30 de secunde

**Întrebare de cercetare** Cum poate fi atribuită separat codecului și generatorului latent pierderea calității dintr-un flux de generare a textului comprimat?

### Problemă

În generarea comprimată de texte scurte, calitatea slabă a textului decodificat poate proveni fie din informația pierdută de codec, fie dintr-o generare deficitară în spațiul latent. Scorurile globale nu permit distingerea acestor cauze și pot orienta efortul de optimizare către componenta greșită.

### Abordare

Protocolul etapizat evaluează cu un singur evaluator extern GPT-2 originalele, reconstrucțiile pereche prin codec, rezultatele MDLM din spațiul tokenilor și rezultatele difuziei din spațiul codurilor. Măsurile referitoare la dicționarul de coduri și la geometrie rămân instrumente de diagnosticare, nu substitute pentru calitatea textului decodificat.

### Rezultatul principal

Reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 și p95 de la 25.10 la 98.91. MDLM în spațiul codurilor reduce totuși perplexitatea mediană cu 30.9% față de MDLM în spațiul tokenurilor.

### De ce este important

Rezultatul transformă diagnosticarea blocajului codecului într-o ordine de lucru aplicabilă: acordați prioritate îmbunătățirii codecului, comparați apoi generarea în spațiul tokenilor cu cea din spațiul codurilor și considerați credibile câștigurile indicatorilor surogat latenți numai dacă se îmbunătățește și textul decodat.

## Rezumat

Generatoarele comprimate de texte scurte pot eșua în două puncte distincte: codecul poate elimina informații înainte de începerea generării, iar generatorul latent poate produce coduri slabe. Fără separarea acestor moduri de eșec, cercetătorii pot irosi resurse de calcul îmbunătățind componenta greșită. Studiem această problemă într-un studiu de caz controlat TinyStories, cu raport 64-la-16, construit pe baza unui codec VQ-VAE-2 ierarhic și a unui generator cu difuziune discretă mascată (MDLM). Folosim un protocol de validare etapizat care separă fidelitatea reconstrucției codecului, calitatea generării latente și diagnosticele latente auxiliare, toate evaluate de același evaluator extern GPT-2, și raportăm totodată metrici semantice complementare pentru studiul geometriei. În configurația testată, numai reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 (+80.4%) și p95 de la 25.10 la 98.91 (+294.1%), ceea ce arată că pierderea dominantă de calitate apare înainte de începerea generării latente. Cu același evaluator, MDLM în spațiul codurilor rămâne substanțial mai performant decât difuziunea în spațiul tokenurilor, reducând media, mediana și p95 cu 32.9%, 30.9% și, respectiv, 36.6%. Regularizarea sensibilă la geometrie îmbunătățește indicatorii surogat latenți locali, dar nu îmbunătățește metricile textului decodificat în rulările disponibile. Contribuția este metodologică, nu algoritmică: lucrarea prezintă un diagnostic etapizat reutilizabil pentru un flux concret și arată că, în acest cadru, fidelitatea codecului, nu eliminarea zgomotului latent, stabilește plafonul practic al calității.

Publicat în 2026 39th Conference of Open Innovations Association (FRUCT)

Tipul contribuției Metodologie de diagnosticare

28 aprilie 2026 numărul 1 pp. 69–76 Conferința principală

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Cuprins Pe această pagină

## Rezultate principale

| Punct de evaluare | n | PPL medie | PPL mediană | PPL p95 |
| --- | --- | --- | --- | --- |
| Texte originale | 256 | 16.24 | 15.17 | 25.1 |
| Reconstrucții ale codecului | 256 | 37.26 | 27.36 | 98.91 |
| Reper AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM în spațiul tokenilor | 256 | 44.74 | 38.42 | 93.6 |
| MDLM în spațiul codurilor | 256 | 30.01 | 26.55 | 59.36 |

**Rezultatul principal.** Cea mai mare parte a pierderii de calitate observate apare înaintea generării; cu toate acestea, difuzia în spațiul codurilor reduce perplexitatea mediană cu 30.9% față de difuzia în spațiul tokenurilor.

Descărcați rezultatele: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Oglindă externă: [Fișa setului de date Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF și citare

**Citați această lucrare** BibTeX este formatul recomandat. Fiecare variantă de mai jos este generată din aceeași înregistrare a publicației.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Fișiere de citare: [Text APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Text IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [Metadate XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Text integral în format JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Set de legături (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Set de legături (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Ghid complet

## Ghid complet de cercetare

## Metodă

## 

Lucrarea utilizează un singur evaluator în trei etape de evaluare, astfel încât fiecărei transformări suplimentare să îi poată fi asociat un decalaj de calitate măsurabil.

1. Reconstruiți Codificați fiecare eșantion TinyStories de 64 de tokenuri în 16 coduri de nivel superior și decodificați-l imediat pentru a măsura pierderea de reconstrucție a codecului.
2. Generare Generați cu MDLM fie tokenuri textuale, fie coduri latente discrete, apoi decodificați eșantioanele din spațiul codurilor prin același codec antrenat.
3. Comparați Evaluați originalele, reconstrucțiile și textele generate prin același protocol extern GPT-2, incluzând statistici privind mediana și cozile distribuției.

![Flux etapizat de generare a textului comprimat, care compară textul original, reconstrucția codecului, MDLM în spațiul codurilor și textul decodat, pentru a separa pierderea codecului de pierderea de generare.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Localizarea etapizată a blocajelor separă pierderea de reconstrucție a codecului de pierderea generării latente, în cadrul unui protocol comun de evaluare a textului decodat.* Sursă: [Diagramă explicativă creată de autor pe baza metodei și rezultatelor publicate.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Condiții de reutilizare: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Citare sugerată: Gavrilov, Gazzaev și Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Descărcați SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Ideea principală

Un generator din aval nu poate recupera informația pe care codecul a eliminat-o deja. Prin urmare, etapa de reconstrucție trebuie auditată înainte de interpretarea rezultatelor generării latente.

### Deosebirea față de abordările înrudite

Comparațiile standard de la un capăt la altul raportează un singur scor final de generare. Acest protocol introduce un punct de control pereche pentru reconstrucție și separă metricile de stare din spațiul latent de dovezile obținute pe textul decodat.

### Elemente de noutate

Contribuția constă într-o metodologie reutilizabilă de diagnosticare etapizată pentru un flux concret de text comprimat, nu într-un nou algoritm de eliminare a zgomotului.

## Întrebări la care contribuie acest articol

## 

Deschideți o întrebare pentru un răspuns concis fundamentat în lucrare. Limitele detaliate ale dovezilor sunt prezentate în secțiunea Limitări.

1. Unde se degradează calitatea în generarea comprimată de texte scurte? În fluxul TinyStories 64-la-16 testat, degradarea dominantă apare la reconstrucția codecului, înainte de începerea generării în spațiul latent. Perplexitatea externă mediană GPT-2 crește de la 15.17 pentru textul original la 27.36 după reconstrucție, iar p95 crește de la 25.10 la 98.91. Acesta este rezultatul unei singure configurații, nu un clasament universal al codecurilor.
2. Cum poate fi separată pierderea codecului de pierderea de generare în spațiul latent? Protocolul etapizat evaluează textele originale, reconstrucțiile pereche prin codec și textul generat final cu același evaluator extern. Diferența dintre original și reconstrucție estimează contribuția codecului, iar comparația dintre reconstrucție și rezultatul generat ajută la localizarea pierderii suplimentare din etapa de generare. Metricile privind starea reprezentării latente sunt raportate separat de dovezile obținute din textul decodificat.
3. Cum trebuie evaluată generarea de text cu reprezentări latente discrete? Lucrarea recomandă verificarea fidelității reconstrucției înainte de compararea generatoarelor, aplicarea aceluiași evaluator al textului decodat în fiecare etapă și raportarea statisticilor centrale și ale cozilor distribuției. De asemenea, tratează utilizarea dicționarului de coduri, geometria și alți indicatori surogat latenți drept instrumente de diagnostic, nu drept înlocuitori ai calității textului decodat.
4. Difuzia în spațiul codurilor depășește difuzia în spațiul tokenurilor? În condițiile evaluatorului comun și ale configurației testate, MDLM din spațiul codurilor reduce perplexitatea medie, mediană și p95 cu 32.9%, 30.9% și, respectiv, 36.6% față de MDLM din spațiul tokenilor. Comparația este descriptivă și specifică acestei configurații: ea nu stabilește un clasament universal pentru seturi de date, rapoarte de compresie, codecuri sau arhitecturi de difuziune diferite.
5. Valorile mai bune ale metricilor geometriei latente garantează un text generat mai bun? Nu. În execuțiile comparabile disponibile, regularizarea sensibilă la geometrie a îmbunătățit indicatorii indirecți locali din spațiul latent, dar nu și metricile textului decodificat. Rezultatul susține verificarea fiecărui câștig al indicatorilor indirecți la nivelul ieșirii finale decodificate și interpretarea absenței transferului drept un rezultat negativ util, nu drept dovadă a îmbunătățirii generării.

## Comparație cu abordări înrudite

## 

| Abordare | Reprezentare | Control / diagnosticare | Ce se păstrează sau se măsoară |
| --- | --- | --- | --- |
| Difuziune în spațiul tokenilor | Tokeni textuali | Calitatea generării în spațiul tokenurilor | Fluența generării directe și comportamentul evaluatorului |
| Generare latentă comprimată | Coduri latente discrete obținute printr-un codec | Calitatea finală a generării de la un capăt la altul | Comportamentul combinat al codecului și al generatorului latent |
| Localizarea etapizată a blocajelor | Text, reconstrucții ale codecului și variabile latente discrete | Separați pierderea codecului de pierderea de generare | Unde se degradează calitatea conform unui evaluator comun |

Comparația diferențiază domeniul evaluării și dovezile; nu reprezintă o ierarhizare universală a abordărilor.

## Relevanță și domeniu de aplicare

## 

Protocolul etapizat este util atunci când un flux generativ cuprinde atât un codec învățat, cât și un generator în spațiul latent, iar sursa degradării calității rezultatelor nu este clară.

1. Generarea comprimată de text cu variabile latente discrete
2. Fidelitatea reconstrucției codecului în fluxurile generative
3. Modelarea limbajului prin difuzie mascată în spațiul codurilor
4. Localizarea blocajelor și evaluarea coerentă între etape
5. Auditarea îmbunătățirilor indicatorilor surogat din spațiul latent în raport cu textul decodificat

## Limitări

## 

- Studiul empiric utilizează exclusiv TinyStories.
- Analiza principală acoperă un singur regim agresiv de compresie de la 64 la 16.
- Sistemul evaluat combină o singură familie de codecuri VQ-VAE-2 ierarhice cu un singur generator MDLM.
- Comparațiile se bazează pe rulări unice și au caracter descriptiv; ele nu reprezintă estimări statistice obținute din rulări cu mai multe inițializări aleatoare.
- Perplexitatea GPT-2 externă este un instrument comun de diagnosticare, nu o metrică universală a calității semantice.
- Concluziile nu trebuie extrapolate direct la toate seturile de date, arhitecturile de codec sau ratele de compresie.

## Referințe citate în articol

## 

Aceste intrări corespund secțiunii numerotate de referințe din versiunea PDF a lucrării.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Resurse și reproductibilitate

## 

### Declarație privind datele

## Versiuni

## 

1. **Versiunea publicată** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Înregistrare arXiv** [Deschideți înregistrarea preprintului, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Index de cercetare în IA** [Pagină Hugging Face Paper cu identitatea verificată a primului autor și cu un rezumat asociat al rezultatelor](https://huggingface.co/papers/2607.24176)
4. **Manuscrisul autorului** [PDF local accesibil ca text](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Prezentare la conferință** [Prezentare FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Indexul volumului conferinței** [Volumul oficial FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF-ul volumului conferinței** [Text integral FRUCT cu acces liber](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Deschideți înregistrarea academică** [OpenAlex](https://openalex.org/W7160914887)
9. **Înregistrare în graful de citări** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Text integral distribuit de autor** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

DOI-ul publicat este identificatorul bibliografic principal. Această pagină rămâne unicul URL canonic al proiectului pentru toate versiunile.

## Publicație conexă

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ro/publications/inspectable-control/)

Citiți [Diagnosticarea blocajului produs de codec](https://aogavrilov.com/ro/projects/codec-bottleneck-diagnosis/) ghidul de cercetare. [Despre autor](https://aogavrilov.com/about/) .

### Note de cercetare focalizate

Răspunsuri adaptate intenției, cu delimitarea dovezilor și trimiteri către această lucrare.

- [Difuziune mascată în spațiul codurilor față de spațiul tokenurilor: cum le comparăm](https://aogavrilov.com/ro/research-notes/code-space-vs-token-space-masked-diffusion/)
