# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/it/publications/where-quality-breaks/

Document language: it

Dove si deteriora la qualità nella generazione compressa di testi brevi: localizzazione per stadi del collo di bottiglia

Una diagnosi per stadi della generazione compressa di testi brevi che distingue la perdita di ricostruzione del codec dalla perdita di generazione latente.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Leggi l’articolo completo in HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Testo ricercabile con formule, tabelle, figure e riferimenti bibliografici.

Manoscritto finale accettato (versione pubblicata dall'autore con DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Condizioni di pubblicazione e riuso](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## L'articolo in 30 secondi

**Domanda di ricerca** Come si può attribuire separatamente al codec e al generatore latente la perdita di qualità in una pipeline di generazione testuale compressa?

### Problema

Nella generazione compressa di testi brevi, la scarsa qualità del testo decodificato può dipendere da informazioni perse dal codec oppure da una generazione debole nello spazio latente. Le metriche end-to-end confondono queste modalità di errore e possono indirizzare gli sforzi di ottimizzazione verso il componente sbagliato.

### Approccio

Il protocollo per fasi valuta gli originali, le corrispondenti ricostruzioni del codec, gli output dell’MDLM nello spazio dei token e quelli della diffusione nello spazio dei codici mediante un unico valutatore GPT-2 esterno. Le misure relative al codebook e alla geometria restano indicatori diagnostici, non sostituti della qualità del testo decodificato.

### Risultato principale

La ricostruzione del codec aumenta la perplessità esterna mediana da 15.17 a 27.36 e il p95 da 25.10 a 98.91. L'MDLM nello spazio dei codici riduce comunque la perplessità mediana del 30.9% rispetto all'MDLM nello spazio dei token.

### Perché è importante

Il risultato traduce la diagnosi del collo di bottiglia del codec in un ordine operativo degli interventi: dare priorità al miglioramento del codec, quindi confrontare la generazione nello spazio dei token e in quello dei codici, e considerare attendibili i progressi degli indicatori surrogati dello spazio latente solo quando migliora anche il testo decodificato.

## Abstract

I sistemi di generazione compressa di testi brevi possono fallire in due punti distinti: il codec può scartare informazioni prima che inizi la generazione, oppure il generatore latente può produrre codici di scarsa qualità. Se non si distinguono queste modalità di errore, si rischia di impiegare risorse di calcolo per migliorare il componente sbagliato. Studiamo il problema in un caso di studio controllato su TinyStories, con compressione da 64 a 16, basato su un codec VQ-VAE-2 gerarchico e un generatore a diffusione discreta mascherata (MDLM). Adottiamo un protocollo di validazione per fasi che distingue la fedeltà della ricostruzione del codec, la qualità della generazione latente e gli indicatori diagnostici ausiliari dello spazio latente, utilizzando un unico valutatore GPT-2 esterno e riportando metriche semantiche complementari per lo studio della geometria. Nella configurazione esaminata, la sola ricostruzione del codec aumenta la perplessità esterna mediana da 15.17 a 27.36 (+80.4%) e il p95 da 25.10 a 98.91 (+294.1%): la perdita di qualità dominante si manifesta dunque prima che inizi la generazione latente. Con lo stesso valutatore, l’MDLM nello spazio dei codici resta sensibilmente migliore della diffusione nello spazio dei token, con riduzioni rispettivamente del 32.9%, del 30.9% e del 36.6% per media, mediana e p95. La regolarizzazione sensibile alla geometria migliora le metriche surrogate locali dello spazio latente, ma nelle esecuzioni disponibili non migliora le metriche del testo decodificato. Il contributo è metodologico, non algoritmico: l’articolo presenta una diagnosi per fasi riutilizzabile per una pipeline concreta e mostra che, in questo contesto, la fedeltà del codec, non il denoising latente, determina il limite superiore pratico della qualità.

Pubblicato in 2026 39th Conference of Open Innovations Association (FRUCT)

Tipo di contributo Metodologia diagnostica

28 aprile 2026 numero 1 pp. 69–76 Conferenza principale

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Contenuti In questa pagina

## Risultati principali

| Punto di valutazione | n | PPL media | PPL mediana | PPL al 95o percentile |
| --- | --- | --- | --- | --- |
| Testi originali | 256 | 16.24 | 15.17 | 25.1 |
| Ricostruzioni del codec | 256 | 37.26 | 27.36 | 98.91 |
| Baseline AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM nello spazio dei token | 256 | 44.74 | 38.42 | 93.6 |
| MDLM nello spazio dei codici | 256 | 30.01 | 26.55 | 59.36 |

**Risultato principale.** La maggior parte della perdita di qualità osservata si verifica prima della generazione; la diffusione nello spazio dei codici riduce comunque la perplessità mediana del 30.9% rispetto alla diffusione nello spazio dei token.

Scarica i risultati: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Mirror esterno: [Scheda del dataset su Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF e citazione

**Come citare l’articolo** BibTeX è il formato raccomandato. Tutte le varianti riportate di seguito sono generate dallo stesso record di pubblicazione.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

File di citazione: [Testo APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Testo IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [XML OAI-DC](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [XML OpenAIRE v4](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [XML MODS](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [Metadati XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Testo integrale in formato JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Insieme di collegamenti (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Insieme di collegamenti (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Guida completa

## Guida di ricerca completa

## Metodo

## 

L’articolo impiega un unico valutatore in tre fasi di valutazione, così che ogni trasformazione aggiuntiva possa essere associata a un divario di qualità misurabile.

1. Ricostruire Codificare ciascun campione TinyStories di 64 token in 16 codici di livello superiore e decodificarlo immediatamente per misurare la perdita di ricostruzione del codec.
2. Genera Generare con MDLM token testuali oppure codici latenti discreti, quindi decodificare i campioni nello spazio dei codici mediante il medesimo codec addestrato.
3. Confronta Valutare originali, ricostruzioni e testi generati con il medesimo protocollo GPT-2 esterno, includendo la mediana e le statistiche delle code.

![Pipeline per fasi di generazione di testo compresso che confronta il testo originale, la ricostruzione del codec, l’MDLM nello spazio dei codici e il testo decodificato, così da distinguere la perdita del codec dalla perdita di generazione.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**La localizzazione per fasi del collo di bottiglia distingue la perdita di ricostruzione del codec dalla perdita di generazione nello spazio latente mediante un unico protocollo condiviso di valutazione del testo decodificato.* Fonte: [Diagramma esplicativo creato dall'autore sulla base del metodo e dei risultati pubblicati.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Condizioni di riutilizzo: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Attribuzione suggerita: Gavrilov, Gazzaev e Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Scarica l'SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Idea principale

Un generatore a valle non può recuperare informazioni che il codec ha già scartato. Occorre pertanto verificare la fase di ricostruzione prima di interpretare i risultati della generazione latente.

### Differenze rispetto ad approcci affini

I confronti end-to-end convenzionali riportano un unico punteggio finale di generazione. Questo protocollo introduce un punto di controllo appaiato della ricostruzione e distingue le metriche diagnostiche nello spazio latente dalle evidenze sul testo decodificato.

### Qual è il contributo innovativo

Il contributo consiste in una metodologia diagnostica per fasi, riutilizzabile per una specifica pipeline di testo compresso, anziché in un nuovo algoritmo di denoising.

## Domande a cui questo articolo contribuisce a rispondere

## 

Apri una domanda per ottenere una risposta concisa fondata sull'articolo. I limiti dettagliati delle evidenze sono riportati nella sezione Limitazioni.

1. In quale fase si deteriora la qualità nella generazione compressa di testi brevi? Nella pipeline TinyStories con compressione da 64 a 16 sottoposta a test, il degrado dominante emerge durante la ricostruzione del codec, prima che inizi la generazione latente. La perplessità esterna mediana misurata con GPT-2 passa da 15.17 per il testo originale a 27.36 dopo la ricostruzione, mentre il p95 aumenta da 25.10 a 98.91. Il risultato riguarda una singola configurazione e non costituisce una classificazione universale dei codec.
2. Come si può separare la perdita del codec dalla perdita di generazione nello spazio latente? Il protocollo per fasi valuta gli originali, le corrispondenti ricostruzioni del codec e il testo finale generato mediante un unico valutatore esterno condiviso. Lo scarto tra originale e ricostruzione stima il contributo del codec, mentre il confronto tra ricostruzione e output generato aiuta a localizzare l'ulteriore perdita introdotta nella fase di generazione. Le metriche sullo stato dello spazio latente sono riportate separatamente dalle evidenze relative al testo decodificato.
3. Come si dovrebbe valutare la generazione testuale con rappresentazioni latenti discrete? L’articolo raccomanda di verificare la fedeltà della ricostruzione prima di confrontare i generatori, di applicare in ogni fase lo stesso valutatore del testo decodificato e di riportare statistiche centrali e delle code. Considera inoltre l’utilizzo del codebook, la geometria e altri indicatori surrogati dello spazio latente come strumenti diagnostici, non come sostituti della qualità del testo decodificato.
4. La diffusione nello spazio dei codici supera quella nello spazio dei token? Con il valutatore condiviso e la configurazione esaminata, l'MDLM nello spazio dei codici riduce la perplexity media, mediana e al p95 rispettivamente del 32.9%, 30.9% e 36.6% rispetto all'MDLM nello spazio dei token. Il confronto è descrittivo e specifico della configurazione: non stabilisce una graduatoria universale tra dataset, rapporti di compressione, codec o architetture di diffusione.
5. Metriche migliori della geometria latente garantiscono una qualità superiore del testo generato? No. Nelle esecuzioni appaiate disponibili, la regolarizzazione sensibile alla geometria ha migliorato gli indicatori surrogati locali nello spazio latente, ma non le metriche sul testo decodificato. Il risultato indica la necessità di verificare ogni miglioramento degli indicatori surrogati sull'output finale decodificato e di considerare il mancato trasferimento come un risultato negativo informativo, non come prova di un miglioramento della generazione.

## Confronto con approcci affini

## 

| Approccio | Rappresentazione | Controllo / diagnosi | Che cosa viene preservato o misurato |
| --- | --- | --- | --- |
| Diffusione nello spazio dei token | Token testuali | Qualità della generazione nello spazio dei token | Fluidità della generazione diretta e comportamento del valutatore |
| Generazione latente compressa | Codici latenti discreti ottenuti mediante un codec | Qualità finale della generazione end-to-end | Comportamento congiunto del codec e del generatore latente |
| Localizzazione per fasi del collo di bottiglia | Testo, ricostruzioni del codec e rappresentazioni latenti discrete | Distinguere la perdita del codec dalla perdita di generazione | Dove si deteriora la qualità con un unico valutatore condiviso |

Il confronto distingue l’ambito della valutazione e le evidenze; non costituisce una graduatoria universale degli approcci.

## Rilevanza e ambito

## 

Il protocollo per fasi è utile quando una pipeline generativa comprende sia un codec appreso sia un generatore nello spazio latente, ma non è chiara l'origine del deterioramento della qualità dell'output.

1. Generazione di testo compressa e con variabili latenti discrete
2. Fedeltà della ricostruzione del codec nelle pipeline generative
3. Modellazione linguistica mediante diffusione mascherata nello spazio dei codici
4. Localizzazione del collo di bottiglia e valutazione coerente tra gli stadi
5. Verifica dei miglioramenti delle misure surrogate nello spazio latente rispetto al testo decodificato

## Limitazioni

## 

- Lo studio empirico utilizza esclusivamente TinyStories.
- L’analisi principale riguarda un unico regime di compressione spinta da 64 a 16.
- Il sistema valutato combina una famiglia di codec VQ-VAE-2 gerarchici con un generatore MDLM.
- I confronti si basano su singole esecuzioni e hanno carattere descrittivo, anziché costituire stime statistiche su più seed.
- La perplessità esterna di GPT-2 è uno strumento diagnostico comune, non una metrica universale della qualità semantica.
- Le conclusioni non devono essere estese direttamente a tutti i dataset, alle architetture dei codec o ai rapporti di compressione.

## Riferimenti citati nell’articolo

## 

Queste voci corrispondono alla sezione numerata dei riferimenti bibliografici nel PDF dell'articolo.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Risorse e riproducibilità

## 

### Dichiarazione sui dati

## Versioni

## 

1. **Versione pubblicata** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Record arXiv** [Apri il record del preprint, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Indice della ricerca sull'IA** [Pagina dell’articolo su Hugging Face con identità verificata del primo autore e collegamento alla sintesi dei risultati](https://huggingface.co/papers/2607.24176)
4. **Manoscritto dell'autore** [PDF locale accessibile in formato testuale](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Presentazione alla conferenza** [Presentazione a FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Indice degli atti della conferenza** [Volume ufficiale FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF degli atti della conferenza** [Testo integrale ad accesso aperto di FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Apri il record scientifico** [OpenAlex](https://openalex.org/W7160914887)
9. **Record del grafo delle citazioni** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Testo integrale condiviso dall'autore** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Il DOI pubblicato è l’identificatore bibliografico primario. Questa pagina resta l’unico URL canonico del progetto in tutte le versioni.

## Pubblicazione correlata

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/it/publications/inspectable-control/)

Leggi [Diagnosi del collo di bottiglia del codec](https://aogavrilov.com/it/projects/codec-bottleneck-diagnosis/) guida alla ricerca. [Informazioni sull'autore](https://aogavrilov.com/about/) .

### Note di ricerca mirate

Risposte specifiche per ciascun intento, con limiti espliciti delle evidenze e rimandi al presente articolo.

- [Diffusione mascherata nello spazio dei codici e nello spazio dei token: come confrontarle](https://aogavrilov.com/it/research-notes/code-space-vs-token-space-masked-diffusion/)
