# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/ms/publications/where-quality-breaks/

Document language: ms

Titik Kemerosotan Kualiti dalam Penjanaan Teks Pendek Termampat: Penyetempatan Cerutan Secara Berperingkat

Diagnosis berperingkat bagi penjanaan teks pendek termampat yang memisahkan kehilangan pembinaan semula kodek daripada kehilangan penjanaan pendam.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Baca makalah penuh dalam HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Teks yang boleh dicari, berserta formula, jadual, rajah dan rujukan.

Manuskrip akhir yang diterima (versi yang disiarkan oleh pengarang dengan DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Syarat penyiaran dan penggunaan semula](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Makalah dalam 30 saat

**Soalan penyelidikan** Bagaimanakah kemerosotan kualiti dalam saluran penjanaan teks termampat dapat dikaitkan secara berasingan dengan kodek dan penjana ruang pendam?

### Masalah

Dalam penjanaan teks pendek termampat, mutu teks ternyahkod yang rendah mungkin berpunca daripada kehilangan maklumat dalam kodek atau kelemahan penjanaan ruang pendam. Skor hujung ke hujung mengaburkan mod kegagalan tersebut dan boleh menyebabkan usaha pengoptimuman ditumpukan pada komponen yang salah.

### Pendekatan

Protokol berperingkat memberikan skor kepada teks asal, pembinaan semula kodek berpasangan, output MDLM ruang token, dan output resapan ruang kod dengan satu penilai GPT-2 luaran. Ukuran buku kod dan geometri kekal sebagai diagnostik, bukan pengganti kualiti teks ternyahkod.

### Hasil utama

Pembinaan semula kodek meningkatkan median perpleksiti luaran daripada 15.17 kepada 27.36 dan p95 daripada 25.10 kepada 98.91. MDLM ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding MDLM ruang token.

### Mengapa hal ini penting

Hasil ini mengubah diagnosis cerutan kodek menjadi urutan kerja yang boleh dilaksanakan: utamakan penambahbaikan kodek, kemudian bandingkan penjanaan ruang token dengan ruang kod, dan terima peningkatan proksi ruang pendam sebagai bukti hanya apabila teks ternyahkod turut bertambah baik.

## Abstrak

Penjana teks pendek termampat boleh gagal pada dua bahagian yang berbeza: kodek mungkin membuang maklumat sebelum penjanaan bermula, atau penjana pendam mungkin menghasilkan kod yang lemah. Tanpa memisahkan mod kegagalan ini, penyelidik mungkin menghabiskan sumber pengkomputeran untuk menambah baik komponen yang salah. Kami mengkaji masalah ini melalui kajian kes TinyStories 64-kepada-16 yang terkawal, dibina daripada kodek VQ-VAE-2 berhierarki dan penjana resapan diskret bertopeng (MDLM). Kami menggunakan protokol pengesahan berperingkat yang memisahkan kesetiaan pembinaan semula kodek, kualiti penjanaan pendam, dan diagnostik pendam tambahan di bawah satu penilai luaran GPT-2 yang dikongsi, di samping melaporkan metrik semantik pelengkap bagi kajian geometri. Dalam konfigurasi yang diuji, pembinaan semula kodek sahaja meningkatkan median keperpleksan luaran daripada 15.17 kepada 27.36 (+80.4%) dan p95 daripada 25.10 kepada 98.91 (+294.1%), yang menunjukkan bahawa kehilangan kualiti dominan muncul sebelum penjanaan pendam bermula. Di bawah penilai yang sama, MDLM ruang kod kekal jauh lebih kukuh berbanding resapan ruang token, masing-masing mengurangkan min, median, dan p95 sebanyak 32.9%, 30.9%, dan 36.6%. Regularisasi peka geometri menambah baik proksi pendam setempat tetapi tidak menambah baik metrik teks ternyahkod dalam larian yang tersedia. Sumbangannya bersifat metodologi dan bukannya algoritma: makalah ini mengemukakan diagnosis berperingkat yang boleh diguna semula bagi satu saluran paip konkrit serta menunjukkan bahawa, dalam tetapan ini, kesetiaan kodek dan bukannya penyahhingaran pendam menetapkan had maksimum kualiti praktikal.

Diterbitkan di 2026 39th Conference of Open Innovations Association (FRUCT)

Jenis sumbangan Metodologi diagnosis

28 April 2026 isu 1 pp. 69–76 Persidangan utama

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Kandungan Pada halaman ini

## Hasil utama

| Titik penilaian | n | PPL min | PPL median | PPL p95 |
| --- | --- | --- | --- | --- |
| Teks asal | 256 | 16.24 | 15.17 | 25.1 |
| Hasil pembinaan semula kodek | 256 | 37.26 | 27.36 | 98.91 |
| Garis dasar AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM ruang token | 256 | 44.74 | 38.42 | 93.6 |
| MDLM ruang kod | 256 | 30.01 | 26.55 | 59.36 |

**Hasil utama.** Sebahagian besar kehilangan kualiti yang diperhatikan berlaku sebelum penjanaan; resapan ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding resapan ruang token.

Muat turun hasil: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Cermin luaran: [Kad set data Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF dan petikan

**Petik makalah ini** BibTeX ialah format yang disyorkan. Setiap varian di bawah dijana daripada rekod penerbitan yang sama.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Fail sitasi: [Teks APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Teks IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML metadata JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Teks penuh JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Set Pautan (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Set Pautan (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Panduan lengkap

## Panduan penyelidikan lengkap

## Kaedah

## 

Makalah ini menggunakan satu penilai merentas tiga peringkat penilaian supaya setiap transformasi tambahan dapat dikaitkan dengan jurang kualiti yang boleh diukur.

1. Bina semula Enkod setiap sampel TinyStories 64 token kepada 16 kod peringkat teratas dan nyahkodnya serta-merta untuk mengukur kehilangan pembinaan semula kodek.
2. Jana Jana sama ada token teks atau kod pendam diskret menggunakan MDLM, kemudian nyahkod sampel ruang kod melalui kodek terlatih yang sama.
3. Bandingkan Berikan skor kepada teks asal, pembinaan semula dan teks yang dijana menggunakan protokol GPT-2 luaran yang sama, termasuk statistik median dan ekor taburan.

![Saluran penjanaan teks termampat berperingkat yang membandingkan teks asal, pembinaan semula kodek, MDLM ruang kod dan teks ternyahkod untuk mengasingkan kehilangan kodek daripada kehilangan penjanaan.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Penyetempatan cerutan secara berperingkat mengasingkan kehilangan pembinaan semula kodek daripada kehilangan penjanaan ruang pendam di bawah satu protokol penilaian teks ternyahkod yang dikongsi.* Sumber: [Rajah penerangan ciptaan pengarang berdasarkan kaedah dan hasil yang diterbitkan.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Syarat penggunaan semula: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Atribusi yang dicadangkan: Gavrilov, Gazzaev, dan Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Muat turun SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Gagasan utama

Penjana hiliran tidak dapat memulihkan maklumat yang telah dibuang oleh kodek. Oleh itu, peringkat pembinaan semula mesti diaudit sebelum hasil penjanaan pendam ditafsirkan.

### Perbezaan daripada pendekatan yang berkaitan

Perbandingan hujung-ke-hujung piawai melaporkan satu skor penjanaan akhir. Protokol ini menyisipkan titik semak pembinaan semula berpasangan dan mengasingkan metrik kesihatan dalam ruang pendam daripada bukti pada teks ternyahkod.

### Perkara yang baharu

Sumbangannya ialah metodologi diagnostik berperingkat yang boleh digunakan semula bagi satu saluran teks termampat yang khusus, bukannya algoritma penyahhinggaan baharu.

## Soalan yang dibantu jawab oleh makalah ini

## 

Buka soalan untuk mendapatkan jawapan ringkas yang berasaskan makalah. Sempadan bukti yang terperinci disenaraikan dalam Batasan.

1. Di manakah kualiti merosot dalam penjanaan teks pendek termampat? Dalam saluran TinyStories 64-ke-16 yang diuji, kemerosotan utama berlaku pada peringkat pembinaan semula kodek, sebelum penjanaan ruang pendam bermula. Median perpleksiti GPT-2 luaran meningkat daripada 15.17 bagi teks asal kepada 27.36 selepas pembinaan semula, manakala p95 meningkat daripada 25.10 kepada 98.91. Hasil ini terpakai pada satu konfigurasi dan bukannya pemeringkatan kodek secara sejagat.
2. Bagaimanakah kehilangan kodek dapat diasingkan daripada kehilangan penjanaan ruang pendam? Protokol berperingkat menilai teks asal, pembinaan semula kodek berpasangan, dan teks akhir yang dijana dengan satu penilai luaran yang dikongsi. Jurang antara teks asal dengan pembinaan semula menganggarkan sumbangan kodek, manakala perbandingan antara pembinaan semula dengan output terjana membantu menentukan lokasi kehilangan tambahan pada peringkat penjanaan. Metrik kesihatan pendam dilaporkan secara berasingan daripada bukti teks ternyahkod.
3. Bagaimanakah penjanaan teks pendam diskret harus dinilai? Makalah ini menyarankan agar kesetiaan pembinaan semula diperiksa sebelum penjana dibandingkan, penilai teks ternyahkod yang sama digunakan pada setiap peringkat, serta statistik pusat dan ekor dilaporkan. Penggunaan buku kod, geometri dan proksi ruang pendam lain turut dianggap sebagai diagnostik, bukannya pengganti bagi kualiti teks ternyahkod.
4. Adakah resapan ruang kod mengatasi resapan ruang token? Menurut penilai bersama dan dalam persediaan yang diuji, MDLM ruang kod mengurangkan min, median dan p95 perpleksiti masing-masing sebanyak 32.9%, 30.9% dan 36.6% berbanding MDLM ruang token. Perbandingan ini bersifat deskriptif dan khusus kepada konfigurasi; perbandingan ini tidak menetapkan pemeringkatan sejagat merentas set data, nisbah pemampatan, kodek atau seni bina resapan.
5. Adakah metrik geometri pendam yang lebih baik menjamin teks janaan yang lebih baik? Tidak. Dalam pelaksanaan berpadanan yang tersedia, regularisasi berasaskan geometri menambah baik proksi setempat dalam ruang pendam, tetapi tidak menambah baik metrik teks ternyahkod. Dapatan ini menyokong pengauditan setiap peningkatan proksi pada output akhir yang dinyahkod serta pentafsiran ketiadaan pemindahan sebagai dapatan negatif yang berguna, bukannya bukti peningkatan penjanaan.

## Perbandingan dengan pendekatan yang berkaitan

## 

| Pendekatan | Perwakilan | Kawalan / diagnosis | Perkara yang dikekalkan atau diukur |
| --- | --- | --- | --- |
| Resapan ruang token | Token teks | Kualiti penjanaan dalam ruang token | Kelancaran dan tingkah laku penilai bagi penjanaan langsung |
| Penjanaan pendam termampat | Kod pendam diskret melalui kodek | Kualiti akhir penjanaan hujung ke hujung | Tingkah laku gabungan kodek dan penjana pendam |
| Penyetempatan cerutan secara berperingkat | Teks, pembinaan semula kodek dan pemboleh ubah pendam diskret | Asingkan kehilangan kodek daripada kehilangan penjanaan | Lokasi kemerosotan kualiti di bawah satu penilai bersama |

Perbandingan ini membezakan skop penilaian dan bukti; perbandingan tersebut bukan pemeringkatan universal bagi pendekatan berkenaan.

## Kerelevanan dan skop

## 

Protokol berperingkat berguna apabila talian paip generatif mengandungi kodek terpelajar dan penjana ruang pendam, tetapi punca kemerosotan kualiti output tidak jelas.

1. Penjanaan teks termampat dengan pemboleh ubah pendam diskret
2. Kesetiaan pembinaan semula kodek dalam saluran paip generatif
3. Pemodelan bahasa berasaskan resapan bertopeng dalam ruang kod
4. Penyetempatan cerutan dan penilaian yang tekal antara peringkat
5. Mengaudit penambahbaikan proksi ruang pendam berdasarkan teks ternyahkod

## Batasan

## 

- Kajian empirikal ini hanya menggunakan TinyStories.
- Analisis utama meliputi satu rejim mampatan agresif 64-kepada-16.
- Sistem yang dinilai menggabungkan satu keluarga kodek VQ-VAE-2 berhierarki dengan satu penjana MDLM.
- Perbandingan berasaskan larian tunggal dan bersifat deskriptif, bukannya anggaran statistik berbilang benih.
- Perpleksiti GPT-2 luaran ialah ukuran diagnostik bersama, bukan metrik universal bagi kualiti semantik.
- Kesimpulan ini tidak seharusnya diterapkan secara langsung pada semua set data, seni bina kodek atau nisbah mampatan.

## Rujukan yang dipetik dalam makalah

## 

Entri ini sepadan dengan bahagian Rujukan bernombor dalam PDF makalah.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Sumber dan kebolehulangan

## 

### Pernyataan data

## Versi

## 

1. **Versi terbitan** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Rekod arXiv** [Buka rekod pracetak, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Indeks penyelidikan AI** [Halaman Makalah Hugging Face dengan identiti pengarang pertama yang disahkan serta ringkasan hasil terpaut](https://huggingface.co/papers/2607.24176)
4. **Manuskrip pengarang** [PDF setempat dengan teks boleh capai](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Pembentangan persidangan** [Pembentangan FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Indeks prosiding persidangan** [Jilid rasmi FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF prosiding persidangan** [Teks penuh akses terbuka FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Buka rekod ilmiah** [OpenAlex](https://openalex.org/W7160914887)
9. **Rekod graf sitasi** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Teks penuh yang dikongsi pengarang** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

DOI yang diterbitkan ialah pengecam bibliografi utama. Halaman ini kekal sebagai satu-satunya URL kanonik projek bagi semua versi.

## Penerbitan berkaitan

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ms/publications/inspectable-control/)

Baca [Diagnosis cerutan kodek](https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/) panduan penyelidikan. [Perihal pengarang](https://aogavrilov.com/about/) .

### Nota penyelidikan terfokus

Jawapan khusus mengikut niat, dengan sempadan bukti dan pautan kembali kepada makalah ini.

- [Resapan bertopeng ruang kod berbanding ruang token: cara membandingkannya](https://aogavrilov.com/ms/research-notes/code-space-vs-token-space-masked-diffusion/)
