# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/bg/publications/where-quality-breaks/

Document language: bg

Къде се срива качеството при компресирано генериране на кратък текст: поетапно локализиране на тясното място

Поетапна диагностика на компресираното генериране на кратък текст, която разграничава загубата при реконструкция чрез кодека от загубата при генериране в латентното пространство.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Прочетете пълния текст във формат HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Текст с възможност за търсене, включващ формули, таблици, фигури и библиография.

Окончателен приет ръкопис (публикувана от автора версия с DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Условия за публикуване и повторно използване](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Статията за 30 секунди

**Изследователски въпрос** Как загубата на качество в конвейер за генериране на компресиран текст може да се припише поотделно на кодека и на латентния генератор?

### Проблем

При генерирането на компресиран кратък текст ниското качество на декодирания текст може да се дължи на информация, загубена от кодека, или на слабо генериране в латентното пространство. Оценките от край до край размиват разграничението между тези режими на отказ и могат да насочат усилията за оптимизация към неправилния компонент.

### Подход

Поетапният протокол оценява оригиналите, съответните им реконструкции чрез кодека, изходите на MDLM в пространството на токените и изходите на дифузията в пространството на кодовете посредством един външен оценител GPT-2. Показателите за кодовата книга и геометрията остават диагностични средства, а не заместители на качеството на декодирания текст.

### Основен резултат

Реконструкцията от кодека повишава медианната външна перплексия от 15.17 на 27.36, а p95 — от 25.10 на 98.91. Въпреки това MDLM в пространството на кодовете намалява медианната перплексия с 30.9% спрямо MDLM в пространството на токените.

### Защо това е важно

Резултатът превръща диагностиката на тесните места в кодека в приложима последователност на работа: първо подобрете кодека, след това съпоставете генерирането в пространството на токените и в кодовото пространство и приемайте подобренията на латентните косвени показатели само когато се подобрява и декодираният текст.

## Резюме

При генераторите на компресиран кратък текст проблемът може да възникне на две различни места: кодекът да отхвърли информация преди началото на генерирането или латентният генератор да създаде некачествени кодове. Ако тези два източника на грешка не бъдат разграничени, изследователите могат да изразходват изчислителни ресурси за подобряване на неподходящия компонент. Изследваме проблема в контролирана постановка с TinyStories и компресия от 64 до 16, изградена върху йерархичен кодек VQ-VAE-2 и генератор с маскирана дискретна дифузия (MDLM). Използваме поетапен протокол за валидиране, който разграничава точността на реконструкцията чрез кодека, качеството на генерирането в латентното пространство и спомагателните диагностични показатели за латентните представяния при един и същ външен оценител GPT-2; за изследването на геометрията отчитаме и допълващи семантични метрики. В изпитаната конфигурация само реконструкцията чрез кодека повишава медианната външна перплексия от 15.17 на 27.36 (+80.4%), а p95 — от 25.10 на 98.91 (+294.1%). Следователно основната загуба на качество възниква преди началото на генерирането в латентното пространство. При същия оценител MDLM в кодовото пространство остава осезаемо по-силен от дифузията в токеновото пространство, като намалява средната стойност, медианата и p95 съответно с 32.9%, 30.9% и 36.6%. Регуляризацията, отчитаща геометрията, подобрява локалните косвени показатели за латентните представяния, но при наличните изпълнения не подобрява метриките върху декодирания текст. Приносът е методологичен, а не алгоритмичен: статията представя повторно приложима поетапна диагностика за конкретен конвейер и показва, че в тази постановка практическият таван на качеството се определя от точността на кодека, а не от премахването на шум в латентното пространство.

Публикувано в 39-а конференция на Open Innovations Association (FRUCT), 2026 г.

Вид на приноса Диагностична методология

28 април 2026 г. брой 1 с. 69–76 Основна конференция

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Съдържание На тази страница

## Основни резултати

| Точка на оценяване | n | Средна PPL | Медианна PPL | p95 PPL |
| --- | --- | --- | --- | --- |
| Оригинални текстове | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкции от кодека | 256 | 37.26 | 27.36 | 98.91 |
| Базов авторегресивен модел | 251 | 30.98 | 23.27 | 56.11 |
| MDLM в пространството на токените | 256 | 44.74 | 38.42 | 93.6 |
| MDLM в пространството на кодовете | 256 | 30.01 | 26.55 | 59.36 |

**Основен резултат.** По-голямата част от наблюдаваната загуба на качество възниква преди генерирането; въпреки това дифузията в пространството на кодовете намалява медианната перплексия с 30.9% спрямо дифузията в пространството на токените.

Изтегляне на резултатите: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Външен огледален източник: [Карта на набор от данни в Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF и цитиране

**Как да цитирате статията** BibTeX е препоръчителният формат. Всеки вариант по-долу е генериран от един и същ запис за публикацията.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Файлове с библиографски записи: [Текст по APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Текст във формат IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML метаданни по JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Пълен текст във формат JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Набор от връзки (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Набор от връзки (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Пълно ръководство

## Пълно изследователско ръководство

## Метод

## 

Статията използва един оценител в три етапа на оценяване, така че всяка допълнителна трансформация да може да се свърже с измерима разлика в качеството.

1. Реконструиране Кодирайте всяка 64-токенна извадка от TinyStories в 16 кода от най-горното ниво и я декодирайте незабавно, за да измерите загубата при реконструкция чрез кодека.
2. Генериране Генерирайте с MDLM текстови токени или дискретни латентни кодове, след което декодирайте извадките от кодовото пространство чрез същия обучен кодек.
3. Сравнете Оценете оригиналите, реконструкциите и генерираните текстове чрез един и същ външен протокол с GPT-2, включително статистики за медианата и опашките.

![Поетапен конвейер за генериране на компресиран текст, който съпоставя оригиналния текст, реконструкцията чрез кодека, MDLM в кодовото пространство и декодирания текст, за да разграничи загубата от кодека от загубата при генерирането.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Поетапното локализиране на тясното място разграничава загубата при реконструкция чрез кодека от загубата при генериране в латентното пространство посредством единен протокол за оценяване на декодирания текст.* Източник: [Обяснителна диаграма, създадена от автора въз основа на публикуваните метод и резултати.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Условия за повторно използване: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Препоръчително позоваване: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Изтегляне на SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Основна идея

Генераторът на следващ етап не може да възстанови информация, която кодекът вече е отхвърлил. Поради това етапът на реконструкция трябва да бъде проверен, преди да се интерпретират резултатите от генерирането в латентното пространство.

### Разлика спрямо сродни подходи

Стандартните съпоставки от край до край отчитат една окончателна оценка на генерирането. Този протокол добавя контролна точка за сдвоена реконструкция и отделя диагностичните метрики в латентното пространство от доказателствата върху декодирания текст.

### Какво е новото

Приносът е повторно използваема поетапна диагностична методология за конкретен конвейер за компресиран текст, а не нов алгоритъм за премахване на шум.

## Въпроси, на които тази статия помага да се отговори

## 

Отворете въпрос за кратък отговор, основан на статията. Подробните граници на доказателствата са посочени в раздел „Ограничения“.

1. Къде се влошава качеството при генериране на компресиран кратък текст? В изпитания конвейер TinyStories 64-към-16 основното влошаване настъпва при реконструкцията чрез кодека, преди да започне генерирането в латентното пространство. Медианната външна перплексия според GPT-2 нараства от 15.17 за оригиналния текст до 27.36 след реконструкцията, а p95 — от 25.10 до 98.91. Това е резултат за една конфигурация, а не универсална класация на кодеците.
2. Как загубата от кодека може да се разграничи от загубата при генериране в латентното пространство? Поетапният протокол оценява оригиналите, съответните им реконструкции чрез кодека и окончателно генерирания текст с един и същ външен оценител. Разликата между оригинала и реконструкцията оценява приноса на кодека, а сравнението между реконструкцията и генерирания изход помага да се локализира допълнителната загуба при генерирането. Метриките за състоянието на латентното представяне се отчитат отделно от данните за декодирания текст.
3. Как следва да се оценява генерирането на текст с дискретни латентни представяния? Статията препоръчва точността на реконструкцията да се проверява преди съпоставянето на генератори, на всеки етап да се прилага един и същ оценител върху декодирания текст и да се отчитат статистики за центъра и опашките на разпределението. Използването на кодовата книга, геометрията и други латентни косвени показатели се разглеждат като диагностични средства, а не като заместители на качеството на декодирания текст.
4. Превъзхожда ли дифузията в кодовото пространство дифузията в пространството на токените? При общия оценител и изпитаната постановка MDLM в пространството на кодовете намалява средната, медианната и p95 перплексията съответно с 32.9%, 30.9% и 36.6% спрямо MDLM в пространството на токените. Сравнението е описателно и специфично за конфигурацията: то не установява универсално класиране за различни набори от данни, коефициенти на компресия, кодеци или дифузионни архитектури.
5. Гарантират ли по-добрите метрики за латентна геометрия по-качествен генериран текст? Не. В наличните съпоставими изпълнения съобразената с геометрията регуляризация подобри локалните заместители в латентното пространство, но не и метриките върху декодирания текст. Резултатът показва необходимостта всяко подобрение по заместваща метрика да се проверява върху крайния декодиран изход, а липсата на пренос да се разглежда като полезен отрицателен резултат, а не като доказателство за подобрено генериране.

## Сравнение със сродни подходи

## 

| Подход | Представяне | Контрол / диагностика | Какво се запазва или измерва |
| --- | --- | --- | --- |
| Дифузия в пространството на токените | Текстови токени | Качество на генерирането в пространството на токените | Плавност и поведение на оценителя при пряко генериране |
| Компресирано латентно генериране | Дискретни латентни кодове чрез кодек | Крайно качество на генерирането от начало до край | Съвместно поведение на кодека и латентния генератор |
| Поетапно локализиране на тесните места | Текст, реконструкции от кодека и дискретни латентни представяния | Разграничете загубата от кодека от загубата при генерирането | Къде се влошава качеството при един общ оценител |

Съпоставката разграничава обхвата на оценяването и доказателствата; тя не представлява универсално подреждане на подходите.

## Приложимост и обхват

## 

Поетапният протокол е полезен, когато генеративният конвейер включва както обучен кодек, така и генератор в латентното пространство, но причината за влошеното качество на изхода е неясна.

1. Генериране на текст чрез компресирани и дискретни латентни представяния
2. Точност на реконструкцията от кодека в генеративни конвейери
3. Езиково моделиране чрез маскирана дифузия в пространството на кодовете
4. Локализиране на тясното място и съгласувано между етапите оценяване
5. Проверка на подобренията в прокси показателите на латентното пространство спрямо декодирания текст

## Ограничения

## 

- Емпиричното изследване използва единствено TinyStories.
- Основният анализ обхваща един агресивен режим на компресия от 64 до 16.
- Оценяваната система съчетава едно семейство йерархични кодеци VQ-VAE-2 с един генератор MDLM.
- Сравненията се основават на единични изпълнения и имат описателен характер, а не представляват статистически оценки с множество начални инициализации.
- Външната перплексия на GPT-2 е общ диагностичен показател, а не универсална метрика за семантично качество.
- Изводите не следва да се пренасят пряко към всички набори от данни, архитектури на кодеци или коефициенти на компресия.

## Източници, цитирани в статията

## 

Тези записи съответстват на номерирания раздел References в PDF файла на статията.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Ресурси и възпроизводимост

## 

### Декларация относно данните

## Версии

## 

1. **Публикувана версия** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Запис в arXiv** [Отваряне на записа за препринта, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Индекс на изследванията в областта на ИИ** [Страница на публикацията в Hugging Face с потвърдена самоличност на първия автор и свързано резюме на резултатите](https://huggingface.co/papers/2607.24176)
4. **Авторски ръкопис** [Локален PDF с достъпен текст](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Доклад на конференция** [Презентация на FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Указател на сборника с доклади от конференцията** [Официален том на FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF на сборника с доклади от конференцията** [Свободно достъпен пълен текст от FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Отваряне на научния запис** [OpenAlex](https://openalex.org/W7160914887)
9. **Запис в графа на цитиранията** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Пълен текст, споделен от автора** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Публикуваният DOI е основният библиографски идентификатор. Тази страница остава единственият каноничен URL на проекта във всички версии.

## Свързана публикация

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/bg/publications/inspectable-control/)

Прочетете [Диагностика на тясното място в кодека](https://aogavrilov.com/bg/projects/codec-bottleneck-diagnosis/) изследователското ръководство. [За автора](https://aogavrilov.com/about/) .

### Тематични изследователски бележки

Отговори според конкретното намерение, с ясно очертани граници на доказателствата и препратки към настоящата публикация.

- [Маскирана дифузия в пространството на кодовете спрямо пространството на токените: как да ги сравним](https://aogavrilov.com/bg/research-notes/code-space-vs-token-space-masked-diffusion/)
