# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/sr/publications/where-quality-breaks/

Document language: sr

Где се нарушава квалитет при генерисању компримованог кратког текста: фазна локализација уских грла

Фазна дијагностика генерисања компримованог кратког текста која раздваја губитак реконструкције кодеком од губитка при генерисању латентних кодова.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Прочитајте цео рад у HTML формату](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Претражив текст с формулама, табелама, сликама и референцама.

Коначни прихваћени рукопис (верзија коју је објавио аутор, са DOI вредношћу). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Услови објављивања и поновне употребе](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Рад за 30 секунди

**Истраживачко питање** Како се губитак квалитета у процесу генерисања компримованог текста може засебно приписати кодеку и латентном генератору?

### Проблем

При генерисању компримованог кратког текста, лош квалитет декодираног текста може потицати од информација изгубљених у кодеку или од слабог генерисања у латентном простору. Метрике целокупног процеса замагљују ове начине отказа и могу усмерити оптимизацију ка погрешној компоненти.

### Приступ

Етапни протокол једним спољним GPT-2 оцењивачем вреднује оригинале, упарене реконструкције кодеком, излазе MDLM-а у простору токена и излазе дифузије у простору кодова. Мере речника кодова и геометрије остају дијагностички показатељи, а не замена за квалитет декодираног текста.

### Главни резултат

Реконструкција кодеком повећава медијану спољне перплексије са 15.17 на 27.36, а p95 са 25.10 на 98.91. MDLM у простору кодова ипак смањује медијану перплексије за 30.9% у односу на MDLM у простору токена.

### Зашто је то важно

Резултат претвара дијагнозу уског грла кодека у применљив редослед рада: најпре унапредити кодек, затим упоредити генерисање у простору токена и простору кодова, а побољшањима латентних посредних мера веровати само када се побољша и декодирани текст.

## Сажетак

Генератори кратког компримованог текста могу отказати на два различита места: кодек може одбацити информације пре почетка генерисања или латентни генератор може произвести слабе кодове. Ако се ови начини отказа не раздвоје, истраживачи могу трошити рачунарске ресурсе на побољшавање погрешне компоненте. Овај проблем проучавамо у контролисаној студији случаја TinyStories са компресијом 64-на-16, заснованој на хијерархијском VQ-VAE-2 кодеку и генератору с маскираном дискретном дифузијом (MDLM). Примењујемо етапни протокол валидације који, уз један заједнички спољни GPT-2 оцењивач, раздваја верност реконструкције кодеком, квалитет генерисања латентних репрезентација и помоћну дијагностику латентних репрезентација, док за испитивање геометрије извештавамо и о допунским семантичким метрикама. У испитаној конфигурацији, сама реконструкција кодеком повећава медијану спољне перплексије са 15.17 на 27.36 (+80.4%), а p95 са 25.10 на 98.91 (+294.1%), што показује да се доминантан губитак квалитета јавља пре почетка генерисања латентних репрезентација. При истом оцењивачу, MDLM у простору кодова остаје осетно успешнији од дифузије у простору токена, смањујући средњу вредност, медијану и p95 за 32.9%, 30.9% и 36.6%. Регуларизација која узима у обзир геометрију побољшава локалне посредне показатеље латентних репрезентација, али у доступним покретањима не побољшава метрике декодираног текста. Допринос је методолошки, а не алгоритамски: рад представља поновљиво употребљиву етапну дијагностику једног конкретног тока обраде и показује да у овом окружењу практичну горњу границу квалитета одређује верност кодека, а не уклањање шума из латентних репрезентација.

Објављено у 2026 39th Conference of Open Innovations Association (FRUCT)

Врста доприноса Дијагностичка методологија

28. април 2026. број 1 стр. 69–76 Главна конференција

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Садржај На овој страници

## Кључни резултати

| Тачка евалуације | n | Средња вредност PPL | Медијана PPL | p95 PPL |
| --- | --- | --- | --- | --- |
| Изворни текстови | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкције кодеком | 256 | 37.26 | 27.36 | 98.91 |
| Полазни AR модел | 251 | 30.98 | 23.27 | 56.11 |
| MDLM у простору токена | 256 | 44.74 | 38.42 | 93.6 |
| MDLM у простору кодова | 256 | 30.01 | 26.55 | 59.36 |

**Кључни резултат.** Највећи део уоченог губитка квалитета настаје пре генерисања; дифузија у простору кодова ипак смањује медијану перплексије за 30.9% у односу на дифузију у простору токена.

Преузмите резултате: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Спољно огледало: [Картица скупа података на платформи Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF и библиографски навод

**Како цитирати овај рад** BibTeX је препоручени формат. Свака варијанта у наставку генерисана је из истог записа о публикацији.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Датотеке библиографских навода: [Текст у формату APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Текст у формату IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML метаподаци према стандарду JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Цео текст у формату JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Скуп веза (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Скуп веза (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Цео водич

## Цео истраживачки водич

## Метод

## 

Рад користи један оцењивач у три фазе вредновања како би се свака додатна трансформација могла повезати с мерљивим јазом у квалитету.

1. Реконструишите Сваки узорак TinyStories од 64 токена кодирајте у 16 кодова највишег нивоа и одмах га декодирајте ради мерења губитка при реконструкцији кодеком.
2. Генеришите Помоћу модела MDLM генеришите текстуалне токене или дискретне латентне кодове, а затим узорке из простора кодова декодирајте истим обученим кодеком.
3. Упоредите Оценити оригинале, реконструкције и генерисане текстове истим спољним GPT-2 протоколом, укључујући медијану и статистике репова расподеле.

![Етапни поступак генерисања компримованог текста који пореди изворни текст, реконструкцију кодеком, MDLM у простору кодова и декодирани текст ради раздвајања губитка кодека од губитка при генерисању.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Етапно локализовање уског грла раздваја губитак реконструкције кодеком од губитка при латентном генерисању у оквиру јединственог протокола за вредновање декодираног текста.* Извор: [Објашњавајући дијаграм који је израдио аутор на основу објављеног метода и резултата.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Услови поновне употребе: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Предложено навођење: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Преузмите SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Кључна идеја

Генератор у каснијој фази не може да поврати информације које је кодек већ одбацио. Зато се фаза реконструкције мора испитати пре тумачења резултата генерисања латентних кодова.

### Разлика у односу на сродне приступе

Стандардна поређења од почетка до краја наводе једну коначну оцену генерисања. Овај протокол уводи упарену контролну тачку реконструкције и раздваја показатеље исправности у латентном простору од доказа добијених на декодираном тексту.

### Шта је ново

Допринос је поновљиво употребљива методологија етапне дијагностике једног конкретног поступка за компримовани текст, а не нов алгоритам за уклањање шума.

## Питања на која овај рад помаже да се одговори

## 

Отворите питање да бисте добили сажет одговор заснован на раду. Детаљне границе расположивих доказа наведене су у одељку Ограничења.

1. Где долази до пада квалитета при генерисању компримованог кратког текста? У испитаном процесу TinyStories са компресијом 64-на-16, доминантно погоршање јавља се при реконструкцији кодеком, пре почетка генерисања у латентном простору. Медијана спољне перплексије модела GPT-2 расте са 15.17 за изворни текст на 27.36 након реконструкције, док p95 расте са 25.10 на 98.91. Ово је резултат за једну конфигурацију, а не универзално рангирање кодека.
2. Како се губитак кодека може раздвојити од губитка при генерисању у латентном простору? Етапни протокол оцењује оригинале, упарене реконструкције кодеком и коначни генерисани текст помоћу једног заједничког спољног оцењивача. Разлика између оригинала и реконструкције процењује допринос кодека, док поређење реконструкције са генерисаним излазом помаже да се локализује додатни губитак при генерисању. Метрике стања латентних репрезентација наводе се одвојено од доказа заснованих на декодираном тексту.
3. Како треба вредновати генерисање текста помоћу дискретних латентних репрезентација? Рад препоручује да се пре поређења генератора провери верност реконструкције, да се у свакој фази примени исти оцењивач декодираног текста и да се прикажу централне статистике и статистике репова расподеле. Употребу књиге кодова, геометрију и друге латентне посредне мере такође третира као дијагностичке показатеље, а не као замену за квалитет декодираног текста.
4. Да ли дифузија у простору кодова надмашује дифузију у простору токена? Према заједничком оцењивачу и у испитаној поставци, MDLM у простору кодова смањује средњу вредност, медијану и p95 перплексије за 32.9%, 30.9% и 36.6% у односу на MDLM у простору токена. Поређење је описно и односи се на конкретну конфигурацију: оно не утврђује универзални поредак за различите скупове података, степене компресије, кодеке или архитектуре дифузије.
5. Да ли боље метрике латентне геометрије гарантују бољи генерисани текст? Не. У доступним упареним извршавањима, регуларизација која узима у обзир геометрију побољшала је локалне посредне показатеље латентног простора, али није побољшала метрике декодованог текста. Овај резултат указује на то да сваки добитак у посредним показатељима треба проверити на коначном декодованом излазу, а изостанак преноса тумачити као користан негативан резултат, а не као доказ побољшања генерисања.

## Поређење са сродним приступима

## 

| Приступ | Репрезентација | Управљање / дијагностика | Шта се очувава или мери |
| --- | --- | --- | --- |
| Дифузија у простору токена | Текстуални токени | Квалитет генерисања у простору токена | Течност непосредно генерисаног текста и понашање оцењивача |
| Генерисање компримованих латентних репрезентација | Дискретни латентни кодови добијени помоћу кодека | Коначни квалитет генерисања од почетка до краја | Заједничко понашање кодека и латентног генератора |
| Етапно локализовање уског грла | Текст, реконструкције кодеком и дискретне латентне променљиве | Раздвојте губитак кодека од губитка при генерисању | Где се квалитет погоршава према једном заједничком оцењивачу |

Поређење разликује обухват вредновања и доказе; оно није универзално рангирање приступа.

## Релевантност и обухват

## 

Етапни протокол је користан када генеративни ток садржи и научени кодек и генератор у латентном простору, али извор погоршања квалитета излаза није јасан.

1. Генерисање текста помоћу компримованих и дискретних латентних репрезентација
2. Верност реконструкције кодеком у генеративним токовима обраде
3. Моделовање језика маскираном дифузијом у простору кодова
4. Локализација уског грла и оцењивање доследно фазама
5. Провера побољшања посредних мера у латентном простору на декодираном тексту

## Ограничења

## 

- Емпиријска студија користи искључиво TinyStories.
- Главна анализа обухвата један агресиван режим компресије 64-на-16.
- Вредновани систем спаја једну хијерархијску породицу VQ-VAE-2 кодека с једним MDLM генератором.
- Поређења се заснивају на појединачним покретањима и описна су, а не статистичке процене добијене употребом више почетних вредности.
- Екстерна перплексија модела GPT-2 заједничка је дијагностичка мера, а не универзална метрика семантичког квалитета.
- Закључке не треба непосредно преносити на све скупове података, архитектуре кодека или степене компресије.

## Референце цитиране у раду

## 

Ове ставке одговарају нумерисаном одељку References у PDF верзији рада.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Ресурси и репродуктивност

## 

### Изјава о подацима

## Верзије

## 

1. **Објављена верзија** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Запис на arXiv-у** [Отвори запис препринта, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Индекс истраживања вештачке интелигенције** [Страница рада на платформи Hugging Face са потврђеним идентитетом првог аутора и повезаним сажетком резултата](https://huggingface.co/papers/2607.24176)
4. **Рукопис аутора** [Локални PDF са доступним текстом](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Излагање на конференцији** [Презентација на FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Индекс зборника радова конференције** [Званични зборник FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF зборника радова конференције** [Отворено доступан цео текст на FRUCT-у](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Отвори научни запис** [OpenAlex](https://openalex.org/W7160914887)
9. **Запис у графу цитата** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Пун текст који је аутор поделио** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Објављени DOI је примарни библиографски идентификатор. Ова страница остаје једини канонски URL пројекта у свим верзијама.

## Повезана публикација

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/sr/publications/inspectable-control/)

Прочитајте [Дијагностиковање уског грла кодека](https://aogavrilov.com/sr/projects/codec-bottleneck-diagnosis/) истраживачки водич. [О аутору](https://aogavrilov.com/about/) .

### Циљане истраживачке белешке

Одговори прилагођени намери упита, са јасним границама доказне поткрепљености и везама ка овом раду.

- [Маскирана дифузија у простору кодова наспрам простора токена: како их упоредити](https://aogavrilov.com/sr/research-notes/code-space-vs-token-space-masked-diffusion/)
