# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/ru/publications/where-quality-breaks/

Document language: ru

Где ухудшается качество при генерации сжатого короткого текста: поэтапная локализация узких мест

Поэтапная диагностика генерации сжатого короткого текста, отделяющая потери при реконструкции кодека от потерь при латентной генерации.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [Университет ИТМО, Санкт-Петербург, Россия](https://en.itmo.ru/)

[Читать полный текст статьи в HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Текст с поиском, формулами, таблицами, рисунками и списком литературы.

Окончательно принятая рукопись (размещенная автором версия с DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Условия публикации и повторного использования](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Статья за 30 секунд

**Вопрос исследования** Как раздельно оценить вклад кодека и латентного генератора в потерю качества конвейера генерации сжатого текста?

### Проблема

При генерации сжатого короткого текста низкое качество декодированного текста может быть вызвано потерей информации в кодеке или слабой генерацией в латентном пространстве. Сквозная оценка смешивает эти причины и может направить оптимизацию не на тот компонент.

### Подход

Поэтапный протокол единым внешним оценщиком GPT-2 измеряет исходные тексты, парные реконструкции кодека, результаты MDLM в пространстве токенов и результаты диффузии в пространстве кодов. Характеристики кодовой книги и геометрии остаются диагностическими показателями и не заменяют оценку качества декодированного текста.

### Основной результат

Реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36, а p95 — с 25,10 до 98,91. При этом MDLM в пространстве кодов снижает медианную перплексию на 30,9% относительно MDLM в пространстве токенов.

### Почему это важно

Результат задает практический порядок работы: сначала улучшать кодек, затем сравнивать генерацию в пространствах токенов и кодов, а рост латентных прокси-метрик считать полезным только тогда, когда одновременно улучшается декодированный текст.

## Аннотация

Генераторы сжатого короткого текста могут давать сбой на двух этапах: кодек может отбросить информацию до начала генерации, а латентный генератор — сформировать некачественные коды. Если не разделять эти причины, вычислительные ресурсы могут быть потрачены на улучшение не того компонента. Мы исследуем эту проблему на контролируемом примере TinyStories со сжатием последовательности с 64 до 16 позиций, используя иерархический кодек VQ-VAE-2 и маскированную дискретную диффузионную модель (MDLM). Поэтапный протокол отдельно оценивает точность реконструкции кодека, качество латентной генерации и вспомогательные характеристики латентного пространства с помощью единого внешнего оценщика GPT-2; для исследования геометрии дополнительно приводятся семантические метрики. В исследованной конфигурации одна только реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36 (+80,4%), а p95 — с 25,10 до 98,91 (+294,1%): основная потеря качества возникает до латентной генерации. При том же оценщике MDLM в пространстве кодов существенно превосходит диффузию в пространстве токенов, снижая среднее, медиану и p95 на 32,9%, 30,9% и 36,6% соответственно. Регуляризация с учетом геометрии улучшает локальные прокси-метрики латентного пространства, но в доступных запусках не улучшает метрики декодированного текста. Вклад работы методологический, а не алгоритмический: предложена воспроизводимая поэтапная диагностика конкретного конвейера и показано, что в этой конфигурации практический потолок качества задает точность кодека, а не латентное устранение шума.

Опубликовано на 2026 39-я конференция Ассоциации открытых инноваций (FRUCT)

Тип вклада Методика диагностики

28 апреля 2026 г. выпуск 1 стр. 69–76 Основная конференция

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Содержание На этой странице

## Ключевые результаты

| Точка оценки | н | Средний PPL | Медианный PPL | p95 ЗГЗ |
| --- | --- | --- | --- | --- |
| Оригинальные тексты | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкции кодеков | 256 | 37.26 | 27.36 | 98.91 |
| Авторегрессионная базовая модель | 251 | 30.98 | 23.27 | 56.11 |
| MDLM в пространстве токенов | 256 | 44.74 | 38.42 | 93.6 |
| MDLM в пространстве кодов | 256 | 30.01 | 26.55 | 59.36 |

**Ключевой результат.** Основная наблюдаемая потеря качества возникает до генерации; при этом диффузия в пространстве кодов снижает медианную перплексию на 30,9% относительно диффузии в пространстве токенов.

## Результаты скачивания:

[CSV-файл](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Внешнее зеркало: [Карточка набора данных Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF и цитирование

**Цитировать эту статью** BibTeX — рекомендуемый формат. Все приведенные ниже варианты создаются на основе одной и той же записи публикации.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

## Файлы цитирования:

[Текст в формате APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [IEEE текст](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML с метаданными JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Полнотекстовый XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Link Set (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Link Set (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

ДОИ: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Полное руководство

## Полное руководство по исследованию

## Метод

## 

В документе используется один оценщик на трех этапах оценки, так что каждое дополнительное преобразование может быть связано с измеримым разрывом в качестве.

1. Реконструировать Кодируйте каждый образец TinyStories из 64 токенов в 16 кодов верхнего уровня и немедленно декодируйте его, чтобы измерить потери при восстановлении кодека.
2. Генерировать Создавайте либо текстовые токены, либо дискретные скрытые коды с помощью MDLM, а затем декодируйте образцы кодового пространства с помощью того же обученного кодека.
3. Сравнивать Оценивайте оригиналы, реконструкции и сгенерированные тексты с помощью одного и того же внешнего протокола GPT-2, включая медианную и хвостовую статистику.

![Конвейер поэтапной генерации сжатого текста сравнивает исходный текст, реконструкцию кодека, MDLM кодового пространства и декодированный текст, чтобы отделить потери кодека от потерь генерации.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Поэтапная локализация узких мест отделяет потери при реконструкции кодека от потерь скрытой генерации в рамках одного общего протокола оценки декодированного текста.* Источник: [Пояснительная схема создана автором на основе опубликованного метода и результатов.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Условия повторного использования: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Предлагаемая атрибуция: Гаврилов, Газзаев и Муравьев (2026), Где качество нарушается при создании сжатого короткого текста. [Скачать SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Основная идея

Последующий генератор не может восстановить информацию, уже отброшенную кодеком. Поэтому качество реконструкции необходимо проверить до интерпретации результатов латентной генерации.

### Отличие от близлежащих подходов

Стандартное сквозное сравнение дает одну итоговую оценку генерации. Предлагаемый протокол добавляет контрольную точку парной реконструкции и отделяет диагностические метрики латентного пространства от свидетельств, полученных на декодированном тексте.

### Что нового

Вклад работы — воспроизводимая методика поэтапной диагностики конкретного конвейера сжатого текста, а не новый алгоритм устранения шума.

## Вопросы, на которые помогает ответить эта статья

## 

Откройте нужный вопрос, чтобы прочитать краткий ответ, основанный на статье. Подробные границы применимости перечислены в разделе «Ограничения».

1. Где происходит ухудшение качества при создании сжатого короткого текста? В тестируемом конвейере TinyStories 64-to-16 доминирующее ухудшение проявляется при реконструкции кодека, прежде чем начинается скрытая генерация. Медиана внешнего недоумения GPT-2 увеличивается с 15,17 для исходного текста до 27,36 после реконструкции, а p95 увеличивается с 25,10 до 98,91. Это результат для одной конфигурации, а не универсального рейтинга кодеков.
2. Как можно отделить потери кодека от потерь скрытого поколения? Поэтапный протокол оценивает оригиналы, реконструкции парных кодеков и окончательно сгенерированный текст с помощью одного общего внешнего средства оценки. Разрыв между исходным и восстановленным данными оценивает вклад кодека, а сравнение реконструкции и сгенерированного вывода помогает локализовать дополнительные потери на этапе генерации. Скрытые показатели здоровья сообщаются отдельно от данных в декодированном тексте.
3. Как следует оценивать генерацию дискретно-латентного текста? В документе рекомендуется проверять точность реконструкции перед сравнением генераторов, применять один и тот же счетчик декодированного текста на каждом этапе и сообщать центральную и хвостовую статистику. Он также рассматривает использование кодовой книги, геометрию и другие скрытые прокси как диагностику, а не как замену качества декодированного текста.
4. Превосходит ли диффузия пространства кода диффузию пространства токенов? При использовании общей системы оценки и тестируемой установки MDLM в кодовом пространстве снижает среднее значение, медиану и недоумение p95 на 32,9%, 30,9% и 36,6% по сравнению с MDLM в пространстве токенов. Сравнение носит описательный характер и зависит от конфигурации: оно не устанавливает универсального ранжирования наборов данных, степени сжатия, кодеков или архитектур распространения.
5. Гарантируют ли лучшие показатели скрытой геометрии лучший сгенерированный текст? Нет. В доступных сопоставленных прогонах регуляризация с учетом геометрии улучшила локальные прокси скрытого пространства, но не улучшила показатели декодированного текста. Результат поддерживает проверку каждого усиления прокси на конечном декодированном выходе и рассматривает отсутствие передачи как полезный отрицательный результат, а не свидетельство улучшения генерации.

## Сравнение с соседними подходами

## 

| Подход | Представительство | Контроль/диагностика | Что сохраняется или измеряется |
| --- | --- | --- | --- |
| Диффузия в пространстве токенов | Текстовые токены | Качество генерации в пространстве токенов | Беглость и результативность прямой генерации |
| Сжатая латентная генерация | Дискретные скрытые коды через кодек | Окончательное качество сквозной генерации | Совместный эффект кодека и латентного генератора |
| Поэтапная локализация узких мест | Текст, реконструкция кодеков и дискретные скрытые значения | Отделите потери кодека от потерь генерации. | Этап, на котором ухудшается качество при едином оценщике |

Сравнение позволяет определить объем оценки и доказательства; это не универсальный рейтинг подходов.

## Релевантность и область применения

## 

Поэтапный протокол полезен, когда генеративный конвейер содержит обучаемый кодек и генератор в латентном пространстве, но источник ухудшения выходного качества неясен.

1. Генерация сжатого текста в дискретном латентном пространстве
2. Точность восстановления кодека в генеративных конвейерах
3. Моделирование языка маскированной диффузии в пространстве кода
4. Локализация узких мест и поэтапная оценка
5. Проверка переноса улучшений латентных прокси-метрик на декодированный текст

## Ограничения

## 

- В эмпирическом исследовании используется только TinyStories.
- Основной анализ охватывает один агрессивный режим сжатия 64 к 16.
- Оцениваемая система объединяет одно семейство иерархических кодеков VQ-VAE-2 с одним генератором MDLM.
- Сравнения основаны на отдельных прогонах и являются описательными, а не многократными статистическими оценками.
- Внешняя перплексия GPT-2 используется как единая диагностическая метрика, а не как универсальная мера семантического качества.
- Выводы не следует переносить непосредственно на все наборы данных, архитектуры кодеков или степени сжатия.

## Литература, цитируемая в статье

## 

Эти записи соответствуют нумерованному списку литературы в PDF статьи.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Материалы и воспроизводимость

## 

### Сведения о данных

## Версии

## 

1. **Опубликованная версия** [IEEE/ФРУКТ, 2026 г.](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Запись arXiv** [Открытая запись препринта, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Индекс исследований в области ИИ** [Страница статьи на Hugging Face с подтверждённой личностью первого автора и связанной сводкой результатов](https://huggingface.co/papers/2607.24176)
4. **Авторская рукопись** [Локальный PDF-файл с доступом к тексту](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Выступление на конференции** [Презентация ФРУКТ 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Указатель трудов конференции** [Официальный сборник FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF из трудов конференции** [Открытый полный текст FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Открытая научная запись** [OpenAlex](https://openalex.org/W7160914887)
9. **Запись графика цитирования** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Полный текст, предоставленный автором** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Опубликованный DOI является основным библиографическим идентификатором. Эта страница остается единственным каноническим URL-адресом проекта во всех версиях.

## Связанная публикация

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ru/publications/inspectable-control/)

Перейти к материалу [Диагностика узкого места кодека](https://aogavrilov.com/ru/research/codec-bottleneck-diagnosis/) с подробным исследовательским разбором. [Об авторе](https://aogavrilov.com/about/) .

### Тематические исследовательские заметки

Ответы на конкретные запросы с явными границами доказательств и ссылками на эту статью.

- [Маскированная диффузия в пространстве кодов и токенов: как их сравнивать](https://aogavrilov.com/ru/research-notes/code-space-vs-token-space-masked-diffusion/)
