Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Где ухудшается качество при генерации сжатого короткого текста: поэтапная локализация узких мест
Поэтапная диагностика генерации сжатого короткого текста, отделяющая потери при реконструкции кодека от потерь при латентной генерации.
Читать полный текст статьи в HTMLТекст с поиском, формулами, таблицами, рисунками и списком литературы.
Окончательно принятая рукопись (размещенная автором версия с DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Условия публикации и повторного использования.
Статья за 30 секунд
Вопрос исследованияКак раздельно оценить вклад кодека и латентного генератора в потерю качества конвейера генерации сжатого текста?
Проблема
При генерации сжатого короткого текста низкое качество декодированного текста может быть вызвано потерей информации в кодеке или слабой генерацией в латентном пространстве. Сквозная оценка смешивает эти причины и может направить оптимизацию не на тот компонент.
Подход
Поэтапный протокол единым внешним оценщиком GPT-2 измеряет исходные тексты, парные реконструкции кодека, результаты MDLM в пространстве токенов и результаты диффузии в пространстве кодов. Характеристики кодовой книги и геометрии остаются диагностическими показателями и не заменяют оценку качества декодированного текста.
Основной результат
Реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36, а p95 — с 25,10 до 98,91. При этом MDLM в пространстве кодов снижает медианную перплексию на 30,9% относительно MDLM в пространстве токенов.
Почему это важно
Результат задает практический порядок работы: сначала улучшать кодек, затем сравнивать генерацию в пространствах токенов и кодов, а рост латентных прокси-метрик считать полезным только тогда, когда одновременно улучшается декодированный текст.
Аннотация
Генераторы сжатого короткого текста могут давать сбой на двух этапах: кодек может отбросить информацию до начала генерации, а латентный генератор — сформировать некачественные коды. Если не разделять эти причины, вычислительные ресурсы могут быть потрачены на улучшение не того компонента. Мы исследуем эту проблему на контролируемом примере TinyStories со сжатием последовательности с 64 до 16 позиций, используя иерархический кодек VQ-VAE-2 и маскированную дискретную диффузионную модель (MDLM). Поэтапный протокол отдельно оценивает точность реконструкции кодека, качество латентной генерации и вспомогательные характеристики латентного пространства с помощью единого внешнего оценщика GPT-2; для исследования геометрии дополнительно приводятся семантические метрики. В исследованной конфигурации одна только реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36 (+80,4%), а p95 — с 25,10 до 98,91 (+294,1%): основная потеря качества возникает до латентной генерации. При том же оценщике MDLM в пространстве кодов существенно превосходит диффузию в пространстве токенов, снижая среднее, медиану и p95 на 32,9%, 30,9% и 36,6% соответственно. Регуляризация с учетом геометрии улучшает локальные прокси-метрики латентного пространства, но в доступных запусках не улучшает метрики декодированного текста. Вклад работы методологический, а не алгоритмический: предложена воспроизводимая поэтапная диагностика конкретного конвейера и показано, что в этой конфигурации практический потолок качества задает точность кодека, а не латентное устранение шума.
Опубликовано на 2026 39-я конференция Ассоциации открытых инноваций (FRUCT)
Тип вклада Методика диагностики
выпуск 1стр. 69–76Основная конференция
Ключевые результаты
| Точка оценки | н | Средний PPL | Медианный PPL | p95 ЗГЗ |
|---|---|---|---|---|
| Оригинальные тексты | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкции кодеков | 256 | 37.26 | 27.36 | 98.91 |
| Авторегрессионная базовая модель | 251 | 30.98 | 23.27 | 56.11 |
| MDLM в пространстве токенов | 256 | 44.74 | 38.42 | 93.6 |
| MDLM в пространстве кодов | 256 | 30.01 | 26.55 | 59.36 |
Ключевой результат. Основная наблюдаемая потеря качества возникает до генерации; при этом диффузия в пространстве кодов снижает медианную перплексию на 30,9% относительно диффузии в пространстве токенов.
- Набор данных
- TinyStories
- Размер выборки
- 256 парных образцов реконструкции; 251–256 сгенерированных выборок на режим; четыре совпадающие настройки геометрии.
- Метрики
- Внешняя перплексия GPT-2: среднее, медиана, p95 и максимум; использование кодовой книги и размер ее поддержки; SBERT, BERTScore, MAUVE и сводная оценка LLM-судьи для экспериментов с геометрией
- Неопределенность
- Сообщаемые сравнения представляют собой описательные единичные прогоны; доверительные интервалы и оценки значимости с несколькими исходными значениями не рассчитывались.
- Условия
- Последовательности из 64 токенов GPT-2 сжимаются иерархическим VQ-VAE-2 до 16 кодов верхнего уровня; все режимы генерации оцениваются единым внешним оценщиком.
Результаты скачивания:
CSV-файлJSONMarkdownВнешнее зеркало:Карточка набора данных Hugging Face
PDF и цитирование
Цитировать эту статью BibTeX — рекомендуемый формат. Все приведенные ниже варианты создаются на основе одной и той же записи публикации.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Полное руководство
Полное руководство по исследованию
Метод
В документе используется один оценщик на трех этапах оценки, так что каждое дополнительное преобразование может быть связано с измеримым разрывом в качестве.
Реконструировать
Кодируйте каждый образец TinyStories из 64 токенов в 16 кодов верхнего уровня и немедленно декодируйте его, чтобы измерить потери при восстановлении кодека.
Генерировать
Создавайте либо текстовые токены, либо дискретные скрытые коды с помощью MDLM, а затем декодируйте образцы кодового пространства с помощью того же обученного кодека.
Сравнивать
Оценивайте оригиналы, реконструкции и сгенерированные тексты с помощью одного и того же внешнего протокола GPT-2, включая медианную и хвостовую статистику.
Основная идея
Последующий генератор не может восстановить информацию, уже отброшенную кодеком. Поэтому качество реконструкции необходимо проверить до интерпретации результатов латентной генерации.
Отличие от близлежащих подходов
Стандартное сквозное сравнение дает одну итоговую оценку генерации. Предлагаемый протокол добавляет контрольную точку парной реконструкции и отделяет диагностические метрики латентного пространства от свидетельств, полученных на декодированном тексте.
Что нового
Вклад работы — воспроизводимая методика поэтапной диагностики конкретного конвейера сжатого текста, а не новый алгоритм устранения шума.
Вопросы, на которые помогает ответить эта статья
Откройте нужный вопрос, чтобы прочитать краткий ответ, основанный на статье. Подробные границы применимости перечислены в разделе «Ограничения».
Где происходит ухудшение качества при создании сжатого короткого текста?
В тестируемом конвейере TinyStories 64-to-16 доминирующее ухудшение проявляется при реконструкции кодека, прежде чем начинается скрытая генерация. Медиана внешнего недоумения GPT-2 увеличивается с 15,17 для исходного текста до 27,36 после реконструкции, а p95 увеличивается с 25,10 до 98,91. Это результат для одной конфигурации, а не универсального рейтинга кодеков.
Как можно отделить потери кодека от потерь скрытого поколения?
Поэтапный протокол оценивает оригиналы, реконструкции парных кодеков и окончательно сгенерированный текст с помощью одного общего внешнего средства оценки. Разрыв между исходным и восстановленным данными оценивает вклад кодека, а сравнение реконструкции и сгенерированного вывода помогает локализовать дополнительные потери на этапе генерации. Скрытые показатели здоровья сообщаются отдельно от данных в декодированном тексте.
Как следует оценивать генерацию дискретно-латентного текста?
В документе рекомендуется проверять точность реконструкции перед сравнением генераторов, применять один и тот же счетчик декодированного текста на каждом этапе и сообщать центральную и хвостовую статистику. Он также рассматривает использование кодовой книги, геометрию и другие скрытые прокси как диагностику, а не как замену качества декодированного текста.
Превосходит ли диффузия пространства кода диффузию пространства токенов?
При использовании общей системы оценки и тестируемой установки MDLM в кодовом пространстве снижает среднее значение, медиану и недоумение p95 на 32,9%, 30,9% и 36,6% по сравнению с MDLM в пространстве токенов. Сравнение носит описательный характер и зависит от конфигурации: оно не устанавливает универсального ранжирования наборов данных, степени сжатия, кодеков или архитектур распространения.
Гарантируют ли лучшие показатели скрытой геометрии лучший сгенерированный текст?
Нет. В доступных сопоставленных прогонах регуляризация с учетом геометрии улучшила локальные прокси скрытого пространства, но не улучшила показатели декодированного текста. Результат поддерживает проверку каждого усиления прокси на конечном декодированном выходе и рассматривает отсутствие передачи как полезный отрицательный результат, а не свидетельство улучшения генерации.
Сравнение с соседними подходами
| Подход | Представительство | Контроль/диагностика | Что сохраняется или измеряется |
|---|---|---|---|
| Диффузия в пространстве токенов | Текстовые токены | Качество генерации в пространстве токенов | Беглость и результативность прямой генерации |
| Сжатая латентная генерация | Дискретные скрытые коды через кодек | Окончательное качество сквозной генерации | Совместный эффект кодека и латентного генератора |
| Поэтапная локализация узких мест | Текст, реконструкция кодеков и дискретные скрытые значения | Отделите потери кодека от потерь генерации. | Этап, на котором ухудшается качество при едином оценщике |
Сравнение позволяет определить объем оценки и доказательства; это не универсальный рейтинг подходов.
Релевантность и область применения
Поэтапный протокол полезен, когда генеративный конвейер содержит обучаемый кодек и генератор в латентном пространстве, но источник ухудшения выходного качества неясен.
Генерация сжатого текста в дискретном латентном пространстве
Точность восстановления кодека в генеративных конвейерах
Моделирование языка маскированной диффузии в пространстве кода
Локализация узких мест и поэтапная оценка
Проверка переноса улучшений латентных прокси-метрик на декодированный текст
Ограничения
- В эмпирическом исследовании используется только TinyStories.
- Основной анализ охватывает один агрессивный режим сжатия 64 к 16.
- Оцениваемая система объединяет одно семейство иерархических кодеков VQ-VAE-2 с одним генератором MDLM.
- Сравнения основаны на отдельных прогонах и являются описательными, а не многократными статистическими оценками.
- Внешняя перплексия GPT-2 используется как единая диагностическая метрика, а не как универсальная мера семантического качества.
- Выводы не следует переносить непосредственно на все наборы данных, архитектуры кодеков или степени сжатия.
Литература, цитируемая в статье
Эти записи соответствуют нумерованному списку литературы в PDF статьи.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Материалы и воспроизводимость
- Издатель
- IEEE
- Локальный PDF с текстовым слоем
- Окончательно принятая рукопись (размещенная автором версия с DOI)
- Ресурсы публикации
- Здесь доступны общедоступная рукопись, таблицы результатов, пояснительная схема и файлы цитирования. Код реализации и контрольные точки модели публично не выпускались.
Сведения о данных
- Источник
- TinyStories, как описано в статье.
- Лицензия
- Использование TinyStories по-прежнему регулируется собственными условиями набора данных; этот сайт не распространяет файлы наборов данных.
- Предварительная обработка
- Токенизация GPT-2, фиксированные входные данные из 64 токенов и иерархическое временное сжатие с 64 до 32 до 16 позиций.
- Разбиение
- В публикации сообщается о 256 парных выборках реконструкции и 251–256 сгенерированных выборках на моду; он не публикует многоразовый разделенный манифест обучения/проверки.
- Формат
- Короткие образцы текста, последовательности токенов GPT-2, дискретные последовательности кода, журналы генерации и сводные таблицы.
- Версия/контрольная сумма
- В документе не сообщается контрольная сумма набора данных или неизменяемый идентификатор снимка TinyStories.
- Получение данных
- Сценарий публичного приобретения не публикуется на странице публикации.
- Ограничения использования
- Доказательства охватывают короткие синтетические истории, и их не следует рассматривать как ориентир для неограниченного создания естественного языка.
Версии
- Опубликованная версияIEEE/ФРУКТ, 2026 г.
- Запись arXivОткрытая запись препринта, arXiv:2607.24176
- Индекс исследований в области ИИСтраница статьи на Hugging Face с подтверждённой личностью первого автора и связанной сводкой результатов
- Авторская рукописьЛокальный PDF-файл с доступом к тексту
- Выступление на конференцииПрезентация ФРУКТ 39
- Указатель трудов конференцииОфициальный сборник FRUCT 39
- PDF из трудов конференцииОткрытый полный текст FRUCT
- Открытая научная записьOpenAlex
- Запись графика цитированияSemantic Scholar
- Полный текст, предоставленный авторомResearchGate
Опубликованный DOI является основным библиографическим идентификатором. Эта страница остается единственным каноническим URL-адресом проекта во всех версиях.