Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Где ухудшается качество при генерации сжатого короткого текста: поэтапная локализация узких мест

Поэтапная диагностика генерации сжатого короткого текста, отделяющая потери при реконструкции кодека от потерь при латентной генерации.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. Университет ИТМО, Санкт-Петербург, Россия

Читать полный текст статьи в HTMLТекст с поиском, формулами, таблицами, рисунками и списком литературы.

Окончательно принятая рукопись (размещенная автором версия с DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Условия публикации и повторного использования.

Статья за 30 секунд

Вопрос исследованияКак раздельно оценить вклад кодека и латентного генератора в потерю качества конвейера генерации сжатого текста?

Проблема

При генерации сжатого короткого текста низкое качество декодированного текста может быть вызвано потерей информации в кодеке или слабой генерацией в латентном пространстве. Сквозная оценка смешивает эти причины и может направить оптимизацию не на тот компонент.

Подход

Поэтапный протокол единым внешним оценщиком GPT-2 измеряет исходные тексты, парные реконструкции кодека, результаты MDLM в пространстве токенов и результаты диффузии в пространстве кодов. Характеристики кодовой книги и геометрии остаются диагностическими показателями и не заменяют оценку качества декодированного текста.

Основной результат

Реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36, а p95 — с 25,10 до 98,91. При этом MDLM в пространстве кодов снижает медианную перплексию на 30,9% относительно MDLM в пространстве токенов.

Почему это важно

Результат задает практический порядок работы: сначала улучшать кодек, затем сравнивать генерацию в пространствах токенов и кодов, а рост латентных прокси-метрик считать полезным только тогда, когда одновременно улучшается декодированный текст.

Аннотация

Генераторы сжатого короткого текста могут давать сбой на двух этапах: кодек может отбросить информацию до начала генерации, а латентный генератор — сформировать некачественные коды. Если не разделять эти причины, вычислительные ресурсы могут быть потрачены на улучшение не того компонента. Мы исследуем эту проблему на контролируемом примере TinyStories со сжатием последовательности с 64 до 16 позиций, используя иерархический кодек VQ-VAE-2 и маскированную дискретную диффузионную модель (MDLM). Поэтапный протокол отдельно оценивает точность реконструкции кодека, качество латентной генерации и вспомогательные характеристики латентного пространства с помощью единого внешнего оценщика GPT-2; для исследования геометрии дополнительно приводятся семантические метрики. В исследованной конфигурации одна только реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36 (+80,4%), а p95 — с 25,10 до 98,91 (+294,1%): основная потеря качества возникает до латентной генерации. При том же оценщике MDLM в пространстве кодов существенно превосходит диффузию в пространстве токенов, снижая среднее, медиану и p95 на 32,9%, 30,9% и 36,6% соответственно. Регуляризация с учетом геометрии улучшает локальные прокси-метрики латентного пространства, но в доступных запусках не улучшает метрики декодированного текста. Вклад работы методологический, а не алгоритмический: предложена воспроизводимая поэтапная диагностика конкретного конвейера и показано, что в этой конфигурации практический потолок качества задает точность кодека, а не латентное устранение шума.

Опубликовано на 2026 39-я конференция Ассоциации открытых инноваций (FRUCT)

Тип вклада Методика диагностики

выпуск 1стр. 69–76Основная конференция

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Поделиться этой статьёйПоделиться

Ключевые результаты

Где снижается качество генерации сжатого короткого текста: ключевые результаты поэтапной локализации узких мест
Точка оценкинСредний PPLМедианный PPLp95 ЗГЗ
Оригинальные тексты25616.2415.1725.1
Реконструкции кодеков25637.2627.3698.91
Авторегрессионная базовая модель25130.9823.2756.11
MDLM в пространстве токенов25644.7438.4293.6
MDLM в пространстве кодов25630.0126.5559.36

Ключевой результат. Основная наблюдаемая потеря качества возникает до генерации; при этом диффузия в пространстве кодов снижает медианную перплексию на 30,9% относительно диффузии в пространстве токенов.

Набор данных
TinyStories
Размер выборки
256 парных образцов реконструкции; 251–256 сгенерированных выборок на режим; четыре совпадающие настройки геометрии.
Метрики
Внешняя перплексия GPT-2: среднее, медиана, p95 и максимум; использование кодовой книги и размер ее поддержки; SBERT, BERTScore, MAUVE и сводная оценка LLM-судьи для экспериментов с геометрией
Неопределенность
Сообщаемые сравнения представляют собой описательные единичные прогоны; доверительные интервалы и оценки значимости с несколькими исходными значениями не рассчитывались.
Условия
Последовательности из 64 токенов GPT-2 сжимаются иерархическим VQ-VAE-2 до 16 кодов верхнего уровня; все режимы генерации оцениваются единым внешним оценщиком.
Результаты скачивания:

PDF и цитирование

Цитировать эту статью BibTeX — рекомендуемый формат. Все приведенные ниже варианты создаются на основе одной и той же записи публикации.

Открыть PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Скачать .bib
Файлы цитирования:

Текст в формате APAIEEE текстRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML с метаданными JATS 1.4Полнотекстовый XML JATS 1.4RDF TurtleLink Set (JSON)Link Set (HTTP)RO-Crate

ДОИ:https://doi.org/10.23919/FRUCT70069.2026.11506553

Полное руководство

Полное руководство по исследованию

Метод

В документе используется один оценщик на трех этапах оценки, так что каждое дополнительное преобразование может быть связано с измеримым разрывом в качестве.

  1. Реконструировать

    Кодируйте каждый образец TinyStories из 64 токенов в 16 кодов верхнего уровня и немедленно декодируйте его, чтобы измерить потери при восстановлении кодека.

  2. Генерировать

    Создавайте либо текстовые токены, либо дискретные скрытые коды с помощью MDLM, а затем декодируйте образцы кодового пространства с помощью того же обученного кодека.

  3. Сравнивать

    Оценивайте оригиналы, реконструкции и сгенерированные тексты с помощью одного и того же внешнего протокола GPT-2, включая медианную и хвостовую статистику.

Конвейер поэтапной генерации сжатого текста сравнивает исходный текст, реконструкцию кодека, MDLM кодового пространства и декодированный текст, чтобы отделить потери кодека от потерь генерации.
Поэтапная локализация узких мест отделяет потери при реконструкции кодека от потерь скрытой генерации в рамках одного общего протокола оценки декодированного текста.Источник: Пояснительная схема создана автором на основе опубликованного метода и результатов..Условия повторного использования: CC BY 4.0.Предлагаемая атрибуция: Гаврилов, Газзаев и Муравьев (2026), Где качество нарушается при создании сжатого короткого текста. Скачать SVG.

Основная идея

Последующий генератор не может восстановить информацию, уже отброшенную кодеком. Поэтому качество реконструкции необходимо проверить до интерпретации результатов латентной генерации.

Отличие от близлежащих подходов

Стандартное сквозное сравнение дает одну итоговую оценку генерации. Предлагаемый протокол добавляет контрольную точку парной реконструкции и отделяет диагностические метрики латентного пространства от свидетельств, полученных на декодированном тексте.

Что нового

Вклад работы — воспроизводимая методика поэтапной диагностики конкретного конвейера сжатого текста, а не новый алгоритм устранения шума.

Вопросы, на которые помогает ответить эта статья

Откройте нужный вопрос, чтобы прочитать краткий ответ, основанный на статье. Подробные границы применимости перечислены в разделе «Ограничения».

  1. Где происходит ухудшение качества при создании сжатого короткого текста?

    В тестируемом конвейере TinyStories 64-to-16 доминирующее ухудшение проявляется при реконструкции кодека, прежде чем начинается скрытая генерация. Медиана внешнего недоумения GPT-2 увеличивается с 15,17 для исходного текста до 27,36 после реконструкции, а p95 увеличивается с 25,10 до 98,91. Это результат для одной конфигурации, а не универсального рейтинга кодеков.

  2. Как можно отделить потери кодека от потерь скрытого поколения?

    Поэтапный протокол оценивает оригиналы, реконструкции парных кодеков и окончательно сгенерированный текст с помощью одного общего внешнего средства оценки. Разрыв между исходным и восстановленным данными оценивает вклад кодека, а сравнение реконструкции и сгенерированного вывода помогает локализовать дополнительные потери на этапе генерации. Скрытые показатели здоровья сообщаются отдельно от данных в декодированном тексте.

  3. Как следует оценивать генерацию дискретно-латентного текста?

    В документе рекомендуется проверять точность реконструкции перед сравнением генераторов, применять один и тот же счетчик декодированного текста на каждом этапе и сообщать центральную и хвостовую статистику. Он также рассматривает использование кодовой книги, геометрию и другие скрытые прокси как диагностику, а не как замену качества декодированного текста.

  4. Превосходит ли диффузия пространства кода диффузию пространства токенов?

    При использовании общей системы оценки и тестируемой установки MDLM в кодовом пространстве снижает среднее значение, медиану и недоумение p95 на 32,9%, 30,9% и 36,6% по сравнению с MDLM в пространстве токенов. Сравнение носит описательный характер и зависит от конфигурации: оно не устанавливает универсального ранжирования наборов данных, степени сжатия, кодеков или архитектур распространения.

  5. Гарантируют ли лучшие показатели скрытой геометрии лучший сгенерированный текст?

    Нет. В доступных сопоставленных прогонах регуляризация с учетом геометрии улучшила локальные прокси скрытого пространства, но не улучшила показатели декодированного текста. Результат поддерживает проверку каждого усиления прокси на конечном декодированном выходе и рассматривает отсутствие передачи как полезный отрицательный результат, а не свидетельство улучшения генерации.

Сравнение с соседними подходами

Где происходит ухудшение качества при генерации сжатого короткого текста: поэтапное сравнение фактов локализации узких мест с соседними подходами
ПодходПредставительствоКонтроль/диагностикаЧто сохраняется или измеряется
Диффузия в пространстве токеновТекстовые токеныКачество генерации в пространстве токеновБеглость и результативность прямой генерации
Сжатая латентная генерацияДискретные скрытые коды через кодекОкончательное качество сквозной генерацииСовместный эффект кодека и латентного генератора
Поэтапная локализация узких местТекст, реконструкция кодеков и дискретные скрытые значенияОтделите потери кодека от потерь генерации.Этап, на котором ухудшается качество при едином оценщике

Сравнение позволяет определить объем оценки и доказательства; это не универсальный рейтинг подходов.

Релевантность и область применения

Поэтапный протокол полезен, когда генеративный конвейер содержит обучаемый кодек и генератор в латентном пространстве, но источник ухудшения выходного качества неясен.

  1. Генерация сжатого текста в дискретном латентном пространстве

  2. Точность восстановления кодека в генеративных конвейерах

  3. Моделирование языка маскированной диффузии в пространстве кода

  4. Локализация узких мест и поэтапная оценка

  5. Проверка переноса улучшений латентных прокси-метрик на декодированный текст

Посмотреть ограничения и границы применимости

Ограничения

  • В эмпирическом исследовании используется только TinyStories.
  • Основной анализ охватывает один агрессивный режим сжатия 64 к 16.
  • Оцениваемая система объединяет одно семейство иерархических кодеков VQ-VAE-2 с одним генератором MDLM.
  • Сравнения основаны на отдельных прогонах и являются описательными, а не многократными статистическими оценками.
  • Внешняя перплексия GPT-2 используется как единая диагностическая метрика, а не как универсальная мера семантического качества.
  • Выводы не следует переносить непосредственно на все наборы данных, архитектуры кодеков или степени сжатия.

Литература, цитируемая в статье

Эти записи соответствуют нумерованному списку литературы в PDF статьи.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Материалы и воспроизводимость

Издатель
IEEE
Ресурсы публикации
Здесь доступны общедоступная рукопись, таблицы результатов, пояснительная схема и файлы цитирования. Код реализации и контрольные точки модели публично не выпускались.

Сведения о данных

Источник
TinyStories, как описано в статье.
Лицензия
Использование TinyStories по-прежнему регулируется собственными условиями набора данных; этот сайт не распространяет файлы наборов данных.
Предварительная обработка
Токенизация GPT-2, фиксированные входные данные из 64 токенов и иерархическое временное сжатие с 64 до 32 до 16 позиций.
Разбиение
В публикации сообщается о 256 парных выборках реконструкции и 251–256 сгенерированных выборках на моду; он не публикует многоразовый разделенный манифест обучения/проверки.
Формат
Короткие образцы текста, последовательности токенов GPT-2, дискретные последовательности кода, журналы генерации и сводные таблицы.
Версия/контрольная сумма
В документе не сообщается контрольная сумма набора данных или неизменяемый идентификатор снимка TinyStories.
Получение данных
Сценарий публичного приобретения не публикуется на странице публикации.
Ограничения использования
Доказательства охватывают короткие синтетические истории, и их не следует рассматривать как ориентир для неограниченного создания естественного языка.

Версии

  1. Опубликованная версияIEEE/ФРУКТ, 2026 г.
  2. Выступление на конференцииПрезентация ФРУКТ 39
  3. Указатель трудов конференцииОфициальный сборник FRUCT 39
  4. PDF из трудов конференцииОткрытый полный текст FRUCT
  5. Открытая научная записьOpenAlex
  6. Запись графика цитированияSemantic Scholar
  7. Полный текст, предоставленный авторомResearchGate

Опубликованный DOI является основным библиографическим идентификатором. Эта страница остается единственным каноническим URL-адресом проекта во всех версиях.