Все публикации

Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Поэтапная диагностика генерации сжатого короткого текста, отделяющая потери при реконструкции кодека от потерь при латентной генерации.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. Университет ИТМО, Санкт-Петербург, Россия

Опубликовано на 2026 39-я конференция Ассоциации открытых инноваций (FRUCT)

Тип вклада Методика диагностики

2026выпуск 1стр. 69–76Основная конференция

DOI 10.23919/FRUCT70069.2026.11506553

Окончательно принятая рукопись (размещенная автором версия с DOI).© 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works.Условия публикации и повторного использования.

Статья за 30 секунд

Проблема

При генерации сжатого короткого текста низкое качество декодированного текста может быть вызвано потерей информации в кодеке или слабой генерацией в латентном пространстве. Сквозная оценка смешивает эти причины и может направить оптимизацию не на тот компонент.

Подход

Поэтапный протокол единым внешним оценщиком GPT-2 измеряет исходные тексты, парные реконструкции кодека, результаты MDLM в пространстве токенов и результаты диффузии в пространстве кодов. Характеристики кодовой книги и геометрии остаются диагностическими показателями и не заменяют оценку качества декодированного текста.

Основной результат

Реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36, а p95 — с 25,10 до 98,91. При этом MDLM в пространстве кодов снижает медианную перплексию на 30,9% относительно MDLM в пространстве токенов.

Почему это важно

Результат задает практический порядок работы: сначала улучшать кодек, затем сравнивать генерацию в пространствах токенов и кодов, а рост латентных прокси-метрик считать полезным только тогда, когда одновременно улучшается декодированный текст.

Аннотация

Генераторы сжатого короткого текста могут давать сбой на двух этапах: кодек может отбросить информацию до начала генерации, а латентный генератор — сформировать некачественные коды. Если не разделять эти причины, вычислительные ресурсы могут быть потрачены на улучшение не того компонента. Мы исследуем эту проблему на контролируемом примере TinyStories со сжатием последовательности с 64 до 16 позиций, используя иерархический кодек VQ-VAE-2 и маскированную дискретную диффузионную модель (MDLM). Поэтапный протокол отдельно оценивает точность реконструкции кодека, качество латентной генерации и вспомогательные характеристики латентного пространства с помощью единого внешнего оценщика GPT-2; для исследования геометрии дополнительно приводятся семантические метрики. В исследованной конфигурации одна только реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36 (+80,4%), а p95 — с 25,10 до 98,91 (+294,1%): основная потеря качества возникает до латентной генерации. При том же оценщике MDLM в пространстве кодов существенно превосходит диффузию в пространстве токенов, снижая среднее, медиану и p95 на 32,9%, 30,9% и 36,6% соответственно. Регуляризация с учетом геометрии улучшает локальные прокси-метрики латентного пространства, но в доступных запусках не улучшает метрики декодированного текста. Вклад работы методологический, а не алгоритмический: предложена воспроизводимая поэтапная диагностика конкретного конвейера и показано, что в этой конфигурации практический потолок качества задает точность кодека, а не латентное устранение шума.

Метод

В документе используется один оценщик на трех этапах оценки, так что каждое дополнительное преобразование может быть связано с измеримым разрывом в качестве.

  1. Реконструировать

    Кодируйте каждый образец TinyStories из 64 токенов в 16 кодов верхнего уровня и немедленно декодируйте его, чтобы измерить потери при восстановлении кодека.

  2. Генерировать

    Создавайте либо текстовые токены, либо дискретные скрытые коды с помощью MDLM, а затем декодируйте образцы кодового пространства с помощью того же обученного кодека.

  3. Сравнивать

    Оценивайте оригиналы, реконструкции и сгенерированные тексты с помощью одного и того же внешнего протокола GPT-2, включая медианную и хвостовую статистику.

Конвейер поэтапной генерации сжатого текста сравнивает исходный текст, реконструкцию кодека, MDLM кодового пространства и декодированный текст, чтобы отделить потери кодека от потерь генерации.
Поэтапная локализация узких мест отделяет потери при реконструкции кодека от потерь скрытой генерации в рамках одного общего протокола оценки декодированного текста.Источник: Пояснительная схема создана автором на основе опубликованного метода и результатов..Условия повторного использования: CC BY 4.0.Предлагаемая атрибуция: Гаврилов, Газзаев и Муравьев (2026), Где качество нарушается при создании сжатого короткого текста. Скачать SVG.

Основная идея

Последующий генератор не может восстановить информацию, уже отброшенную кодеком. Поэтому качество реконструкции необходимо проверить до интерпретации результатов латентной генерации.

Отличие от близлежащих подходов

Стандартное сквозное сравнение дает одну итоговую оценку генерации. Предлагаемый протокол добавляет контрольную точку парной реконструкции и отделяет диагностические метрики латентного пространства от свидетельств, полученных на декодированном тексте.

Что нового

Вклад работы — воспроизводимая методика поэтапной диагностики конкретного конвейера сжатого текста, а не новый алгоритм устранения шума.

Ключевые результаты

Где снижается качество генерации сжатого короткого текста: ключевые результаты поэтапной локализации узких мест
Точка оценкинСредний PPLМедианный PPLp95 ЗГЗ
Оригинальные тексты25616.2415.1725.1
Реконструкции кодеков25637.2627.3698.91
Авторегрессионная базовая модель25130.9823.2756.11
MDLM в пространстве токенов25644.7438.4293.6
MDLM в пространстве кодов25630.0126.5559.36

Ключевой результат. Основная наблюдаемая потеря качества возникает до генерации; при этом диффузия в пространстве кодов снижает медианную перплексию на 30,9% относительно диффузии в пространстве токенов.

Набор данных
TinyStories
Размер выборки
256 парных образцов реконструкции; 251–256 сгенерированных выборок на режим; четыре совпадающие настройки геометрии.
Метрики
Внешняя перплексия GPT-2: среднее, медиана, p95 и максимум; использование кодовой книги и размер ее поддержки; SBERT, BERTScore, MAUVE и сводная оценка LLM-судьи для экспериментов с геометрией
Неопределенность
Сообщаемые сравнения представляют собой описательные единичные прогоны; доверительные интервалы и оценки значимости с несколькими исходными значениями не рассчитывались.
Условия
Последовательности из 64 токенов GPT-2 сжимаются иерархическим VQ-VAE-2 до 16 кодов верхнего уровня; все режимы генерации оцениваются единым внешним оценщиком.

Сравнение с соседними подходами

Где происходит ухудшение качества при генерации сжатого короткого текста: поэтапное сравнение фактов локализации узких мест с соседними подходами
ПодходПредставительствоКонтроль/диагностикаЧто сохраняется или измеряется
Диффузия в пространстве токеновТекстовые токеныКачество генерации в пространстве токеновБеглость и результативность прямой генерации
Сжатая латентная генерацияДискретные скрытые коды через кодекОкончательное качество сквозной генерацииСовместный эффект кодека и латентного генератора
Поэтапная локализация узких местТекст, реконструкция кодеков и дискретные скрытые значенияОтделите потери кодека от потерь генерации.Этап, на котором ухудшается качество при едином оценщике

Сравнение позволяет определить объем оценки и доказательства; это не универсальный рейтинг подходов.

Когда цитировать эту статью

Данная статья может быть актуальна при обсуждении:

  • Генерация сжатого короткого текста и его компромисс между качеством и эффективностью
  • дискретная генерация скрытого текста или языковое моделирование маскированной диффузии
  • точность реконструкции кодека в двухэтапных генеративных системах
  • диагностика узких мест кодеков и поэтапная локализация узких мест
  • поэтапная оценка трубопроводов генерации сжатого воздуха
  • сравнение генерации в пространстве токенов и диффузии в пространстве кодов
  • отрицательные результаты, в которых улучшение латентных прокси-метрик не переносится на качество декодированного текста

Ограничения

  • В эмпирическом исследовании используется только TinyStories.
  • Основной анализ охватывает один агрессивный режим сжатия 64 к 16.
  • Оцениваемая система объединяет одно семейство иерархических кодеков VQ-VAE-2 с одним генератором MDLM.
  • Сравнения основаны на отдельных прогонах и являются описательными, а не многократными статистическими оценками.
  • Внешняя перплексия GPT-2 используется как единая диагностическая метрика, а не как универсальная мера семантического качества.
  • Выводы не следует переносить непосредственно на все наборы данных, архитектуры кодеков или степени сжатия.

Связанные области исследований

Поэтапный протокол полезен, когда генеративный конвейер содержит обучаемый кодек и генератор в латентном пространстве, но источник ухудшения выходного качества неясен.

  1. Генерация сжатого текста в дискретном латентном пространстве

  2. Точность восстановления кодека в генеративных конвейерах

  3. Моделирование языка маскированной диффузии в пространстве кода

  4. Локализация узких мест и поэтапная оценка

  5. Проверка переноса улучшений латентных прокси-метрик на декодированный текст

Объем. Доказательства получены из одной конфигурации TinyStories от 64 до 16 с иерархическими VQ-VAE-2 и MDLM с использованием описательных однократных сравнений. Это не универсальный рейтинг кодеков, методов сжатия, пространства токенов или кодового пространства.

Материалы и воспроизводимость

Издатель
IEEE
Код
Не опубликовано публично; неактивная кнопка кода не отображается.
Установка
Рецепт общедоступной установки пока недоступен; неактивная кнопка кода не отображается.
Минимальный пробег
Опубликованный протокол — реконструкция → оценка → генерация → оценка → сравнение, но исполняемая общедоступная команда еще не выпущена.
Конфигурации
В документе сообщается об иерархическом VQ-VAE-2 с верхней и нижней кодовыми книгами из 512 кодов и MDLM с использованием параметризации SUBS.
Выпустить/зафиксировать
Идентификатор общедоступного выпуска недоступен.
Контрольные точки
Страница публикации не распространяет контрольные точки модели.
Ожидаемый результат
Медиана реконструкции PPL 27,36; пространство токенов MDLM 38.42; кодовое пространство MDLM 26.55 под общим внешним механизмом оценки GPT-2.
Аппаратное обеспечение
Требования к аппаратному обеспечению в опубликованной статье не указаны.

Сведения о данных

Источник
TinyStories, как описано в статье.
Лицензия
Использование TinyStories по-прежнему регулируется собственными условиями набора данных; этот сайт не распространяет файлы наборов данных.
Предварительная обработка
Токенизация GPT-2, фиксированные входные данные из 64 токенов и иерархическое временное сжатие с 64 до 32 до 16 позиций.
Расколоть
В публикации сообщается о 256 парных выборках реконструкции и 251–256 сгенерированных выборках на моду; он не публикует многоразовый разделенный манифест обучения/проверки.
Формат
Короткие образцы текста, последовательности токенов GPT-2, дискретные последовательности кода, журналы генерации и сводные таблицы.
Версия/контрольная сумма
В документе не сообщается контрольная сумма набора данных или неизменяемый идентификатор снимка TinyStories.
Получение данных
Сценарий публичного приобретения не публикуется на странице публикации.
Ограничения использования
Доказательства охватывают короткие синтетические истории, и их не следует рассматривать как ориентир для неограниченного создания естественного языка.

Версии

  1. Опубликованная версияIEEE/ФРУКТ, 2026 г.
  2. Выступление на конференцииПрезентация ФРУКТ 39

Опубликованный DOI является основным библиографическим идентификатором. Эта страница остается единственным каноническим URL-адресом проекта во всех версиях.

Цитировать эту статью

BibTeX — рекомендуемый формат. Все приведенные ниже варианты создаются на основе одной и той же записи публикации.

@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Скачать .bib

Файлы цитирования:CITATION.cffТекст в формате APAIEEE текстРИС

ДОИ:10.23919/FRUCT70069.2026.11506553