Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Поэтапная диагностика генерации сжатого короткого текста, отделяющая потери при реконструкции кодека от потерь при латентной генерации.
Опубликовано на 2026 39-я конференция Ассоциации открытых инноваций (FRUCT)
Тип вклада Методика диагностики
2026выпуск 1стр. 69–76Основная конференция
Окончательно принятая рукопись (размещенная автором версия с DOI).© 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works.Условия публикации и повторного использования.
Статья за 30 секунд
Проблема
При генерации сжатого короткого текста низкое качество декодированного текста может быть вызвано потерей информации в кодеке или слабой генерацией в латентном пространстве. Сквозная оценка смешивает эти причины и может направить оптимизацию не на тот компонент.
Подход
Поэтапный протокол единым внешним оценщиком GPT-2 измеряет исходные тексты, парные реконструкции кодека, результаты MDLM в пространстве токенов и результаты диффузии в пространстве кодов. Характеристики кодовой книги и геометрии остаются диагностическими показателями и не заменяют оценку качества декодированного текста.
Основной результат
Реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36, а p95 — с 25,10 до 98,91. При этом MDLM в пространстве кодов снижает медианную перплексию на 30,9% относительно MDLM в пространстве токенов.
Почему это важно
Результат задает практический порядок работы: сначала улучшать кодек, затем сравнивать генерацию в пространствах токенов и кодов, а рост латентных прокси-метрик считать полезным только тогда, когда одновременно улучшается декодированный текст.
Аннотация
Генераторы сжатого короткого текста могут давать сбой на двух этапах: кодек может отбросить информацию до начала генерации, а латентный генератор — сформировать некачественные коды. Если не разделять эти причины, вычислительные ресурсы могут быть потрачены на улучшение не того компонента. Мы исследуем эту проблему на контролируемом примере TinyStories со сжатием последовательности с 64 до 16 позиций, используя иерархический кодек VQ-VAE-2 и маскированную дискретную диффузионную модель (MDLM). Поэтапный протокол отдельно оценивает точность реконструкции кодека, качество латентной генерации и вспомогательные характеристики латентного пространства с помощью единого внешнего оценщика GPT-2; для исследования геометрии дополнительно приводятся семантические метрики. В исследованной конфигурации одна только реконструкция кодека повышает медианную внешнюю перплексию с 15,17 до 27,36 (+80,4%), а p95 — с 25,10 до 98,91 (+294,1%): основная потеря качества возникает до латентной генерации. При том же оценщике MDLM в пространстве кодов существенно превосходит диффузию в пространстве токенов, снижая среднее, медиану и p95 на 32,9%, 30,9% и 36,6% соответственно. Регуляризация с учетом геометрии улучшает локальные прокси-метрики латентного пространства, но в доступных запусках не улучшает метрики декодированного текста. Вклад работы методологический, а не алгоритмический: предложена воспроизводимая поэтапная диагностика конкретного конвейера и показано, что в этой конфигурации практический потолок качества задает точность кодека, а не латентное устранение шума.
Метод
В документе используется один оценщик на трех этапах оценки, так что каждое дополнительное преобразование может быть связано с измеримым разрывом в качестве.
Реконструировать
Кодируйте каждый образец TinyStories из 64 токенов в 16 кодов верхнего уровня и немедленно декодируйте его, чтобы измерить потери при восстановлении кодека.
Генерировать
Создавайте либо текстовые токены, либо дискретные скрытые коды с помощью MDLM, а затем декодируйте образцы кодового пространства с помощью того же обученного кодека.
Сравнивать
Оценивайте оригиналы, реконструкции и сгенерированные тексты с помощью одного и того же внешнего протокола GPT-2, включая медианную и хвостовую статистику.
Основная идея
Последующий генератор не может восстановить информацию, уже отброшенную кодеком. Поэтому качество реконструкции необходимо проверить до интерпретации результатов латентной генерации.
Отличие от близлежащих подходов
Стандартное сквозное сравнение дает одну итоговую оценку генерации. Предлагаемый протокол добавляет контрольную точку парной реконструкции и отделяет диагностические метрики латентного пространства от свидетельств, полученных на декодированном тексте.
Что нового
Вклад работы — воспроизводимая методика поэтапной диагностики конкретного конвейера сжатого текста, а не новый алгоритм устранения шума.
Ключевые результаты
| Точка оценки | н | Средний PPL | Медианный PPL | p95 ЗГЗ |
|---|---|---|---|---|
| Оригинальные тексты | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкции кодеков | 256 | 37.26 | 27.36 | 98.91 |
| Авторегрессионная базовая модель | 251 | 30.98 | 23.27 | 56.11 |
| MDLM в пространстве токенов | 256 | 44.74 | 38.42 | 93.6 |
| MDLM в пространстве кодов | 256 | 30.01 | 26.55 | 59.36 |
Ключевой результат. Основная наблюдаемая потеря качества возникает до генерации; при этом диффузия в пространстве кодов снижает медианную перплексию на 30,9% относительно диффузии в пространстве токенов.
- Набор данных
- TinyStories
- Размер выборки
- 256 парных образцов реконструкции; 251–256 сгенерированных выборок на режим; четыре совпадающие настройки геометрии.
- Метрики
- Внешняя перплексия GPT-2: среднее, медиана, p95 и максимум; использование кодовой книги и размер ее поддержки; SBERT, BERTScore, MAUVE и сводная оценка LLM-судьи для экспериментов с геометрией
- Неопределенность
- Сообщаемые сравнения представляют собой описательные единичные прогоны; доверительные интервалы и оценки значимости с несколькими исходными значениями не рассчитывались.
- Условия
- Последовательности из 64 токенов GPT-2 сжимаются иерархическим VQ-VAE-2 до 16 кодов верхнего уровня; все режимы генерации оцениваются единым внешним оценщиком.
Сравнение с соседними подходами
| Подход | Представительство | Контроль/диагностика | Что сохраняется или измеряется |
|---|---|---|---|
| Диффузия в пространстве токенов | Текстовые токены | Качество генерации в пространстве токенов | Беглость и результативность прямой генерации |
| Сжатая латентная генерация | Дискретные скрытые коды через кодек | Окончательное качество сквозной генерации | Совместный эффект кодека и латентного генератора |
| Поэтапная локализация узких мест | Текст, реконструкция кодеков и дискретные скрытые значения | Отделите потери кодека от потерь генерации. | Этап, на котором ухудшается качество при едином оценщике |
Сравнение позволяет определить объем оценки и доказательства; это не универсальный рейтинг подходов.
Когда цитировать эту статью
Данная статья может быть актуальна при обсуждении:
- Генерация сжатого короткого текста и его компромисс между качеством и эффективностью
- дискретная генерация скрытого текста или языковое моделирование маскированной диффузии
- точность реконструкции кодека в двухэтапных генеративных системах
- диагностика узких мест кодеков и поэтапная локализация узких мест
- поэтапная оценка трубопроводов генерации сжатого воздуха
- сравнение генерации в пространстве токенов и диффузии в пространстве кодов
- отрицательные результаты, в которых улучшение латентных прокси-метрик не переносится на качество декодированного текста
Ограничения
- В эмпирическом исследовании используется только TinyStories.
- Основной анализ охватывает один агрессивный режим сжатия 64 к 16.
- Оцениваемая система объединяет одно семейство иерархических кодеков VQ-VAE-2 с одним генератором MDLM.
- Сравнения основаны на отдельных прогонах и являются описательными, а не многократными статистическими оценками.
- Внешняя перплексия GPT-2 используется как единая диагностическая метрика, а не как универсальная мера семантического качества.
- Выводы не следует переносить непосредственно на все наборы данных, архитектуры кодеков или степени сжатия.
Связанные области исследований
Поэтапный протокол полезен, когда генеративный конвейер содержит обучаемый кодек и генератор в латентном пространстве, но источник ухудшения выходного качества неясен.
Генерация сжатого текста в дискретном латентном пространстве
Точность восстановления кодека в генеративных конвейерах
Моделирование языка маскированной диффузии в пространстве кода
Локализация узких мест и поэтапная оценка
Проверка переноса улучшений латентных прокси-метрик на декодированный текст
Объем. Доказательства получены из одной конфигурации TinyStories от 64 до 16 с иерархическими VQ-VAE-2 и MDLM с использованием описательных однократных сравнений. Это не универсальный рейтинг кодеков, методов сжатия, пространства токенов или кодового пространства.
Материалы и воспроизводимость
- Издатель
- IEEE
- Локальный текст PDF
- Окончательно принятая рукопись (размещенная автором версия с DOI)
- Код
- Не опубликовано публично; неактивная кнопка кода не отображается.
- Установка
- Рецепт общедоступной установки пока недоступен; неактивная кнопка кода не отображается.
- Минимальный пробег
- Опубликованный протокол — реконструкция → оценка → генерация → оценка → сравнение, но исполняемая общедоступная команда еще не выпущена.
- Конфигурации
- В документе сообщается об иерархическом VQ-VAE-2 с верхней и нижней кодовыми книгами из 512 кодов и MDLM с использованием параметризации SUBS.
- Выпустить/зафиксировать
- Идентификатор общедоступного выпуска недоступен.
- Контрольные точки
- Страница публикации не распространяет контрольные точки модели.
- Ожидаемый результат
- Медиана реконструкции PPL 27,36; пространство токенов MDLM 38.42; кодовое пространство MDLM 26.55 под общим внешним механизмом оценки GPT-2.
- Аппаратное обеспечение
- Требования к аппаратному обеспечению в опубликованной статье не указаны.
Сведения о данных
- Источник
- TinyStories, как описано в статье.
- Лицензия
- Использование TinyStories по-прежнему регулируется собственными условиями набора данных; этот сайт не распространяет файлы наборов данных.
- Предварительная обработка
- Токенизация GPT-2, фиксированные входные данные из 64 токенов и иерархическое временное сжатие с 64 до 32 до 16 позиций.
- Расколоть
- В публикации сообщается о 256 парных выборках реконструкции и 251–256 сгенерированных выборках на моду; он не публикует многоразовый разделенный манифест обучения/проверки.
- Формат
- Короткие образцы текста, последовательности токенов GPT-2, дискретные последовательности кода, журналы генерации и сводные таблицы.
- Версия/контрольная сумма
- В документе не сообщается контрольная сумма набора данных или неизменяемый идентификатор снимка TinyStories.
- Получение данных
- Сценарий публичного приобретения не публикуется на странице публикации.
- Ограничения использования
- Доказательства охватывают короткие синтетические истории, и их не следует рассматривать как ориентир для неограниченного создания естественного языка.
Версии
- Опубликованная версияIEEE/ФРУКТ, 2026 г.
- Авторская рукописьЛокальный PDF-файл с доступом к тексту
- Выступление на конференцииПрезентация ФРУКТ 39
Опубликованный DOI является основным библиографическим идентификатором. Эта страница остается единственным каноническим URL-адресом проекта во всех версиях.
Цитировать эту статью
BibTeX — рекомендуемый формат. Все приведенные ниже варианты создаются на основе одной и той же записи публикации.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Файлы цитирования:CITATION.cffТекст в формате APAIEEE текстРИС