Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Де втрачається якість у генерації стиснених коротких текстів: поетапна локалізація вузьких місць
Поетапна діагностика генерації стиснених коротких текстів, що відокремлює втрати реконструкції кодеком від втрат генерації в латентному просторі.
Читати повний текст статті у форматі HTMLТекст із можливістю пошуку, що містить формули, таблиці, рисунки та бібліографію.
Остаточна прийнята версія рукопису (опублікована автором версія з DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Умови оприлюднення та повторного використання.
Стаття за 30 секунд
Дослідницьке питанняЯк у конвеєрі генерації стисненого тексту окремо визначити внесок кодека й латентного генератора у втрату якості?
Проблема
Під час генерації стиснених коротких текстів низька якість декодованого тексту може бути зумовлена втратою інформації в кодеку або слабкою генерацією в латентному просторі. Наскрізні оцінки не розрізняють цих режимів відмови, через що зусилля з оптимізації можуть бути спрямовані на хибний компонент.
Підхід
Поетапний протокол оцінює оригінали, парні реконструкції кодеком, результати MDLM у просторі токенів і результати дифузії у просторі кодів за допомогою одного зовнішнього оцінювача GPT-2. Показники кодової книги та геометрії залишаються діагностичними засобами, а не заміною оцінювання якості декодованого тексту.
Основний результат
Реконструкція кодека підвищує медіанну зовнішню перплексію з 15.17 до 27.36, а p95 — з 25.10 до 98.91. Водночас MDLM у просторі кодів знижує медіанну перплексію на 30.9% порівняно з MDLM у просторі токенів.
Чому це важливо
Результат перетворює діагностику вузького місця кодека на практичну послідовність дій: спочатку вдосконалити кодек, потім порівняти генерацію у просторі токенів і просторі кодів, а поліпшення проксі-показників латентного простору вважати переконливими лише тоді, коли поліпшується й декодований текст.
Анотація
Генератори стиснених коротких текстів можуть зазнавати збою у двох різних місцях: кодек може втратити інформацію ще до початку генерації, або латентний генератор може створити неякісні коди. Без розмежування цих режимів відмови дослідники ризикують витрачати обчислювальні ресурси на вдосконалення не того компонента. Ми досліджуємо цю проблему в контрольованій конфігурації TinyStories зі стисненням 64 до 16, побудованій на ієрархічному кодеку VQ-VAE-2 та генераторі маскованої дискретної дифузії (MDLM). Поетапний протокол валідації за допомогою одного спільного зовнішнього засобу оцінювання GPT-2 розмежовує точність реконструкції кодеком, якість генерації в латентному просторі та допоміжні діагностичні показники латентного простору; для дослідження геометрії додатково наведено семантичні метрики. У випробуваній конфігурації сама реконструкція кодеком підвищує медіанну зовнішню перплексію з 15.17 до 27.36 (+80.4%), а p95 — з 25.10 до 98.91 (+294.1%). Отже, основна втрата якості відбувається ще до початку генерації в латентному просторі. За оцінювання тим самим засобом MDLM у просторі кодів залишається істотно кращою за дифузію у просторі токенів: середня, медіанна та p95-перплексія нижчі відповідно на 32.9%, 30.9% і 36.6%. Регуляризація з урахуванням геометрії поліпшує локальні проксі-показники латентного простору, але в наявних запусках не поліпшує метрик декодованого тексту. Отже, внесок роботи є методологічним, а не алгоритмічним: у статті запропоновано придатну до повторного використання поетапну діагностику конкретного конвеєра й показано, що за цих умов практичну верхню межу якості визначає точність реконструкції кодеком, а не усунення шуму в латентному просторі.
Місце публікації 39-та конференція Асоціації відкритих інновацій 2026 року (FRUCT)
Тип внеску Методологія діагностики
випуск 1с. 69–76Основна конференція
Ключові результати
| Точка оцінювання | n | Середня PPL | Медіанна PPL | PPL на 95-му перцентилі |
|---|---|---|---|---|
| Оригінальні тексти | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкції кодека | 256 | 37.26 | 27.36 | 98.91 |
| Базова модель AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM у просторі токенів | 256 | 44.74 | 38.42 | 93.6 |
| MDLM у просторі кодів | 256 | 30.01 | 26.55 | 59.36 |
Ключовий результат. Більша частина спостережуваного погіршення якості виникає до генерації; водночас дифузія у просторі кодів знижує медіанну перплексію на 30.9% порівняно з дифузією у просторі токенів.
- Набір даних
- TinyStories
- Розмір вибірки
- 256 парних зразків реконструкції; 251–256 згенерованих зразків для кожного режиму; чотири узгоджені конфігурації геометрії.
- Метрики
- Зовнішня перплексія GPT-2: середнє, медіана, p95 і максимум; використання кодової книги та розмір носія; SBERT, BERTScore, MAUVE і зведена оцінка LLM-судді для запусків із дослідження геометрії
- Невизначеність
- Наведені порівняння є описовими одиничними запусками; довірчі інтервали та оцінки значущості за кількома початковими значеннями не обчислювали.
- Умови
- Послідовності токенів GPT-2 завдовжки 64 стискаються до 16 кодів верхнього рівня за допомогою ієрархічної VQ-VAE-2; в усіх режимах генерації використовується спільний зовнішній засіб оцінювання.
Завантажити результати:CSVJSONMarkdownЗовнішнє дзеркало:Картка набору даних Hugging Face
PDF і цитування
Цитувати цю статтю Рекомендованим форматом є BibTeX. Усі наведені нижче варіанти сформовано з одного запису про публікацію.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Файли цитування:Текст у форматі APAТекст у форматі IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML метаданих JATS 1.4Повнотекстовий XML у форматі JATS 1.4RDF TurtleНабір посилань (JSON)Набір посилань (HTTP)RO-Crate
Повні настанови
Повні дослідницькі настанови
Метод
У статті на трьох етапах оцінювання застосовано один оцінювач, тому кожне додаткове перетворення можна пов’язати з вимірюваним розривом у якості.
Реконструювати
Закодуйте кожен 64-токенний зразок TinyStories у 16 кодів верхнього рівня й одразу декодуйте його, щоб виміряти втрату реконструкції кодеком.
Згенерувати
Згенеруйте за допомогою MDLM текстові токени або дискретні латентні коди, а потім декодуйте зразки з простору кодів тим самим навченим кодеком.
Порівняти
Оцініть оригінали, реконструкції та згенеровані тексти за єдиним зовнішнім протоколом GPT-2, зокрема наведіть медіану та статистики хвостів розподілу.
Ключова ідея
Подальший генератор не здатен відновити інформацію, яку кодек уже відкинув. Тому перш ніж інтерпретувати результати генерації в латентному просторі, необхідно перевірити етап реконструкції.
Відмінність від споріднених підходів
Стандартні наскрізні порівняння наводять одну підсумкову оцінку генерації. Цей протокол додає парну контрольну точку реконструкції та відокремлює діагностичні метрики в латентному просторі від свідчень за декодованим текстом.
Що нового
Внесок полягає у придатній до повторного використання поетапній методиці діагностики одного конкретного конвеєра стисненого тексту, а не в новому алгоритмі усунення шуму.
Питання, на які допомагає відповісти ця стаття
Відкрийте запитання, щоб отримати стислу відповідь, що ґрунтується на статті. Докладні межі доказовості наведено в розділі «Обмеження».
На якому етапі погіршується якість генерації стисненого короткого тексту?
У випробуваному конвеєрі TinyStories зі стисненням 64 до 16 основне погіршення виникає на етапі реконструкції кодеком, ще до початку латентної генерації. Медіанна зовнішня перплексія GPT-2 зростає з 15.17 для оригінального тексту до 27.36 після реконструкції, тоді як p95 зростає з 25.10 до 98.91. Це результат для однієї конфігурації, а не універсальний рейтинг кодеків.
Як відокремити втрату кодека від втрати генерації в латентному просторі?
Поетапний протокол оцінює оригінали, парні реконструкції кодеком і кінцевий згенерований текст за допомогою єдиного зовнішнього оцінювача. Розрив між оригіналом і реконструкцією дає оцінку внеску кодека, тоді як порівняння реконструкції зі згенерованим результатом допомагає локалізувати додаткові втрати на етапі генерації. Метрики стану латентного представлення наводяться окремо від свідчень, отриманих із декодованого тексту.
Як слід оцінювати генерацію тексту з дискретними латентними представленнями?
Стаття рекомендує перевіряти точність реконструкції до порівняння генераторів, застосовувати той самий оцінювач декодованого тексту на кожному етапі та наводити центральні й хвостові статистики. Використання кодової книги, геометрію та інші латентні сурогати вона також розглядає як діагностичні показники, а не заміну якості декодованого тексту.
Чи перевершує дифузія у просторі кодів дифузію у просторі токенів?
За спільного оцінювача та випробуваної конфігурації MDLM у просторі кодів знижує середню, медіанну й p95-перплексію відповідно на 32.9%, 30.9% і 36.6% порівняно з MDLM у просторі токенів. Це порівняння є описовим і залежить від конфігурації: воно не встановлює універсального ранжування для різних наборів даних, коефіцієнтів стиснення, кодеків чи архітектур дифузії.
Чи гарантують кращі метрики геометрії латентного простору вищу якість згенерованого тексту?
Ні. У наявних зіставних запусках регуляризація з урахуванням геометрії поліпшила локальні проксі-показники латентного простору, але не поліпшила метрики декодованого тексту. Цей результат обґрунтовує необхідність перевіряти кожне поліпшення проксі-показника на кінцевому декодованому виході, а відсутність перенесення трактувати як корисний негативний результат, а не як свідчення поліпшення генерації.
Порівняння зі спорідненими підходами
| Підхід | Представлення | Керування / діагностика | Що зберігається або вимірюється |
|---|---|---|---|
| Дифузія у просторі токенів | Текстові токени | Якість генерації у просторі токенів | Плавність тексту та поведінка засобу оцінювання для прямої генерації |
| Стиснена латентна генерація | Дискретні латентні коди, отримані за допомогою кодека | Кінцева наскрізна якість генерації | Спільна поведінка кодека й латентного генератора |
| Поетапна локалізація вузьких місць | Текст, реконструкції кодеком і дискретні латентні представлення | Розмежовуйте втрату кодека і втрату генерації | Де погіршується якість за оцінювання одним спільним засобом |
Порівняння розрізняє обсяг оцінювання та доказову базу; це не універсальний рейтинг підходів.
Актуальність і межі застосування
Поетапний протокол корисний, коли генеративний конвеєр містить і навчений кодек, і генератор у латентному просторі, але джерело погіршення якості результату незрозуміле.
Стиснена генерація тексту з дискретними латентними представленнями
Точність реконструкції кодека в генеративних конвеєрах
Мовне моделювання методом маскованої дифузії у просторі кодів
Локалізація вузьких місць та узгоджене між етапами оцінювання
Перевірка поліпшень проксі-показників латентного простору на декодованому тексті
Обмеження
- Емпіричне дослідження використовує лише TinyStories.
- Основний аналіз охоплює один агресивний режим стиснення 64-до-16.
- Оцінювана система поєднує одне сімейство ієрархічних кодеків VQ-VAE-2 з одним генератором MDLM.
- Порівняння ґрунтуються на одиничних запусках і мають описовий характер, а не є статистичними оцінками за кількома початковими значеннями генератора.
- Зовнішня перплексія GPT-2 є спільним діагностичним показником, а не універсальною метрикою семантичної якості.
- Висновки не слід безпосередньо переносити на всі набори даних, архітектури кодеків або коефіцієнти стиснення.
Джерела, цитовані у статті
Ці записи відповідають нумерованому розділу References у PDF-версії статті.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Ресурси та відтворюваність
- Видавець
- IEEE
- Локальний PDF із текстом
- Остаточна прийнята версія рукопису (опублікована автором версія з DOI)
- Ресурси публікації
- Тут доступні відкритий рукопис, таблиці результатів, пояснювальний рисунок і файли цитування. Код реалізації та контрольні точки публічно не оприлюднено.
Відомості про дані
- Джерело
- TinyStories, як описано у статті.
- Ліцензія
- Використання TinyStories регулюється власними умовами набору даних; цей сайт не розповсюджує жодних його файлів.
- Попереднє оброблення
- Токенізація GPT-2, вхідні послідовності фіксованої довжини 64 токени та ієрархічне часове стиснення з 64 до 32, а потім до 16 позицій.
- Розділити
- У публікації наведено 256 парних зразків реконструкції та 251–256 згенерованих зразків для кожного режиму; придатного до повторного використання маніфесту поділу на навчальну й валідаційну вибірки не опубліковано.
- Формат
- Зразки коротких текстів, послідовності токенів GPT-2, послідовності дискретних кодів, журнали генерації та підсумкові таблиці.
- Версія / контрольна сума
- У статті не наведено контрольної суми набору даних або незмінного ідентифікатора знімка TinyStories.
- Отримання даних
- Разом зі сторінкою публікації не оприлюднено сценарію для отримання даних.
- Межі застосування
- Свідчення охоплюють короткі синтетичні оповіді й не мають трактуватися як еталон для необмеженої генерації природної мови.
Версії
- Опублікована версіяIEEE / FRUCT, 2026
- Запис в arXivВідкрити запис препринту, arXiv:2607.24176
- Авторський рукописЛокальний PDF із доступним текстом
- Доповідь на конференціїПрезентація FRUCT 39
- Покажчик матеріалів конференціїОфіційний том FRUCT 39
- PDF матеріалів конференціїВідкритий повний текст FRUCT
- Відкрити науковий записOpenAlex
- Запис у графі цитуваньSemantic Scholar
- Повний текст, наданий авторомResearchGate
Опублікований DOI є основним бібліографічним ідентифікатором. Ця сторінка залишається єдиною канонічною URL-адресою проєкту для всіх версій.