Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Къде се срива качеството при компресирано генериране на кратък текст: поетапно локализиране на тясното място
Поетапна диагностика на компресираното генериране на кратък текст, която разграничава загубата при реконструкция чрез кодека от загубата при генериране в латентното пространство.
Прочетете пълния текст във формат HTMLТекст с възможност за търсене, включващ формули, таблици, фигури и библиография.
Окончателен приет ръкопис (публикувана от автора версия с DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Условия за публикуване и повторно използване.
Статията за 30 секунди
Изследователски въпросКак загубата на качество в конвейер за генериране на компресиран текст може да се припише поотделно на кодека и на латентния генератор?
Проблем
При генерирането на компресиран кратък текст ниското качество на декодирания текст може да се дължи на информация, загубена от кодека, или на слабо генериране в латентното пространство. Оценките от край до край размиват разграничението между тези режими на отказ и могат да насочат усилията за оптимизация към неправилния компонент.
Подход
Поетапният протокол оценява оригиналите, съответните им реконструкции чрез кодека, изходите на MDLM в пространството на токените и изходите на дифузията в пространството на кодовете посредством един външен оценител GPT-2. Показателите за кодовата книга и геометрията остават диагностични средства, а не заместители на качеството на декодирания текст.
Основен резултат
Реконструкцията от кодека повишава медианната външна перплексия от 15.17 на 27.36, а p95 — от 25.10 на 98.91. Въпреки това MDLM в пространството на кодовете намалява медианната перплексия с 30.9% спрямо MDLM в пространството на токените.
Защо това е важно
Резултатът превръща диагностиката на тесните места в кодека в приложима последователност на работа: първо подобрете кодека, след това съпоставете генерирането в пространството на токените и в кодовото пространство и приемайте подобренията на латентните косвени показатели само когато се подобрява и декодираният текст.
Резюме
При генераторите на компресиран кратък текст проблемът може да възникне на две различни места: кодекът да отхвърли информация преди началото на генерирането или латентният генератор да създаде некачествени кодове. Ако тези два източника на грешка не бъдат разграничени, изследователите могат да изразходват изчислителни ресурси за подобряване на неподходящия компонент. Изследваме проблема в контролирана постановка с TinyStories и компресия от 64 до 16, изградена върху йерархичен кодек VQ-VAE-2 и генератор с маскирана дискретна дифузия (MDLM). Използваме поетапен протокол за валидиране, който разграничава точността на реконструкцията чрез кодека, качеството на генерирането в латентното пространство и спомагателните диагностични показатели за латентните представяния при един и същ външен оценител GPT-2; за изследването на геометрията отчитаме и допълващи семантични метрики. В изпитаната конфигурация само реконструкцията чрез кодека повишава медианната външна перплексия от 15.17 на 27.36 (+80.4%), а p95 — от 25.10 на 98.91 (+294.1%). Следователно основната загуба на качество възниква преди началото на генерирането в латентното пространство. При същия оценител MDLM в кодовото пространство остава осезаемо по-силен от дифузията в токеновото пространство, като намалява средната стойност, медианата и p95 съответно с 32.9%, 30.9% и 36.6%. Регуляризацията, отчитаща геометрията, подобрява локалните косвени показатели за латентните представяния, но при наличните изпълнения не подобрява метриките върху декодирания текст. Приносът е методологичен, а не алгоритмичен: статията представя повторно приложима поетапна диагностика за конкретен конвейер и показва, че в тази постановка практическият таван на качеството се определя от точността на кодека, а не от премахването на шум в латентното пространство.
Публикувано в 39-а конференция на Open Innovations Association (FRUCT), 2026 г.
Вид на приноса Диагностична методология
брой 1с. 69–76Основна конференция
Основни резултати
| Точка на оценяване | n | Средна PPL | Медианна PPL | p95 PPL |
|---|---|---|---|---|
| Оригинални текстове | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкции от кодека | 256 | 37.26 | 27.36 | 98.91 |
| Базов авторегресивен модел | 251 | 30.98 | 23.27 | 56.11 |
| MDLM в пространството на токените | 256 | 44.74 | 38.42 | 93.6 |
| MDLM в пространството на кодовете | 256 | 30.01 | 26.55 | 59.36 |
Основен резултат. По-голямата част от наблюдаваната загуба на качество възниква преди генерирането; въпреки това дифузията в пространството на кодовете намалява медианната перплексия с 30.9% спрямо дифузията в пространството на токените.
- Набор от данни
- TinyStories
- Размер на извадката
- 256 сдвоени извадки за реконструкция; 251–256 генерирани извадки за всеки режим; четири съпоставени конфигурации на геометрията.
- Метрики
- Външна перплексия на GPT-2: средна стойност, медиана, p95 и максимум; използване на кодовата книга и размер на носителя; SBERT, BERTScore, MAUVE и обобщение от LLM оценител за експериментите с геометрия
- Неопределеност
- Отчетените съпоставки представляват описателни единични изпълнения; не са изчислявани доверителни интервали и оценки на значимостта с множество начални стойности.
- Условия
- Последователности от 64 токена на GPT-2, компресирани до 16 кода от най-горното ниво с йерархичен VQ-VAE-2; всички режими на генериране използват общия външен оценител.
Изтегляне на резултатите:CSVJSONMarkdownВъншен огледален източник:Карта на набор от данни в Hugging Face
PDF и цитиране
Как да цитирате статията BibTeX е препоръчителният формат. Всеки вариант по-долу е генериран от един и същ запис за публикацията.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Файлове с библиографски записи:Текст по APAТекст във формат IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML метаданни по JATS 1.4Пълен текст във формат JATS 1.4 XMLRDF TurtleНабор от връзки (JSON)Набор от връзки (HTTP)RO-Crate
Пълно ръководство
Пълно изследователско ръководство
Метод
Статията използва един оценител в три етапа на оценяване, така че всяка допълнителна трансформация да може да се свърже с измерима разлика в качеството.
Реконструиране
Кодирайте всяка 64-токенна извадка от TinyStories в 16 кода от най-горното ниво и я декодирайте незабавно, за да измерите загубата при реконструкция чрез кодека.
Генериране
Генерирайте с MDLM текстови токени или дискретни латентни кодове, след което декодирайте извадките от кодовото пространство чрез същия обучен кодек.
Сравнете
Оценете оригиналите, реконструкциите и генерираните текстове чрез един и същ външен протокол с GPT-2, включително статистики за медианата и опашките.
Основна идея
Генераторът на следващ етап не може да възстанови информация, която кодекът вече е отхвърлил. Поради това етапът на реконструкция трябва да бъде проверен, преди да се интерпретират резултатите от генерирането в латентното пространство.
Разлика спрямо сродни подходи
Стандартните съпоставки от край до край отчитат една окончателна оценка на генерирането. Този протокол добавя контролна точка за сдвоена реконструкция и отделя диагностичните метрики в латентното пространство от доказателствата върху декодирания текст.
Какво е новото
Приносът е повторно използваема поетапна диагностична методология за конкретен конвейер за компресиран текст, а не нов алгоритъм за премахване на шум.
Въпроси, на които тази статия помага да се отговори
Отворете въпрос за кратък отговор, основан на статията. Подробните граници на доказателствата са посочени в раздел „Ограничения“.
Къде се влошава качеството при генериране на компресиран кратък текст?
В изпитания конвейер TinyStories 64-към-16 основното влошаване настъпва при реконструкцията чрез кодека, преди да започне генерирането в латентното пространство. Медианната външна перплексия според GPT-2 нараства от 15.17 за оригиналния текст до 27.36 след реконструкцията, а p95 — от 25.10 до 98.91. Това е резултат за една конфигурация, а не универсална класация на кодеците.
Как загубата от кодека може да се разграничи от загубата при генериране в латентното пространство?
Поетапният протокол оценява оригиналите, съответните им реконструкции чрез кодека и окончателно генерирания текст с един и същ външен оценител. Разликата между оригинала и реконструкцията оценява приноса на кодека, а сравнението между реконструкцията и генерирания изход помага да се локализира допълнителната загуба при генерирането. Метриките за състоянието на латентното представяне се отчитат отделно от данните за декодирания текст.
Как следва да се оценява генерирането на текст с дискретни латентни представяния?
Статията препоръчва точността на реконструкцията да се проверява преди съпоставянето на генератори, на всеки етап да се прилага един и същ оценител върху декодирания текст и да се отчитат статистики за центъра и опашките на разпределението. Използването на кодовата книга, геометрията и други латентни косвени показатели се разглеждат като диагностични средства, а не като заместители на качеството на декодирания текст.
Превъзхожда ли дифузията в кодовото пространство дифузията в пространството на токените?
При общия оценител и изпитаната постановка MDLM в пространството на кодовете намалява средната, медианната и p95 перплексията съответно с 32.9%, 30.9% и 36.6% спрямо MDLM в пространството на токените. Сравнението е описателно и специфично за конфигурацията: то не установява универсално класиране за различни набори от данни, коефициенти на компресия, кодеци или дифузионни архитектури.
Гарантират ли по-добрите метрики за латентна геометрия по-качествен генериран текст?
Не. В наличните съпоставими изпълнения съобразената с геометрията регуляризация подобри локалните заместители в латентното пространство, но не и метриките върху декодирания текст. Резултатът показва необходимостта всяко подобрение по заместваща метрика да се проверява върху крайния декодиран изход, а липсата на пренос да се разглежда като полезен отрицателен резултат, а не като доказателство за подобрено генериране.
Сравнение със сродни подходи
| Подход | Представяне | Контрол / диагностика | Какво се запазва или измерва |
|---|---|---|---|
| Дифузия в пространството на токените | Текстови токени | Качество на генерирането в пространството на токените | Плавност и поведение на оценителя при пряко генериране |
| Компресирано латентно генериране | Дискретни латентни кодове чрез кодек | Крайно качество на генерирането от начало до край | Съвместно поведение на кодека и латентния генератор |
| Поетапно локализиране на тесните места | Текст, реконструкции от кодека и дискретни латентни представяния | Разграничете загубата от кодека от загубата при генерирането | Къде се влошава качеството при един общ оценител |
Съпоставката разграничава обхвата на оценяването и доказателствата; тя не представлява универсално подреждане на подходите.
Приложимост и обхват
Поетапният протокол е полезен, когато генеративният конвейер включва както обучен кодек, така и генератор в латентното пространство, но причината за влошеното качество на изхода е неясна.
Генериране на текст чрез компресирани и дискретни латентни представяния
Точност на реконструкцията от кодека в генеративни конвейери
Езиково моделиране чрез маскирана дифузия в пространството на кодовете
Локализиране на тясното място и съгласувано между етапите оценяване
Проверка на подобренията в прокси показателите на латентното пространство спрямо декодирания текст
Ограничения
- Емпиричното изследване използва единствено TinyStories.
- Основният анализ обхваща един агресивен режим на компресия от 64 до 16.
- Оценяваната система съчетава едно семейство йерархични кодеци VQ-VAE-2 с един генератор MDLM.
- Сравненията се основават на единични изпълнения и имат описателен характер, а не представляват статистически оценки с множество начални инициализации.
- Външната перплексия на GPT-2 е общ диагностичен показател, а не универсална метрика за семантично качество.
- Изводите не следва да се пренасят пряко към всички набори от данни, архитектури на кодеци или коефициенти на компресия.
Източници, цитирани в статията
Тези записи съответстват на номерирания раздел References в PDF файла на статията.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Ресурси и възпроизводимост
- Издател
- IEEE
- Локален PDF с текста
- Окончателен приет ръкопис (публикувана от автора версия с DOI)
- Ресурси към публикацията
- Тук са достъпни публичният ръкопис, таблиците с резултати, пояснителната фигура и файловете за цитиране. Програмната реализация и контролните точки не са публикувани.
Декларация относно данните
- Източник
- TinyStories, както е описан в статията.
- Лиценз
- Използването на TinyStories остава подчинено на собствените условия на набора от данни; този сайт не разпространява повторно файлове от набора.
- Предварителна обработка
- Токенизация с GPT-2, входове с фиксирана дължина от 64 токена и йерархична времева компресия от 64 през 32 до 16 позиции.
- Разделяне
- Публикацията отчита 256 сдвоени извадки за реконструкция и 251–256 генерирани извадки за всеки режим; тя не публикува повторно използваем манифест за разделянето на обучаваща и валидационна извадка.
- Формат
- Извадки от кратки текстове, последователности от GPT-2 токени, последователности от дискретни кодове, дневници на генерирането и обобщаващи таблици.
- Версия / контролна сума
- В статията не са посочени контролна сума на набора от данни или неизменяем идентификатор на моментно състояние на TinyStories.
- Придобиване
- Към страницата на публикацията не е предоставен публичен скрипт за придобиване на данните.
- Ограничения за употреба
- Доказателствата обхващат кратки синтетични разкази и не следва да се приемат като еталон за неограничено генериране на естествен език.
Версии
- Публикувана версияIEEE / FRUCT, 2026
- Запис в arXivОтваряне на записа за препринта, arXiv:2607.24176
- Индекс на изследванията в областта на ИИСтраница на публикацията в Hugging Face с потвърдена самоличност на първия автор и свързано резюме на резултатите
- Авторски ръкописЛокален PDF с достъпен текст
- Доклад на конференцияПрезентация на FRUCT 39
- Указател на сборника с доклади от конференциятаОфициален том на FRUCT 39
- PDF на сборника с доклади от конференциятаСвободно достъпен пълен текст от FRUCT
- Отваряне на научния записOpenAlex
- Запис в графа на цитираниятаSemantic Scholar
- Пълен текст, споделен от автораResearchGate
Публикуваният DOI е основният библиографски идентификатор. Тази страница остава единственият каноничен URL на проекта във всички версии.