Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Где се нарушава квалитет при генерисању компримованог кратког текста: фазна локализација уских грла
Фазна дијагностика генерисања компримованог кратког текста која раздваја губитак реконструкције кодеком од губитка при генерисању латентних кодова.
Прочитајте цео рад у HTML форматуПретражив текст с формулама, табелама, сликама и референцама.
Коначни прихваћени рукопис (верзија коју је објавио аутор, са DOI вредношћу). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Услови објављивања и поновне употребе.
Рад за 30 секунди
Истраживачко питањеКако се губитак квалитета у процесу генерисања компримованог текста може засебно приписати кодеку и латентном генератору?
Проблем
При генерисању компримованог кратког текста, лош квалитет декодираног текста може потицати од информација изгубљених у кодеку или од слабог генерисања у латентном простору. Метрике целокупног процеса замагљују ове начине отказа и могу усмерити оптимизацију ка погрешној компоненти.
Приступ
Етапни протокол једним спољним GPT-2 оцењивачем вреднује оригинале, упарене реконструкције кодеком, излазе MDLM-а у простору токена и излазе дифузије у простору кодова. Мере речника кодова и геометрије остају дијагностички показатељи, а не замена за квалитет декодираног текста.
Главни резултат
Реконструкција кодеком повећава медијану спољне перплексије са 15.17 на 27.36, а p95 са 25.10 на 98.91. MDLM у простору кодова ипак смањује медијану перплексије за 30.9% у односу на MDLM у простору токена.
Зашто је то важно
Резултат претвара дијагнозу уског грла кодека у применљив редослед рада: најпре унапредити кодек, затим упоредити генерисање у простору токена и простору кодова, а побољшањима латентних посредних мера веровати само када се побољша и декодирани текст.
Сажетак
Генератори кратког компримованог текста могу отказати на два различита места: кодек може одбацити информације пре почетка генерисања или латентни генератор може произвести слабе кодове. Ако се ови начини отказа не раздвоје, истраживачи могу трошити рачунарске ресурсе на побољшавање погрешне компоненте. Овај проблем проучавамо у контролисаној студији случаја TinyStories са компресијом 64-на-16, заснованој на хијерархијском VQ-VAE-2 кодеку и генератору с маскираном дискретном дифузијом (MDLM). Примењујемо етапни протокол валидације који, уз један заједнички спољни GPT-2 оцењивач, раздваја верност реконструкције кодеком, квалитет генерисања латентних репрезентација и помоћну дијагностику латентних репрезентација, док за испитивање геометрије извештавамо и о допунским семантичким метрикама. У испитаној конфигурацији, сама реконструкција кодеком повећава медијану спољне перплексије са 15.17 на 27.36 (+80.4%), а p95 са 25.10 на 98.91 (+294.1%), што показује да се доминантан губитак квалитета јавља пре почетка генерисања латентних репрезентација. При истом оцењивачу, MDLM у простору кодова остаје осетно успешнији од дифузије у простору токена, смањујући средњу вредност, медијану и p95 за 32.9%, 30.9% и 36.6%. Регуларизација која узима у обзир геометрију побољшава локалне посредне показатеље латентних репрезентација, али у доступним покретањима не побољшава метрике декодираног текста. Допринос је методолошки, а не алгоритамски: рад представља поновљиво употребљиву етапну дијагностику једног конкретног тока обраде и показује да у овом окружењу практичну горњу границу квалитета одређује верност кодека, а не уклањање шума из латентних репрезентација.
Објављено у 2026 39th Conference of Open Innovations Association (FRUCT)
Врста доприноса Дијагностичка методологија
број 1стр. 69–76Главна конференција
Кључни резултати
| Тачка евалуације | n | Средња вредност PPL | Медијана PPL | p95 PPL |
|---|---|---|---|---|
| Изворни текстови | 256 | 16.24 | 15.17 | 25.1 |
| Реконструкције кодеком | 256 | 37.26 | 27.36 | 98.91 |
| Полазни AR модел | 251 | 30.98 | 23.27 | 56.11 |
| MDLM у простору токена | 256 | 44.74 | 38.42 | 93.6 |
| MDLM у простору кодова | 256 | 30.01 | 26.55 | 59.36 |
Кључни резултат. Највећи део уоченог губитка квалитета настаје пре генерисања; дифузија у простору кодова ипак смањује медијану перплексије за 30.9% у односу на дифузију у простору токена.
- Скуп података
- TinyStories
- Величина узорка
- 256 упарених узорака реконструкције; 251–256 генерисаних узорака по режиму; четири усклађене поставке геометрије.
- Метрике
- Екстерна перплексија модела GPT-2: средња вредност, медијана, p95 и максимум; искоришћеност књиге кодова и величина носача; SBERT, BERTScore, MAUVE и сажетак LLM оцењивача за експерименте геометрије
- Неизвесност
- Приказана поређења су описна појединачна извршавања; интервали поверења и процене значајности с више семена нису израчунати.
- Услови
- Низови токена модела GPT-2 дужине 64, компримовани у 16 кодова највишег нивоа хијерархијским моделом VQ-VAE-2; сви режими генерисања користе заједнички спољни оцењивач.
Преузмите резултате:CSVJSONMarkdownСпољно огледало:Картица скупа података на платформи Hugging Face
PDF и библиографски навод
Како цитирати овај рад BibTeX је препоручени формат. Свака варијанта у наставку генерисана је из истог записа о публикацији.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Датотеке библиографских навода:Текст у формату APAТекст у формату IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML метаподаци према стандарду JATS 1.4Цео текст у формату JATS 1.4 XMLRDF TurtleСкуп веза (JSON)Скуп веза (HTTP)RO-Crate
Цео водич
Цео истраживачки водич
Метод
Рад користи један оцењивач у три фазе вредновања како би се свака додатна трансформација могла повезати с мерљивим јазом у квалитету.
Реконструишите
Сваки узорак TinyStories од 64 токена кодирајте у 16 кодова највишег нивоа и одмах га декодирајте ради мерења губитка при реконструкцији кодеком.
Генеришите
Помоћу модела MDLM генеришите текстуалне токене или дискретне латентне кодове, а затим узорке из простора кодова декодирајте истим обученим кодеком.
Упоредите
Оценити оригинале, реконструкције и генерисане текстове истим спољним GPT-2 протоколом, укључујући медијану и статистике репова расподеле.
Кључна идеја
Генератор у каснијој фази не може да поврати информације које је кодек већ одбацио. Зато се фаза реконструкције мора испитати пре тумачења резултата генерисања латентних кодова.
Разлика у односу на сродне приступе
Стандардна поређења од почетка до краја наводе једну коначну оцену генерисања. Овај протокол уводи упарену контролну тачку реконструкције и раздваја показатеље исправности у латентном простору од доказа добијених на декодираном тексту.
Шта је ново
Допринос је поновљиво употребљива методологија етапне дијагностике једног конкретног поступка за компримовани текст, а не нов алгоритам за уклањање шума.
Питања на која овај рад помаже да се одговори
Отворите питање да бисте добили сажет одговор заснован на раду. Детаљне границе расположивих доказа наведене су у одељку Ограничења.
Где долази до пада квалитета при генерисању компримованог кратког текста?
У испитаном процесу TinyStories са компресијом 64-на-16, доминантно погоршање јавља се при реконструкцији кодеком, пре почетка генерисања у латентном простору. Медијана спољне перплексије модела GPT-2 расте са 15.17 за изворни текст на 27.36 након реконструкције, док p95 расте са 25.10 на 98.91. Ово је резултат за једну конфигурацију, а не универзално рангирање кодека.
Како се губитак кодека може раздвојити од губитка при генерисању у латентном простору?
Етапни протокол оцењује оригинале, упарене реконструкције кодеком и коначни генерисани текст помоћу једног заједничког спољног оцењивача. Разлика између оригинала и реконструкције процењује допринос кодека, док поређење реконструкције са генерисаним излазом помаже да се локализује додатни губитак при генерисању. Метрике стања латентних репрезентација наводе се одвојено од доказа заснованих на декодираном тексту.
Како треба вредновати генерисање текста помоћу дискретних латентних репрезентација?
Рад препоручује да се пре поређења генератора провери верност реконструкције, да се у свакој фази примени исти оцењивач декодираног текста и да се прикажу централне статистике и статистике репова расподеле. Употребу књиге кодова, геометрију и друге латентне посредне мере такође третира као дијагностичке показатеље, а не као замену за квалитет декодираног текста.
Да ли дифузија у простору кодова надмашује дифузију у простору токена?
Према заједничком оцењивачу и у испитаној поставци, MDLM у простору кодова смањује средњу вредност, медијану и p95 перплексије за 32.9%, 30.9% и 36.6% у односу на MDLM у простору токена. Поређење је описно и односи се на конкретну конфигурацију: оно не утврђује универзални поредак за различите скупове података, степене компресије, кодеке или архитектуре дифузије.
Да ли боље метрике латентне геометрије гарантују бољи генерисани текст?
Не. У доступним упареним извршавањима, регуларизација која узима у обзир геометрију побољшала је локалне посредне показатеље латентног простора, али није побољшала метрике декодованог текста. Овај резултат указује на то да сваки добитак у посредним показатељима треба проверити на коначном декодованом излазу, а изостанак преноса тумачити као користан негативан резултат, а не као доказ побољшања генерисања.
Поређење са сродним приступима
| Приступ | Репрезентација | Управљање / дијагностика | Шта се очувава или мери |
|---|---|---|---|
| Дифузија у простору токена | Текстуални токени | Квалитет генерисања у простору токена | Течност непосредно генерисаног текста и понашање оцењивача |
| Генерисање компримованих латентних репрезентација | Дискретни латентни кодови добијени помоћу кодека | Коначни квалитет генерисања од почетка до краја | Заједничко понашање кодека и латентног генератора |
| Етапно локализовање уског грла | Текст, реконструкције кодеком и дискретне латентне променљиве | Раздвојте губитак кодека од губитка при генерисању | Где се квалитет погоршава према једном заједничком оцењивачу |
Поређење разликује обухват вредновања и доказе; оно није универзално рангирање приступа.
Релевантност и обухват
Етапни протокол је користан када генеративни ток садржи и научени кодек и генератор у латентном простору, али извор погоршања квалитета излаза није јасан.
Генерисање текста помоћу компримованих и дискретних латентних репрезентација
Верност реконструкције кодеком у генеративним токовима обраде
Моделовање језика маскираном дифузијом у простору кодова
Локализација уског грла и оцењивање доследно фазама
Провера побољшања посредних мера у латентном простору на декодираном тексту
Ограничења
- Емпиријска студија користи искључиво TinyStories.
- Главна анализа обухвата један агресиван режим компресије 64-на-16.
- Вредновани систем спаја једну хијерархијску породицу VQ-VAE-2 кодека с једним MDLM генератором.
- Поређења се заснивају на појединачним покретањима и описна су, а не статистичке процене добијене употребом више почетних вредности.
- Екстерна перплексија модела GPT-2 заједничка је дијагностичка мера, а не универзална метрика семантичког квалитета.
- Закључке не треба непосредно преносити на све скупове података, архитектуре кодека или степене компресије.
Референце цитиране у раду
Ове ставке одговарају нумерисаном одељку References у PDF верзији рада.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Ресурси и репродуктивност
- Издавач
- IEEE
- Ресурси публикације
- Овде су доступни јавни рукопис, табеле резултата, илустративна слика и датотеке за цитирање. Имплементациони код и контролне тачке нису јавно објављени.
Изјава о подацима
- Извор
- TinyStories, како је описан у раду.
- Лиценца
- Употреба скупа TinyStories и даље подлеже условима самог скупа података; овај сајт не дистрибуира његове датотеке.
- Претходна обрада
- Токенизација модела GPT-2, улази фиксне дужине од 64 токена и хијерархијска временска компресија са 64 на 32, па на 16 положаја.
- Подела
- Публикација наводи 256 упарених узорака реконструкције и 251–256 генерисаних узорака по режиму; не објављује поновљиво употребљив манифест поделе на скуп за обучавање и валидацију.
- Формат
- Узорци кратког текста, низови GPT-2 токена, низови дискретних кодова, дневници генерисања и збирне табеле.
- Верзија / контролни збир
- У раду није наведен контролни збир скупа података нити идентификатор непроменљивог снимка TinyStories.
- Прибављање
- Уз страницу публикације није објављена јавна скрипта за прибављање података.
- Ограничења употребе
- Докази обухватају кратке синтетичке приче и не треба их сматрати референтним тестом за неограничено генерисање природног језика.
Верзије
- Објављена верзијаIEEE / FRUCT, 2026
- Запис на arXiv-уОтвори запис препринта, arXiv:2607.24176
- Индекс истраживања вештачке интелигенцијеСтраница рада на платформи Hugging Face са потврђеним идентитетом првог аутора и повезаним сажетком резултата
- Рукопис аутораЛокални PDF са доступним текстом
- Излагање на конференцијиПрезентација на FRUCT 39
- Индекс зборника радова конференцијеЗванични зборник FRUCT 39
- PDF зборника радова конференцијеОтворено доступан цео текст на FRUCT-у
- Отвори научни записOpenAlex
- Запис у графу цитатаSemantic Scholar
- Пун текст који је аутор поделиоResearchGate
Објављени DOI је примарни библиографски идентификатор. Ова страница остаје једини канонски URL пројекта у свим верзијама.