Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Kde sa stráca kvalita pri generovaní komprimovaných krátkych textov: etapová lokalizácia úzkeho miesta
Etapová diagnostika generovania komprimovaných krátkych textov, ktorá oddeľuje stratu pri rekonštrukcii kodekom od straty pri generovaní latentných reprezentácií.
Prečítať celý článok vo formáte HTMLPrehľadávateľný text so vzorcami, tabuľkami, obrázkami a bibliografickými odkazmi.
Konečný prijatý rukopis (verzia zverejnená autorom s DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Podmienky zverejnenia a opätovného použitia.
Článok za 30 sekúnd
Výskumná otázkaAko možno pokles kvality v procese generovania komprimovaného textu samostatne pripísať kodeku a latentnému generátoru?
Problém
Pri generovaní komprimovaného krátkeho textu môže nízka kvalita dekódovaného textu vyplývať zo straty informácií v kodeku alebo zo slabého generovania v latentnom priestore. Celkové metriky tieto režimy zlyhania stierajú a môžu nasmerovať optimalizačné úsilie na nesprávny komponent.
Prístup
Etapový protokol hodnotí originály, párové rekonštrukcie kodekom, výstupy MDLM v priestore tokenov a výstupy difúzie v priestore kódov pomocou jedného externého hodnotiteľa GPT-2. Miery kódovej knihy a geometrie zostávajú diagnostickými ukazovateľmi, nie náhradou za kvalitu dekódovaného textu.
Hlavný výsledok
Rekonštrukcia kodeku zvyšuje medián externej perplexity z 15.17 na 27.36 a p95 z 25.10 na 98.91. MDLM v priestore kódov napriek tomu znižuje medián perplexity o 30.9% oproti MDLM v priestore tokenov.
Prečo je to dôležité
Výsledok premieňa diagnostiku úzkeho miesta kodeku na praktické poradie krokov: najprv zlepšiť kodek, potom porovnať generovanie v priestore tokenov a v priestore kódov a zlepšeniam zástupných ukazovateľov v latentnom priestore dôverovať iba vtedy, keď sa zlepší aj dekódovaný text.
Abstrakt
Generátory komprimovaných krátkych textov môžu zlyhať na dvoch rôznych miestach: kodek môže zahodiť informácie ešte pred začiatkom generovania alebo latentný generátor môže vytvárať nekvalitné kódy. Bez oddelenia týchto spôsobov zlyhania môžu výskumníci vynakladať výpočtové zdroje na zlepšovanie nesprávneho komponentu. Tento problém skúmame v kontrolovanej prípadovej štúdii TinyStories s kompresiou zo 64 na 16, založenej na hierarchickom kodeku VQ-VAE-2 a generátore s maskovanou diskrétnou difúziou (MDLM). Používame etapový validačný protokol, ktorý pri jednom spoločnom externom hodnotiacom modeli GPT-2 oddeľuje vernosť rekonštrukcie kodeku, kvalitu generovania latentných reprezentácií a pomocnú diagnostiku latentných reprezentácií; zároveň uvádzame doplnkové sémantické metriky pre štúdium geometrie. V testovanej konfigurácii samotná rekonštrukcia kodeku zvyšuje medián externej perplexity z 15.17 na 27.36 (+80.4%) a p95 z 25.10 na 98.91 (+294.1%), čo naznačuje, že dominantná strata kvality vzniká ešte pred začiatkom latentného generovania. Pri rovnakom hodnotiacom modeli zostáva MDLM v priestore kódov výrazne lepší než difúzia v priestore tokenov a znižuje priemer, medián a p95 postupne o 32.9%, 30.9% a 36.6%. Regularizácia zohľadňujúca geometriu zlepšuje lokálne zástupné ukazovatele latentných reprezentácií, no v dostupných behoch nezlepšuje metriky dekódovaného textu. Prínos je skôr metodologický než algoritmický: práca predstavuje opakovane použiteľnú etapovú diagnostiku jedného konkrétneho postupu a ukazuje, že v tomto prostredí určuje praktický strop kvality skôr vernosť kodeku než odšumovanie latentných reprezentácií.
Miesto publikovania 2026 39th Conference of Open Innovations Association (FRUCT)
Typ prínosu Diagnostická metodika
číslo 1s. 69–76Hlavná konferencia
Kľúčové výsledky
| Bod hodnotenia | n | Priemerná PPL | Medián PPL | p95 PPL |
|---|---|---|---|---|
| Pôvodné texty | 256 | 16.24 | 15.17 | 25.1 |
| Rekonštrukcie kodeku | 256 | 37.26 | 27.36 | 98.91 |
| Referenčný model AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM v priestore tokenov | 256 | 44.74 | 38.42 | 93.6 |
| MDLM v priestore kódov | 256 | 30.01 | 26.55 | 59.36 |
Kľúčový výsledok. Väčšina pozorovanej straty kvality vzniká pred generovaním; difúzia v priestore kódov napriek tomu znižuje medián perplexity o 30.9% v porovnaní s difúziou v priestore tokenov.
- Dátová množina
- TinyStories
- Veľkosť vzorky
- 256 párových vzoriek rekonštrukcie; 251 až 256 generovaných vzoriek na režim; štyri zhodné nastavenia geometrie.
- Metriky
- Externá perplexita GPT-2: priemer, medián, p95 a maximum; využitie číselníka kódov a veľkosť nosiča; SBERT, BERTScore, MAUVE a súhrn hodnotenia modelom LLM pre experimenty s geometriou
- Neistota
- Uvádzané porovnania predstavujú opisné jednotlivé behy; intervaly spoľahlivosti ani odhady významnosti založené na viacerých počiatočných nastaveniach sa nevypočítali.
- Podmienky
- Sekvencie tokenov GPT-2 s dĺžkou 64 komprimované hierarchickým modelom VQ-VAE-2 na 16 kódov najvyššej úrovne; všetky režimy generovania používajú spoločný externý hodnotiaci nástroj.
Stiahnuť výsledky:CSVJSONMarkdownExterné zrkadlo:Karta dátového súboru Hugging Face
PDF a citácia
Citovať túto prácu Odporúčaným formátom je BibTeX. Všetky nižšie uvedené varianty sa generujú z rovnakého publikačného záznamu.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Citačné súbory:Text podľa APAText podľa normy IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadáta XML podľa JATS 1.4Plný text vo formáte JATS 1.4 XMLRDF TurtleSúbor odkazov (JSON)Súbor odkazov (HTTP)RO-Crate
Úplná príručka
Úplná výskumná príručka
Metóda
Článok používa vo všetkých troch fázach hodnotenia jediný hodnotiaci nástroj, aby bolo možné každú ďalšiu transformáciu spojiť s merateľným rozdielom v kvalite.
Rekonštruovať
Každú 64-tokenovú vzorku TinyStories zakódujte do 16 kódov najvyššej úrovne a ihneď ju dekódujte, aby ste zmerali stratu pri rekonštrukcii kodekom.
Generovať
Pomocou MDLM vygenerujte buď textové tokeny, alebo diskrétne latentné kódy a vzorky z priestoru kódov následne dekódujte tým istým natrénovaným kodekom.
Porovnať
Vyhodnotiť pôvodné texty, rekonštrukcie a generované texty rovnakým externým protokolom GPT-2 vrátane mediánu a štatistík chvostov rozdelenia.
Kľúčová myšlienka
Nadväzujúci generátor nedokáže obnoviť informácie, ktoré kodek už zahodil. Pred interpretáciou výsledkov generovania latentných reprezentácií preto treba preveriť fázu rekonštrukcie.
Odlišnosť od príbuzných prístupov
Štandardné porovnania celého reťazca uvádzajú jediné konečné skóre generovania. Tento protokol pridáva párový kontrolný bod rekonštrukcie a oddeľuje diagnostické metriky v latentnom priestore od dôkazov získaných z dekódovaného textu.
Čo je nové
Prínosom je opakovane použiteľná viacfázová diagnostická metodika pre jeden konkrétny reťazec spracovania komprimovaného textu, nie nový algoritmus odstraňovania šumu.
Otázky, na ktoré tento článok pomáha odpovedať
Otvorte otázku a získajte stručnú odpoveď podloženú článkom. Podrobné hranice dôkazov sú uvedené v časti Obmedzenia.
Kde sa pri generovaní komprimovaného krátkeho textu zhoršuje kvalita?
V testovanom procese TinyStories s kompresiou zo 64 na 16 sa hlavné zhoršenie objavuje pri rekonštrukcii kodekom, ešte pred začiatkom generovania v latentnom priestore. Medián externej perplexity modelu GPT-2 sa zvyšuje z 15.17 pri pôvodnom texte na 27.36 po rekonštrukcii, zatiaľ čo p95 rastie z 25.10 na 98.91. Ide o výsledok jednej konfigurácie, nie o všeobecné poradie kodekov.
Ako možno oddeliť stratu spôsobenú kodekom od straty pri generovaní v latentnom priestore?
Etapový protokol hodnotí originály, párové rekonštrukcie kodekom a výsledný vygenerovaný text pomocou jedného spoločného externého hodnotiteľa. Rozdiel medzi originálom a rekonštrukciou odhaduje podiel kodeku, zatiaľ čo porovnanie rekonštrukcie s vygenerovaným výstupom pomáha lokalizovať dodatočnú stratu pri generovaní. Metriky kvality latentnej reprezentácie sa uvádzajú oddelene od dôkazov získaných z dekódovaného textu.
Ako hodnotiť generovanie textu s diskrétnymi latentnými reprezentáciami?
Článok odporúča pred porovnaním generátorov skontrolovať vernosť rekonštrukcie, v každej fáze používať rovnaký hodnotiaci nástroj pre dekódovaný text a uvádzať centrálne aj chvostové štatistiky. Využitie kódovej knihy, geometriu a ďalšie latentné zástupné ukazovatele zároveň chápe ako diagnostiku, nie ako náhradu kvality dekódovaného textu.
Prekonáva difúzia v priestore kódov difúziu v priestore tokenov?
Pri spoločnom hodnotiteľovi a testovanom nastavení znižuje MDLM v priestore kódov priemer, medián a p95 perplexity o 32.9 %, 30.9 % a 36.6 % oproti MDLM v priestore tokenov. Porovnanie je opisné a špecifické pre danú konfiguráciu: neurčuje univerzálne poradie naprieč súbormi údajov, kompresnými pomermi, kodekmi ani architektúrami difúzie.
Zaručujú lepšie metriky geometrie latentného priestoru kvalitnejší generovaný text?
Nie. V dostupných párovaných behoch regularizácia zohľadňujúca geometriu zlepšila lokálne zástupné ukazovatele latentného priestoru, nezlepšila však metriky dekódovaného textu. Výsledok podporuje overovanie každého zlepšenia zástupného ukazovateľa na konečnom dekódovanom výstupe a interpretáciu neprítomnosti prenosu ako užitočného negatívneho výsledku, nie ako dôkazu zlepšenia generovania.
Porovnanie s príbuznými prístupmi
| Prístup | Reprezentácia | Kontrola / diagnostika | Čo sa zachováva alebo meria |
|---|---|---|---|
| Difúzia v priestore tokenov | Textové tokeny | Kvalita generovania v priestore tokenov | Plynulosť priameho generovania a správanie hodnotiaceho nástroja |
| Generovanie komprimovaných latentných reprezentácií | Diskrétne latentné kódy získané pomocou kodeku | Konečná kvalita generovania od vstupu po výstup | Spoločné správanie kodeku a latentného generátora |
| Viacfázová lokalizácia úzkych miest | Text, rekonštrukcie kodekom a diskrétne latentné reprezentácie | Oddeľte stratu kodeku od straty pri generovaní | Kde sa pri jednom spoločnom hodnotiteľovi zhoršuje kvalita |
Porovnanie rozlišuje rozsah hodnotenia a dôkazov; nejde o univerzálne poradie prístupov.
Relevantnosť a rozsah
Etapový protokol je užitočný vtedy, keď generatívny postup zahŕňa naučený kodek aj generátor v latentnom priestore, no príčina zníženej kvality výstupu nie je zrejmá.
Generovanie textu s komprimovanými a diskrétnymi latentnými reprezentáciami
Vernosť rekonštrukcie kodeku v generatívnych postupoch
Jazykové modelovanie pomocou maskovanej difúzie v priestore kódov
Lokalizácia úzkeho miesta a etapovo konzistentné hodnotenie
Overovanie zlepšení zástupných metrík latentného priestoru voči dekódovanému textu
Obmedzenia
- Empirická štúdia používa výlučne TinyStories.
- Hlavná analýza zahŕňa jediný agresívny režim kompresie 64 na 16.
- Hodnotený systém kombinuje jednu rodinu hierarchických kodekov VQ-VAE-2 s jedným generátorom MDLM.
- Porovnania vychádzajú z jednotlivých behov a majú opisný charakter; nejde o štatistické odhady založené na viacerých inicializáciách.
- Externá perplexita GPT-2 je spoločným diagnostickým ukazovateľom, nie univerzálnou metrikou sémantickej kvality.
- Závery nemožno bezprostredne prenášať na všetky dátové množiny, architektúry kodekov ani kompresné pomery.
Literatúra citovaná v článku
Tieto položky zodpovedajú číslovanému zoznamu literatúry v dokumente PDF.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Zdroje a reprodukovateľnosť
- Vydavateľ
- IEEE
- Lokálny text vo formáte PDF
- Konečný prijatý rukopis (verzia zverejnená autorom s DOI)
- Zdroje k publikácii
- Verejný rukopis, tabuľky výsledkov, vysvetľujúci obrázok a citačné súbory sú dostupné na tomto mieste. Implementačný kód ani kontrolné body neboli verejne sprístupnené.
Vyhlásenie o údajoch
- Zdroj
- TinyStories podľa opisu v článku.
- Licencia
- Používanie TinyStories naďalej podlieha vlastným podmienkam súboru údajov; táto lokalita ďalej nešíri žiadne jeho súbory.
- Predspracovanie
- Tokenizácia GPT-2, vstupy s pevnou dĺžkou 64 tokenov a hierarchická časová kompresia zo 64 na 32 a následne na 16 pozícií.
- Rozdelenie
- Publikácia uvádza 256 párových vzoriek rekonštrukcie a 251–256 vygenerovaných vzoriek pre každý režim; opakovane použiteľný manifest rozdelenia na trénovaciu a validačnú množinu nezverejňuje.
- Formát
- Vzorky krátkych textov, sekvencie tokenov GPT-2, sekvencie diskrétnych kódov, záznamy generovania a súhrnné tabuľky.
- Verzia / kontrolný súčet
- Článok neuvádza kontrolný súčet dátového súboru ani nemenný identifikátor snímky TinyStories.
- Získanie údajov
- Na stránke publikácie nie je zverejnený verejný skript na získanie údajov.
- Obmedzenia použitia
- Dôkazy sa týkajú krátkych syntetických príbehov a nemali by sa považovať za referenčné hodnotenie neobmedzeného generovania prirodzeného jazyka.
Verzie
- Publikovaná verziaIEEE / FRUCT, 2026
- Záznam v arXivOtvoriť záznam preprintu, arXiv:2607.24176
- Register výskumu umelej inteligencieStránka článku na Hugging Face s overenou totožnosťou prvého autora a prepojeným súhrnom výsledkov
- Autorský rukopisLokálny dokument PDF s prístupným textom
- Konferenčná prednáškaPrezentácia FRUCT 39
- Register konferenčného zborníkaOficiálny zväzok FRUCT 39
- PDF konferenčného zborníkaVoľne dostupný plný text FRUCT
- Otvoriť odborný záznamOpenAlex
- Záznam citačného grafuSemantic Scholar
- Plný text sprístupnený autoromResearchGate
Publikované DOI je primárnym bibliografickým identifikátorom. Táto stránka zostáva jedinou kanonickou adresou URL projektu naprieč verziami.