Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Hvor kvaliteten svigter i komprimeret korttekstgenerering: trinvis lokalisering af flaskehalse
En trinvis diagnose af komprimeret korttekstgenerering, der adskiller tab ved codec-rekonstruktion fra tab ved latent generering.
Læs hele artiklen i HTMLSøgbar tekst med formler, tabeller, figurer og referencer.
Endeligt accepteret manuskript (forfatterpubliceret version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Vilkår for offentliggørelse og genbrug.
Artiklen på 30 sekunder
ForskningsspørgsmålHvordan kan kvalitetstab i en pipeline til komprimeret tekstgenerering henføres særskilt til codec'et og den latente generator?
Problemstilling
Ved generering af komprimerede korte tekster kan mangelfuld afkodet tekst skyldes informationstab i codec'et eller utilstrækkelig generering i det latente rum. Samlede end-to-end-målinger udvisker forskellen mellem fejltyperne og kan lede optimeringsindsatsen mod den forkerte komponent.
Tilgang
Den trinvise protokol evaluerer originaltekster, parrede codec-rekonstruktioner, MDLM-output i tokenrummet og diffusionsoutput i koderummet med den samme eksterne GPT-2-evaluator. Mål for kodebog og geometri bruges som diagnostik og ikke som erstatning for kvaliteten af den afkodede tekst.
Hovedresultat
Codec-rekonstruktion øger den eksterne medianperpleksitet fra 15.17 til 27.36 og p95 fra 25.10 til 98.91. MDLM i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med MDLM i tokenrummet.
Hvorfor det er vigtigt
Resultatet omsætter diagnosticering af codec-flaskehalse til en konkret arbejdsrækkefølge: Forbedr først codec'et, sammenlign derefter generering i tokenrummet og koderummet, og tillæg kun forbedringer i latente proxymål betydning, når den afkodede tekst også bliver bedre.
Resumé
Generatorer af komprimerede korte tekster kan svigte to forskellige steder: Codec'et kan kassere information, før genereringen begynder, eller den latente generator kan frembringe mangelfulde koder. Uden en adskillelse af disse fejltyper risikerer forskere at bruge beregningsressourcer på den forkerte komponent. Vi undersøger problemet i et kontrolleret TinyStories-casestudie med komprimering fra 64 til 16, baseret på et hierarkisk VQ-VAE-2-codec og en generator med maskeret diskret diffusion (MDLM). En trinvis valideringsprotokol adskiller codec-rekonstruktionens kvalitet, kvaliteten af den latente generering og supplerende diagnostik af de latente repræsentationer under den samme eksterne GPT-2-evaluator; desuden rapporterer vi supplerende semantiske mål i geometriundersøgelsen. I den afprøvede konfiguration øger codec-rekonstruktionen alene den eksterne medianperpleksitet fra 15.17 til 27.36 (+80.4%) og p95 fra 25.10 til 98.91 (+294.1%). Det dominerende kvalitetstab opstår således, før den latente generering begynder. Med den samme evaluator er MDLM i koderummet fortsat markant bedre end diffusion i tokenrummet og reducerer henholdsvis gennemsnit, median og p95 med 32.9%, 30.9% og 36.6%. Geometribevidst regularisering forbedrer lokale proxymål i det latente rum, men ikke målene for afkodet tekst i de tilgængelige kørsler. Bidraget er metodisk snarere end algoritmisk: Artiklen præsenterer en genanvendelig, trinvis diagnose af én konkret pipeline og viser, at det praktiske kvalitetsloft i denne konfiguration bestemmes af codec'ets rekonstruktionskvalitet snarere end af den latente afstøjning.
Udgivet på 2026 39th Conference of Open Innovations Association (FRUCT)
Bidragstype Diagnostisk metodik
nummer 1s. 69–76Hovedkonference
Hovedresultater
| Evalueringspunkt | n | Gennemsnitlig PPL | Median-PPL | p95-PPL |
|---|---|---|---|---|
| Originaltekster | 256 | 16.24 | 15.17 | 25.1 |
| Kodekrekonstruktioner | 256 | 37.26 | 27.36 | 98.91 |
| AR-baseline | 251 | 30.98 | 23.27 | 56.11 |
| MDLM i tokenrummet | 256 | 44.74 | 38.42 | 93.6 |
| MDLM i koderummet | 256 | 30.01 | 26.55 | 59.36 |
Hovedresultat. Størstedelen af det observerede kvalitetstab opstår før genereringen; diffusion i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med diffusion i tokenrummet.
- Datasæt
- TinyStories
- Stikprøvestørrelse
- 256 parrede rekonstruktionsstikprøver; 251–256 genererede stikprøver pr. tilstand; fire matchede geometriindstillinger.
- Metrikker
- Ekstern GPT-2-perpleksitet: gennemsnit, median, p95 og maksimum; brug af kodebog og støttemængdens størrelse; SBERT, BERTScore, MAUVE og et resumé fra en LLM-bedømmer for geometrikørsler
- Usikkerhed
- De rapporterede sammenligninger er deskriptive enkeltkørsler; konfidensintervaller og signifikansestimater på tværs af flere seeds blev ikke beregnet.
- Betingelser
- GPT-2-tokensekvenser med en længde på 64, komprimeret til 16 koder på øverste niveau med en hierarkisk VQ-VAE-2; alle genereringstilstande anvender den fælles eksterne bedømmer.
Hent resultater:CSVJSONMarkdownEksternt spejl:Hugging Face-datasætkort
PDF og citation
Citér artiklen BibTeX er det anbefalede format. Alle varianter nedenfor genereres ud fra den samme publikationspost.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Citationsfiler:APA-tekstIEEE-tekstRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata-XMLFuldtekst i JATS 1.4 XMLRDF TurtleLinksæt (JSON)Linksæt (HTTP)RO-Crate
Komplet vejledning
Komplet forskningsvejledning
Metode
Artiklen anvender én evaluator på tværs af tre evalueringstrin, så hver yderligere transformation kan forbindes med en målbar kvalitetsforskel.
Rekonstruér
Indkod hver TinyStories-prøve på 64 tokens som 16 koder på øverste niveau, og afkod den straks for at måle codec-rekonstruktionstabet.
Generér
Generér enten teksttokens eller diskrete latente koder med MDLM, og afkod derefter prøver fra koderummet gennem den samme trænede codec.
Sammenlign
Bedøm originaler, rekonstruktioner og genererede tekster med den samme eksterne GPT-2-protokol, herunder statistik for median og fordelingshaler.
Hovedidé
En efterfølgende generator kan ikke genskabe information, som codec'et allerede har kasseret. Rekonstruktionstrinnet skal derfor undersøges, før resultaterne af den latente generering fortolkes.
Forskel fra beslægtede tilgange
Standardiserede end-to-end-sammenligninger rapporterer én afsluttende genereringsscore. Denne protokol indfører et parvist kontrolpunkt for rekonstruktion og adskiller tilstandsmål i det latente rum fra evidens baseret på afkodet tekst.
Hvad er nyt?
Bidraget er en genanvendelig, trinvis diagnostisk metode til én konkret pipeline for komprimeret tekst, ikke en ny afstøjningsalgoritme.
Spørgsmål, som denne artikel bidrager til at besvare
Åbn et spørgsmål for at få et kort svar med grundlag i artiklen. De detaljerede evidensgrænser fremgår af Begrænsninger.
Hvor opstår kvalitetstabet ved generering af komprimeret korttekst?
I den afprøvede TinyStories-pipeline med komprimering fra 64 til 16 optræder den dominerende forringelse ved codec-rekonstruktionen, før den latente generering begynder. Den eksterne GPT-2-medianperpleksitet stiger fra 15.17 for originalteksten til 27.36 efter rekonstruktion, mens p95 stiger fra 25.10 til 98.91. Dette resultat gælder én konfiguration og udgør ikke en universel rangordning af codecs.
Hvordan kan codec-tab adskilles fra tab ved generering i det latente rum?
Den trinvise protokol evaluerer originaler, parrede codec-rekonstruktioner og den endeligt genererede tekst med én fælles ekstern evaluator. Forskellen mellem original og rekonstruktion estimerer codec'ets bidrag, mens sammenligningen mellem rekonstruktion og genereret output bidrager til at lokalisere det yderligere genereringstab. Metrikker for det latente rums tilstand rapporteres adskilt fra evidensen i den afkodede tekst.
Hvordan bør tekstgenerering med diskrete latente repræsentationer evalueres?
Artiklen anbefaler at kontrollere rekonstruktionsnøjagtigheden, før generatorer sammenlignes, at anvende den samme evaluator for afkodet tekst på hvert trin og at rapportere central- og halestatistik. Den behandler desuden brug af kodebog, geometri og andre latente proxymål som diagnostik frem for erstatninger for kvaliteten af den afkodede tekst.
Klarer diffusion i koderummet sig bedre end diffusion i tokenrummet?
Med den fælles evaluator og den afprøvede opsætning reducerer MDLM i koderummet henholdsvis gennemsnitlig, median og p95-perpleksitet med 32.9%, 30.9% og 36.6% sammenlignet med MDLM i tokenrummet. Sammenligningen er deskriptiv og konfigurationsspecifik: Den fastslår ikke en universel rangordning på tværs af datasæt, komprimeringsforhold, codecs eller diffusionsarkitekturer.
Garanterer bedre mål for latent geometri bedre genereret tekst?
Nej. I de tilgængelige matchede kørsler forbedrede geometribevidst regularisering lokale proxyer i det latente rum, men ikke metrikkerne for afkodet tekst. Resultatet taler for, at enhver proxyforbedring efterprøves på det endelige afkodede output, og at manglende overførsel betragtes som et nyttigt negativt resultat frem for som evidens for bedre generering.
Sammenligning med beslægtede tilgange
| Tilgang | Repræsentation | Styring/diagnose | Hvad bevares eller måles? |
|---|---|---|---|
| Diffusion i tokenrummet | Teksttokens | Genereringskvalitet i tokenrummet | Flydende sprog og bedømmerens adfærd ved direkte generering |
| Komprimeret latent generering | Diskrete latente koder via en codec | Endelig ende-til-ende-kvalitet af genereringen | Samspillet mellem kodekken og den latente generator |
| Trinvis lokalisering af flaskehalse | Tekst, codec-rekonstruktioner og diskrete latente repræsentationer | Adskil codec-tab fra genereringstab | Hvor kvaliteten forringes under én fælles evaluator |
Sammenligningen skelner mellem evalueringsomfang og evidens; den udgør ikke en universel rangordning af tilgangene.
Relevans og afgrænsning
Den trinvise protokol er nyttig, når en generativ pipeline både indeholder et indlært codec og en generator i det latente rum, men årsagen til den forringede outputkvalitet er uklar.
Komprimeret tekstgenerering med diskrete latente repræsentationer
Kvaliteten af codec-rekonstruktion i generative pipelines
Maskeret diffusionssprogmodellering i kode-rummet
Lokalisering af flaskehalse og trinkonsistent evaluering
Revision af forbedringer i proxy-mål i latentrummet op imod afkodet tekst
Begrænsninger
- Den empiriske undersøgelse omfatter kun TinyStories.
- Hovedanalysen omfatter ét aggressivt kompressionsregime fra 64 til 16.
- Det evaluerede system kombinerer én hierarkisk VQ-VAE-2-codecfamilie med én MDLM-generator.
- Sammenligningerne bygger på enkeltkørsler og er deskriptive snarere end statistiske estimater baseret på flere randomiseringsfrø.
- Ekstern GPT-2-perpleksitet er et fælles diagnostisk mål, ikke en universel metrik for semantisk kvalitet.
- Konklusionerne kan ikke uden videre overføres til andre datasæt, codec-arkitekturer eller komprimeringsforhold.
Referencer citeret i artiklen
Disse poster svarer til den nummererede referenceliste i artiklens PDF.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Ressourcer og reproducerbarhed
- Forlag
- IEEE
- Publikationsressourcer
- Det offentlige manuskript, resultattabellerne, den forklarende figur og citationsfilerne er tilgængelige her. Implementeringskode og kontrolpunkter er ikke offentliggjort.
Dataerklæring
- Kilde
- TinyStories, som beskrevet i artiklen.
- Licens
- Anvendelsen af TinyStories er fortsat underlagt datasættets egne vilkår; dette websted videredistribuerer ingen datasætfiler.
- Forbehandling
- GPT-2-tokenisering, faste input på 64 tokens og hierarkisk tidslig komprimering fra 64 til 32 til 16 positioner.
- Opdeling
- Publikationen rapporterer 256 parvise rekonstruktionsprøver og 251–256 genererede prøver pr. tilstand; den offentliggør ikke et genanvendeligt manifest over opdelingen mellem trænings- og valideringsdata.
- Format
- Korte tekstprøver, GPT-2-tokensekvenser, diskrete kodesekvenser, genereringslogge og oversigtstabeller.
- Version / kontrolsum
- Artiklen angiver hverken en kontrolsum for datasættet eller en uforanderlig snapshot-identifikator for TinyStories.
- Indsamling
- Der offentliggøres ikke et offentligt indsamlingsscript sammen med publikationssiden.
- Begrænsninger for anvendelse
- Evidensen omfatter korte syntetiske fortællinger og bør ikke betragtes som et benchmark for ubegrænset generering af naturligt sprog.
Versioner
- Udgivet versionIEEE / FRUCT, 2026
- arXiv-postÅbn preprintposten, arXiv:2607.24176
- ForfattermanuskriptLokal PDF med tekstadgang
- KonferenceforedragFRUCT 39-præsentation
- Indeks over konferenceartiklerOfficielt FRUCT 39-bind
- PDF med konferenceartiklerFRUCT-fuldtekst med fri adgang
- Åbn den videnskabelige postOpenAlex
- Post i citationsgrafenSemantic Scholar
- Fuldtekst delt af forfatterenResearchGate
Den offentliggjorte DOI er den primære bibliografiske identifikator. Denne side forbliver projektets eneste kanoniske URL på tværs af versioner.