Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Hvor kvaliteten svigter i komprimeret korttekstgenerering: trinvis lokalisering af flaskehalse

En trinvis diagnose af komprimeret korttekstgenerering, der adskiller tab ved codec-rekonstruktion fra tab ved latent generering.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Sankt Petersborg, Rusland

Læs hele artiklen i HTMLSøgbar tekst med formler, tabeller, figurer og referencer.

Endeligt accepteret manuskript (forfatterpubliceret version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Vilkår for offentliggørelse og genbrug.

Artiklen på 30 sekunder

ForskningsspørgsmålHvordan kan kvalitetstab i en pipeline til komprimeret tekstgenerering henføres særskilt til codec'et og den latente generator?

Problemstilling

Ved generering af komprimerede korte tekster kan mangelfuld afkodet tekst skyldes informationstab i codec'et eller utilstrækkelig generering i det latente rum. Samlede end-to-end-målinger udvisker forskellen mellem fejltyperne og kan lede optimeringsindsatsen mod den forkerte komponent.

Tilgang

Den trinvise protokol evaluerer originaltekster, parrede codec-rekonstruktioner, MDLM-output i tokenrummet og diffusionsoutput i koderummet med den samme eksterne GPT-2-evaluator. Mål for kodebog og geometri bruges som diagnostik og ikke som erstatning for kvaliteten af den afkodede tekst.

Hovedresultat

Codec-rekonstruktion øger den eksterne medianperpleksitet fra 15.17 til 27.36 og p95 fra 25.10 til 98.91. MDLM i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med MDLM i tokenrummet.

Hvorfor det er vigtigt

Resultatet omsætter diagnosticering af codec-flaskehalse til en konkret arbejdsrækkefølge: Forbedr først codec'et, sammenlign derefter generering i tokenrummet og koderummet, og tillæg kun forbedringer i latente proxymål betydning, når den afkodede tekst også bliver bedre.

Resumé

Generatorer af komprimerede korte tekster kan svigte to forskellige steder: Codec'et kan kassere information, før genereringen begynder, eller den latente generator kan frembringe mangelfulde koder. Uden en adskillelse af disse fejltyper risikerer forskere at bruge beregningsressourcer på den forkerte komponent. Vi undersøger problemet i et kontrolleret TinyStories-casestudie med komprimering fra 64 til 16, baseret på et hierarkisk VQ-VAE-2-codec og en generator med maskeret diskret diffusion (MDLM). En trinvis valideringsprotokol adskiller codec-rekonstruktionens kvalitet, kvaliteten af den latente generering og supplerende diagnostik af de latente repræsentationer under den samme eksterne GPT-2-evaluator; desuden rapporterer vi supplerende semantiske mål i geometriundersøgelsen. I den afprøvede konfiguration øger codec-rekonstruktionen alene den eksterne medianperpleksitet fra 15.17 til 27.36 (+80.4%) og p95 fra 25.10 til 98.91 (+294.1%). Det dominerende kvalitetstab opstår således, før den latente generering begynder. Med den samme evaluator er MDLM i koderummet fortsat markant bedre end diffusion i tokenrummet og reducerer henholdsvis gennemsnit, median og p95 med 32.9%, 30.9% og 36.6%. Geometribevidst regularisering forbedrer lokale proxymål i det latente rum, men ikke målene for afkodet tekst i de tilgængelige kørsler. Bidraget er metodisk snarere end algoritmisk: Artiklen præsenterer en genanvendelig, trinvis diagnose af én konkret pipeline og viser, at det praktiske kvalitetsloft i denne konfiguration bestemmes af codec'ets rekonstruktionskvalitet snarere end af den latente afstøjning.

Udgivet på 2026 39th Conference of Open Innovations Association (FRUCT)

Bidragstype Diagnostisk metodik

nummer 1s. 69–76Hovedkonference

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Del denne artikelDel

Hovedresultater

Nøgleresultater fra Hvor kvaliteten svigter ved generering af komprimeret korttekst: Trinvis lokalisering af flaskehalse
EvalueringspunktnGennemsnitlig PPLMedian-PPLp95-PPL
Originaltekster25616.2415.1725.1
Kodekrekonstruktioner25637.2627.3698.91
AR-baseline25130.9823.2756.11
MDLM i tokenrummet25644.7438.4293.6
MDLM i koderummet25630.0126.5559.36

Hovedresultat. Størstedelen af det observerede kvalitetstab opstår før genereringen; diffusion i koderummet reducerer dog fortsat medianperpleksiteten med 30.9% sammenlignet med diffusion i tokenrummet.

Datasæt
TinyStories
Stikprøvestørrelse
256 parrede rekonstruktionsstikprøver; 251–256 genererede stikprøver pr. tilstand; fire matchede geometriindstillinger.
Metrikker
Ekstern GPT-2-perpleksitet: gennemsnit, median, p95 og maksimum; brug af kodebog og støttemængdens størrelse; SBERT, BERTScore, MAUVE og et resumé fra en LLM-bedømmer for geometrikørsler
Usikkerhed
De rapporterede sammenligninger er deskriptive enkeltkørsler; konfidensintervaller og signifikansestimater på tværs af flere seeds blev ikke beregnet.
Betingelser
GPT-2-tokensekvenser med en længde på 64, komprimeret til 16 koder på øverste niveau med en hierarkisk VQ-VAE-2; alle genereringstilstande anvender den fælles eksterne bedømmer.

PDF og citation

Citér artiklen BibTeX er det anbefalede format. Alle varianter nedenfor genereres ud fra den samme publikationspost.

Åbn PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Hent .bib

Citationsfiler:APA-tekstIEEE-tekstRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata-XMLFuldtekst i JATS 1.4 XMLRDF TurtleLinksæt (JSON)Linksæt (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Komplet vejledning

Komplet forskningsvejledning

Metode

Artiklen anvender én evaluator på tværs af tre evalueringstrin, så hver yderligere transformation kan forbindes med en målbar kvalitetsforskel.

  1. Rekonstruér

    Indkod hver TinyStories-prøve på 64 tokens som 16 koder på øverste niveau, og afkod den straks for at måle codec-rekonstruktionstabet.

  2. Generér

    Generér enten teksttokens eller diskrete latente koder med MDLM, og afkod derefter prøver fra koderummet gennem den samme trænede codec.

  3. Sammenlign

    Bedøm originaler, rekonstruktioner og genererede tekster med den samme eksterne GPT-2-protokol, herunder statistik for median og fordelingshaler.

Trinvis pipeline til komprimeret tekstgenerering, der sammenligner originaltekst, codec-rekonstruktion, MDLM i koderummet og afkodet tekst for at adskille codec-tab fra genereringstab.
Trinvis lokalisering af flaskehalse adskiller tab ved codec-rekonstruktion fra tab ved latent generering under én fælles evalueringsprotokol for afkodet tekst.Kilde: Forklarende diagram udarbejdet af forfatteren på grundlag af den publicerede metode og resultaterne..Vilkår for genbrug: CC BY 4.0.Foreslået kreditering: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Hent SVG.

Hovedidé

En efterfølgende generator kan ikke genskabe information, som codec'et allerede har kasseret. Rekonstruktionstrinnet skal derfor undersøges, før resultaterne af den latente generering fortolkes.

Forskel fra beslægtede tilgange

Standardiserede end-to-end-sammenligninger rapporterer én afsluttende genereringsscore. Denne protokol indfører et parvist kontrolpunkt for rekonstruktion og adskiller tilstandsmål i det latente rum fra evidens baseret på afkodet tekst.

Hvad er nyt?

Bidraget er en genanvendelig, trinvis diagnostisk metode til én konkret pipeline for komprimeret tekst, ikke en ny afstøjningsalgoritme.

Spørgsmål, som denne artikel bidrager til at besvare

Åbn et spørgsmål for at få et kort svar med grundlag i artiklen. De detaljerede evidensgrænser fremgår af Begrænsninger.

  1. Hvor opstår kvalitetstabet ved generering af komprimeret korttekst?

    I den afprøvede TinyStories-pipeline med komprimering fra 64 til 16 optræder den dominerende forringelse ved codec-rekonstruktionen, før den latente generering begynder. Den eksterne GPT-2-medianperpleksitet stiger fra 15.17 for originalteksten til 27.36 efter rekonstruktion, mens p95 stiger fra 25.10 til 98.91. Dette resultat gælder én konfiguration og udgør ikke en universel rangordning af codecs.

  2. Hvordan kan codec-tab adskilles fra tab ved generering i det latente rum?

    Den trinvise protokol evaluerer originaler, parrede codec-rekonstruktioner og den endeligt genererede tekst med én fælles ekstern evaluator. Forskellen mellem original og rekonstruktion estimerer codec'ets bidrag, mens sammenligningen mellem rekonstruktion og genereret output bidrager til at lokalisere det yderligere genereringstab. Metrikker for det latente rums tilstand rapporteres adskilt fra evidensen i den afkodede tekst.

  3. Hvordan bør tekstgenerering med diskrete latente repræsentationer evalueres?

    Artiklen anbefaler at kontrollere rekonstruktionsnøjagtigheden, før generatorer sammenlignes, at anvende den samme evaluator for afkodet tekst på hvert trin og at rapportere central- og halestatistik. Den behandler desuden brug af kodebog, geometri og andre latente proxymål som diagnostik frem for erstatninger for kvaliteten af den afkodede tekst.

  4. Klarer diffusion i koderummet sig bedre end diffusion i tokenrummet?

    Med den fælles evaluator og den afprøvede opsætning reducerer MDLM i koderummet henholdsvis gennemsnitlig, median og p95-perpleksitet med 32.9%, 30.9% og 36.6% sammenlignet med MDLM i tokenrummet. Sammenligningen er deskriptiv og konfigurationsspecifik: Den fastslår ikke en universel rangordning på tværs af datasæt, komprimeringsforhold, codecs eller diffusionsarkitekturer.

  5. Garanterer bedre mål for latent geometri bedre genereret tekst?

    Nej. I de tilgængelige matchede kørsler forbedrede geometribevidst regularisering lokale proxyer i det latente rum, men ikke metrikkerne for afkodet tekst. Resultatet taler for, at enhver proxyforbedring efterprøves på det endelige afkodede output, og at manglende overførsel betragtes som et nyttigt negativt resultat frem for som evidens for bedre generering.

Sammenligning med beslægtede tilgange

Faktuel sammenligning af Hvor kvaliteten svigter ved generering af komprimeret korttekst: Trinvis lokalisering af flaskehalse med beslægtede tilgange
TilgangRepræsentationStyring/diagnoseHvad bevares eller måles?
Diffusion i tokenrummetTeksttokensGenereringskvalitet i tokenrummetFlydende sprog og bedømmerens adfærd ved direkte generering
Komprimeret latent genereringDiskrete latente koder via en codecEndelig ende-til-ende-kvalitet af genereringenSamspillet mellem kodekken og den latente generator
Trinvis lokalisering af flaskehalseTekst, codec-rekonstruktioner og diskrete latente repræsentationerAdskil codec-tab fra genereringstabHvor kvaliteten forringes under én fælles evaluator

Sammenligningen skelner mellem evalueringsomfang og evidens; den udgør ikke en universel rangordning af tilgangene.

Relevans og afgrænsning

Den trinvise protokol er nyttig, når en generativ pipeline både indeholder et indlært codec og en generator i det latente rum, men årsagen til den forringede outputkvalitet er uklar.

  1. Komprimeret tekstgenerering med diskrete latente repræsentationer

  2. Kvaliteten af codec-rekonstruktion i generative pipelines

  3. Maskeret diffusionssprogmodellering i kode-rummet

  4. Lokalisering af flaskehalse og trinkonsistent evaluering

  5. Revision af forbedringer i proxy-mål i latentrummet op imod afkodet tekst

Se begrænsninger og evidensgrænser

Begrænsninger

  • Den empiriske undersøgelse omfatter kun TinyStories.
  • Hovedanalysen omfatter ét aggressivt kompressionsregime fra 64 til 16.
  • Det evaluerede system kombinerer én hierarkisk VQ-VAE-2-codecfamilie med én MDLM-generator.
  • Sammenligningerne bygger på enkeltkørsler og er deskriptive snarere end statistiske estimater baseret på flere randomiseringsfrø.
  • Ekstern GPT-2-perpleksitet er et fælles diagnostisk mål, ikke en universel metrik for semantisk kvalitet.
  • Konklusionerne kan ikke uden videre overføres til andre datasæt, codec-arkitekturer eller komprimeringsforhold.

Referencer citeret i artiklen

Disse poster svarer til den nummererede referenceliste i artiklens PDF.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Ressourcer og reproducerbarhed

Forlag
IEEE
Publikationsressourcer
Det offentlige manuskript, resultattabellerne, den forklarende figur og citationsfilerne er tilgængelige her. Implementeringskode og kontrolpunkter er ikke offentliggjort.

Dataerklæring

Kilde
TinyStories, som beskrevet i artiklen.
Licens
Anvendelsen af TinyStories er fortsat underlagt datasættets egne vilkår; dette websted videredistribuerer ingen datasætfiler.
Forbehandling
GPT-2-tokenisering, faste input på 64 tokens og hierarkisk tidslig komprimering fra 64 til 32 til 16 positioner.
Opdeling
Publikationen rapporterer 256 parvise rekonstruktionsprøver og 251–256 genererede prøver pr. tilstand; den offentliggør ikke et genanvendeligt manifest over opdelingen mellem trænings- og valideringsdata.
Format
Korte tekstprøver, GPT-2-tokensekvenser, diskrete kodesekvenser, genereringslogge og oversigtstabeller.
Version / kontrolsum
Artiklen angiver hverken en kontrolsum for datasættet eller en uforanderlig snapshot-identifikator for TinyStories.
Indsamling
Der offentliggøres ikke et offentligt indsamlingsscript sammen med publikationssiden.
Begrænsninger for anvendelse
Evidensen omfatter korte syntetiske fortællinger og bør ikke betragtes som et benchmark for ubegrænset generering af naturligt sprog.

Versioner

  1. Udgivet versionIEEE / FRUCT, 2026
  2. ForfattermanuskriptLokal PDF med tekstadgang
  3. KonferenceforedragFRUCT 39-præsentation
  4. Indeks over konferenceartiklerOfficielt FRUCT 39-bind
  5. PDF med konferenceartiklerFRUCT-fuldtekst med fri adgang
  6. Åbn den videnskabelige postOpenAlex
  7. Post i citationsgrafenSemantic Scholar
  8. Fuldtekst delt af forfatterenResearchGate

Den offentliggjorte DOI er den primære bibliografiske identifikator. Denne side forbliver projektets eneste kanoniske URL på tværs af versioner.