Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Hvor kvaliteten svikter i komprimert generering av korte tekster: trinnvis lokalisering av flaskehalser
En trinnvis diagnose av komprimert generering av korte tekster som skiller tap ved kodekrekonstruksjon fra latentgenereringstap.
Les hele artikkelen i HTML-formatSøkbar tekst med formler, tabeller, figurer og referanser.
Endelig akseptert manuskript (forfatterpublisert versjon med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Vilkår for publisering og gjenbruk.
Artikkelen på 30 sekunder
ForskningsspørsmålHvordan kan kvalitetstap i en komprimert pipeline for tekstgenerering tilskrives henholdsvis kodeken og latentgeneratoren?
Problemstilling
Ved generering av komprimert korttekst kan svakheter i den dekodede teksten skyldes informasjon som kodeken har gått glipp av, eller mangelfull generering i latentrommet. Ende-til-ende-målinger visker ut skillet mellom disse feiltypene og kan føre til at optimaliseringsarbeidet rettes mot feil komponent.
Tilnærming
Den trinnvise protokollen skårer originaler, parvise kodekrekonstruksjoner, resultater fra MDLM i tokenrommet og diffusjonsresultater i koderommet med én ekstern GPT-2-evaluator. Mål på kodebok og geometri er fortsatt diagnostiske hjelpemidler, ikke erstatninger for kvaliteten på dekodet tekst.
Hovedresultat
Kodekrekonstruksjon øker median ekstern perpleksitet fra 15.17 til 27.36 og p95 fra 25.10 til 98.91. MDLM i koderommet reduserer likevel median perpleksitet med 30.9% sammenlignet med MDLM i tokenrommet.
Hvorfor dette er viktig
Resultatet gir en praktisk arbeidsrekkefølge for diagnostisering av kodekflaskehalser: Prioriter forbedringer av kodeken, sammenlign deretter generering i tokenrommet og koderommet, og stol bare på forbedringer i latente surrogatmål når den dekodede teksten også blir bedre.
Sammendrag
Generatorer for komprimert korttekst kan svikte på to ulike steder: Kodeken kan forkaste informasjon før genereringen begynner, eller latentgeneratoren kan produsere svake koder. Uten å skille disse feiltypene kan forskere bruke beregningsressurser på å forbedre feil komponent. Vi undersøker problemet i en kontrollert TinyStories-kasus med komprimering fra 64 til 16, bygget på en hierarkisk VQ-VAE-2-kodek og en generator med maskert diskret diffusjon (MDLM). Vi benytter en trinnvis valideringsprotokoll som skiller mellom kodekrekonstruksjonens troskap, kvaliteten på genereringen i latentrommet og supplerende diagnostikk i latentrommet, vurdert med én felles ekstern GPT-2-evalueringsmodell; samtidig rapporterer vi komplementære semantiske mål for geometristudien. I den testede konfigurasjonen øker kodekrekonstruksjonen alene median ekstern perpleksitet fra 15.17 til 27.36 (+80.4%) og p95 fra 25.10 til 98.91 (+294.1%). Dette viser at det dominerende kvalitetstapet oppstår før genereringen i latentrommet begynner. Med samme evalueringsmodell er MDLM i koderommet fortsatt vesentlig bedre enn diffusjon i tokenrommet, med reduksjoner i henholdsvis gjennomsnitt, median og p95 på 32.9%, 30.9% og 36.6%. Geometribevisst regularisering forbedrer lokale surrogatmål i latentrommet, men gir ingen forbedring i målene for dekodet tekst i de tilgjengelige kjøringene. Bidraget er metodisk snarere enn algoritmisk: Artikkelen presenterer en gjenbrukbar, trinnvis diagnostikk for én konkret behandlingskjede og viser at det i denne konfigurasjonen er kodektroskapen, ikke støyfjerningen i latentrommet, som setter det praktiske kvalitetstaket.
Publisert i 2026 39th Conference of Open Innovations Association (FRUCT)
Bidragstype Diagnostisk metodikk
nummer 1s. 69–76Hovedkonferanse
Hovedresultater
| Evalueringspunkt | n | Gjennomsnittlig PPL | Median PPL | p95 PPL |
|---|---|---|---|---|
| Originaltekster | 256 | 16.24 | 15.17 | 25.1 |
| Kodekrekonstruksjoner | 256 | 37.26 | 27.36 | 98.91 |
| AR-referansemodell | 251 | 30.98 | 23.27 | 56.11 |
| MDLM i tokenrommet | 256 | 44.74 | 38.42 | 93.6 |
| MDLM i koderommet | 256 | 30.01 | 26.55 | 59.36 |
Hovedresultat. Det meste av det observerte kvalitetstapet oppstår før genereringen; diffusjon i koderommet reduserer likevel median perpleksitet med 30.9% sammenlignet med diffusjon i tokenrommet.
- Datasett
- TinyStories
- Utvalgsstørrelse
- 256 parede rekonstruksjonsutvalg; 251–256 genererte utvalg per modus; fire samsvarende geometriinnstillinger.
- Måleverdier
- Ekstern GPT-2-perpleksitet: gjennomsnitt, median, p95 og maksimum; bruk av kodebok og støttemengdens størrelse; SBERT, BERTScore, MAUVE og et sammendrag fra en LLM-dommer for geometrikjøringer
- Usikkerhet
- De rapporterte sammenligningene er deskriptive enkeltkjøringer; konfidensintervaller og signifikansestimater med flere frø ble ikke beregnet.
- Betingelser
- GPT-2-tokensekvenser med lengde 64, komprimert til 16 koder på toppnivå med en hierarkisk VQ-VAE-2; alle genereringsmodusene bruker den felles eksterne skåringsmodellen.
Last ned resultater:CSVJSONMarkdownEksternt speil:Hugging Face-datasettkort
PDF og sitering
Siter denne artikkelen BibTeX er det anbefalte formatet. Alle variantene nedenfor genereres fra den samme publikasjonsposten.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Siteringsfiler:APA-tekstIEEE-tekstRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata i XMLFulltekst i JATS 1.4 XMLRDF TurtleLenkesett (JSON)Lenkesett (HTTP)RO-Crate
Fullstendig veiledning
Fullstendig forskningsveiledning
Metode
Artikkelen bruker én skåringsfunksjon på tvers av tre evalueringstrinn, slik at hver ytterligere transformasjon kan knyttes til et målbart kvalitetsavvik.
Rekonstruer
Kod hver TinyStories-prøve på 64 tokener til 16 koder på toppnivå, og dekod den umiddelbart for å måle kodekrekonstruksjonstapet.
Generer
Generer enten teksttokener eller diskrete latente koder med MDLM, og dekod deretter prøver fra koderommet gjennom den samme trente kodeken.
Sammenlign
Skår originaler, rekonstruksjoner og genererte tekster med den samme eksterne GPT-2-protokollen, inkludert median- og halestatistikk.
Hovedidé
En nedstrøms generator kan ikke gjenopprette informasjon som kodeken allerede har forkastet. Rekonstruksjonstrinnet må derfor revideres før resultatene fra latentgenereringen tolkes.
Forskjell fra beslektede tilnærminger
Standard sammenligninger fra ende til ende rapporterer én endelig genereringsskår. Denne protokollen legger inn et paret kontrollpunkt for rekonstruksjon og skiller helsemål i latentrommet fra evidens på dekodet tekst.
Hva er nytt?
Bidraget er en gjenbrukbar, trinnvis diagnostisk metodikk for én konkret pipeline for komprimert tekst, ikke en ny avstøyingsalgoritme.
Spørsmål denne artikkelen bidrar til å besvare
Åpne et spørsmål for å få et kortfattet svar forankret i artikkelen. Detaljerte evidensgrenser er oppført under Begrensninger.
Hvor oppstår kvalitetssvikten ved generering av komprimert korttekst?
I den testede TinyStories-pipelinen med komprimering fra 64 til 16 oppstår den dominerende forringelsen ved kodekrekonstruksjonen, før latentgenereringen begynner. Median ekstern GPT-2-perplexity øker fra 15.17 for originalteksten til 27.36 etter rekonstruksjon, mens p95 øker fra 25.10 til 98.91. Dette resultatet gjelder én konfigurasjon og utgjør ikke en universell rangering av kodeker.
Hvordan kan kodektap skilles fra tap ved latentgenerering?
Den trinnvise protokollen evaluerer originaler, parvise kodekrekonstruksjoner og den endelige genererte teksten med én felles ekstern skåringsmodell. Avviket mellom original og rekonstruksjon anslår kodekens bidrag, mens sammenligningen mellom rekonstruksjon og generert resultat bidrar til å lokalisere det ytterligere genereringstapet. Mål på latenttilstand rapporteres separat fra evidens basert på dekodet tekst.
Hvordan bør tekstgenerering med diskrete latente representasjoner evalueres?
Artikkelen anbefaler å kontrollere rekonstruksjonstrofasthet før generatorer sammenlignes, bruke samme skåringsfunksjon for dekodet tekst på hvert trinn og rapportere sentral- og halestatistikk. Bruk av kodebok, geometri og andre latente proxyer behandles dessuten som diagnostikk, ikke som erstatninger for kvaliteten på dekodet tekst.
Gir diffusjon i koderommet bedre resultater enn diffusjon i tokenrommet?
Med den felles skåringsmodellen og det testede oppsettet reduserer MDLM i koderommet gjennomsnittlig, median og p95 perpleksitet med henholdsvis 32.9%, 30.9% og 36.6% sammenlignet med MDLM i tokenrommet. Sammenligningen er deskriptiv og konfigurasjonsspesifikk: Den fastslår ingen universell rangering på tvers av datasett, komprimeringsgrader, kodeker eller diffusjonsarkitekturer.
Garanterer bedre mål for latent geometri bedre generert tekst?
Nei. I de tilgjengelige sammenlignbare kjøringene forbedret geometribevisst regularisering lokale proksymål i latentrommet, men ikke måleverdiene for dekodet tekst. Resultatet tilsier at enhver forbedring i proksymål bør etterprøves i det endelige dekodede resultatet, og at manglende overføring bør behandles som et nyttig negativt resultat, ikke som evidens for bedre generering.
Sammenligning med beslektede tilnærminger
| Tilnærming | Representasjon | Kontroll/diagnostikk | Hva bevares eller måles? |
|---|---|---|---|
| Diffusjon i tokenrommet | Teksttokener | Genereringskvalitet i tokenrommet | Flyt og skåringsmodellens atferd ved direkte generering |
| Komprimert generering i latentrommet | Diskrete latente koder via en kodek | Endelig ende-til-ende-kvalitet på genereringen | Samlet atferd for kodeken og latentgeneratoren |
| Trinnvis lokalisering av flaskehalser | Tekst, kodekrekonstruksjoner og diskrete latenter | Skill kodektap fra genereringstap | Hvor kvaliteten forringes med én felles skåringsmodell |
Sammenligningen skiller mellom evalueringsomfang og evidens; den er ikke en universell rangering av tilnærmingene.
Relevans og avgrensning
Den trinnvise protokollen er nyttig når en generativ behandlingskjede inneholder både en lært kodek og en latentromsgenerator, men årsaken til redusert resultatkvalitet er uklar.
Komprimert tekstgenerering med diskrete latentvariabler
Rekonstruksjonstroskap for kodeker i generative behandlingskjeder
Språkmodellering med maskert diffusjon i koderommet
Lokalisering av flaskehalser og trinnkonsistent evaluering
Revisjon av proxyforbedringer i latentrommet opp mot dekodet tekst
Begrensninger
- Den empiriske studien bruker bare TinyStories.
- Hovedanalysen omfatter ett aggressivt kompresjonsregime fra 64 til 16.
- Det evaluerte systemet kombinerer én hierarkisk VQ-VAE-2-kodekfamilie med én MDLM-generator.
- Sammenligningene bygger på enkeltkjøringer og er deskriptive, ikke statistiske estimater basert på flere tilfeldige initialiseringer.
- Ekstern GPT-2-perpleksitet er et felles diagnostisk mål, ikke et universelt mål på semantisk kvalitet.
- Konklusjonene bør ikke overføres direkte til alle datasett, kodekarkitekturer eller kompresjonsforhold.
Referanser sitert i artikkelen
Disse oppføringene svarer til den nummererte referanselisten i artikkelens PDF-fil.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Ressurser og reproduserbarhet
- Utgiver
- IEEE
- Lokal PDF med fulltekst
- Endelig akseptert manuskript (forfatterpublisert versjon med DOI)
- Publikasjonsressurser
- Det offentlige manuskriptet, resultattabellene, den forklarende figuren og siteringsfilene er tilgjengelige her. Implementasjonskode og sjekkpunkter er ikke offentliggjort.
Dataerklæring
- Kilde
- TinyStories, slik det er beskrevet i artikkelen.
- Lisens
- Bruk av TinyStories er fortsatt underlagt datasettets egne vilkår; dette nettstedet videreformidler ingen datasettfiler.
- Forbehandling
- GPT-2-tokenisering, faste inndata på 64 tokener og hierarkisk temporal komprimering fra 64 til 32 til 16 posisjoner.
- Del opp
- Publikasjonen rapporterer 256 parede rekonstruksjonsprøver og 251–256 genererte prøver per modus; den publiserer ikke et gjenbrukbart manifest for trenings-/valideringsdelingen.
- Format
- Korte tekstprøver, GPT-2-tokensekvenser, diskrete kodesekvenser, genereringslogger og sammendragstabeller.
- Versjon / kontrollsum
- Artikkelen oppgir verken kontrollsum for datasettet eller en uforanderlig øyeblikksbildeidentifikator for TinyStories.
- Innhenting
- Det er ikke publisert et offentlig innhentingsskript sammen med publikasjonssiden.
- Bruksbegrensninger
- Evidensen omfatter korte syntetiske fortellinger og bør ikke behandles som en referanseprøve for ubegrenset generering av naturlig språk.
Versjoner
- Publisert versjonIEEE / FRUCT, 2026
- arXiv-postÅpne preprintposten, arXiv:2607.24176
- ForfattermanuskriptTeksttilgjengelig lokal PDF
- KonferanseforedragFRUCT 39-presentasjon
- Indeks over konferansepublikasjonerOffisielt FRUCT 39-bind
- PDF med konferansepublikasjonerÅpent tilgjengelig fulltekst fra FRUCT
- Åpne den vitenskapelige postenOpenAlex
- Oppføring i siteringsgrafSemantic Scholar
- Fulltekst delt av forfatterenResearchGate
Den publiserte DOI-en er den primære bibliografiske identifikatoren. Denne siden forblir prosjektets ene kanoniske URL på tvers av versjoner.