Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Waar kwaliteit tekortschiet bij gecomprimeerde generatie van korte teksten: gefaseerde lokalisatie van knelpunten

Een gefaseerde diagnose van gecomprimeerde generatie van korte teksten die codecreconstructieverlies onderscheidt van verlies bij latente generatie.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Sint-Petersburg, Rusland

Het volledige artikel in HTML lezenDoorzoekbare tekst met formules, tabellen, figuren en referenties.

Definitief geaccepteerd manuscript (door de auteur geplaatste versie met DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Voorwaarden voor publicatie en hergebruik.

Artikel in 30 seconden

OnderzoeksvraagHoe kan kwaliteitsverlies in een pijplijn voor gecomprimeerde tekstgeneratie afzonderlijk worden toegeschreven aan de codec en de latente generator?

Probleem

Bij het genereren van gecomprimeerde korte teksten kan een zwakke gedecodeerde tekst voortkomen uit informatieverlies door de codec of uit gebrekkige generatie in de latente ruimte. End-to-endscores verdoezelen deze faalwijzen en kunnen ertoe leiden dat optimalisatie-inspanningen op de verkeerde component worden gericht.

Aanpak

Het gefaseerde protocol beoordeelt originelen, gekoppelde codecreconstructies, MDLM-uitvoer in de tokenruimte en diffusie-uitvoer in de coderuimte met één externe GPT-2-beoordelaar. Maten voor het codeboek en de geometrie blijven diagnostische hulpmiddelen en vervangen de kwaliteit van gedecodeerde tekst niet.

Hoofdresultaat

Codecreconstructie verhoogt de mediane externe perplexiteit van 15.17 naar 27.36 en p95 van 25.10 naar 98.91. MDLM in coderuimte verlaagt de mediane perplexiteit niettemin met 30.9% ten opzichte van MDLM in tokenruimte.

Waarom dit van belang is

Het resultaat vertaalt de diagnose van codecknelpunten naar een uitvoerbare werkvolgorde: geef prioriteit aan codecverbeteringen, vergelijk vervolgens generatie in de token- en coderuimte en vertrouw winst in latente proxy's alleen wanneer ook de gedecodeerde tekst verbetert.

Samenvatting

Generatoren van gecomprimeerde korte teksten kunnen op twee verschillende plaatsen tekortschieten: de codec kan informatie verliezen voordat de generatie begint, of de latente generator kan zwakke codes produceren. Zonder deze foutmodi van elkaar te scheiden, kunnen onderzoekers rekenkracht besteden aan de verbetering van de verkeerde component. Wij onderzoeken dit probleem in een gecontroleerde TinyStories-casestudy met compressie van 64 naar 16, opgebouwd uit een hiërarchische VQ-VAE-2-codec en een generator op basis van gemaskeerde discrete diffusie (MDLM). We gebruiken een gefaseerd validatieprotocol dat de getrouwheid van codecreconstructie, de kwaliteit van latente generatie en aanvullende diagnostische maten voor latente variabelen van elkaar scheidt met één gezamenlijk extern GPT-2-beoordelingsmodel; daarnaast rapporteren we aanvullende semantische maten voor het geometrieonderzoek. In de geteste configuratie verhoogt codecreconstructie alleen al de mediane externe perplexiteit van 15.17 naar 27.36 (+80.4%) en p95 van 25.10 naar 98.91 (+294.1%). Dit toont aan dat het dominante kwaliteitsverlies optreedt voordat de latente generatie begint. Met hetzelfde beoordelingsmodel blijft MDLM in coderuimte aanmerkelijk sterker dan diffusie in tokenruimte: het gemiddelde, de mediaan en p95 dalen respectievelijk met 32.9%, 30.9% en 36.6%. Geometriebewuste regularisatie verbetert lokale proxymaten voor latente variabelen, maar verbetert in de beschikbare uitvoeringen de maten voor gedecodeerde tekst niet. De bijdrage is methodologisch en niet algoritmisch: het artikel presenteert een herbruikbare gefaseerde diagnose voor één concrete pijplijn en laat zien dat in deze context de codecgetrouwheid, en niet de latente ruisverwijdering, het praktische kwaliteitsplafond bepaalt.

Gepubliceerd bij 2026 39th Conference of Open Innovations Association (FRUCT)

Type bijdrage Diagnostische methodologie

nummer 1pp. 69–76Hoofdconferentie

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Dit artikel delenDelen

Kernresultaten

Belangrijkste resultaten van Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
EvaluatiepuntnGemiddelde PPLMediane PPLp95 PPL
Oorspronkelijke teksten25616.2415.1725.1
Codecreconstructies25637.2627.3698.91
AR-baseline25130.9823.2756.11
MDLM in de tokenruimte25644.7438.4293.6
MDLM in coderuimte25630.0126.5559.36

Kernresultaat. Het grootste deel van het waargenomen kwaliteitsverlies ontstaat vóór de generatie; diffusie in de coderuimte verlaagt de mediane perplexiteit niettemin met 30.9% ten opzichte van diffusie in de tokenruimte.

Dataset
TinyStories
Steekproefomvang
256 gepaarde reconstructiesteekproeven; 251–256 gegenereerde steekproeven per modus; vier overeenkomstige geometrie-instellingen.
Metrieken
Externe GPT-2-perplexiteit: gemiddelde, mediaan, p95 en maximum; gebruik van het codeboek en omvang van de support; SBERT, BERTScore, MAUVE en een samenvatting van een LLM-beoordelaar voor experimenten met geometrie
Onzekerheid
De gerapporteerde vergelijkingen betreffen beschrijvende afzonderlijke runs; betrouwbaarheidsintervallen en significantieschattingen met meerdere seeds zijn niet berekend.
Voorwaarden
GPT-2-tokenreeksen met een lengte van 64, gecomprimeerd tot 16 codes op het hoogste niveau met een hiërarchische VQ-VAE-2; alle generatiemodi gebruiken dezelfde externe beoordelaar.

PDF en citatie

Dit artikel citeren BibTeX is het aanbevolen formaat. Elke onderstaande variant wordt uit hetzelfde publicatierecord gegenereerd.

PDF openen
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
.bib downloaden

Citatiebestanden:APA-tekstIEEE-tekstRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata-XMLJATS 1.4 XML met volledige tekstRDF TurtleLinkset (JSON)Linkset (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Volledige gids

Volledige onderzoeksgids

Methode

Het artikel gebruikt in drie evaluatiefasen dezelfde beoordelaar, zodat elke aanvullende transformatie aan een meetbaar kwaliteitsverschil kan worden gekoppeld.

  1. Reconstrueren

    Codeer elk TinyStories-sample van 64 tokens tot 16 codes op het hoogste niveau en decodeer het onmiddellijk om het codec-reconstructieverlies te meten.

  2. Genereren

    Genereer met MDLM teksttokens dan wel discrete latente codes en decodeer vervolgens samples uit de coderuimte met dezelfde getrainde codec.

  3. Vergelijken

    Beoordeel oorspronkelijke teksten, reconstructies en gegenereerde teksten met hetzelfde externe GPT-2-protocol, inclusief statistieken voor de mediaan en de staarten.

Gefaseerde pijplijn voor generatie van gecomprimeerde tekst die oorspronkelijke tekst, codecreconstructie, MDLM in de coderuimte en gedecodeerde tekst vergelijkt om codecverlies van generatieverlies te onderscheiden.
Gefaseerde lokalisatie van knelpunten onderscheidt het reconstructieverlies van de codec van het verlies bij latente generatie binnen één gedeeld evaluatieprotocol voor gedecodeerde tekst.Bron: Door de auteur gemaakt verklarend diagram op basis van de gepubliceerde methode en resultaten..Hergebruiksvoorwaarden: CC BY 4.0.Aanbevolen bronvermelding: Gavrilov, Gazzaev en Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. SVG downloaden.

Kernidee

Een generator verderop in de keten kan informatie die de codec al heeft verworpen niet terugwinnen. De reconstructiefase moet daarom worden gecontroleerd voordat resultaten van latente generatie worden geïnterpreteerd.

Verschil met verwante benaderingen

Standaard end-to-endvergelijkingen rapporteren één uiteindelijke generatiescore. Dit protocol voegt een gekoppeld reconstructiecontrolepunt in en onderscheidt gezondheidsmetrieken in de latente ruimte van bewijs op basis van gedecodeerde tekst.

Wat is nieuw

De bijdrage bestaat uit een herbruikbare, gefaseerde diagnostische methodologie voor één concrete pijplijn voor gecomprimeerde tekst, niet uit een nieuw algoritme voor ruisverwijdering.

Vragen die dit artikel mede beantwoordt

Open een vraag voor een beknopt, op het artikel gebaseerd antwoord. Gedetailleerde bewijsgrenzen staan onder Beperkingen.

  1. Waar gaat kwaliteit verloren bij de generatie van gecomprimeerde korte teksten?

    In de geteste TinyStories-pijplijn met compressie van 64 naar 16 treedt de voornaamste verslechtering op bij de codecreconstructie, nog voordat de generatie in de latente ruimte begint. De mediane externe GPT-2-perplexiteit stijgt van 15.17 voor de oorspronkelijke tekst naar 27.36 na reconstructie, terwijl p95 stijgt van 25.10 naar 98.91. Dit resultaat geldt voor één configuratie en vormt geen universele rangschikking van codecs.

  2. Hoe kan codecverlies worden onderscheiden van generatieverlies in de latente ruimte?

    Het gefaseerde protocol evalueert originelen, gekoppelde codecreconstructies en uiteindelijk gegenereerde tekst met één gedeelde externe beoordelaar. Het verschil tussen origineel en reconstructie schat de bijdrage van de codec, terwijl de vergelijking tussen reconstructie en gegenereerde uitvoer helpt het aanvullende generatieverlies te lokaliseren. Metrieken voor de kwaliteit van de latente representatie worden afzonderlijk van het bewijs uit gedecodeerde tekst gerapporteerd.

  3. Hoe moet tekstgeneratie met discrete latente representaties worden geëvalueerd?

    Het artikel beveelt aan de reconstructiegetrouwheid te controleren voordat generatoren worden vergeleken, in elke fase dezelfde beoordelaar voor gedecodeerde tekst toe te passen en zowel centrale als staartstatistieken te rapporteren. Ook worden codeboekgebruik, geometrie en andere latente proxy's behandeld als diagnostische hulpmiddelen, niet als vervanging voor de kwaliteit van gedecodeerde tekst.

  4. Presteert diffusie in de coderuimte beter dan diffusie in de tokenruimte?

    Volgens de gedeelde beoordelaar en binnen de geteste opzet verlaagt MDLM in de coderuimte de gemiddelde, mediane en p95-perplexiteit met respectievelijk 32.9%, 30.9% en 36.6% ten opzichte van MDLM in de tokenruimte. De vergelijking is beschrijvend en configuratiespecifiek: zij toont geen universele rangorde aan voor verschillende datasets, compressieverhoudingen, codecs of diffusiearchitecturen.

  5. Garanderen betere maten voor de latente geometrie betere gegenereerde tekst?

    Nee. In de beschikbare gematchte uitvoeringen verbeterde geometrieregularisatie de lokale proxymaatstaven in de latente ruimte, maar niet de metrieken voor gedecodeerde tekst. Dit resultaat onderstreept dat elke verbetering van een proxy aan de uiteindelijke gedecodeerde uitvoer moet worden getoetst en dat uitblijvende overdracht als een nuttig negatief resultaat moet worden beschouwd, niet als bewijs voor betere generatie.

Vergelijking met verwante benaderingen

Feitelijke vergelijking van Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization met verwante benaderingen
AanpakRepresentatieControle / diagnoseWat wordt behouden of gemeten
Diffusie in de tokenruimteTeksttokensGeneratiekwaliteit in de tokenruimteVloeiendheid en gedrag van de beoordelaar bij directe generatie
Gecomprimeerde latente generatieDiscrete latente codes via een codecUiteindelijke end-to-end-generatiekwaliteitGecombineerd gedrag van codec en latente generator
Gefaseerde lokalisatie van knelpuntenTekst, codecreconstructies en discrete latente variabelenOnderscheid codecverlies van generatieverliesWaar de kwaliteit afneemt volgens één gedeelde beoordelaar

De vergelijking maakt onderscheid naar evaluatiereikwijdte en bewijs; zij vormt geen universele rangschikking van de benaderingen.

Relevantie en reikwijdte

Het gefaseerde protocol is nuttig wanneer een generatieve pijplijn zowel een aangeleerde codec als een generator in de latente ruimte bevat, maar de oorzaak van de verminderde uitvoerkwaliteit onduidelijk is.

  1. Tekstgeneratie met gecomprimeerde en discrete latente variabelen

  2. Getrouwheid van codecreconstructie in generatieve pijplijnen

  3. Taalmodellering met gemaskeerde diffusie in de coderuimte

  4. Lokalisatie van knelpunten en faseconsistente evaluatie

  5. Verbeteringen van proxy's in de latente ruimte toetsen aan gedecodeerde tekst

Bekijk de beperkingen en grenzen van het bewijs

Beperkingen

  • De empirische studie gebruikt uitsluitend TinyStories.
  • De hoofdanalyse betreft één agressief 64-naar-16-compressieregime.
  • Het geëvalueerde systeem combineert één hiërarchische VQ-VAE-2-codecfamilie met één MDLM-generator.
  • De vergelijkingen zijn gebaseerd op afzonderlijke uitvoeringen en zijn beschrijvend van aard; het zijn geen statistische schattingen met meerdere random seeds.
  • Externe GPT-2-perplexiteit is een gemeenschappelijk diagnostisch instrument, geen universele maat voor semantische kwaliteit.
  • De conclusies mogen niet rechtstreeks worden overgedragen op alle datasets, codecarchitecturen of compressieverhoudingen.

In het artikel aangehaalde referenties

Deze vermeldingen corresponderen met de genummerde sectie References in de pdf van het artikel.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Bronnen en reproduceerbaarheid

Uitgever
IEEE
Publicatiebronnen
Het openbare manuscript, de resultaattabellen, de toelichtende figuur en de citatiebestanden zijn hier beschikbaar. Implementatiecode en checkpoints zijn niet openbaar vrijgegeven.

Dataverklaring

Bron
TinyStories, zoals beschreven in het artikel.
Licentie
Voor het gebruik van TinyStories blijven de eigen voorwaarden van de dataset gelden; deze site verspreidt geen datasetbestanden opnieuw.
Voorbewerking
GPT-2-tokenisatie, vaste invoer van 64 tokens en hiërarchische temporele compressie van 64 via 32 naar 16 posities.
Opsplitsen
De publicatie rapporteert 256 gekoppelde reconstructiesteekproeven en 251–256 gegenereerde steekproeven per modus; zij publiceert geen herbruikbaar manifest van de opsplitsing in trainings- en validatiedata.
Formaat
Korte tekststeekproeven, GPT-2-tokensequenties, discrete codesequenties, generatielogboeken en samenvattende tabellen.
Versie / controlesom
In het artikel wordt geen controlesom van de dataset of onveranderlijke snapshot-ID van TinyStories gerapporteerd.
Verwerving
Bij de publicatiepagina is geen openbaar acquisitiescript uitgebracht.
Gebruiksbeperkingen
Het bewijs betreft korte synthetische verhalen en mag niet worden beschouwd als benchmark voor onbeperkte generatie van natuurlijke taal.

Versies

  1. Gepubliceerde versieIEEE / FRUCT, 2026
  2. Index van de congresbundelOfficiële FRUCT 39-bundel
  3. Pdf van de congresbundelOpen volledige tekst bij FRUCT
  4. Wetenschappelijk record openenOpenAlex
  5. Record in de citatiegraafSemantic Scholar
  6. Door de auteur gedeelde volledige tekstResearchGate

De gepubliceerde DOI is de primaire bibliografische identificatie. Deze pagina blijft in alle versies de enige canonieke project-URL.