Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Var kvalitetsbristerna uppstår vid komprimerad generering av korta texter: stegvis lokalisering av flaskhalsar

En stegvis diagnos av komprimerad generering av korta texter som skiljer kodekens rekonstruktionsförlust från förlusten vid latent generering.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Läs hela artikeln i HTML-formatSökbar text med formler, tabeller, figurer och referenser.

Slutligt accepterat manuskript (författarpublicerad version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Villkor för publicering och återanvändning.

Artikeln på 30 sekunder

ForskningsfrågaHur kan kvalitetsförlust i en komprimerad pipeline för textgenerering hänföras separat till kodeken respektive latentgeneratorn?

Problem

Vid generering av komprimerad korttext kan bristfällig avkodad text bero på information som kodeken har förlorat eller på svag generering i latentutrymmet. Mätvärden för hela kedjan suddar ut skillnaden mellan dessa feltyper och kan styra optimeringsarbetet mot fel komponent.

Metod

Det stegvisa protokollet poängsätter original, parade kodekrekonstruktioner, MDLM-utdata i tokenrymden och diffusionsutdata i kodrymden med en extern GPT-2-bedömare. Mått på kodbok och geometri förblir diagnostiska verktyg och ersätter inte kvaliteten hos avkodad text.

Huvudresultat

Kodekrekonstruktion höjer den externa medianperplexiteten från 15.17 till 27.36 och p95 från 25.10 till 98.91. MDLM i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med MDLM i tokenrummet.

Varför det är viktigt

Resultatet omsätter diagnos av kodekflaskhalsar i en handlingsinriktad arbetsordning: prioritera kodekförbättringar, jämför därefter generering i token- och kodrymden och lita på förbättringar i latenta proxymått endast när även den avkodade texten förbättras.

Sammanfattning

Generatorer för komprimerad korttext kan fallera i två olika led: kodeken kan förlora information innan genereringen börjar, eller så kan generatorn i latentutrymmet producera bristfälliga koder. Om felkällorna inte särskiljs riskerar forskare att lägga beräkningsresurser på fel komponent. Vi undersöker problemet i en kontrollerad TinyStories-fallstudie med komprimering från 64 till 16, baserad på en hierarkisk VQ-VAE-2-kodek och en generator med maskerad diskret diffusion (MDLM). Med en gemensam extern GPT-2-bedömare tillämpar vi ett stegvis valideringsprotokoll som skiljer mellan kodekrekonstruktionens trohet, kvaliteten på den latenta genereringen och kompletterande diagnostik i latentutrymmet; för geometristudien redovisar vi även kompletterande semantiska mått. I den testade konfigurationen höjer enbart kodekrekonstruktionen den externa medianperplexiteten från 15.17 till 27.36 (+80.4%) och p95 från 25.10 till 98.91 (+294.1%). Den dominerande kvalitetsförlusten uppstår alltså innan den latenta genereringen börjar. Med samma bedömare är MDLM i kodrymden fortfarande påtagligt starkare än diffusion i tokenrymden och minskar medelvärdet, medianen och p95 med 32.9%, 30.9% respektive 36.6%. Geometrimedveten regularisering förbättrar lokala proxymått i latentutrymmet, men inte måtten för avkodad text i de tillgängliga körningarna. Bidraget är metodologiskt snarare än algoritmiskt: artikeln presenterar en återanvändbar stegvis diagnos för en konkret pipeline och visar att kodekens rekonstruktionstrohet, inte brusreduceringen i latentutrymmet, sätter det praktiska kvalitetstaket i denna konfiguration.

Publicerad vid 2026 39th Conference of Open Innovations Association (FRUCT)

Typ av bidrag Diagnostisk metodik

nummer 1s. 69–76Huvudkonferens

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Dela denna artikelDela

Centrala resultat

Huvudresultat från Var kvaliteten brister vid generering av komprimerad korttext: stegvis lokalisering av flaskhalsar
UtvärderingspunktnGenomsnittlig PPLMedian-PPLp95-PPL
Originaltexter25616.2415.1725.1
Kodekrekonstruktioner25637.2627.3698.91
AR-baslinje25130.9823.2756.11
MDLM i tokenrymden25644.7438.4293.6
MDLM i kodrummet25630.0126.5559.36

Huvudresultat. Merparten av den observerade kvalitetsförlusten uppstår före genereringen; diffusion i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med diffusion i tokenrummet.

Datamängd
TinyStories
Stickprovsstorlek
256 parade rekonstruktionsexempel; 251–256 genererade exempel per läge; fyra matchade geometriinställningar.
Mått
Extern GPT-2-perplexitet: medelvärde, median, p95 och maximum; användning av kodboken och stödets storlek; SBERT, BERTScore, MAUVE samt en sammanfattning från en LLM-domare för geometrikörningar
Osäkerhet
De redovisade jämförelserna är deskriptiva enkelkörningar; konfidensintervall och signifikansskattningar över flera slumptalsfrön beräknades inte.
Villkor
GPT-2-tokensekvenser med längden 64 som komprimeras till 16 koder på den översta nivån med en hierarkisk VQ-VAE-2; samtliga genereringslägen använder den gemensamma externa poängsättaren.

PDF och citering

Citera denna artikel BibTeX är det rekommenderade formatet. Varje variant nedan genereras från samma publikationspost.

Öppna PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Ladda ned .bib

Citeringsfiler:APA-textIEEE-textRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata i XMLFulltext i JATS 1.4 XMLRDF TurtleLänkuppsättning (JSON)Länkuppsättning (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Fullständig guide

Fullständig forskningsguide

Metod

Artikeln använder en och samma poängfunktion i tre utvärderingssteg, så att varje ytterligare transformation kan förknippas med ett mätbart kvalitetsgap.

  1. Rekonstruera

    Koda varje TinyStories-exempel med 64 token till 16 koder på den översta nivån och avkoda det omedelbart för att mäta rekonstruktionsförlusten för kodeken.

  2. Generera

    Generera antingen texttoken eller diskreta latenta koder med MDLM och avkoda sedan exempel från kodutrymmet med samma tränade kodek.

  3. Jämför

    Poängsätt original, rekonstruktioner och genererade texter med samma externa GPT-2-protokoll, inklusive statistik över median och fördelningssvansar.

Stegvis pipeline för generering av komprimerad text som jämför originaltext, kodekrekonstruktion, MDLM i kodrymden och avkodad text för att särskilja kodekförlust från genereringsförlust.
Stegvis lokalisering av flaskhalsar särskiljer kodekens rekonstruktionsförlust från förlusten vid latent generering inom ett gemensamt utvärderingsprotokoll för avkodad text.Källa: Författarskapat förklarande diagram baserat på den publicerade metoden och resultaten..Villkor för återanvändning: CC BY 4.0.Föreslagen attribuering: Gavrilov, Gazzaev och Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Ladda ned SVG.

Grundidé

En efterföljande generator kan inte återvinna information som kodeken redan har kastat bort. Rekonstruktionssteget måste därför granskas innan resultat från latent generering tolkas.

Skillnad mot närliggande angreppssätt

Standardjämförelser från början till slut redovisar ett enda slutligt genereringsmått. Detta protokoll inför en parad kontrollpunkt för rekonstruktion och skiljer hälsomått i latentrum från evidens för avkodad text.

Vad är nytt?

Bidraget är en återanvändbar, stegvis diagnostisk metodik för en konkret pipeline för komprimerad text, snarare än en ny algoritm för brusreducering.

Frågor som artikeln bidrar till att besvara

Öppna en fråga för ett kortfattat svar med stöd i artikeln. Detaljerade gränser för evidensen anges under Begränsningar.

  1. Var uppstår kvalitetsbrister vid generering av komprimerad korttext?

    I den testade TinyStories-pipelinen med komprimering från 64 till 16 uppträder den dominerande försämringen vid kodekrekonstruktionen, innan genereringen i latentutrymmet börjar. Den externa medianperplexiteten enligt GPT-2 ökar från 15.17 för originaltext till 27.36 efter rekonstruktion, medan p95 ökar från 25.10 till 98.91. Detta är ett resultat för en enskild konfiguration, inte en universell rangordning av kodekar.

  2. Hur kan kodekförlust särskiljas från förlust vid generering i latentutrymmet?

    Det stegvisa protokollet utvärderar original, parade kodekrekonstruktioner och slutlig genererad text med en gemensam extern bedömare. Skillnaden mellan original och rekonstruktion skattar kodekens bidrag, medan jämförelsen mellan rekonstruktion och genererad utdata hjälper till att lokalisera den ytterligare genereringsförlusten. Mått på latentrepräsentationens kvalitet rapporteras åtskilda från evidens baserad på avkodad text.

  3. Hur bör textgenerering med diskreta latenta representationer utvärderas?

    Artikeln rekommenderar att rekonstruktionens trohet kontrolleras innan generatorer jämförs, att samma poängfunktion för avkodad text används i varje steg samt att central- och svansstatistik redovisas. Den behandlar också kodboksanvändning, geometri och andra latenta proxymått som diagnostik, inte som ersättning för den avkodade textens kvalitet.

  4. Överträffar diffusion i kodutrymmet diffusion i tokenutrymmet?

    Med den gemensamma bedömaren och den testade konfigurationen minskar MDLM i kodrymden medelvärdet, medianen och p95 för perplexitet med 32.9%, 30.9% respektive 36.6% jämfört med MDLM i tokenrymden. Jämförelsen är deskriptiv och konfigurationsspecifik; den fastställer ingen universell rangordning över datamängder, komprimeringsgrader, kodekar eller diffusionsarkitekturer.

  5. Garanterar bättre mått på latent geometri bättre genererad text?

    Nej. I de tillgängliga matchade körningarna förbättrade geometrimedveten regularisering lokala proxymått i latentrummet, men inte måtten för avkodad text. Resultatet talar för att varje förbättring av proxymått bör granskas i den slutliga avkodade utdatan och att utebliven överföring bör behandlas som ett användbart negativt resultat, inte som belägg för förbättrad generering.

Jämförelse med närliggande angreppssätt

Saklig jämförelse mellan Var kvaliteten brister vid generering av komprimerad korttext: stegvis lokalisering av flaskhalsar och närliggande angreppssätt
MetodRepresentationStyrning/diagnosVad bevaras eller mäts?
Diffusion i tokenrymdenTexttokenGenereringskvalitet i tokenutrymmetSpråkligt flyt och poängsättarens beteende vid direkt generering
Komprimerad latent genereringDiskreta latenta koder via en kodekSlutlig kvalitet på genereringen från början till slutKodekens och latentgeneratorns kombinerade beteende
Stegvis lokalisering av flaskhalsarText, kodekrekonstruktioner och diskreta latenta representationerSärskilj kodekförlust från genereringsförlustVar kvaliteten försämras med en gemensam bedömare

Jämförelsen skiljer mellan utvärderingens omfattning och evidens; den är ingen universell rangordning av metoderna.

Relevans och avgränsning

Det stegvisa protokollet är användbart när ett generativt arbetsflöde innehåller både en inlärd kodek och en generator i latentrummet, men orsaken till försämrad utdatakvalitet är oklar.

  1. Komprimerad textgenerering med diskreta latenta representationer

  2. Kodekrekonstruktionens trohet i generativa pipelines

  3. Språkmodellering med maskerad diffusion i kodrum

  4. Lokalisering av flaskhalsar och stegkonsistent utvärdering

  5. Granskning av förbättrade proxymått i det latenta rummet mot avkodad text

Se begränsningar och evidensens räckvidd

Begränsningar

  • Den empiriska studien använder endast TinyStories.
  • Huvudanalysen omfattar en aggressiv kompressionsregim från 64 till 16.
  • Det utvärderade systemet kombinerar en hierarkisk kodekfamilj av typen VQ-VAE-2 med en MDLM-generator.
  • Jämförelserna bygger på enskilda körningar och är deskriptiva snarare än statistiska skattningar över flera slumpfrön.
  • Extern GPT-2-perplexitet är ett gemensamt diagnostiskt mått, inte ett universellt mått på semantisk kvalitet.
  • Slutsatserna bör inte överföras direkt till alla datamängder, kodekarkitekturer eller kompressionsgrader.

Referenser som citeras i artikeln

Dessa poster motsvarar den numrerade referensförteckningen i artikelns PDF-version.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Resurser och reproducerbarhet

Utgivare
IEEE
Publikationsresurser
Det offentliga manuskriptet, resultattabellerna, den förklarande figuren och citeringsfilerna finns här. Implementationskod och kontrollpunkter har inte offentliggjorts.

Dataredogörelse

Källa
TinyStories, såsom det beskrivs i artikeln.
Licens
Användning av TinyStories omfattas fortsatt av datamängdens egna villkor; webbplatsen vidaredistribuerar inga filer från datamängden.
Förbehandling
GPT-2-tokenisering, fasta indata med 64 token och hierarkisk temporal komprimering från 64 till 32 och därefter 16 positioner.
Uppdelning
Publikationen redovisar 256 parade rekonstruktionssampel och 251–256 genererade sampel per läge; den publicerar inget återanvändbart manifest för uppdelningen i tränings- och valideringsdata.
Format
Korta textsampel, tokensekvenser från GPT-2, diskreta kodsekvenser, genereringsloggar och sammanfattande tabeller.
Version/kontrollsumma
Någon kontrollsumma för datamängden eller identifierare för en oföränderlig TinyStories-ögonblicksbild redovisas inte i artikeln.
Datainsamling
Något offentligt skript för datainsamling publiceras inte tillsammans med publikationssidan.
Användningsbegränsningar
Evidensen omfattar korta syntetiska berättelser och bör inte betraktas som ett riktmärke för obegränsad generering av naturligt språk.

Versioner

  1. Publicerad versionIEEE / FRUCT, 2026
  2. FörfattarmanuskriptTextåtkomlig lokal PDF
  3. KonferensföredragFRUCT 39-presentation
  4. Index över konferenshandlingarOfficiell FRUCT 39-volym
  5. Konferenshandlingar som PDFFRUCT-fulltext med öppen åtkomst
  6. Öppna den vetenskapliga postenOpenAlex
  7. Post i citeringsgrafSemantic Scholar
  8. Fulltext delad av författarenResearchGate

Den publicerade DOI:n är den primära bibliografiska identifieraren. Denna sida förblir projektets enda kanoniska URL i samtliga versioner.