Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Var kvalitetsbristerna uppstår vid komprimerad generering av korta texter: stegvis lokalisering av flaskhalsar
En stegvis diagnos av komprimerad generering av korta texter som skiljer kodekens rekonstruktionsförlust från förlusten vid latent generering.
Läs hela artikeln i HTML-formatSökbar text med formler, tabeller, figurer och referenser.
Slutligt accepterat manuskript (författarpublicerad version med DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Villkor för publicering och återanvändning.
Artikeln på 30 sekunder
ForskningsfrågaHur kan kvalitetsförlust i en komprimerad pipeline för textgenerering hänföras separat till kodeken respektive latentgeneratorn?
Problem
Vid generering av komprimerad korttext kan bristfällig avkodad text bero på information som kodeken har förlorat eller på svag generering i latentutrymmet. Mätvärden för hela kedjan suddar ut skillnaden mellan dessa feltyper och kan styra optimeringsarbetet mot fel komponent.
Metod
Det stegvisa protokollet poängsätter original, parade kodekrekonstruktioner, MDLM-utdata i tokenrymden och diffusionsutdata i kodrymden med en extern GPT-2-bedömare. Mått på kodbok och geometri förblir diagnostiska verktyg och ersätter inte kvaliteten hos avkodad text.
Huvudresultat
Kodekrekonstruktion höjer den externa medianperplexiteten från 15.17 till 27.36 och p95 från 25.10 till 98.91. MDLM i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med MDLM i tokenrummet.
Varför det är viktigt
Resultatet omsätter diagnos av kodekflaskhalsar i en handlingsinriktad arbetsordning: prioritera kodekförbättringar, jämför därefter generering i token- och kodrymden och lita på förbättringar i latenta proxymått endast när även den avkodade texten förbättras.
Sammanfattning
Generatorer för komprimerad korttext kan fallera i två olika led: kodeken kan förlora information innan genereringen börjar, eller så kan generatorn i latentutrymmet producera bristfälliga koder. Om felkällorna inte särskiljs riskerar forskare att lägga beräkningsresurser på fel komponent. Vi undersöker problemet i en kontrollerad TinyStories-fallstudie med komprimering från 64 till 16, baserad på en hierarkisk VQ-VAE-2-kodek och en generator med maskerad diskret diffusion (MDLM). Med en gemensam extern GPT-2-bedömare tillämpar vi ett stegvis valideringsprotokoll som skiljer mellan kodekrekonstruktionens trohet, kvaliteten på den latenta genereringen och kompletterande diagnostik i latentutrymmet; för geometristudien redovisar vi även kompletterande semantiska mått. I den testade konfigurationen höjer enbart kodekrekonstruktionen den externa medianperplexiteten från 15.17 till 27.36 (+80.4%) och p95 från 25.10 till 98.91 (+294.1%). Den dominerande kvalitetsförlusten uppstår alltså innan den latenta genereringen börjar. Med samma bedömare är MDLM i kodrymden fortfarande påtagligt starkare än diffusion i tokenrymden och minskar medelvärdet, medianen och p95 med 32.9%, 30.9% respektive 36.6%. Geometrimedveten regularisering förbättrar lokala proxymått i latentutrymmet, men inte måtten för avkodad text i de tillgängliga körningarna. Bidraget är metodologiskt snarare än algoritmiskt: artikeln presenterar en återanvändbar stegvis diagnos för en konkret pipeline och visar att kodekens rekonstruktionstrohet, inte brusreduceringen i latentutrymmet, sätter det praktiska kvalitetstaket i denna konfiguration.
Publicerad vid 2026 39th Conference of Open Innovations Association (FRUCT)
Typ av bidrag Diagnostisk metodik
nummer 1s. 69–76Huvudkonferens
Centrala resultat
| Utvärderingspunkt | n | Genomsnittlig PPL | Median-PPL | p95-PPL |
|---|---|---|---|---|
| Originaltexter | 256 | 16.24 | 15.17 | 25.1 |
| Kodekrekonstruktioner | 256 | 37.26 | 27.36 | 98.91 |
| AR-baslinje | 251 | 30.98 | 23.27 | 56.11 |
| MDLM i tokenrymden | 256 | 44.74 | 38.42 | 93.6 |
| MDLM i kodrummet | 256 | 30.01 | 26.55 | 59.36 |
Huvudresultat. Merparten av den observerade kvalitetsförlusten uppstår före genereringen; diffusion i kodrummet minskar ändå medianperplexiteten med 30.9% jämfört med diffusion i tokenrummet.
- Datamängd
- TinyStories
- Stickprovsstorlek
- 256 parade rekonstruktionsexempel; 251–256 genererade exempel per läge; fyra matchade geometriinställningar.
- Mått
- Extern GPT-2-perplexitet: medelvärde, median, p95 och maximum; användning av kodboken och stödets storlek; SBERT, BERTScore, MAUVE samt en sammanfattning från en LLM-domare för geometrikörningar
- Osäkerhet
- De redovisade jämförelserna är deskriptiva enkelkörningar; konfidensintervall och signifikansskattningar över flera slumptalsfrön beräknades inte.
- Villkor
- GPT-2-tokensekvenser med längden 64 som komprimeras till 16 koder på den översta nivån med en hierarkisk VQ-VAE-2; samtliga genereringslägen använder den gemensamma externa poängsättaren.
Ladda ned resultat:CSVJSONMarkdownExtern spegel:Hugging Face-datasetkort
PDF och citering
Citera denna artikel BibTeX är det rekommenderade formatet. Varje variant nedan genereras från samma publikationspost.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Citeringsfiler:APA-textIEEE-textRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4-metadata i XMLFulltext i JATS 1.4 XMLRDF TurtleLänkuppsättning (JSON)Länkuppsättning (HTTP)RO-Crate
Fullständig guide
Fullständig forskningsguide
Metod
Artikeln använder en och samma poängfunktion i tre utvärderingssteg, så att varje ytterligare transformation kan förknippas med ett mätbart kvalitetsgap.
Rekonstruera
Koda varje TinyStories-exempel med 64 token till 16 koder på den översta nivån och avkoda det omedelbart för att mäta rekonstruktionsförlusten för kodeken.
Generera
Generera antingen texttoken eller diskreta latenta koder med MDLM och avkoda sedan exempel från kodutrymmet med samma tränade kodek.
Jämför
Poängsätt original, rekonstruktioner och genererade texter med samma externa GPT-2-protokoll, inklusive statistik över median och fördelningssvansar.
Grundidé
En efterföljande generator kan inte återvinna information som kodeken redan har kastat bort. Rekonstruktionssteget måste därför granskas innan resultat från latent generering tolkas.
Skillnad mot närliggande angreppssätt
Standardjämförelser från början till slut redovisar ett enda slutligt genereringsmått. Detta protokoll inför en parad kontrollpunkt för rekonstruktion och skiljer hälsomått i latentrum från evidens för avkodad text.
Vad är nytt?
Bidraget är en återanvändbar, stegvis diagnostisk metodik för en konkret pipeline för komprimerad text, snarare än en ny algoritm för brusreducering.
Frågor som artikeln bidrar till att besvara
Öppna en fråga för ett kortfattat svar med stöd i artikeln. Detaljerade gränser för evidensen anges under Begränsningar.
Var uppstår kvalitetsbrister vid generering av komprimerad korttext?
I den testade TinyStories-pipelinen med komprimering från 64 till 16 uppträder den dominerande försämringen vid kodekrekonstruktionen, innan genereringen i latentutrymmet börjar. Den externa medianperplexiteten enligt GPT-2 ökar från 15.17 för originaltext till 27.36 efter rekonstruktion, medan p95 ökar från 25.10 till 98.91. Detta är ett resultat för en enskild konfiguration, inte en universell rangordning av kodekar.
Hur kan kodekförlust särskiljas från förlust vid generering i latentutrymmet?
Det stegvisa protokollet utvärderar original, parade kodekrekonstruktioner och slutlig genererad text med en gemensam extern bedömare. Skillnaden mellan original och rekonstruktion skattar kodekens bidrag, medan jämförelsen mellan rekonstruktion och genererad utdata hjälper till att lokalisera den ytterligare genereringsförlusten. Mått på latentrepräsentationens kvalitet rapporteras åtskilda från evidens baserad på avkodad text.
Hur bör textgenerering med diskreta latenta representationer utvärderas?
Artikeln rekommenderar att rekonstruktionens trohet kontrolleras innan generatorer jämförs, att samma poängfunktion för avkodad text används i varje steg samt att central- och svansstatistik redovisas. Den behandlar också kodboksanvändning, geometri och andra latenta proxymått som diagnostik, inte som ersättning för den avkodade textens kvalitet.
Överträffar diffusion i kodutrymmet diffusion i tokenutrymmet?
Med den gemensamma bedömaren och den testade konfigurationen minskar MDLM i kodrymden medelvärdet, medianen och p95 för perplexitet med 32.9%, 30.9% respektive 36.6% jämfört med MDLM i tokenrymden. Jämförelsen är deskriptiv och konfigurationsspecifik; den fastställer ingen universell rangordning över datamängder, komprimeringsgrader, kodekar eller diffusionsarkitekturer.
Garanterar bättre mått på latent geometri bättre genererad text?
Nej. I de tillgängliga matchade körningarna förbättrade geometrimedveten regularisering lokala proxymått i latentrummet, men inte måtten för avkodad text. Resultatet talar för att varje förbättring av proxymått bör granskas i den slutliga avkodade utdatan och att utebliven överföring bör behandlas som ett användbart negativt resultat, inte som belägg för förbättrad generering.
Jämförelse med närliggande angreppssätt
| Metod | Representation | Styrning/diagnos | Vad bevaras eller mäts? |
|---|---|---|---|
| Diffusion i tokenrymden | Texttoken | Genereringskvalitet i tokenutrymmet | Språkligt flyt och poängsättarens beteende vid direkt generering |
| Komprimerad latent generering | Diskreta latenta koder via en kodek | Slutlig kvalitet på genereringen från början till slut | Kodekens och latentgeneratorns kombinerade beteende |
| Stegvis lokalisering av flaskhalsar | Text, kodekrekonstruktioner och diskreta latenta representationer | Särskilj kodekförlust från genereringsförlust | Var kvaliteten försämras med en gemensam bedömare |
Jämförelsen skiljer mellan utvärderingens omfattning och evidens; den är ingen universell rangordning av metoderna.
Relevans och avgränsning
Det stegvisa protokollet är användbart när ett generativt arbetsflöde innehåller både en inlärd kodek och en generator i latentrummet, men orsaken till försämrad utdatakvalitet är oklar.
Komprimerad textgenerering med diskreta latenta representationer
Kodekrekonstruktionens trohet i generativa pipelines
Språkmodellering med maskerad diffusion i kodrum
Lokalisering av flaskhalsar och stegkonsistent utvärdering
Granskning av förbättrade proxymått i det latenta rummet mot avkodad text
Begränsningar
- Den empiriska studien använder endast TinyStories.
- Huvudanalysen omfattar en aggressiv kompressionsregim från 64 till 16.
- Det utvärderade systemet kombinerar en hierarkisk kodekfamilj av typen VQ-VAE-2 med en MDLM-generator.
- Jämförelserna bygger på enskilda körningar och är deskriptiva snarare än statistiska skattningar över flera slumpfrön.
- Extern GPT-2-perplexitet är ett gemensamt diagnostiskt mått, inte ett universellt mått på semantisk kvalitet.
- Slutsatserna bör inte överföras direkt till alla datamängder, kodekarkitekturer eller kompressionsgrader.
Referenser som citeras i artikeln
Dessa poster motsvarar den numrerade referensförteckningen i artikelns PDF-version.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Resurser och reproducerbarhet
- Utgivare
- IEEE
- Lokal PDF med fulltext
- Slutligt accepterat manuskript (författarpublicerad version med DOI)
- Publikationsresurser
- Det offentliga manuskriptet, resultattabellerna, den förklarande figuren och citeringsfilerna finns här. Implementationskod och kontrollpunkter har inte offentliggjorts.
Dataredogörelse
- Källa
- TinyStories, såsom det beskrivs i artikeln.
- Licens
- Användning av TinyStories omfattas fortsatt av datamängdens egna villkor; webbplatsen vidaredistribuerar inga filer från datamängden.
- Förbehandling
- GPT-2-tokenisering, fasta indata med 64 token och hierarkisk temporal komprimering från 64 till 32 och därefter 16 positioner.
- Uppdelning
- Publikationen redovisar 256 parade rekonstruktionssampel och 251–256 genererade sampel per läge; den publicerar inget återanvändbart manifest för uppdelningen i tränings- och valideringsdata.
- Format
- Korta textsampel, tokensekvenser från GPT-2, diskreta kodsekvenser, genereringsloggar och sammanfattande tabeller.
- Version/kontrollsumma
- Någon kontrollsumma för datamängden eller identifierare för en oföränderlig TinyStories-ögonblicksbild redovisas inte i artikeln.
- Datainsamling
- Något offentligt skript för datainsamling publiceras inte tillsammans med publikationssidan.
- Användningsbegränsningar
- Evidensen omfattar korta syntetiska berättelser och bör inte betraktas som ett riktmärke för obegränsad generering av naturligt språk.
Versioner
- Publicerad versionIEEE / FRUCT, 2026
- arXiv-postÖppna preprintposten, arXiv:2607.24176
- FörfattarmanuskriptTextåtkomlig lokal PDF
- KonferensföredragFRUCT 39-presentation
- Index över konferenshandlingarOfficiell FRUCT 39-volym
- Konferenshandlingar som PDFFRUCT-fulltext med öppen åtkomst
- Öppna den vetenskapliga postenOpenAlex
- Post i citeringsgrafSemantic Scholar
- Fulltext delad av författarenResearchGate
Den publicerade DOI:n är den primära bibliografiska identifieraren. Denna sida förblir projektets enda kanoniska URL i samtliga versioner.