Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Unde se degradează calitatea în generarea comprimată de texte scurte: localizarea etapizată a blocajelor

Un diagnostic etapizat al generării comprimate de texte scurte, care separă pierderea de reconstrucție introdusă de codec de pierderea introdusă de generarea latentă.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Citiți articolul integral în format HTMLText interogabil cu formule, tabele, figuri și referințe.

Manuscrisul final acceptat (versiune publicată de autor, cu DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Condiții de publicare și reutilizare.

Lucrarea în 30 de secunde

Întrebare de cercetareCum poate fi atribuită separat codecului și generatorului latent pierderea calității dintr-un flux de generare a textului comprimat?

Problemă

În generarea comprimată de texte scurte, calitatea slabă a textului decodificat poate proveni fie din informația pierdută de codec, fie dintr-o generare deficitară în spațiul latent. Scorurile globale nu permit distingerea acestor cauze și pot orienta efortul de optimizare către componenta greșită.

Abordare

Protocolul etapizat evaluează cu un singur evaluator extern GPT-2 originalele, reconstrucțiile pereche prin codec, rezultatele MDLM din spațiul tokenilor și rezultatele difuziei din spațiul codurilor. Măsurile referitoare la dicționarul de coduri și la geometrie rămân instrumente de diagnosticare, nu substitute pentru calitatea textului decodificat.

Rezultatul principal

Reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 și p95 de la 25.10 la 98.91. MDLM în spațiul codurilor reduce totuși perplexitatea mediană cu 30.9% față de MDLM în spațiul tokenurilor.

De ce este important

Rezultatul transformă diagnosticarea blocajului codecului într-o ordine de lucru aplicabilă: acordați prioritate îmbunătățirii codecului, comparați apoi generarea în spațiul tokenilor cu cea din spațiul codurilor și considerați credibile câștigurile indicatorilor surogat latenți numai dacă se îmbunătățește și textul decodat.

Rezumat

Generatoarele comprimate de texte scurte pot eșua în două puncte distincte: codecul poate elimina informații înainte de începerea generării, iar generatorul latent poate produce coduri slabe. Fără separarea acestor moduri de eșec, cercetătorii pot irosi resurse de calcul îmbunătățind componenta greșită. Studiem această problemă într-un studiu de caz controlat TinyStories, cu raport 64-la-16, construit pe baza unui codec VQ-VAE-2 ierarhic și a unui generator cu difuziune discretă mascată (MDLM). Folosim un protocol de validare etapizat care separă fidelitatea reconstrucției codecului, calitatea generării latente și diagnosticele latente auxiliare, toate evaluate de același evaluator extern GPT-2, și raportăm totodată metrici semantice complementare pentru studiul geometriei. În configurația testată, numai reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 (+80.4%) și p95 de la 25.10 la 98.91 (+294.1%), ceea ce arată că pierderea dominantă de calitate apare înainte de începerea generării latente. Cu același evaluator, MDLM în spațiul codurilor rămâne substanțial mai performant decât difuziunea în spațiul tokenurilor, reducând media, mediana și p95 cu 32.9%, 30.9% și, respectiv, 36.6%. Regularizarea sensibilă la geometrie îmbunătățește indicatorii surogat latenți locali, dar nu îmbunătățește metricile textului decodificat în rulările disponibile. Contribuția este metodologică, nu algoritmică: lucrarea prezintă un diagnostic etapizat reutilizabil pentru un flux concret și arată că, în acest cadru, fidelitatea codecului, nu eliminarea zgomotului latent, stabilește plafonul practic al calității.

Publicat în 2026 39th Conference of Open Innovations Association (FRUCT)

Tipul contribuției Metodologie de diagnosticare

numărul 1pp. 69–76Conferința principală

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Distribuiți această lucrareDistribuiți

Rezultate principale

Rezultatele principale ale lucrării «Unde se degradează calitatea în generarea de texte scurte comprimate: localizarea etapizată a blocajului»
Punct de evaluarenPPL mediePPL medianăPPL p95
Texte originale25616.2415.1725.1
Reconstrucții ale codecului25637.2627.3698.91
Reper AR25130.9823.2756.11
MDLM în spațiul tokenilor25644.7438.4293.6
MDLM în spațiul codurilor25630.0126.5559.36

Rezultatul principal. Cea mai mare parte a pierderii de calitate observate apare înaintea generării; cu toate acestea, difuzia în spațiul codurilor reduce perplexitatea mediană cu 30.9% față de difuzia în spațiul tokenurilor.

Set de date
TinyStories
Dimensiunea eșantionului
256 de eșantioane pereche pentru reconstrucție; 251–256 de eșantioane generate per mod; patru configurații geometrice echivalente.
Metrici
Perplexitate GPT-2 externă: medie, mediană, p95 și maxim; utilizarea dicționarului de coduri și dimensiunea suportului; SBERT, BERTScore, MAUVE și un rezumat furnizat de un evaluator LLM pentru rulările de geometrie
Incertitudine
Comparațiile raportate provin din rulări individuale descriptive; nu au fost calculate intervale de încredere sau estimări ale semnificației pe mai multe semințe.
Condiții
Secvențe de 64 de tokenuri GPT-2, comprimate în 16 coduri de nivel superior cu un VQ-VAE-2 ierarhic; toate modurile de generare utilizează același evaluator extern.

PDF și citare

Citați această lucrare BibTeX este formatul recomandat. Fiecare variantă de mai jos este generată din aceeași înregistrare a publicației.

Deschideți PDF-ul
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Descărcați .bib

Fișiere de citare:Text APAText IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadate XML JATS 1.4Text integral în format JATS 1.4 XMLRDF TurtleSet de legături (JSON)Set de legături (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Ghid complet

Ghid complet de cercetare

Metodă

Lucrarea utilizează un singur evaluator în trei etape de evaluare, astfel încât fiecărei transformări suplimentare să îi poată fi asociat un decalaj de calitate măsurabil.

  1. Reconstruiți

    Codificați fiecare eșantion TinyStories de 64 de tokenuri în 16 coduri de nivel superior și decodificați-l imediat pentru a măsura pierderea de reconstrucție a codecului.

  2. Generare

    Generați cu MDLM fie tokenuri textuale, fie coduri latente discrete, apoi decodificați eșantioanele din spațiul codurilor prin același codec antrenat.

  3. Comparați

    Evaluați originalele, reconstrucțiile și textele generate prin același protocol extern GPT-2, incluzând statistici privind mediana și cozile distribuției.

Flux etapizat de generare a textului comprimat, care compară textul original, reconstrucția codecului, MDLM în spațiul codurilor și textul decodat, pentru a separa pierderea codecului de pierderea de generare.
Localizarea etapizată a blocajelor separă pierderea de reconstrucție a codecului de pierderea generării latente, în cadrul unui protocol comun de evaluare a textului decodat.Sursă: Diagramă explicativă creată de autor pe baza metodei și rezultatelor publicate..Condiții de reutilizare: CC BY 4.0.Citare sugerată: Gavrilov, Gazzaev și Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Descărcați SVG.

Ideea principală

Un generator din aval nu poate recupera informația pe care codecul a eliminat-o deja. Prin urmare, etapa de reconstrucție trebuie auditată înainte de interpretarea rezultatelor generării latente.

Deosebirea față de abordările înrudite

Comparațiile standard de la un capăt la altul raportează un singur scor final de generare. Acest protocol introduce un punct de control pereche pentru reconstrucție și separă metricile de stare din spațiul latent de dovezile obținute pe textul decodat.

Elemente de noutate

Contribuția constă într-o metodologie reutilizabilă de diagnosticare etapizată pentru un flux concret de text comprimat, nu într-un nou algoritm de eliminare a zgomotului.

Întrebări la care contribuie acest articol

Deschideți o întrebare pentru un răspuns concis fundamentat în lucrare. Limitele detaliate ale dovezilor sunt prezentate în secțiunea Limitări.

  1. Unde se degradează calitatea în generarea comprimată de texte scurte?

    În fluxul TinyStories 64-la-16 testat, degradarea dominantă apare la reconstrucția codecului, înainte de începerea generării în spațiul latent. Perplexitatea externă mediană GPT-2 crește de la 15.17 pentru textul original la 27.36 după reconstrucție, iar p95 crește de la 25.10 la 98.91. Acesta este rezultatul unei singure configurații, nu un clasament universal al codecurilor.

  2. Cum poate fi separată pierderea codecului de pierderea de generare în spațiul latent?

    Protocolul etapizat evaluează textele originale, reconstrucțiile pereche prin codec și textul generat final cu același evaluator extern. Diferența dintre original și reconstrucție estimează contribuția codecului, iar comparația dintre reconstrucție și rezultatul generat ajută la localizarea pierderii suplimentare din etapa de generare. Metricile privind starea reprezentării latente sunt raportate separat de dovezile obținute din textul decodificat.

  3. Cum trebuie evaluată generarea de text cu reprezentări latente discrete?

    Lucrarea recomandă verificarea fidelității reconstrucției înainte de compararea generatoarelor, aplicarea aceluiași evaluator al textului decodat în fiecare etapă și raportarea statisticilor centrale și ale cozilor distribuției. De asemenea, tratează utilizarea dicționarului de coduri, geometria și alți indicatori surogat latenți drept instrumente de diagnostic, nu drept înlocuitori ai calității textului decodat.

  4. Difuzia în spațiul codurilor depășește difuzia în spațiul tokenurilor?

    În condițiile evaluatorului comun și ale configurației testate, MDLM din spațiul codurilor reduce perplexitatea medie, mediană și p95 cu 32.9%, 30.9% și, respectiv, 36.6% față de MDLM din spațiul tokenilor. Comparația este descriptivă și specifică acestei configurații: ea nu stabilește un clasament universal pentru seturi de date, rapoarte de compresie, codecuri sau arhitecturi de difuziune diferite.

  5. Valorile mai bune ale metricilor geometriei latente garantează un text generat mai bun?

    Nu. În execuțiile comparabile disponibile, regularizarea sensibilă la geometrie a îmbunătățit indicatorii indirecți locali din spațiul latent, dar nu și metricile textului decodificat. Rezultatul susține verificarea fiecărui câștig al indicatorilor indirecți la nivelul ieșirii finale decodificate și interpretarea absenței transferului drept un rezultat negativ util, nu drept dovadă a îmbunătățirii generării.

Comparație cu abordări înrudite

Comparație factuală între «Unde se degradează calitatea în generarea de texte scurte comprimate: localizarea etapizată a blocajului» și abordările înrudite
AbordareReprezentareControl / diagnosticareCe se păstrează sau se măsoară
Difuziune în spațiul tokenilorTokeni textualiCalitatea generării în spațiul tokenurilorFluența generării directe și comportamentul evaluatorului
Generare latentă comprimatăCoduri latente discrete obținute printr-un codecCalitatea finală a generării de la un capăt la altulComportamentul combinat al codecului și al generatorului latent
Localizarea etapizată a blocajelorText, reconstrucții ale codecului și variabile latente discreteSeparați pierderea codecului de pierderea de generareUnde se degradează calitatea conform unui evaluator comun

Comparația diferențiază domeniul evaluării și dovezile; nu reprezintă o ierarhizare universală a abordărilor.

Relevanță și domeniu de aplicare

Protocolul etapizat este util atunci când un flux generativ cuprinde atât un codec învățat, cât și un generator în spațiul latent, iar sursa degradării calității rezultatelor nu este clară.

  1. Generarea comprimată de text cu variabile latente discrete

  2. Fidelitatea reconstrucției codecului în fluxurile generative

  3. Modelarea limbajului prin difuzie mascată în spațiul codurilor

  4. Localizarea blocajelor și evaluarea coerentă între etape

  5. Auditarea îmbunătățirilor indicatorilor surogat din spațiul latent în raport cu textul decodificat

Consultați limitările și limitele dovezilor

Limitări

  • Studiul empiric utilizează exclusiv TinyStories.
  • Analiza principală acoperă un singur regim agresiv de compresie de la 64 la 16.
  • Sistemul evaluat combină o singură familie de codecuri VQ-VAE-2 ierarhice cu un singur generator MDLM.
  • Comparațiile se bazează pe rulări unice și au caracter descriptiv; ele nu reprezintă estimări statistice obținute din rulări cu mai multe inițializări aleatoare.
  • Perplexitatea GPT-2 externă este un instrument comun de diagnosticare, nu o metrică universală a calității semantice.
  • Concluziile nu trebuie extrapolate direct la toate seturile de date, arhitecturile de codec sau ratele de compresie.

Referințe citate în articol

Aceste intrări corespund secțiunii numerotate de referințe din versiunea PDF a lucrării.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Resurse și reproductibilitate

Editor
IEEE
Resursele publicației
Manuscrisul public, tabelele cu rezultate, figura explicativă și fișierele de citare sunt disponibile aici. Codul implementării și punctele de control nu au fost publicate.

Declarație privind datele

Sursă
TinyStories, astfel cum este descris în lucrare.
Licență
Utilizarea TinyStories rămâne supusă condițiilor proprii ale setului de date; acest site nu redistribuie niciun fișier al setului de date.
Preprocesare
Tokenizare GPT-2, intrări fixe de 64 de tokenuri și compresie temporală ierarhică de la 64 la 32 și apoi la 16 poziții.
Împărțire
Publicația raportează 256 de eșantioane pereche pentru reconstrucție și 251–256 de eșantioane generate pentru fiecare mod; nu publică un manifest reutilizabil al împărțirii în seturi de antrenare și validare.
Format
Eșantioane de text scurt, secvențe de tokeni GPT-2, secvențe de coduri discrete, jurnale de generare și tabele sintetice.
Versiune / sumă de control
Articolul nu raportează o sumă de control a setului de date sau un identificator imuabil al instantaneului TinyStories.
Achiziție
Pagina publicației nu pune la dispoziție un script public de achiziție.
Limite de utilizare
Dovezile acoperă povestiri sintetice scurte și nu trebuie considerate un reper pentru generarea nerestricționată de limbaj natural.

Versiuni

  1. Versiunea publicatăIEEE / FRUCT, 2026
  2. Manuscrisul autoruluiPDF local accesibil ca text
  3. Prezentare la conferințăPrezentare FRUCT 39
  4. Indexul volumului conferințeiVolumul oficial FRUCT 39
  5. PDF-ul volumului conferințeiText integral FRUCT cu acces liber
  6. Deschideți înregistrarea academicăOpenAlex
  7. Înregistrare în graful de cităriSemantic Scholar
  8. Text integral distribuit de autorResearchGate

DOI-ul publicat este identificatorul bibliografic principal. Această pagină rămâne unicul URL canonic al proiectului pentru toate versiunile.