Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Unde se degradează calitatea în generarea comprimată de texte scurte: localizarea etapizată a blocajelor
Un diagnostic etapizat al generării comprimate de texte scurte, care separă pierderea de reconstrucție introdusă de codec de pierderea introdusă de generarea latentă.
Citiți articolul integral în format HTMLText interogabil cu formule, tabele, figuri și referințe.
Manuscrisul final acceptat (versiune publicată de autor, cu DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Condiții de publicare și reutilizare.
Lucrarea în 30 de secunde
Întrebare de cercetareCum poate fi atribuită separat codecului și generatorului latent pierderea calității dintr-un flux de generare a textului comprimat?
Problemă
În generarea comprimată de texte scurte, calitatea slabă a textului decodificat poate proveni fie din informația pierdută de codec, fie dintr-o generare deficitară în spațiul latent. Scorurile globale nu permit distingerea acestor cauze și pot orienta efortul de optimizare către componenta greșită.
Abordare
Protocolul etapizat evaluează cu un singur evaluator extern GPT-2 originalele, reconstrucțiile pereche prin codec, rezultatele MDLM din spațiul tokenilor și rezultatele difuziei din spațiul codurilor. Măsurile referitoare la dicționarul de coduri și la geometrie rămân instrumente de diagnosticare, nu substitute pentru calitatea textului decodificat.
Rezultatul principal
Reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 și p95 de la 25.10 la 98.91. MDLM în spațiul codurilor reduce totuși perplexitatea mediană cu 30.9% față de MDLM în spațiul tokenurilor.
De ce este important
Rezultatul transformă diagnosticarea blocajului codecului într-o ordine de lucru aplicabilă: acordați prioritate îmbunătățirii codecului, comparați apoi generarea în spațiul tokenilor cu cea din spațiul codurilor și considerați credibile câștigurile indicatorilor surogat latenți numai dacă se îmbunătățește și textul decodat.
Rezumat
Generatoarele comprimate de texte scurte pot eșua în două puncte distincte: codecul poate elimina informații înainte de începerea generării, iar generatorul latent poate produce coduri slabe. Fără separarea acestor moduri de eșec, cercetătorii pot irosi resurse de calcul îmbunătățind componenta greșită. Studiem această problemă într-un studiu de caz controlat TinyStories, cu raport 64-la-16, construit pe baza unui codec VQ-VAE-2 ierarhic și a unui generator cu difuziune discretă mascată (MDLM). Folosim un protocol de validare etapizat care separă fidelitatea reconstrucției codecului, calitatea generării latente și diagnosticele latente auxiliare, toate evaluate de același evaluator extern GPT-2, și raportăm totodată metrici semantice complementare pentru studiul geometriei. În configurația testată, numai reconstrucția codecului crește perplexitatea externă mediană de la 15.17 la 27.36 (+80.4%) și p95 de la 25.10 la 98.91 (+294.1%), ceea ce arată că pierderea dominantă de calitate apare înainte de începerea generării latente. Cu același evaluator, MDLM în spațiul codurilor rămâne substanțial mai performant decât difuziunea în spațiul tokenurilor, reducând media, mediana și p95 cu 32.9%, 30.9% și, respectiv, 36.6%. Regularizarea sensibilă la geometrie îmbunătățește indicatorii surogat latenți locali, dar nu îmbunătățește metricile textului decodificat în rulările disponibile. Contribuția este metodologică, nu algoritmică: lucrarea prezintă un diagnostic etapizat reutilizabil pentru un flux concret și arată că, în acest cadru, fidelitatea codecului, nu eliminarea zgomotului latent, stabilește plafonul practic al calității.
Publicat în 2026 39th Conference of Open Innovations Association (FRUCT)
Tipul contribuției Metodologie de diagnosticare
numărul 1pp. 69–76Conferința principală
Rezultate principale
| Punct de evaluare | n | PPL medie | PPL mediană | PPL p95 |
|---|---|---|---|---|
| Texte originale | 256 | 16.24 | 15.17 | 25.1 |
| Reconstrucții ale codecului | 256 | 37.26 | 27.36 | 98.91 |
| Reper AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM în spațiul tokenilor | 256 | 44.74 | 38.42 | 93.6 |
| MDLM în spațiul codurilor | 256 | 30.01 | 26.55 | 59.36 |
Rezultatul principal. Cea mai mare parte a pierderii de calitate observate apare înaintea generării; cu toate acestea, difuzia în spațiul codurilor reduce perplexitatea mediană cu 30.9% față de difuzia în spațiul tokenurilor.
- Set de date
- TinyStories
- Dimensiunea eșantionului
- 256 de eșantioane pereche pentru reconstrucție; 251–256 de eșantioane generate per mod; patru configurații geometrice echivalente.
- Metrici
- Perplexitate GPT-2 externă: medie, mediană, p95 și maxim; utilizarea dicționarului de coduri și dimensiunea suportului; SBERT, BERTScore, MAUVE și un rezumat furnizat de un evaluator LLM pentru rulările de geometrie
- Incertitudine
- Comparațiile raportate provin din rulări individuale descriptive; nu au fost calculate intervale de încredere sau estimări ale semnificației pe mai multe semințe.
- Condiții
- Secvențe de 64 de tokenuri GPT-2, comprimate în 16 coduri de nivel superior cu un VQ-VAE-2 ierarhic; toate modurile de generare utilizează același evaluator extern.
Descărcați rezultatele:CSVJSONMarkdownOglindă externă:Fișa setului de date Hugging Face
PDF și citare
Citați această lucrare BibTeX este formatul recomandat. Fiecare variantă de mai jos este generată din aceeași înregistrare a publicației.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Fișiere de citare:Text APAText IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadate XML JATS 1.4Text integral în format JATS 1.4 XMLRDF TurtleSet de legături (JSON)Set de legături (HTTP)RO-Crate
Ghid complet
Ghid complet de cercetare
Metodă
Lucrarea utilizează un singur evaluator în trei etape de evaluare, astfel încât fiecărei transformări suplimentare să îi poată fi asociat un decalaj de calitate măsurabil.
Reconstruiți
Codificați fiecare eșantion TinyStories de 64 de tokenuri în 16 coduri de nivel superior și decodificați-l imediat pentru a măsura pierderea de reconstrucție a codecului.
Generare
Generați cu MDLM fie tokenuri textuale, fie coduri latente discrete, apoi decodificați eșantioanele din spațiul codurilor prin același codec antrenat.
Comparați
Evaluați originalele, reconstrucțiile și textele generate prin același protocol extern GPT-2, incluzând statistici privind mediana și cozile distribuției.
Ideea principală
Un generator din aval nu poate recupera informația pe care codecul a eliminat-o deja. Prin urmare, etapa de reconstrucție trebuie auditată înainte de interpretarea rezultatelor generării latente.
Deosebirea față de abordările înrudite
Comparațiile standard de la un capăt la altul raportează un singur scor final de generare. Acest protocol introduce un punct de control pereche pentru reconstrucție și separă metricile de stare din spațiul latent de dovezile obținute pe textul decodat.
Elemente de noutate
Contribuția constă într-o metodologie reutilizabilă de diagnosticare etapizată pentru un flux concret de text comprimat, nu într-un nou algoritm de eliminare a zgomotului.
Întrebări la care contribuie acest articol
Deschideți o întrebare pentru un răspuns concis fundamentat în lucrare. Limitele detaliate ale dovezilor sunt prezentate în secțiunea Limitări.
Unde se degradează calitatea în generarea comprimată de texte scurte?
În fluxul TinyStories 64-la-16 testat, degradarea dominantă apare la reconstrucția codecului, înainte de începerea generării în spațiul latent. Perplexitatea externă mediană GPT-2 crește de la 15.17 pentru textul original la 27.36 după reconstrucție, iar p95 crește de la 25.10 la 98.91. Acesta este rezultatul unei singure configurații, nu un clasament universal al codecurilor.
Cum poate fi separată pierderea codecului de pierderea de generare în spațiul latent?
Protocolul etapizat evaluează textele originale, reconstrucțiile pereche prin codec și textul generat final cu același evaluator extern. Diferența dintre original și reconstrucție estimează contribuția codecului, iar comparația dintre reconstrucție și rezultatul generat ajută la localizarea pierderii suplimentare din etapa de generare. Metricile privind starea reprezentării latente sunt raportate separat de dovezile obținute din textul decodificat.
Cum trebuie evaluată generarea de text cu reprezentări latente discrete?
Lucrarea recomandă verificarea fidelității reconstrucției înainte de compararea generatoarelor, aplicarea aceluiași evaluator al textului decodat în fiecare etapă și raportarea statisticilor centrale și ale cozilor distribuției. De asemenea, tratează utilizarea dicționarului de coduri, geometria și alți indicatori surogat latenți drept instrumente de diagnostic, nu drept înlocuitori ai calității textului decodat.
Difuzia în spațiul codurilor depășește difuzia în spațiul tokenurilor?
În condițiile evaluatorului comun și ale configurației testate, MDLM din spațiul codurilor reduce perplexitatea medie, mediană și p95 cu 32.9%, 30.9% și, respectiv, 36.6% față de MDLM din spațiul tokenilor. Comparația este descriptivă și specifică acestei configurații: ea nu stabilește un clasament universal pentru seturi de date, rapoarte de compresie, codecuri sau arhitecturi de difuziune diferite.
Valorile mai bune ale metricilor geometriei latente garantează un text generat mai bun?
Nu. În execuțiile comparabile disponibile, regularizarea sensibilă la geometrie a îmbunătățit indicatorii indirecți locali din spațiul latent, dar nu și metricile textului decodificat. Rezultatul susține verificarea fiecărui câștig al indicatorilor indirecți la nivelul ieșirii finale decodificate și interpretarea absenței transferului drept un rezultat negativ util, nu drept dovadă a îmbunătățirii generării.
Comparație cu abordări înrudite
| Abordare | Reprezentare | Control / diagnosticare | Ce se păstrează sau se măsoară |
|---|---|---|---|
| Difuziune în spațiul tokenilor | Tokeni textuali | Calitatea generării în spațiul tokenurilor | Fluența generării directe și comportamentul evaluatorului |
| Generare latentă comprimată | Coduri latente discrete obținute printr-un codec | Calitatea finală a generării de la un capăt la altul | Comportamentul combinat al codecului și al generatorului latent |
| Localizarea etapizată a blocajelor | Text, reconstrucții ale codecului și variabile latente discrete | Separați pierderea codecului de pierderea de generare | Unde se degradează calitatea conform unui evaluator comun |
Comparația diferențiază domeniul evaluării și dovezile; nu reprezintă o ierarhizare universală a abordărilor.
Relevanță și domeniu de aplicare
Protocolul etapizat este util atunci când un flux generativ cuprinde atât un codec învățat, cât și un generator în spațiul latent, iar sursa degradării calității rezultatelor nu este clară.
Generarea comprimată de text cu variabile latente discrete
Fidelitatea reconstrucției codecului în fluxurile generative
Modelarea limbajului prin difuzie mascată în spațiul codurilor
Localizarea blocajelor și evaluarea coerentă între etape
Auditarea îmbunătățirilor indicatorilor surogat din spațiul latent în raport cu textul decodificat
Limitări
- Studiul empiric utilizează exclusiv TinyStories.
- Analiza principală acoperă un singur regim agresiv de compresie de la 64 la 16.
- Sistemul evaluat combină o singură familie de codecuri VQ-VAE-2 ierarhice cu un singur generator MDLM.
- Comparațiile se bazează pe rulări unice și au caracter descriptiv; ele nu reprezintă estimări statistice obținute din rulări cu mai multe inițializări aleatoare.
- Perplexitatea GPT-2 externă este un instrument comun de diagnosticare, nu o metrică universală a calității semantice.
- Concluziile nu trebuie extrapolate direct la toate seturile de date, arhitecturile de codec sau ratele de compresie.
Referințe citate în articol
Aceste intrări corespund secțiunii numerotate de referințe din versiunea PDF a lucrării.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Resurse și reproductibilitate
- Editor
- IEEE
- PDF local al textului
- Manuscrisul final acceptat (versiune publicată de autor, cu DOI)
- Resursele publicației
- Manuscrisul public, tabelele cu rezultate, figura explicativă și fișierele de citare sunt disponibile aici. Codul implementării și punctele de control nu au fost publicate.
Declarație privind datele
- Sursă
- TinyStories, astfel cum este descris în lucrare.
- Licență
- Utilizarea TinyStories rămâne supusă condițiilor proprii ale setului de date; acest site nu redistribuie niciun fișier al setului de date.
- Preprocesare
- Tokenizare GPT-2, intrări fixe de 64 de tokenuri și compresie temporală ierarhică de la 64 la 32 și apoi la 16 poziții.
- Împărțire
- Publicația raportează 256 de eșantioane pereche pentru reconstrucție și 251–256 de eșantioane generate pentru fiecare mod; nu publică un manifest reutilizabil al împărțirii în seturi de antrenare și validare.
- Format
- Eșantioane de text scurt, secvențe de tokeni GPT-2, secvențe de coduri discrete, jurnale de generare și tabele sintetice.
- Versiune / sumă de control
- Articolul nu raportează o sumă de control a setului de date sau un identificator imuabil al instantaneului TinyStories.
- Achiziție
- Pagina publicației nu pune la dispoziție un script public de achiziție.
- Limite de utilizare
- Dovezile acoperă povestiri sintetice scurte și nu trebuie considerate un reper pentru generarea nerestricționată de limbaj natural.
Versiuni
- Versiunea publicatăIEEE / FRUCT, 2026
- Înregistrare arXivDeschideți înregistrarea preprintului, arXiv:2607.24176
- Manuscrisul autoruluiPDF local accesibil ca text
- Prezentare la conferințăPrezentare FRUCT 39
- Indexul volumului conferințeiVolumul oficial FRUCT 39
- PDF-ul volumului conferințeiText integral FRUCT cu acces liber
- Deschideți înregistrarea academicăOpenAlex
- Înregistrare în graful de cităriSemantic Scholar
- Text integral distribuit de autorResearchGate
DOI-ul publicat este identificatorul bibliografic principal. Această pagină rămâne unicul URL canonic al proiectului pentru toate versiunile.