Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Kde se láme kvalita při generování komprimovaných krátkých textů: vícefázová lokalizace úzkého hrdla

Vícefázová diagnostika generování komprimovaných krátkých textů, která odděluje ztrátu při rekonstrukci kodeku od ztráty při generování v latentním prostoru.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Přečíst celý článek v HTMLProhledávatelný text se vzorci, tabulkami, obrázky a bibliografickými odkazy.

Konečná přijatá verze rukopisu (verze zveřejněná autorem s DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Podmínky zveřejnění a opětovného použití.

Článek ve 30 sekundách

Výzkumná otázkaJak v řetězci generování komprimovaného textu samostatně přisoudit pokles kvality kodeku a latentnímu generátoru?

Problém

Při generování komprimovaných krátkých textů může nízká kvalita dekódovaného textu pramenit buď z informací ztracených kodekem, nebo z nedostatečného generování v latentním prostoru. Hodnocení celého řetězce tyto způsoby selhání zastírá, a optimalizační úsilí tak může být zaměřeno na nesprávnou komponentu.

Přístup

Vícefázový protokol hodnotí originály, odpovídající rekonstrukce kodekem, výstupy MDLM v prostoru tokenů a výstupy difuze v prostoru kódů jediným externím hodnotitelem GPT-2. Metriky číselníku kódů a geometrie slouží jako diagnostické ukazatele, nikoli jako náhrada hodnocení kvality dekódovaného textu.

Hlavní výsledek

Rekonstrukce kodeku zvyšuje medián externí perplexity z 15.17 na 27.36 a p95 z 25.10 na 98.91. MDLM v prostoru kódů přesto snižuje medián perplexity o 30.9 % oproti MDLM v prostoru tokenů.

Proč je to důležité

Výsledek převádí diagnostiku úzkého hrdla kodeku do praktického pořadí práce: nejprve zlepšit kodek, poté porovnat generování v prostoru tokenů a v prostoru kódů a zlepšení zástupných metrik v latentním prostoru považovat za přínos pouze tehdy, zlepší-li se i dekódovaný text.

Abstrakt

Generátory komprimovaných krátkých textů mohou selhávat ve dvou různých fázích: kodek může zahodit informace ještě před zahájením generování, nebo latentní generátor může vytvářet nekvalitní kódy. Bez rozlišení těchto režimů selhání mohou výzkumníci vynakládat výpočetní prostředky na zlepšování nesprávné komponenty. Tento problém zkoumáme v kontrolované případové studii TinyStories s kompresí z 64 na 16, založené na hierarchickém kodeku VQ-VAE-2 a generátoru s maskovanou diskrétní difuzí (MDLM). Používáme vícefázový validační protokol, který s jedním společným externím hodnotitelem GPT-2 odděluje věrnost rekonstrukce kodeku, kvalitu generování v latentním prostoru a pomocné diagnostické metriky latentních reprezentací; pro studii geometrie zároveň uvádíme doplňkové sémantické metriky. V testované konfiguraci zvyšuje samotná rekonstrukce kodekem medián externí perplexity z 15.17 na 27.36 (+80.4 %) a p95 z 25.10 na 98.91 (+294.1 %), což ukazuje, že dominantní ztráta kvality nastává ještě před zahájením generování v latentním prostoru. Při hodnocení týmž modelem si MDLM v prostoru kódů vede podstatně lépe než difuze v prostoru tokenů: snižuje průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Regularizace zohledňující geometrii zlepšuje lokální zástupné metriky v latentním prostoru, avšak v dostupných bězích nezlepšuje metriky dekódovaného textu. Přínos je metodologický, nikoli algoritmický: článek představuje opakovaně použitelnou vícefázovou diagnostiku jednoho konkrétního řetězce a ukazuje, že v tomto uspořádání určuje praktický strop kvality věrnost kodeku, nikoli latentní odšumování.

Publikováno na 2026 39th Conference of Open Innovations Association (FRUCT)

Typ přínosu Diagnostická metodologie

číslo 1s. 69–76Hlavní konference

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Sdílet tento článekSdílet

Klíčové výsledky

Kde se při generování komprimovaného krátkého textu zhoršuje kvalita: etapová lokalizace úzkého hrdla – hlavní výsledky
Bod evaluacenPrůměrná PPLMedián PPLPPL na 95. percentilu
Původní texty25616.2415.1725.1
Rekonstrukce kodeku25637.2627.3698.91
Výchozí model AR25130.9823.2756.11
MDLM v prostoru tokenů25644.7438.4293.6
MDLM v prostoru kódů25630.0126.5559.36

Klíčový výsledek. Většina pozorovaného poklesu kvality vzniká před generováním; difuze v prostoru kódů přesto snižuje medián perplexity o 30.9% oproti difuzi v prostoru tokenů.

Datová sada
TinyStories
Velikost vzorku
256 párových vzorků rekonstrukce; 251–256 generovaných vzorků pro každý režim; čtyři vzájemně sladěná nastavení geometrie.
Metriky
Externě měřená perplexita GPT-2: průměr, medián, p95 a maximum; využití číselníku kódů a velikost jeho podpory; SBERT, BERTScore, MAUVE a souhrn hodnocení modelem LLM pro běhy zaměřené na geometrii
Nejistota
Uvedená porovnání vycházejí z popisných jednotlivých běhů; intervaly spolehlivosti ani odhady statistické významnosti pro více náhodných semen nebyly vypočteny.
Podmínky
Posloupnosti tokenů GPT-2 o délce 64 komprimované hierarchickým modelem VQ-VAE-2 do 16 kódů nejvyšší úrovně; všechny režimy generování používají společný externí hodnotitel.

PDF a citace

Jak citovat tento článek Doporučeným formátem je BibTeX. Všechny níže uvedené varianty pocházejí z téhož záznamu o publikaci.

Otevřít PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Stáhnout .bib

Citační soubory:Text citace podle APAText ve formátu IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadata XML ve formátu JATS 1.4Plný text ve formátu JATS 1.4 XMLRDF TurtleSada odkazů (JSON)Sada odkazů (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Úplný průvodce

Úplný výzkumný průvodce

Metoda

Článek používá ve třech fázích hodnocení tutéž hodnoticí funkci, aby bylo možné každé další transformaci přiřadit měřitelný rozdíl v kvalitě.

  1. Rekonstrukce

    Každý 64tokenový vzorek TinyStories zakódujte do 16 kódů nejvyšší úrovně a bezprostředně jej dekódujte, abyste změřili ztrátu rekonstrukce kodekem.

  2. Generování

    Pomocí MDLM vygenerujte buď textové tokeny, nebo diskrétní latentní kódy a vzorky z prostoru kódů následně dekódujte týmž natrénovaným kodekem.

  3. Porovnání

    Ohodnoťte původní texty, rekonstrukce i generované texty stejným externím protokolem GPT-2 včetně mediánu a statistik chvostů rozdělení.

Vícefázový řetězec generování komprimovaného textu porovnává původní text, rekonstrukci kodekem, MDLM v prostoru kódů a dekódovaný text, aby oddělil ztrátu způsobenou kodekem od ztráty při generování.
Vícefázová lokalizace úzkého hrdla odděluje ztrátu při rekonstrukci kodekem od ztráty při generování v latentním prostoru pomocí jediného společného protokolu hodnocení dekódovaného textu.Zdroj: Vysvětlující schéma vytvořené autorem na základě publikované metody a výsledků..Podmínky opětovného užití: CC BY 4.0.Doporučená citace: Gavrilov, Gazzaev a Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Stáhnout SVG.

Hlavní myšlenka

Navazující generátor nedokáže obnovit informace, které kodek již zahodil. Před interpretací výsledků generování v latentním prostoru je proto nutné prověřit fázi rekonstrukce.

Rozdíl oproti příbuzným přístupům

Standardní porovnání typu end-to-end uvádějí jediné konečné skóre generování. Tento protokol zavádí párový kontrolní bod rekonstrukce a odděluje diagnostické metriky v latentním prostoru od důkazů získaných z dekódovaného textu.

Co je nové

Přínosem je opakovaně použitelná metodika postupné diagnostiky jedné konkrétní pipeline komprimovaného textu, nikoli nový algoritmus odstraňování šumu.

Otázky, na které článek pomáhá odpovědět

Otevřete otázku a zobrazte stručnou odpověď opřenou o článek. Podrobné hranice důkazní platnosti jsou uvedeny v části Omezení.

  1. Ve které fázi se při generování komprimovaného krátkého textu zhoršuje kvalita?

    V testovaném řetězci TinyStories s kompresí 64 na 16 dochází k hlavnímu zhoršení již při rekonstrukci kodekem, tedy před zahájením generování v latentním prostoru. Medián externí perplexity podle GPT-2 roste z 15.17 u původního textu na 27.36 po rekonstrukci, zatímco p95 vzroste z 25.10 na 98.91. Jde o výsledek jediné konfigurace, nikoli o obecně platné pořadí kodeků.

  2. Jak lze oddělit ztrátu způsobenou kodekem od ztráty při generování v latentním prostoru?

    Etapový protokol hodnotí originály, odpovídající rekonstrukce kodekem a výsledný generovaný text pomocí jediného společného externího hodnotitele. Rozdíl mezi originálem a rekonstrukcí odhaduje příspěvek kodeku, zatímco srovnání rekonstrukce s generovaným výstupem pomáhá lokalizovat dodatečnou ztrátu při generování. Metriky stavu latentní reprezentace se uvádějí odděleně od dokladů založených na dekódovaném textu.

  3. Jak hodnotit generování textu s diskrétními latentními reprezentacemi?

    Článek doporučuje před porovnáváním generátorů ověřit věrnost rekonstrukce, v každé fázi použít stejnou hodnoticí funkci pro dekódovaný text a uvádět centrální statistiky i statistiky chvostů rozdělení. Využití číselníku kódů, geometrii a další latentní zástupné metriky zároveň chápe jako diagnostické ukazatele, nikoli jako náhradu hodnocení kvality dekódovaného textu.

  4. Překonává difuze v prostoru kódů difuzi v prostoru tokenů?

    Při společném hodnotiteli a testovaném uspořádání snižuje MDLM v prostoru kódů oproti MDLM v prostoru tokenů průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Srovnání je popisné a specifické pro danou konfiguraci: neurčuje univerzální pořadí napříč datovými sadami, kompresními poměry, kodeky ani difuzními architekturami.

  5. Zaručují lepší metriky latentní geometrie kvalitnější generovaný text?

    Ne. V dostupných párově srovnatelných bězích regularizace zohledňující geometrii zlepšila lokální zástupné ukazatele v latentním prostoru, nikoli však metriky dekódovaného textu. Výsledek podporuje ověřování každého zlepšení zástupného ukazatele na konečném dekódovaném výstupu a chápání nepřeneseného zlepšení jako užitečného negativního výsledku, nikoli jako dokladu lepšího generování.

Porovnání s příbuznými přístupy

Kde se při generování komprimovaného krátkého textu zhoršuje kvalita: etapová lokalizace úzkého hrdla – věcné srovnání s příbuznými přístupy
PřístupReprezentaceKontrola / diagnostikaCo se zachovává nebo měří
Difuze v prostoru tokenůTextové tokenyKvalita generování v prostoru tokenůPlynulost přímého generování a chování hodnotitele
Komprimované latentní generováníDiskrétní latentní kódy získané pomocí kodekuVýsledná kvalita generování v celém řetězciKombinované chování kodeku a latentního generátoru
Postupná lokalizace úzkých místText, rekonstrukce kodekem a diskrétní latentní reprezentaceOddělte ztrátu kodeku od ztráty při generováníKde se při společném hodnotiteli zhoršuje kvalita

Porovnání rozlišuje rozsah hodnocení a průkaznost důkazů; nejde o univerzální pořadí přístupů.

Relevance a rozsah

Etapový protokol je užitečný tehdy, když generativní řetězec obsahuje naučený kodek i generátor v latentním prostoru, ale příčina zhoršené kvality výstupu není zřejmá.

  1. Generování textu s komprimovanými a diskrétními latentními reprezentacemi

  2. Věrnost rekonstrukce kodeku v generativních pipeline

  3. Jazykové modelování pomocí maskované difuze v prostoru kódů

  4. Lokalizace úzkého hrdla a hodnocení konzistentní napříč fázemi

  5. Ověřování zlepšení zástupných metrik v latentním prostoru na dekódovaném textu

Viz omezení a hranice průkaznosti důkazů

Omezení

  • Empirická studie používá výhradně TinyStories.
  • Hlavní analýza zahrnuje jediný agresivní kompresní režim 64 ku 16.
  • Hodnocený systém kombinuje jednu rodinu hierarchických kodeků VQ-VAE-2 s jedním generátorem MDLM.
  • Porovnání vycházejí z jednotlivých běhů a mají popisný charakter; nejde o statistické odhady založené na více náhodných inicializacích.
  • Externě měřená perplexita GPT-2 je společným diagnostickým ukazatelem, nikoli univerzální metrikou sémantické kvality.
  • Závěry nelze bezprostředně přenášet na všechny datové sady, architektury kodeků ani kompresní poměry.

Literatura citovaná v článku

Tyto položky odpovídají číslovanému oddílu References v PDF článku.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Zdroje a reprodukovatelnost

Vydavatel
IEEE
Zdroje k publikaci
Veřejný rukopis, tabulky výsledků, vysvětlující obrázek a citační soubory jsou k dispozici zde. Implementační kód ani kontrolní body nebyly zveřejněny.

Prohlášení o datech

Zdroj
TinyStories, jak je popsáno v článku.
Licence
Použití TinyStories se nadále řídí vlastními podmínkami datové sady; tento web žádné její soubory dále nešíří.
Předzpracování
Tokenizace GPT-2, vstupy s pevnou délkou 64 tokenů a hierarchická časová komprese z 64 na 32 a následně na 16 pozic.
Rozdělit
Publikace uvádí 256 párových vzorků rekonstrukce a 251–256 generovaných vzorků pro každý režim; opakovaně použitelný manifest rozdělení na trénovací a validační data nezveřejňuje.
Formát
Vzorky krátkých textů, posloupnosti tokenů GPT-2, posloupnosti diskrétních kódů, záznamy generování a souhrnné tabulky.
Verze / kontrolní součet
Článek neuvádí kontrolní součet datové sady ani neměnný identifikátor snímku TinyStories.
Získání dat
Spolu se stránkou publikace nebyl zveřejněn skript pro získání dat.
Meze použití
Důkazy se týkají krátkých syntetických příběhů a nelze je považovat za benchmark neomezeného generování přirozeného jazyka.

Verze

  1. Publikovaná verzeIEEE / FRUCT, 2026
  2. Konferenční přednáškaPrezentace na FRUCT 39
  3. Rejstřík konferenčního sborníkuOficiální svazek FRUCT 39
  4. PDF konferenčního sborníkuVolně dostupný plný text FRUCT
  5. Otevřít odborný záznamOpenAlex
  6. Záznam v citačním grafuSemantic Scholar
  7. Plný text zpřístupněný autoremResearchGate

Publikované DOI je primárním bibliografickým identifikátorem. Tato stránka zůstává napříč verzemi jedinou kanonickou adresou URL projektu.