Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Kde se láme kvalita při generování komprimovaných krátkých textů: vícefázová lokalizace úzkého hrdla
Vícefázová diagnostika generování komprimovaných krátkých textů, která odděluje ztrátu při rekonstrukci kodeku od ztráty při generování v latentním prostoru.
Přečíst celý článek v HTMLProhledávatelný text se vzorci, tabulkami, obrázky a bibliografickými odkazy.
Konečná přijatá verze rukopisu (verze zveřejněná autorem s DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Podmínky zveřejnění a opětovného použití.
Článek ve 30 sekundách
Výzkumná otázkaJak v řetězci generování komprimovaného textu samostatně přisoudit pokles kvality kodeku a latentnímu generátoru?
Problém
Při generování komprimovaných krátkých textů může nízká kvalita dekódovaného textu pramenit buď z informací ztracených kodekem, nebo z nedostatečného generování v latentním prostoru. Hodnocení celého řetězce tyto způsoby selhání zastírá, a optimalizační úsilí tak může být zaměřeno na nesprávnou komponentu.
Přístup
Vícefázový protokol hodnotí originály, odpovídající rekonstrukce kodekem, výstupy MDLM v prostoru tokenů a výstupy difuze v prostoru kódů jediným externím hodnotitelem GPT-2. Metriky číselníku kódů a geometrie slouží jako diagnostické ukazatele, nikoli jako náhrada hodnocení kvality dekódovaného textu.
Hlavní výsledek
Rekonstrukce kodeku zvyšuje medián externí perplexity z 15.17 na 27.36 a p95 z 25.10 na 98.91. MDLM v prostoru kódů přesto snižuje medián perplexity o 30.9 % oproti MDLM v prostoru tokenů.
Proč je to důležité
Výsledek převádí diagnostiku úzkého hrdla kodeku do praktického pořadí práce: nejprve zlepšit kodek, poté porovnat generování v prostoru tokenů a v prostoru kódů a zlepšení zástupných metrik v latentním prostoru považovat za přínos pouze tehdy, zlepší-li se i dekódovaný text.
Abstrakt
Generátory komprimovaných krátkých textů mohou selhávat ve dvou různých fázích: kodek může zahodit informace ještě před zahájením generování, nebo latentní generátor může vytvářet nekvalitní kódy. Bez rozlišení těchto režimů selhání mohou výzkumníci vynakládat výpočetní prostředky na zlepšování nesprávné komponenty. Tento problém zkoumáme v kontrolované případové studii TinyStories s kompresí z 64 na 16, založené na hierarchickém kodeku VQ-VAE-2 a generátoru s maskovanou diskrétní difuzí (MDLM). Používáme vícefázový validační protokol, který s jedním společným externím hodnotitelem GPT-2 odděluje věrnost rekonstrukce kodeku, kvalitu generování v latentním prostoru a pomocné diagnostické metriky latentních reprezentací; pro studii geometrie zároveň uvádíme doplňkové sémantické metriky. V testované konfiguraci zvyšuje samotná rekonstrukce kodekem medián externí perplexity z 15.17 na 27.36 (+80.4 %) a p95 z 25.10 na 98.91 (+294.1 %), což ukazuje, že dominantní ztráta kvality nastává ještě před zahájením generování v latentním prostoru. Při hodnocení týmž modelem si MDLM v prostoru kódů vede podstatně lépe než difuze v prostoru tokenů: snižuje průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Regularizace zohledňující geometrii zlepšuje lokální zástupné metriky v latentním prostoru, avšak v dostupných bězích nezlepšuje metriky dekódovaného textu. Přínos je metodologický, nikoli algoritmický: článek představuje opakovaně použitelnou vícefázovou diagnostiku jednoho konkrétního řetězce a ukazuje, že v tomto uspořádání určuje praktický strop kvality věrnost kodeku, nikoli latentní odšumování.
Publikováno na 2026 39th Conference of Open Innovations Association (FRUCT)
Typ přínosu Diagnostická metodologie
číslo 1s. 69–76Hlavní konference
Klíčové výsledky
| Bod evaluace | n | Průměrná PPL | Medián PPL | PPL na 95. percentilu |
|---|---|---|---|---|
| Původní texty | 256 | 16.24 | 15.17 | 25.1 |
| Rekonstrukce kodeku | 256 | 37.26 | 27.36 | 98.91 |
| Výchozí model AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM v prostoru tokenů | 256 | 44.74 | 38.42 | 93.6 |
| MDLM v prostoru kódů | 256 | 30.01 | 26.55 | 59.36 |
Klíčový výsledek. Většina pozorovaného poklesu kvality vzniká před generováním; difuze v prostoru kódů přesto snižuje medián perplexity o 30.9% oproti difuzi v prostoru tokenů.
- Datová sada
- TinyStories
- Velikost vzorku
- 256 párových vzorků rekonstrukce; 251–256 generovaných vzorků pro každý režim; čtyři vzájemně sladěná nastavení geometrie.
- Metriky
- Externě měřená perplexita GPT-2: průměr, medián, p95 a maximum; využití číselníku kódů a velikost jeho podpory; SBERT, BERTScore, MAUVE a souhrn hodnocení modelem LLM pro běhy zaměřené na geometrii
- Nejistota
- Uvedená porovnání vycházejí z popisných jednotlivých běhů; intervaly spolehlivosti ani odhady statistické významnosti pro více náhodných semen nebyly vypočteny.
- Podmínky
- Posloupnosti tokenů GPT-2 o délce 64 komprimované hierarchickým modelem VQ-VAE-2 do 16 kódů nejvyšší úrovně; všechny režimy generování používají společný externí hodnotitel.
Stáhnout výsledky:CSVJSONMarkdownExterní zrcadlová kopie:Karta datové sady na Hugging Face
PDF a citace
Jak citovat tento článek Doporučeným formátem je BibTeX. Všechny níže uvedené varianty pocházejí z téhož záznamu o publikaci.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Citační soubory:Text citace podle APAText ve formátu IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadata XML ve formátu JATS 1.4Plný text ve formátu JATS 1.4 XMLRDF TurtleSada odkazů (JSON)Sada odkazů (HTTP)RO-Crate
Úplný průvodce
Úplný výzkumný průvodce
Metoda
Článek používá ve třech fázích hodnocení tutéž hodnoticí funkci, aby bylo možné každé další transformaci přiřadit měřitelný rozdíl v kvalitě.
Rekonstrukce
Každý 64tokenový vzorek TinyStories zakódujte do 16 kódů nejvyšší úrovně a bezprostředně jej dekódujte, abyste změřili ztrátu rekonstrukce kodekem.
Generování
Pomocí MDLM vygenerujte buď textové tokeny, nebo diskrétní latentní kódy a vzorky z prostoru kódů následně dekódujte týmž natrénovaným kodekem.
Porovnání
Ohodnoťte původní texty, rekonstrukce i generované texty stejným externím protokolem GPT-2 včetně mediánu a statistik chvostů rozdělení.
Hlavní myšlenka
Navazující generátor nedokáže obnovit informace, které kodek již zahodil. Před interpretací výsledků generování v latentním prostoru je proto nutné prověřit fázi rekonstrukce.
Rozdíl oproti příbuzným přístupům
Standardní porovnání typu end-to-end uvádějí jediné konečné skóre generování. Tento protokol zavádí párový kontrolní bod rekonstrukce a odděluje diagnostické metriky v latentním prostoru od důkazů získaných z dekódovaného textu.
Co je nové
Přínosem je opakovaně použitelná metodika postupné diagnostiky jedné konkrétní pipeline komprimovaného textu, nikoli nový algoritmus odstraňování šumu.
Otázky, na které článek pomáhá odpovědět
Otevřete otázku a zobrazte stručnou odpověď opřenou o článek. Podrobné hranice důkazní platnosti jsou uvedeny v části Omezení.
Ve které fázi se při generování komprimovaného krátkého textu zhoršuje kvalita?
V testovaném řetězci TinyStories s kompresí 64 na 16 dochází k hlavnímu zhoršení již při rekonstrukci kodekem, tedy před zahájením generování v latentním prostoru. Medián externí perplexity podle GPT-2 roste z 15.17 u původního textu na 27.36 po rekonstrukci, zatímco p95 vzroste z 25.10 na 98.91. Jde o výsledek jediné konfigurace, nikoli o obecně platné pořadí kodeků.
Jak lze oddělit ztrátu způsobenou kodekem od ztráty při generování v latentním prostoru?
Etapový protokol hodnotí originály, odpovídající rekonstrukce kodekem a výsledný generovaný text pomocí jediného společného externího hodnotitele. Rozdíl mezi originálem a rekonstrukcí odhaduje příspěvek kodeku, zatímco srovnání rekonstrukce s generovaným výstupem pomáhá lokalizovat dodatečnou ztrátu při generování. Metriky stavu latentní reprezentace se uvádějí odděleně od dokladů založených na dekódovaném textu.
Jak hodnotit generování textu s diskrétními latentními reprezentacemi?
Článek doporučuje před porovnáváním generátorů ověřit věrnost rekonstrukce, v každé fázi použít stejnou hodnoticí funkci pro dekódovaný text a uvádět centrální statistiky i statistiky chvostů rozdělení. Využití číselníku kódů, geometrii a další latentní zástupné metriky zároveň chápe jako diagnostické ukazatele, nikoli jako náhradu hodnocení kvality dekódovaného textu.
Překonává difuze v prostoru kódů difuzi v prostoru tokenů?
Při společném hodnotiteli a testovaném uspořádání snižuje MDLM v prostoru kódů oproti MDLM v prostoru tokenů průměrnou, mediánovou a p95 perplexitu o 32.9 %, 30.9 % a 36.6 %. Srovnání je popisné a specifické pro danou konfiguraci: neurčuje univerzální pořadí napříč datovými sadami, kompresními poměry, kodeky ani difuzními architekturami.
Zaručují lepší metriky latentní geometrie kvalitnější generovaný text?
Ne. V dostupných párově srovnatelných bězích regularizace zohledňující geometrii zlepšila lokální zástupné ukazatele v latentním prostoru, nikoli však metriky dekódovaného textu. Výsledek podporuje ověřování každého zlepšení zástupného ukazatele na konečném dekódovaném výstupu a chápání nepřeneseného zlepšení jako užitečného negativního výsledku, nikoli jako dokladu lepšího generování.
Porovnání s příbuznými přístupy
| Přístup | Reprezentace | Kontrola / diagnostika | Co se zachovává nebo měří |
|---|---|---|---|
| Difuze v prostoru tokenů | Textové tokeny | Kvalita generování v prostoru tokenů | Plynulost přímého generování a chování hodnotitele |
| Komprimované latentní generování | Diskrétní latentní kódy získané pomocí kodeku | Výsledná kvalita generování v celém řetězci | Kombinované chování kodeku a latentního generátoru |
| Postupná lokalizace úzkých míst | Text, rekonstrukce kodekem a diskrétní latentní reprezentace | Oddělte ztrátu kodeku od ztráty při generování | Kde se při společném hodnotiteli zhoršuje kvalita |
Porovnání rozlišuje rozsah hodnocení a průkaznost důkazů; nejde o univerzální pořadí přístupů.
Relevance a rozsah
Etapový protokol je užitečný tehdy, když generativní řetězec obsahuje naučený kodek i generátor v latentním prostoru, ale příčina zhoršené kvality výstupu není zřejmá.
Generování textu s komprimovanými a diskrétními latentními reprezentacemi
Věrnost rekonstrukce kodeku v generativních pipeline
Jazykové modelování pomocí maskované difuze v prostoru kódů
Lokalizace úzkého hrdla a hodnocení konzistentní napříč fázemi
Ověřování zlepšení zástupných metrik v latentním prostoru na dekódovaném textu
Omezení
- Empirická studie používá výhradně TinyStories.
- Hlavní analýza zahrnuje jediný agresivní kompresní režim 64 ku 16.
- Hodnocený systém kombinuje jednu rodinu hierarchických kodeků VQ-VAE-2 s jedním generátorem MDLM.
- Porovnání vycházejí z jednotlivých běhů a mají popisný charakter; nejde o statistické odhady založené na více náhodných inicializacích.
- Externě měřená perplexita GPT-2 je společným diagnostickým ukazatelem, nikoli univerzální metrikou sémantické kvality.
- Závěry nelze bezprostředně přenášet na všechny datové sady, architektury kodeků ani kompresní poměry.
Literatura citovaná v článku
Tyto položky odpovídají číslovanému oddílu References v PDF článku.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Zdroje a reprodukovatelnost
- Vydavatel
- IEEE
- Místní textové PDF
- Konečná přijatá verze rukopisu (verze zveřejněná autorem s DOI)
- Zdroje k publikaci
- Veřejný rukopis, tabulky výsledků, vysvětlující obrázek a citační soubory jsou k dispozici zde. Implementační kód ani kontrolní body nebyly zveřejněny.
Prohlášení o datech
- Zdroj
- TinyStories, jak je popsáno v článku.
- Licence
- Použití TinyStories se nadále řídí vlastními podmínkami datové sady; tento web žádné její soubory dále nešíří.
- Předzpracování
- Tokenizace GPT-2, vstupy s pevnou délkou 64 tokenů a hierarchická časová komprese z 64 na 32 a následně na 16 pozic.
- Rozdělit
- Publikace uvádí 256 párových vzorků rekonstrukce a 251–256 generovaných vzorků pro každý režim; opakovaně použitelný manifest rozdělení na trénovací a validační data nezveřejňuje.
- Formát
- Vzorky krátkých textů, posloupnosti tokenů GPT-2, posloupnosti diskrétních kódů, záznamy generování a souhrnné tabulky.
- Verze / kontrolní součet
- Článek neuvádí kontrolní součet datové sady ani neměnný identifikátor snímku TinyStories.
- Získání dat
- Spolu se stránkou publikace nebyl zveřejněn skript pro získání dat.
- Meze použití
- Důkazy se týkají krátkých syntetických příběhů a nelze je považovat za benchmark neomezeného generování přirozeného jazyka.
Verze
- Publikovaná verzeIEEE / FRUCT, 2026
- Záznam na arXivOtevřít záznam preprintu, arXiv:2607.24176
- Autorský rukopisLokální PDF s textovou vrstvou
- Konferenční přednáškaPrezentace na FRUCT 39
- Rejstřík konferenčního sborníkuOficiální svazek FRUCT 39
- PDF konferenčního sborníkuVolně dostupný plný text FRUCT
- Otevřít odborný záznamOpenAlex
- Záznam v citačním grafuSemantic Scholar
- Plný text zpřístupněný autoremResearchGate
Publikované DOI je primárním bibliografickým identifikátorem. Tato stránka zůstává napříč verzemi jedinou kanonickou adresou URL projektu.