Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Gdzie załamuje się jakość w generowaniu skompresowanych krótkich tekstów: etapowa lokalizacja wąskiego gardła
Etapowa diagnostyka generowania krótkich tekstów w reprezentacji skompresowanej, rozdzielająca utratę jakości podczas rekonstrukcji przez kodek od utraty jakości podczas generowania w przestrzeni utajonej.
Przeczytaj pełny tekst publikacji w formacie HTMLPrzeszukiwalny tekst zawierający wzory, tabele, rysunki i bibliografię.
Ostateczna przyjęta wersja manuskryptu (wersja udostępniona przez autora wraz z DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Warunki udostępniania i ponownego wykorzystania.
Artykuł w 30 sekund
Pytanie badawczeJak w potoku generowania skompresowanego tekstu osobno przypisać utratę jakości kodekowi i generatorowi w przestrzeni utajonej?
Problem
W generowaniu krótkich tekstów w reprezentacji skompresowanej niska jakość tekstu po dekodowaniu może wynikać z informacji utraconych przez kodek albo z niedostatecznej jakości generatora działającego w przestrzeni utajonej. Miary kompleksowe zacierają różnicę między tymi rodzajami błędów i mogą skierować optymalizację na niewłaściwy komponent.
Podejście
Protokół etapowy ocenia oryginały, odpowiadające im rekonstrukcje kodeka, wyniki MDLM w przestrzeni tokenów oraz wyniki dyfuzji w przestrzeni kodów za pomocą jednego zewnętrznego modelu oceniającego GPT-2. Miary wykorzystania słownika kodów i jego geometrii pełnią funkcję diagnostyczną, nie zastępują zaś oceny jakości tekstu po dekodowaniu.
Główny wynik
Rekonstrukcja przez kodek zwiększa medianę zewnętrznej perpleksji z 15.17 do 27.36, a p95 z 25.10 do 98.91. MDLM w przestrzeni kodów nadal obniża medianę perpleksji o 30.9% względem MDLM w przestrzeni tokenów.
Dlaczego ma to znaczenie
Wynik przekłada diagnostykę wąskiego gardła kodeka na praktyczną kolejność działań: najpierw należy udoskonalić kodek, następnie porównać generowanie w przestrzeni tokenów i przestrzeni kodów, a poprawie miar zastępczych w przestrzeni ukrytej ufać tylko wtedy, gdy poprawia się również zdekodowany tekst.
Streszczenie
Generatory krótkich tekstów w reprezentacji skompresowanej mogą zawodzić w dwóch miejscach: kodek może odrzucać informacje jeszcze przed rozpoczęciem generowania albo generator działający w przestrzeni utajonej może wytwarzać słabe kody. Bez rozdzielenia tych rodzajów błędów badacze mogą zużywać zasoby obliczeniowe na ulepszanie niewłaściwego komponentu. Analizujemy ten problem w kontrolowanym studium przypadku TinyStories z kompresją z 64 do 16 pozycji, opartym na hierarchicznym kodeku VQ-VAE-2 i generatorze maskowanej dyfuzji dyskretnej (MDLM). Etapowy protokół walidacji rozdziela wierność rekonstrukcji przez kodek, jakość generowania w przestrzeni utajonej i pomocniczą diagnostykę tej przestrzeni przy użyciu jednej wspólnej zewnętrznej funkcji oceniającej GPT-2; badanie geometrii uzupełniają miary semantyczne. W badanej konfiguracji sama rekonstrukcja przez kodek zwiększa medianę zewnętrznej perpleksji z 15.17 do 27.36 (+80.4%), a p95 z 25.10 do 98.91 (+294.1%), co wskazuje, że dominująca utrata jakości następuje przed rozpoczęciem generowania w przestrzeni utajonej. Przy tej samej funkcji oceniającej MDLM w przestrzeni kodów nadal przewyższa dyfuzję w przestrzeni tokenów, obniżając średnią, medianę i p95 perpleksji odpowiednio o 32.9%, 30.9% i 36.6%. Regularyzacja uwzględniająca geometrię poprawia lokalne miary zastępcze w przestrzeni utajonej, lecz w dostępnych przebiegach nie poprawia miar tekstu po dekodowaniu. Wkład pracy ma charakter metodologiczny, a nie algorytmiczny: obejmuje etapową procedurę diagnostyczną możliwą do ponownego zastosowania w jednym konkretnym potoku oraz wyniki wskazujące, że w tej konfiguracji praktyczny pułap jakości wyznacza wierność kodeka, nie zaś odszumianie w przestrzeni utajonej.
Miejsce publikacji 2026 39th Conference of Open Innovations Association (FRUCT)
Rodzaj wkładu Metodyka diagnostyczna
numer 1s. 69–76Konferencja główna
Najważniejsze wyniki
| Punkt ewaluacji | n | Średnia PPL | Mediana PPL | p95 PPL |
|---|---|---|---|---|
| Teksty oryginalne | 256 | 16.24 | 15.17 | 25.1 |
| Rekonstrukcje kodeka | 256 | 37.26 | 27.36 | 98.91 |
| Punkt odniesienia AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM w przestrzeni tokenów | 256 | 44.74 | 38.42 | 93.6 |
| MDLM w przestrzeni kodów | 256 | 30.01 | 26.55 | 59.36 |
Najważniejszy wynik. Większość zaobserwowanej utraty jakości następuje przed etapem generowania, choć dyfuzja w przestrzeni kodów nadal obniża medianę perpleksji o 30.9% względem dyfuzji w przestrzeni tokenów.
- Zbiór danych
- TinyStories
- Liczebność próby
- 256 sparowanych próbek rekonstrukcji; 251–256 wygenerowanych próbek na tryb; cztery dopasowane konfiguracje geometrii.
- Metryki
- Zewnętrzna perpleksja według GPT-2: średnia, mediana, p95 i maksimum; wykorzystanie słownika kodów i wielkość jego aktywnego zbioru; SBERT, BERTScore, MAUVE oraz podsumowanie oceny przez LLM w eksperymentach dotyczących geometrii
- Niepewność
- Przedstawione porównania mają charakter opisowy i pochodzą z pojedynczych przebiegów; nie obliczono przedziałów ufności ani oszacowań istotności dla wielu wartości ziarna losowego.
- Warunki
- Sekwencje 64 tokenów GPT-2 skompresowane do 16 kodów najwyższego poziomu za pomocą hierarchicznego VQ-VAE-2; wszystkie tryby generowania korzystają ze wspólnej zewnętrznej metody oceny.
Pobierz wyniki:CSVJSONMarkdownZewnętrzna kopia lustrzana:Karta zbioru danych Hugging Face
PDF i cytowanie
Cytowanie tej publikacji Zalecanym formatem cytowania jest BibTeX. Wszystkie poniższe warianty wygenerowano na podstawie tego samego rekordu publikacji.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Pliki cytowania:Tekst APATekst IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLMetadane XML zgodne z JATS 1.4Pełny tekst w formacie JATS 1.4 XMLRDF TurtleZestaw odsyłaczy (JSON)Zestaw odsyłaczy (HTTP)RO-Crate
Pełny przewodnik
Pełny przewodnik badawczy
Metoda
W artykule na trzech etapach oceny stosuje się tę samą funkcję oceniającą, dzięki czemu każdą dodatkową transformację można powiązać z mierzalną luką jakościową.
Zrekonstruuj
Zakoduj każdą 64-tokenową próbkę TinyStories do 16 kodów najwyższego poziomu, po czym natychmiast ją zdekoduj, aby zmierzyć stratę rekonstrukcji przez kodek.
Generuj
Wygeneruj za pomocą MDLM tokeny tekstowe albo dyskretne kody utajone, a następnie zdekoduj próbki z przestrzeni kodów przy użyciu tego samego wytrenowanego kodeka.
Porównaj
Oceń teksty oryginalne, rekonstrukcje i teksty wygenerowane według tego samego zewnętrznego protokołu GPT-2, uwzględniając medianę i statystyki ogonów rozkładu.
Główna idea
Generator działający na dalszym etapie nie może odzyskać informacji, które kodek już odrzucił. Dlatego przed interpretacją wyników generowania w przestrzeni ukrytej należy przeprowadzić audyt etapu rekonstrukcji.
Różnica względem pokrewnych podejść
Standardowe porównania kompleksowe podają jedną końcową ocenę generowania. Ten protokół wprowadza sparowany punkt kontrolny rekonstrukcji i oddziela miary diagnostyczne w przestrzeni ukrytej od dowodów uzyskanych dla zdekodowanego tekstu.
Co stanowi nowość
Wkładem pracy jest etapowa metodyka diagnostyczna, którą można ponownie zastosować do jednego konkretnego potoku generowania tekstu w reprezentacji skompresowanej, nie zaś nowy algorytm odszumiania.
Pytania, na które pomaga odpowiedzieć ta publikacja
Otwórz pytanie, aby uzyskać zwięzłą odpowiedź opartą na publikacji. Szczegółowe granice materiału dowodowego podano w sekcji Ograniczenia.
Na którym etapie pogarsza się jakość generowania skompresowanych krótkich tekstów?
W badanym potoku TinyStories 64-do-16 dominujące pogorszenie występuje na etapie rekonstrukcji kodeka, jeszcze przed rozpoczęciem generowania w przestrzeni utajonej. Mediana zewnętrznej perplexity według GPT-2 wzrasta z 15.17 dla tekstu oryginalnego do 27.36 po rekonstrukcji, natomiast p95 wzrasta z 25.10 do 98.91. Jest to wynik dotyczący jednej konfiguracji, a nie uniwersalny ranking kodeków.
Jak oddzielić stratę kodeka od straty generowania w przestrzeni utajonej?
Protokół etapowy ocenia oryginały, odpowiadające im rekonstrukcje kodeka oraz końcowy tekst wygenerowany za pomocą jednego wspólnego zewnętrznego modelu oceniającego. Różnica między oryginałem a rekonstrukcją pozwala oszacować udział kodeka, natomiast porównanie rekonstrukcji z wynikiem generowania pomaga zlokalizować dodatkową stratę na etapie generowania. Miary jakości reprezentacji latentnej przedstawia się oddzielnie od wyników dotyczących zdekodowanego tekstu.
Jak oceniać generowanie tekstu z dyskretną reprezentacją utajoną?
W artykule zaleca się sprawdzenie wierności rekonstrukcji przed porównywaniem generatorów, stosowanie na każdym etapie tej samej funkcji oceniającej zdekodowany tekst oraz podawanie statystyk centralnych i ogonowych. Wykorzystanie słownika kodów, geometrię i inne miary zastępcze w przestrzeni ukrytej traktuje się ponadto jako narzędzia diagnostyczne, a nie zamienniki oceny jakości zdekodowanego tekstu.
Czy dyfuzja w przestrzeni kodów przewyższa dyfuzję w przestrzeni tokenów?
Przy wspólnym modelu oceniającym i w testowanej konfiguracji MDLM w przestrzeni kodów obniża średnią, medianę i p95 perplexity odpowiednio o 32.9%, 30.9% i 36.6% względem MDLM w przestrzeni tokenów. Porównanie ma charakter opisowy i zależy od konfiguracji: nie ustanawia uniwersalnego rankingu dla różnych zbiorów danych, stopni kompresji, kodeków ani architektur dyfuzyjnych.
Czy lepsze metryki geometrii przestrzeni utajonej gwarantują wyższą jakość wygenerowanego tekstu?
Nie. W dostępnych dopasowanych przebiegach regularyzacja uwzględniająca geometrię poprawiała lokalne miary zastępcze w przestrzeni ukrytej, lecz nie poprawiała metryk zdekodowanego tekstu. Wynik ten uzasadnia weryfikowanie każdej poprawy miary zastępczej na końcowym zdekodowanym wyniku oraz traktowanie braku przeniesienia jako użytecznego wyniku negatywnego, a nie jako dowodu poprawy generowania.
Porównanie z pokrewnymi podejściami
| Podejście | Reprezentacja | Kontrola / diagnostyka | Co jest zachowywane lub mierzone |
|---|---|---|---|
| Dyfuzja w przestrzeni tokenów | Tokeny tekstowe | Jakość generowania w przestrzeni tokenów | Płynność bezpośrednio generowanego tekstu i zachowanie metody oceny |
| Generowanie w skompresowanej przestrzeni ukrytej | Dyskretne kody utajone uzyskiwane za pomocą kodeka | Końcowa jakość generowania od wejścia do wyjścia | Łączne zachowanie kodeka i generatora reprezentacji ukrytych |
| Etapowa lokalizacja wąskiego gardła | Tekst, rekonstrukcje kodeka i dyskretne reprezentacje ukryte | Oddziel stratę rekonstrukcji kodeka od straty generowania | Gdzie pogarsza się jakość przy zastosowaniu jednego wspólnego modelu oceniającego |
Porównanie rozróżnia zakres oceny i podstawę dowodową; nie stanowi uniwersalnego rankingu podejść.
Znaczenie i zakres
Protokół etapowy jest użyteczny, gdy potok generatywny obejmuje zarówno wyuczony kodek, jak i generator działający w przestrzeni latentnej, lecz źródło pogorszenia jakości wyników pozostaje niejasne.
Generowanie tekstu skompresowanego i opartego na dyskretnych reprezentacjach ukrytych
Wierność rekonstrukcji kodeka w potokach generatywnych
Maskowane dyfuzyjne modelowanie języka w przestrzeni kodów
Lokalizacja wąskiego gardła i ewaluacja spójna między etapami
Audyt poprawy miar zastępczych w przestrzeni ukrytej względem zdekodowanego tekstu
Ograniczenia
- Badanie empiryczne wykorzystuje wyłącznie TinyStories.
- Główna analiza obejmuje jeden agresywny wariant kompresji 64-do-16.
- Oceniany system łączy jedną rodzinę hierarchicznych kodeków VQ-VAE-2 z jednym generatorem MDLM.
- Porównania opierają się na pojedynczych uruchomieniach i mają charakter opisowy, nie zaś statystycznych oszacowań dla wielu ziaren losowych.
- Zewnętrzna miara perplexity modelu GPT-2 jest wspólnym narzędziem diagnostycznym, a nie uniwersalną metryką jakości semantycznej.
- Wniosków nie należy bezpośrednio przenosić na wszystkie zbiory danych, architektury kodeków ani współczynniki kompresji.
Literatura cytowana w publikacji
Pozycje te odpowiadają numerowanej sekcji References w pliku PDF artykułu.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Zasoby i odtwarzalność
- Wydawca
- IEEE
- Lokalny plik PDF z tekstem
- Ostateczna przyjęta wersja manuskryptu (wersja udostępniona przez autora wraz z DOI)
- Materiały dotyczące publikacji
- Tutaj udostępniono publiczny maszynopis, tabele wyników, rysunek objaśniający i pliki cytowań. Kod implementacji i punkty kontrolne modelu nie zostały opublikowane.
Oświadczenie dotyczące danych
- Źródło
- TinyStories, zgodnie z opisem w artykule.
- Licencja
- Korzystanie z TinyStories podlega warunkom właściwym dla tego zbioru danych; witryna nie rozpowszechnia żadnych jego plików.
- Przetwarzanie wstępne
- Tokenizacja GPT-2, wejścia o stałej długości 64 tokenów oraz hierarchiczna kompresja czasowa z 64 do 32, a następnie do 16 pozycji.
- Podział
- Publikacja podaje 256 sparowanych próbek rekonstrukcji oraz 251–256 próbek wygenerowanych dla każdego trybu; nie udostępnia manifestu podziału na zbiór treningowy i walidacyjny nadającego się do ponownego użycia.
- Format
- Próbki krótkich tekstów, sekwencje tokenów GPT-2, sekwencje kodów dyskretnych, dzienniki generowania i tabele zbiorcze.
- Wersja / suma kontrolna
- W artykule nie podano sumy kontrolnej zbioru danych ani niezmiennego identyfikatora migawki TinyStories.
- Pozyskanie
- Wraz ze stroną publikacji nie udostępniono publicznego skryptu do pozyskania danych.
- Ograniczenia stosowania
- Dowody obejmują krótkie opowiadania syntetyczne i nie powinny być traktowane jako punkt odniesienia dla nieograniczonego generowania języka naturalnego.
Wersje
- Wersja opublikowanaIEEE / FRUCT, 2026
- Rekord arXivOtwórz rekord preprintu, arXiv:2607.24176
- Manuskrypt autoraLokalny plik PDF z dostępną warstwą tekstową
- Wystąpienie konferencyjnePrezentacja FRUCT 39
- Indeks materiałów konferencyjnychOficjalny tom FRUCT 39
- Materiały konferencyjne w formacie PDFOtwarty pełny tekst FRUCT
- Otwórz rekord naukowyOpenAlex
- Rekord grafu cytowańSemantic Scholar
- Pełny tekst udostępniony przez autoraResearchGate
Opublikowany DOI jest podstawowym identyfikatorem bibliograficznym. Ta strona pozostaje jedynym kanonicznym adresem URL projektu we wszystkich wersjach.