Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Missä laatu heikkenee pakatussa lyhyttekstin generoinnissa: pullonkaulan vaiheittainen paikantaminen
Pakattujen lyhyiden tekstien generoinnin vaiheittainen diagnoosi, jossa koodekin rekonstruktiohäviö erotetaan latenttigeneroinnin häviöstä.
Lue koko artikkeli HTML-muodossaHaettava teksti kaavoineen, taulukoineen, kuvioineen ja lähdeviitteineen.
Lopullinen hyväksytty käsikirjoitus (tekijän julkaisema versio, jossa on DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Julkaisemisen ja uudelleenkäytön ehdot.
Artikkeli 30 sekunnissa
TutkimuskysymysMiten pakatun tekstingenerointiputken laadun heikkeneminen voidaan kohdentaa erikseen koodekille ja piiloavaruuden generaattorille?
Ongelma
Pakatussa lyhyen tekstin generoinnissa dekoodatun tekstin heikko laatu voi johtua joko koodekin hukkaamasta informaatiosta tai heikosta generoinnista piiloavaruudessa. Päästä päähän lasketut tunnusluvut sekoittavat nämä vikatavat ja voivat ohjata optimointityön väärään komponenttiin.
Lähestymistapa
Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot, tokenavaruuden MDLM-tulosteet ja koodiavaruuden diffuusiotulosteet pisteytetään yhdellä ulkoisella GPT-2-arvioijalla. Koodikirjaa ja geometriaa koskevat mittarit ovat diagnostisia eivätkä korvaa dekoodatun tekstin laadun arviointia.
Päätulos
Koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 ja p95-arvon arvosta 25.10 arvoon 98.91. Koodiavaruuden MDLM pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden MDLM:ään verrattuna.
Miksi tällä on merkitystä
Tulos tekee koodekin pullonkaulan diagnosoinnista käytännöllisen työjärjestyksen: paranna ensin koodekkia, vertaa sen jälkeen tokeni- ja koodiavaruuden generointia ja luota latenttiavaruuden sijaismittarien parannuksiin vain, jos myös dekoodattu teksti paranee.
Tiivistelmä
Pakatun lyhyttekstin generaattorit voivat epäonnistua kahdessa eri vaiheessa: koodekki voi hävittää tietoa ennen generoinnin alkua, tai latenttigeneraattori voi tuottaa heikkolaatuisia koodeja. Jos näitä virhetyyppejä ei eroteta toisistaan, tutkijat voivat käyttää laskentaresursseja väärän komponentin parantamiseen. Tutkimme ongelmaa kontrolloidussa TinyStories-tapaustutkimuksessa, jossa 64 tokenia pakataan 16:ksi hierarkkisesta VQ-VAE-2-koodekista ja maskatun diskreetin diffuusion generaattorista (MDLM) koostuvassa järjestelmässä. Käytämme vaiheittaista validointiprotokollaa, joka erottaa koodekin rekonstruktion uskollisuuden, latenttigeneroinnin laadun ja täydentävän latenttiavaruuden diagnostiikan toisistaan saman ulkoisen GPT-2-arvioijan avulla; geometriatutkimuksesta raportoimme lisäksi täydentäviä semanttisia mittareita. Testatussa asetelmassa jo pelkkä koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 (+80.4%) ja p95-arvon arvosta 25.10 arvoon 98.91 (+294.1%), mikä osoittaa hallitsevan laatuhäviön syntyvän ennen latenttigeneroinnin alkua. Samalla arvioijalla koodiavaruuden MDLM on edelleen selvästi tokeniavaruuden diffuusiota parempi: keskiarvo pienenee 32.9%, mediaani 30.9% ja p95-arvo 36.6%. Geometrian huomioiva regularisointi parantaa paikallisia latenttiavaruuden sijaismittareita mutta ei käytettävissä olevissa ajoissa dekoodatun tekstin mittareita. Kontribuutio on menetelmällinen eikä algoritminen: artikkelissa esitetään yhdelle konkreettiselle käsittelyketjulle uudelleenkäytettävä vaiheittainen diagnoosi ja osoitetaan, että tässä asetelmassa käytännön laadun ylärajan määrää koodekin uskollisuus eikä latenttikohinan poisto.
Julkaisupaikka 2026 39th Conference of Open Innovations Association (FRUCT)
Kontribuution tyyppi Diagnostinen menetelmä
numero 1s. 69–76Pääkonferenssi
Keskeiset tulokset
| Arviointikohta | n | Keskimääräinen PPL | PPL:n mediaani | PPL:n 95. persentiili |
|---|---|---|---|---|
| Alkuperäiset tekstit | 256 | 16.24 | 15.17 | 25.1 |
| Koodekin rekonstruktiot | 256 | 37.26 | 27.36 | 98.91 |
| AR-vertailutaso | 251 | 30.98 | 23.27 | 56.11 |
| Tokenavaruuden MDLM | 256 | 44.74 | 38.42 | 93.6 |
| Koodiavaruuden MDLM | 256 | 30.01 | 26.55 | 59.36 |
Keskeinen tulos. Suurin osa havaitusta laatuhäviöstä syntyy ennen generointia; koodiavaruuden diffuusio pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden diffuusioon verrattuna.
- Aineisto
- TinyStories
- Otoskoko
- 256 parittaista rekonstruktionäytettä; 251–256 generoitua näytettä tilaa kohden; neljä yhteensovitettua geometria-asetusta.
- Mittarit
- Ulkoinen GPT-2-perpleksisyys: keskiarvo, mediaani, p95 ja maksimi; koodikirjan käyttö ja kantajan koko; SBERT, BERTScore, MAUVE sekä LLM-arvioijan yhteenveto geometriakokeista
- Epävarmuus
- Raportoidut vertailut ovat kuvailevia yksittäisajoja; luottamusvälejä ja useisiin satunnaissiemeniin perustuvia merkitsevyysarvioita ei laskettu.
- Ehdot
- Hierarkkisella VQ-VAE-2:lla 16 ylätason koodiksi pakatut 64 tokenin GPT-2-sekvenssit; kaikissa generointitavoissa käytetään samaa ulkoista arvioijaa.
Lataa tulokset:CSVJSONMarkdownUlkoinen peilipalvelu:Hugging Face -aineistokortti
PDF ja viittaustiedot
Viittaa tähän artikkeliin BibTeX on suositeltu muoto. Kaikki alla olevat versiot tuotetaan samasta julkaisutietueesta.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Viittaustiedostot:APA-tekstiIEEE-tekstiRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 -metatieto-XMLKokoteksti JATS 1.4 XML -muodossaRDF TurtleLinkkijoukko (JSON)Linkkijoukko (HTTP)RO-Crate
Kattava opas
Kattava tutkimusopas
Menetelmä
Artikkelissa käytetään samaa arviointimenetelmää kolmessa arviointivaiheessa, jotta jokaiseen lisämuunnokseen voidaan yhdistää mitattava laatuero.
Rekonstruoi
Enkoodaa kukin 64 tokenin TinyStories-näyte 16 ylätason koodiksi ja dekoodaa se välittömästi koodekkirekonstruktiohäviön mittaamiseksi.
Generoi
Generoi MDLM:llä joko tekstitokeneita tai diskreettejä latenttikoodeja ja dekoodaa sitten koodiavaruuden näytteet samalla koulutetulla koodekilla.
Vertaile
Pisteytä alkuperäistekstit, rekonstruktiot ja generoidut tekstit samalla ulkoisella GPT-2-protokollalla ja sisällytä tarkasteluun mediaani- ja häntätilastot.
Keskeinen ajatus
Jatkokäsittelyn generaattori ei voi palauttaa tietoa, jonka koodekki on jo hävittänyt. Siksi rekonstruktiovaihe on auditoitava ennen latenttigeneroinnin tulosten tulkintaa.
Ero läheisiin lähestymistapoihin
Tavanomaiset päästä päähän -vertailut raportoivat yhden lopullisen generointituloksen. Tässä protokollassa lisätään parittainen rekonstruktion tarkistuspiste ja erotetaan latenttiavaruuden kuntoa kuvaavat mittarit purettua tekstiä koskevasta näytöstä.
Mikä on uutta
Tutkimuksen kontribuutio on uudelleenkäytettävä vaiheittainen diagnostiikkamenetelmä yhdelle konkreettiselle pakatun tekstin käsittelyputkelle, ei uusi kohinanpoistoalgoritmi.
Kysymykset, joihin tämä artikkeli auttaa vastaamaan
Avaa kysymys saadaksesi artikkeliin perustuvan tiiviin vastauksen. Näytön yksityiskohtaiset rajat esitetään Rajoitukset-osiossa.
Missä pakatun lyhyen tekstin generoinnin laatu heikkenee?
Testatussa TinyStories 64-to-16 -putkessa hallitseva laadun heikkeneminen ilmenee koodekin rekonstruktiossa ennen piiloavaruuden generoinnin alkamista. Ulkoisen GPT-2-perplexiteetin mediaani kasvaa alkuperäisen tekstin arvosta 15.17 rekonstruktion jälkeiseen arvoon 27.36, ja p95 kasvaa arvosta 25.10 arvoon 98.91. Tulos koskee yhtä konfiguraatiota eikä ole koodekkien yleispätevä paremmuusjärjestys.
Miten koodekkihäviö voidaan erottaa piiloavaruuden generointihäviöstä?
Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot ja lopullinen generoitu teksti arvioidaan samalla ulkoisella arvioijalla. Alkuperäisen ja rekonstruktion välinen ero estimoi koodekin osuutta, kun taas rekonstruktion ja generoidun tulosteen vertailu auttaa paikantamaan generointivaiheen lisähäviön. Latenttiesityksen toimivuutta kuvaavat mittarit raportoidaan erillään dekoodattua tekstiä koskevasta näytöstä.
Miten diskreetteihin piilomuuttujiin perustuvaa tekstin generointia tulisi arvioida?
Artikkelissa suositellaan rekonstruktion uskollisuuden tarkistamista ennen generaattorien vertailua, saman puretun tekstin arviointimenetelmän käyttämistä kaikissa vaiheissa sekä jakauman keskiosaa ja häntiä kuvaavien tilastojen raportointia. Lisäksi koodikirjan käyttöä, geometriaa ja muita latentteja sijaismittareita käsitellään diagnostiikkana, ei puretun tekstin laadun korvikkeina.
Onko koodiavaruuden diffuusio tokeniavaruuden diffuusiota suorituskykyisempi?
Samalla arvioijalla ja testatussa asetelmassa koodiavaruuden MDLM pienentää perpleksiteetin keskiarvoa 32.9%, mediaania 30.9% ja p95-arvoa 36.6% tokeniavaruuden MDLM:ään verrattuna. Vertailu on kuvaileva ja kokoonpanokohtainen: se ei osoita yleispätevää paremmuusjärjestystä eri aineistojen, pakkaussuhteiden, koodekkien tai diffuusioarkkitehtuurien välillä.
Takaavatko paremmat latenttigeometrian mittarit laadukkaamman generoidun tekstin?
Ei. Käytettävissä olevissa kaltaistetuissa ajoissa geometriatietoinen regularisointi paransi latenttiavaruuden paikallisia korvikemittareita mutta ei dekoodatun tekstin mittareita. Tulos puoltaa jokaisen korvikemittarin parannuksen tarkistamista lopullisesta dekoodatusta tulosteesta sekä siirtymän puuttumisen käsittelemistä hyödyllisenä negatiivisena tuloksena eikä näyttönä generoinnin paranemisesta.
Vertailu läheisiin lähestymistapoihin
| Lähestymistapa | Esitys | Ohjaus / diagnosointi | Mitä säilytetään tai mitataan |
|---|---|---|---|
| Tokenavaruuden diffuusio | Tekstitokenit | Generoinnin laatu tokeniavaruudessa | Suoran generoinnin sujuvuus ja arvioijan käyttäytyminen |
| Pakattu latenttigenerointi | Diskreetit latenttikoodit koodekin avulla | Lopullinen päästä päähän -generoinnin laatu | Koodekin ja latenttigeneraattorin yhteiskäyttäytyminen |
| Pullonkaulojen vaiheittainen paikantaminen | Teksti, koodekin rekonstruktiot ja diskreetit latenttiesitykset | Erota koodekkihäviö generointihäviöstä | Missä laatu heikkenee yhteistä arvioijaa käytettäessä |
Vertailussa erotetaan arvioinnin laajuus ja näyttö; kyse ei ole lähestymistapojen yleispätevästä paremmuusjärjestyksestä.
Merkitys ja rajaus
Vaiheistettu protokolla on hyödyllinen, kun generatiivinen käsittelyketju sisältää sekä opitun koodekin että latenttiavaruuden generaattorin mutta tulosteen laadun heikkenemisen syy on epäselvä.
Pakattu tekstingenerointi diskreeteillä latenteilla
Koodekin rekonstruktion uskollisuus generatiivisissa putkissa
Maskattuun diffuusioon perustuva kielimallinnus koodiavaruudessa
Pullonkaulan paikantaminen ja vaiheiden suhteen johdonmukainen arviointi
Latenttiavaruuden sijaismittarien parannusten auditointi dekoodattua tekstiä vasten
Rajoitukset
- Empiirisessä tutkimuksessa käytetään ainoastaan TinyStories-aineistoa.
- Pääanalyysi kattaa yhden voimakkaan 64:stä 16:een -pakkausasetelman.
- Arvioitu järjestelmä yhdistää yhden hierarkkisen VQ-VAE-2-koodekkiperheen ja yhden MDLM-generaattorin.
- Vertailut perustuvat yksittäisiin ajoihin ja ovat kuvailevia eivätkä useisiin satunnaissiemeniin perustuvia tilastollisia estimaatteja.
- Ulkoinen GPT-2-perpleksisyys on yhteinen diagnostinen mittari, ei yleispätevä semanttisen laadun mittari.
- Johtopäätöksiä ei pidä siirtää sellaisinaan kaikkiin aineistoihin, koodekkiarkkitehtuureihin tai pakkaussuhteisiin.
Artikkelissa siteeratut lähteet
Nämä merkinnät vastaavat artikkelin PDF-version numeroitua References-osiota.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Aineistot ja toistettavuus
- Kustantaja
- IEEE
- Paikallinen teksti-PDF
- Lopullinen hyväksytty käsikirjoitus (tekijän julkaisema versio, jossa on DOI)
- Julkaisuaineistot
- Julkinen käsikirjoitus, tulostaulukot, selittävä kuvio ja viittaustiedostot ovat saatavilla täällä. Toteutuskoodia ja tarkistuspisteitä ei ole julkaistu.
Aineistoseloste
- Lähde
- TinyStories artikkelissa kuvatulla tavalla.
- Lisenssi
- TinyStories-aineiston käyttöön sovelletaan edelleen aineiston omia ehtoja; sivusto ei jakele aineistotiedostoja uudelleen.
- Esikäsittely
- GPT-2-tokenisointi, kiinteät 64 tokenin syötteet ja hierarkkinen ajallinen pakkaus 64 positiosta 32:n kautta 16 positioon.
- Jako
- Julkaisussa raportoidaan 256 parittaista rekonstruktionäytettä ja 251–256 generoitua näytettä tilaa kohden; uudelleenkäytettävää opetus- ja validointijaon manifestia ei julkaista.
- Muoto
- Lyhyet tekstinäytteet, GPT-2-tokenijonot, diskreetit koodijonot, generointilokit ja yhteenvetotaulukot.
- Versio / tarkistussumma
- Artikkelissa ei ilmoiteta aineiston tarkistussummaa eikä muuttumattoman TinyStories-tilannevedoksen tunnistetta.
- Hankinta
- Julkaisusivun yhteydessä ei ole julkaistu avointa aineistonhakukomentosarjaa.
- Käytön rajat
- Näyttö koskee lyhyitä synteettisiä tarinoita, eikä sitä pidä käsitellä rajoittamattoman luonnollisen kielen generoinnin vertailukohtana.
Versiot
- Julkaistu versioIEEE / FRUCT, 2026
- arXiv-tietueAvaa esipainoksen tietue, arXiv:2607.24176
- Kirjoittajan käsikirjoitusTekstimuodossa saavutettava paikallinen PDF
- KonferenssiesitelmäFRUCT 39 -esitys
- Konferenssijulkaisujen hakemistoVirallinen FRUCT 39 -julkaisu
- Konferenssijulkaisun PDFFRUCTin avoin kokoteksti
- Avaa tieteellinen tietueOpenAlex
- Viittausgraafin tietueSemantic Scholar
- Kirjoittajan jakama kokotekstiResearchGate
Julkaistu DOI on ensisijainen bibliografinen tunniste. Tämä sivu säilyy hankkeen ainoana kanonisena URL-osoitteena kaikissa versioissa.