Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Missä laatu heikkenee pakatussa lyhyttekstin generoinnissa: pullonkaulan vaiheittainen paikantaminen

Pakattujen lyhyiden tekstien generoinnin vaiheittainen diagnoosi, jossa koodekin rekonstruktiohäviö erotetaan latenttigeneroinnin häviöstä.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Lue koko artikkeli HTML-muodossaHaettava teksti kaavoineen, taulukoineen, kuvioineen ja lähdeviitteineen.

Lopullinen hyväksytty käsikirjoitus (tekijän julkaisema versio, jossa on DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Julkaisemisen ja uudelleenkäytön ehdot.

Artikkeli 30 sekunnissa

TutkimuskysymysMiten pakatun tekstingenerointiputken laadun heikkeneminen voidaan kohdentaa erikseen koodekille ja piiloavaruuden generaattorille?

Ongelma

Pakatussa lyhyen tekstin generoinnissa dekoodatun tekstin heikko laatu voi johtua joko koodekin hukkaamasta informaatiosta tai heikosta generoinnista piiloavaruudessa. Päästä päähän lasketut tunnusluvut sekoittavat nämä vikatavat ja voivat ohjata optimointityön väärään komponenttiin.

Lähestymistapa

Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot, tokenavaruuden MDLM-tulosteet ja koodiavaruuden diffuusiotulosteet pisteytetään yhdellä ulkoisella GPT-2-arvioijalla. Koodikirjaa ja geometriaa koskevat mittarit ovat diagnostisia eivätkä korvaa dekoodatun tekstin laadun arviointia.

Päätulos

Koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 ja p95-arvon arvosta 25.10 arvoon 98.91. Koodiavaruuden MDLM pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden MDLM:ään verrattuna.

Miksi tällä on merkitystä

Tulos tekee koodekin pullonkaulan diagnosoinnista käytännöllisen työjärjestyksen: paranna ensin koodekkia, vertaa sen jälkeen tokeni- ja koodiavaruuden generointia ja luota latenttiavaruuden sijaismittarien parannuksiin vain, jos myös dekoodattu teksti paranee.

Tiivistelmä

Pakatun lyhyttekstin generaattorit voivat epäonnistua kahdessa eri vaiheessa: koodekki voi hävittää tietoa ennen generoinnin alkua, tai latenttigeneraattori voi tuottaa heikkolaatuisia koodeja. Jos näitä virhetyyppejä ei eroteta toisistaan, tutkijat voivat käyttää laskentaresursseja väärän komponentin parantamiseen. Tutkimme ongelmaa kontrolloidussa TinyStories-tapaustutkimuksessa, jossa 64 tokenia pakataan 16:ksi hierarkkisesta VQ-VAE-2-koodekista ja maskatun diskreetin diffuusion generaattorista (MDLM) koostuvassa järjestelmässä. Käytämme vaiheittaista validointiprotokollaa, joka erottaa koodekin rekonstruktion uskollisuuden, latenttigeneroinnin laadun ja täydentävän latenttiavaruuden diagnostiikan toisistaan saman ulkoisen GPT-2-arvioijan avulla; geometriatutkimuksesta raportoimme lisäksi täydentäviä semanttisia mittareita. Testatussa asetelmassa jo pelkkä koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 (+80.4%) ja p95-arvon arvosta 25.10 arvoon 98.91 (+294.1%), mikä osoittaa hallitsevan laatuhäviön syntyvän ennen latenttigeneroinnin alkua. Samalla arvioijalla koodiavaruuden MDLM on edelleen selvästi tokeniavaruuden diffuusiota parempi: keskiarvo pienenee 32.9%, mediaani 30.9% ja p95-arvo 36.6%. Geometrian huomioiva regularisointi parantaa paikallisia latenttiavaruuden sijaismittareita mutta ei käytettävissä olevissa ajoissa dekoodatun tekstin mittareita. Kontribuutio on menetelmällinen eikä algoritminen: artikkelissa esitetään yhdelle konkreettiselle käsittelyketjulle uudelleenkäytettävä vaiheittainen diagnoosi ja osoitetaan, että tässä asetelmassa käytännön laadun ylärajan määrää koodekin uskollisuus eikä latenttikohinan poisto.

Julkaisupaikka 2026 39th Conference of Open Innovations Association (FRUCT)

Kontribuution tyyppi Diagnostinen menetelmä

numero 1s. 69–76Pääkonferenssi

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Jaa tämä artikkeliJaa

Keskeiset tulokset

Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization – keskeiset tulokset
ArviointikohtanKeskimääräinen PPLPPL:n mediaaniPPL:n 95. persentiili
Alkuperäiset tekstit25616.2415.1725.1
Koodekin rekonstruktiot25637.2627.3698.91
AR-vertailutaso25130.9823.2756.11
Tokenavaruuden MDLM25644.7438.4293.6
Koodiavaruuden MDLM25630.0126.5559.36

Keskeinen tulos. Suurin osa havaitusta laatuhäviöstä syntyy ennen generointia; koodiavaruuden diffuusio pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden diffuusioon verrattuna.

Aineisto
TinyStories
Otoskoko
256 parittaista rekonstruktionäytettä; 251–256 generoitua näytettä tilaa kohden; neljä yhteensovitettua geometria-asetusta.
Mittarit
Ulkoinen GPT-2-perpleksisyys: keskiarvo, mediaani, p95 ja maksimi; koodikirjan käyttö ja kantajan koko; SBERT, BERTScore, MAUVE sekä LLM-arvioijan yhteenveto geometriakokeista
Epävarmuus
Raportoidut vertailut ovat kuvailevia yksittäisajoja; luottamusvälejä ja useisiin satunnaissiemeniin perustuvia merkitsevyysarvioita ei laskettu.
Ehdot
Hierarkkisella VQ-VAE-2:lla 16 ylätason koodiksi pakatut 64 tokenin GPT-2-sekvenssit; kaikissa generointitavoissa käytetään samaa ulkoista arvioijaa.

PDF ja viittaustiedot

Viittaa tähän artikkeliin BibTeX on suositeltu muoto. Kaikki alla olevat versiot tuotetaan samasta julkaisutietueesta.

Avaa PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Lataa .bib

Viittaustiedostot:APA-tekstiIEEE-tekstiRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 -metatieto-XMLKokoteksti JATS 1.4 XML -muodossaRDF TurtleLinkkijoukko (JSON)Linkkijoukko (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Kattava opas

Kattava tutkimusopas

Menetelmä

Artikkelissa käytetään samaa arviointimenetelmää kolmessa arviointivaiheessa, jotta jokaiseen lisämuunnokseen voidaan yhdistää mitattava laatuero.

  1. Rekonstruoi

    Enkoodaa kukin 64 tokenin TinyStories-näyte 16 ylätason koodiksi ja dekoodaa se välittömästi koodekkirekonstruktiohäviön mittaamiseksi.

  2. Generoi

    Generoi MDLM:llä joko tekstitokeneita tai diskreettejä latenttikoodeja ja dekoodaa sitten koodiavaruuden näytteet samalla koulutetulla koodekilla.

  3. Vertaile

    Pisteytä alkuperäistekstit, rekonstruktiot ja generoidut tekstit samalla ulkoisella GPT-2-protokollalla ja sisällytä tarkasteluun mediaani- ja häntätilastot.

Pakatun tekstin vaiheittainen generointiputki vertaa alkuperäistä tekstiä, koodekin rekonstruktiota, koodiavaruuden MDLM:ää ja purettua tekstiä erottaakseen koodekkihäviön generointihäviöstä.
Pullonkaulojen vaiheittainen paikantaminen erottaa koodekin rekonstruktiohäviön latenttigeneroinnin häviöstä yhteisellä puretun tekstin arviointiprotokollalla.Lähde: Kirjoittajan laatima, julkaistuun menetelmään ja tuloksiin perustuva selittävä kaavio..Uudelleenkäytön ehdot: CC BY 4.0.Ehdotettu lähdemerkintä: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Lataa SVG.

Keskeinen ajatus

Jatkokäsittelyn generaattori ei voi palauttaa tietoa, jonka koodekki on jo hävittänyt. Siksi rekonstruktiovaihe on auditoitava ennen latenttigeneroinnin tulosten tulkintaa.

Ero läheisiin lähestymistapoihin

Tavanomaiset päästä päähän -vertailut raportoivat yhden lopullisen generointituloksen. Tässä protokollassa lisätään parittainen rekonstruktion tarkistuspiste ja erotetaan latenttiavaruuden kuntoa kuvaavat mittarit purettua tekstiä koskevasta näytöstä.

Mikä on uutta

Tutkimuksen kontribuutio on uudelleenkäytettävä vaiheittainen diagnostiikkamenetelmä yhdelle konkreettiselle pakatun tekstin käsittelyputkelle, ei uusi kohinanpoistoalgoritmi.

Kysymykset, joihin tämä artikkeli auttaa vastaamaan

Avaa kysymys saadaksesi artikkeliin perustuvan tiiviin vastauksen. Näytön yksityiskohtaiset rajat esitetään Rajoitukset-osiossa.

  1. Missä pakatun lyhyen tekstin generoinnin laatu heikkenee?

    Testatussa TinyStories 64-to-16 -putkessa hallitseva laadun heikkeneminen ilmenee koodekin rekonstruktiossa ennen piiloavaruuden generoinnin alkamista. Ulkoisen GPT-2-perplexiteetin mediaani kasvaa alkuperäisen tekstin arvosta 15.17 rekonstruktion jälkeiseen arvoon 27.36, ja p95 kasvaa arvosta 25.10 arvoon 98.91. Tulos koskee yhtä konfiguraatiota eikä ole koodekkien yleispätevä paremmuusjärjestys.

  2. Miten koodekkihäviö voidaan erottaa piiloavaruuden generointihäviöstä?

    Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot ja lopullinen generoitu teksti arvioidaan samalla ulkoisella arvioijalla. Alkuperäisen ja rekonstruktion välinen ero estimoi koodekin osuutta, kun taas rekonstruktion ja generoidun tulosteen vertailu auttaa paikantamaan generointivaiheen lisähäviön. Latenttiesityksen toimivuutta kuvaavat mittarit raportoidaan erillään dekoodattua tekstiä koskevasta näytöstä.

  3. Miten diskreetteihin piilomuuttujiin perustuvaa tekstin generointia tulisi arvioida?

    Artikkelissa suositellaan rekonstruktion uskollisuuden tarkistamista ennen generaattorien vertailua, saman puretun tekstin arviointimenetelmän käyttämistä kaikissa vaiheissa sekä jakauman keskiosaa ja häntiä kuvaavien tilastojen raportointia. Lisäksi koodikirjan käyttöä, geometriaa ja muita latentteja sijaismittareita käsitellään diagnostiikkana, ei puretun tekstin laadun korvikkeina.

  4. Onko koodiavaruuden diffuusio tokeniavaruuden diffuusiota suorituskykyisempi?

    Samalla arvioijalla ja testatussa asetelmassa koodiavaruuden MDLM pienentää perpleksiteetin keskiarvoa 32.9%, mediaania 30.9% ja p95-arvoa 36.6% tokeniavaruuden MDLM:ään verrattuna. Vertailu on kuvaileva ja kokoonpanokohtainen: se ei osoita yleispätevää paremmuusjärjestystä eri aineistojen, pakkaussuhteiden, koodekkien tai diffuusioarkkitehtuurien välillä.

  5. Takaavatko paremmat latenttigeometrian mittarit laadukkaamman generoidun tekstin?

    Ei. Käytettävissä olevissa kaltaistetuissa ajoissa geometriatietoinen regularisointi paransi latenttiavaruuden paikallisia korvikemittareita mutta ei dekoodatun tekstin mittareita. Tulos puoltaa jokaisen korvikemittarin parannuksen tarkistamista lopullisesta dekoodatusta tulosteesta sekä siirtymän puuttumisen käsittelemistä hyödyllisenä negatiivisena tuloksena eikä näyttönä generoinnin paranemisesta.

Vertailu läheisiin lähestymistapoihin

Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization – tosiasioihin perustuva vertailu lähimenetelmiin
LähestymistapaEsitysOhjaus / diagnosointiMitä säilytetään tai mitataan
Tokenavaruuden diffuusioTekstitokenitGeneroinnin laatu tokeniavaruudessaSuoran generoinnin sujuvuus ja arvioijan käyttäytyminen
Pakattu latenttigenerointiDiskreetit latenttikoodit koodekin avullaLopullinen päästä päähän -generoinnin laatuKoodekin ja latenttigeneraattorin yhteiskäyttäytyminen
Pullonkaulojen vaiheittainen paikantaminenTeksti, koodekin rekonstruktiot ja diskreetit latenttiesityksetErota koodekkihäviö generointihäviöstäMissä laatu heikkenee yhteistä arvioijaa käytettäessä

Vertailussa erotetaan arvioinnin laajuus ja näyttö; kyse ei ole lähestymistapojen yleispätevästä paremmuusjärjestyksestä.

Merkitys ja rajaus

Vaiheistettu protokolla on hyödyllinen, kun generatiivinen käsittelyketju sisältää sekä opitun koodekin että latenttiavaruuden generaattorin mutta tulosteen laadun heikkenemisen syy on epäselvä.

  1. Pakattu tekstingenerointi diskreeteillä latenteilla

  2. Koodekin rekonstruktion uskollisuus generatiivisissa putkissa

  3. Maskattuun diffuusioon perustuva kielimallinnus koodiavaruudessa

  4. Pullonkaulan paikantaminen ja vaiheiden suhteen johdonmukainen arviointi

  5. Latenttiavaruuden sijaismittarien parannusten auditointi dekoodattua tekstiä vasten

Katso rajoitteet ja näytön rajat

Rajoitukset

  • Empiirisessä tutkimuksessa käytetään ainoastaan TinyStories-aineistoa.
  • Pääanalyysi kattaa yhden voimakkaan 64:stä 16:een -pakkausasetelman.
  • Arvioitu järjestelmä yhdistää yhden hierarkkisen VQ-VAE-2-koodekkiperheen ja yhden MDLM-generaattorin.
  • Vertailut perustuvat yksittäisiin ajoihin ja ovat kuvailevia eivätkä useisiin satunnaissiemeniin perustuvia tilastollisia estimaatteja.
  • Ulkoinen GPT-2-perpleksisyys on yhteinen diagnostinen mittari, ei yleispätevä semanttisen laadun mittari.
  • Johtopäätöksiä ei pidä siirtää sellaisinaan kaikkiin aineistoihin, koodekkiarkkitehtuureihin tai pakkaussuhteisiin.

Artikkelissa siteeratut lähteet

Nämä merkinnät vastaavat artikkelin PDF-version numeroitua References-osiota.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Aineistot ja toistettavuus

Kustantaja
IEEE
Julkaisuaineistot
Julkinen käsikirjoitus, tulostaulukot, selittävä kuvio ja viittaustiedostot ovat saatavilla täällä. Toteutuskoodia ja tarkistuspisteitä ei ole julkaistu.

Aineistoseloste

Lähde
TinyStories artikkelissa kuvatulla tavalla.
Lisenssi
TinyStories-aineiston käyttöön sovelletaan edelleen aineiston omia ehtoja; sivusto ei jakele aineistotiedostoja uudelleen.
Esikäsittely
GPT-2-tokenisointi, kiinteät 64 tokenin syötteet ja hierarkkinen ajallinen pakkaus 64 positiosta 32:n kautta 16 positioon.
Jako
Julkaisussa raportoidaan 256 parittaista rekonstruktionäytettä ja 251–256 generoitua näytettä tilaa kohden; uudelleenkäytettävää opetus- ja validointijaon manifestia ei julkaista.
Muoto
Lyhyet tekstinäytteet, GPT-2-tokenijonot, diskreetit koodijonot, generointilokit ja yhteenvetotaulukot.
Versio / tarkistussumma
Artikkelissa ei ilmoiteta aineiston tarkistussummaa eikä muuttumattoman TinyStories-tilannevedoksen tunnistetta.
Hankinta
Julkaisusivun yhteydessä ei ole julkaistu avointa aineistonhakukomentosarjaa.
Käytön rajat
Näyttö koskee lyhyitä synteettisiä tarinoita, eikä sitä pidä käsitellä rajoittamattoman luonnollisen kielen generoinnin vertailukohtana.

Versiot

  1. Julkaistu versioIEEE / FRUCT, 2026
  2. KonferenssiesitelmäFRUCT 39 -esitys
  3. Konferenssijulkaisujen hakemistoVirallinen FRUCT 39 -julkaisu
  4. Konferenssijulkaisun PDFFRUCTin avoin kokoteksti
  5. Avaa tieteellinen tietueOpenAlex
  6. Viittausgraafin tietueSemantic Scholar
  7. Kirjoittajan jakama kokotekstiResearchGate

Julkaistu DOI on ensisijainen bibliografinen tunniste. Tämä sivu säilyy hankkeen ainoana kanonisena URL-osoitteena kaikissa versioissa.