# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/fi/publications/where-quality-breaks/

Document language: fi

Missä laatu heikkenee pakatussa lyhyttekstin generoinnissa: pullonkaulan vaiheittainen paikantaminen

Pakattujen lyhyiden tekstien generoinnin vaiheittainen diagnoosi, jossa koodekin rekonstruktiohäviö erotetaan latenttigeneroinnin häviöstä.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Lue koko artikkeli HTML-muodossa](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Haettava teksti kaavoineen, taulukoineen, kuvioineen ja lähdeviitteineen.

Lopullinen hyväksytty käsikirjoitus (tekijän julkaisema versio, jossa on DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Julkaisemisen ja uudelleenkäytön ehdot](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Artikkeli 30 sekunnissa

**Tutkimuskysymys** Miten pakatun tekstingenerointiputken laadun heikkeneminen voidaan kohdentaa erikseen koodekille ja piiloavaruuden generaattorille?

### Ongelma

Pakatussa lyhyen tekstin generoinnissa dekoodatun tekstin heikko laatu voi johtua joko koodekin hukkaamasta informaatiosta tai heikosta generoinnista piiloavaruudessa. Päästä päähän lasketut tunnusluvut sekoittavat nämä vikatavat ja voivat ohjata optimointityön väärään komponenttiin.

### Lähestymistapa

Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot, tokenavaruuden MDLM-tulosteet ja koodiavaruuden diffuusiotulosteet pisteytetään yhdellä ulkoisella GPT-2-arvioijalla. Koodikirjaa ja geometriaa koskevat mittarit ovat diagnostisia eivätkä korvaa dekoodatun tekstin laadun arviointia.

### Päätulos

Koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 ja p95-arvon arvosta 25.10 arvoon 98.91. Koodiavaruuden MDLM pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden MDLM:ään verrattuna.

### Miksi tällä on merkitystä

Tulos tekee koodekin pullonkaulan diagnosoinnista käytännöllisen työjärjestyksen: paranna ensin koodekkia, vertaa sen jälkeen tokeni- ja koodiavaruuden generointia ja luota latenttiavaruuden sijaismittarien parannuksiin vain, jos myös dekoodattu teksti paranee.

## Tiivistelmä

Pakatun lyhyttekstin generaattorit voivat epäonnistua kahdessa eri vaiheessa: koodekki voi hävittää tietoa ennen generoinnin alkua, tai latenttigeneraattori voi tuottaa heikkolaatuisia koodeja. Jos näitä virhetyyppejä ei eroteta toisistaan, tutkijat voivat käyttää laskentaresursseja väärän komponentin parantamiseen. Tutkimme ongelmaa kontrolloidussa TinyStories-tapaustutkimuksessa, jossa 64 tokenia pakataan 16:ksi hierarkkisesta VQ-VAE-2-koodekista ja maskatun diskreetin diffuusion generaattorista (MDLM) koostuvassa järjestelmässä. Käytämme vaiheittaista validointiprotokollaa, joka erottaa koodekin rekonstruktion uskollisuuden, latenttigeneroinnin laadun ja täydentävän latenttiavaruuden diagnostiikan toisistaan saman ulkoisen GPT-2-arvioijan avulla; geometriatutkimuksesta raportoimme lisäksi täydentäviä semanttisia mittareita. Testatussa asetelmassa jo pelkkä koodekin rekonstruktio nostaa ulkoisen perpleksiteetin mediaanin arvosta 15.17 arvoon 27.36 (+80.4%) ja p95-arvon arvosta 25.10 arvoon 98.91 (+294.1%), mikä osoittaa hallitsevan laatuhäviön syntyvän ennen latenttigeneroinnin alkua. Samalla arvioijalla koodiavaruuden MDLM on edelleen selvästi tokeniavaruuden diffuusiota parempi: keskiarvo pienenee 32.9%, mediaani 30.9% ja p95-arvo 36.6%. Geometrian huomioiva regularisointi parantaa paikallisia latenttiavaruuden sijaismittareita mutta ei käytettävissä olevissa ajoissa dekoodatun tekstin mittareita. Kontribuutio on menetelmällinen eikä algoritminen: artikkelissa esitetään yhdelle konkreettiselle käsittelyketjulle uudelleenkäytettävä vaiheittainen diagnoosi ja osoitetaan, että tässä asetelmassa käytännön laadun ylärajan määrää koodekin uskollisuus eikä latenttikohinan poisto.

Julkaisupaikka 2026 39th Conference of Open Innovations Association (FRUCT)

Kontribuution tyyppi Diagnostinen menetelmä

28. huhtikuuta 2026 numero 1 s. 69–76 Pääkonferenssi

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Sisältö Tällä sivulla

## Keskeiset tulokset

| Arviointikohta | n | Keskimääräinen PPL | PPL:n mediaani | PPL:n 95. persentiili |
| --- | --- | --- | --- | --- |
| Alkuperäiset tekstit | 256 | 16.24 | 15.17 | 25.1 |
| Koodekin rekonstruktiot | 256 | 37.26 | 27.36 | 98.91 |
| AR-vertailutaso | 251 | 30.98 | 23.27 | 56.11 |
| Tokenavaruuden MDLM | 256 | 44.74 | 38.42 | 93.6 |
| Koodiavaruuden MDLM | 256 | 30.01 | 26.55 | 59.36 |

**Keskeinen tulos.** Suurin osa havaitusta laatuhäviöstä syntyy ennen generointia; koodiavaruuden diffuusio pienentää silti perpleksiteetin mediaania 30.9% tokeniavaruuden diffuusioon verrattuna.

Lataa tulokset: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Ulkoinen peilipalvelu: [Hugging Face -aineistokortti](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF ja viittaustiedot

**Viittaa tähän artikkeliin** BibTeX on suositeltu muoto. Kaikki alla olevat versiot tuotetaan samasta julkaisutietueesta.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Viittaustiedostot: [APA-teksti](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [IEEE-teksti](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [JATS 1.4 -metatieto-XML](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Kokoteksti JATS 1.4 XML -muodossa](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Linkkijoukko (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Linkkijoukko (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Kattava opas

## Kattava tutkimusopas

## Menetelmä

## 

Artikkelissa käytetään samaa arviointimenetelmää kolmessa arviointivaiheessa, jotta jokaiseen lisämuunnokseen voidaan yhdistää mitattava laatuero.

1. Rekonstruoi Enkoodaa kukin 64 tokenin TinyStories-näyte 16 ylätason koodiksi ja dekoodaa se välittömästi koodekkirekonstruktiohäviön mittaamiseksi.
2. Generoi Generoi MDLM:llä joko tekstitokeneita tai diskreettejä latenttikoodeja ja dekoodaa sitten koodiavaruuden näytteet samalla koulutetulla koodekilla.
3. Vertaile Pisteytä alkuperäistekstit, rekonstruktiot ja generoidut tekstit samalla ulkoisella GPT-2-protokollalla ja sisällytä tarkasteluun mediaani- ja häntätilastot.

![Pakatun tekstin vaiheittainen generointiputki vertaa alkuperäistä tekstiä, koodekin rekonstruktiota, koodiavaruuden MDLM:ää ja purettua tekstiä erottaakseen koodekkihäviön generointihäviöstä.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Pullonkaulojen vaiheittainen paikantaminen erottaa koodekin rekonstruktiohäviön latenttigeneroinnin häviöstä yhteisellä puretun tekstin arviointiprotokollalla.* Lähde: [Kirjoittajan laatima, julkaistuun menetelmään ja tuloksiin perustuva selittävä kaavio.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Uudelleenkäytön ehdot: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Ehdotettu lähdemerkintä: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Lataa SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Keskeinen ajatus

Jatkokäsittelyn generaattori ei voi palauttaa tietoa, jonka koodekki on jo hävittänyt. Siksi rekonstruktiovaihe on auditoitava ennen latenttigeneroinnin tulosten tulkintaa.

### Ero läheisiin lähestymistapoihin

Tavanomaiset päästä päähän -vertailut raportoivat yhden lopullisen generointituloksen. Tässä protokollassa lisätään parittainen rekonstruktion tarkistuspiste ja erotetaan latenttiavaruuden kuntoa kuvaavat mittarit purettua tekstiä koskevasta näytöstä.

### Mikä on uutta

Tutkimuksen kontribuutio on uudelleenkäytettävä vaiheittainen diagnostiikkamenetelmä yhdelle konkreettiselle pakatun tekstin käsittelyputkelle, ei uusi kohinanpoistoalgoritmi.

## Kysymykset, joihin tämä artikkeli auttaa vastaamaan

## 

Avaa kysymys saadaksesi artikkeliin perustuvan tiiviin vastauksen. Näytön yksityiskohtaiset rajat esitetään Rajoitukset-osiossa.

1. Missä pakatun lyhyen tekstin generoinnin laatu heikkenee? Testatussa TinyStories 64-to-16 -putkessa hallitseva laadun heikkeneminen ilmenee koodekin rekonstruktiossa ennen piiloavaruuden generoinnin alkamista. Ulkoisen GPT-2-perplexiteetin mediaani kasvaa alkuperäisen tekstin arvosta 15.17 rekonstruktion jälkeiseen arvoon 27.36, ja p95 kasvaa arvosta 25.10 arvoon 98.91. Tulos koskee yhtä konfiguraatiota eikä ole koodekkien yleispätevä paremmuusjärjestys.
2. Miten koodekkihäviö voidaan erottaa piiloavaruuden generointihäviöstä? Vaiheistetussa protokollassa alkuperäiset tekstit, niitä vastaavat koodekkirekonstruktiot ja lopullinen generoitu teksti arvioidaan samalla ulkoisella arvioijalla. Alkuperäisen ja rekonstruktion välinen ero estimoi koodekin osuutta, kun taas rekonstruktion ja generoidun tulosteen vertailu auttaa paikantamaan generointivaiheen lisähäviön. Latenttiesityksen toimivuutta kuvaavat mittarit raportoidaan erillään dekoodattua tekstiä koskevasta näytöstä.
3. Miten diskreetteihin piilomuuttujiin perustuvaa tekstin generointia tulisi arvioida? Artikkelissa suositellaan rekonstruktion uskollisuuden tarkistamista ennen generaattorien vertailua, saman puretun tekstin arviointimenetelmän käyttämistä kaikissa vaiheissa sekä jakauman keskiosaa ja häntiä kuvaavien tilastojen raportointia. Lisäksi koodikirjan käyttöä, geometriaa ja muita latentteja sijaismittareita käsitellään diagnostiikkana, ei puretun tekstin laadun korvikkeina.
4. Onko koodiavaruuden diffuusio tokeniavaruuden diffuusiota suorituskykyisempi? Samalla arvioijalla ja testatussa asetelmassa koodiavaruuden MDLM pienentää perpleksiteetin keskiarvoa 32.9%, mediaania 30.9% ja p95-arvoa 36.6% tokeniavaruuden MDLM:ään verrattuna. Vertailu on kuvaileva ja kokoonpanokohtainen: se ei osoita yleispätevää paremmuusjärjestystä eri aineistojen, pakkaussuhteiden, koodekkien tai diffuusioarkkitehtuurien välillä.
5. Takaavatko paremmat latenttigeometrian mittarit laadukkaamman generoidun tekstin? Ei. Käytettävissä olevissa kaltaistetuissa ajoissa geometriatietoinen regularisointi paransi latenttiavaruuden paikallisia korvikemittareita mutta ei dekoodatun tekstin mittareita. Tulos puoltaa jokaisen korvikemittarin parannuksen tarkistamista lopullisesta dekoodatusta tulosteesta sekä siirtymän puuttumisen käsittelemistä hyödyllisenä negatiivisena tuloksena eikä näyttönä generoinnin paranemisesta.

## Vertailu läheisiin lähestymistapoihin

## 

| Lähestymistapa | Esitys | Ohjaus / diagnosointi | Mitä säilytetään tai mitataan |
| --- | --- | --- | --- |
| Tokenavaruuden diffuusio | Tekstitokenit | Generoinnin laatu tokeniavaruudessa | Suoran generoinnin sujuvuus ja arvioijan käyttäytyminen |
| Pakattu latenttigenerointi | Diskreetit latenttikoodit koodekin avulla | Lopullinen päästä päähän -generoinnin laatu | Koodekin ja latenttigeneraattorin yhteiskäyttäytyminen |
| Pullonkaulojen vaiheittainen paikantaminen | Teksti, koodekin rekonstruktiot ja diskreetit latenttiesitykset | Erota koodekkihäviö generointihäviöstä | Missä laatu heikkenee yhteistä arvioijaa käytettäessä |

Vertailussa erotetaan arvioinnin laajuus ja näyttö; kyse ei ole lähestymistapojen yleispätevästä paremmuusjärjestyksestä.

## Merkitys ja rajaus

## 

Vaiheistettu protokolla on hyödyllinen, kun generatiivinen käsittelyketju sisältää sekä opitun koodekin että latenttiavaruuden generaattorin mutta tulosteen laadun heikkenemisen syy on epäselvä.

1. Pakattu tekstingenerointi diskreeteillä latenteilla
2. Koodekin rekonstruktion uskollisuus generatiivisissa putkissa
3. Maskattuun diffuusioon perustuva kielimallinnus koodiavaruudessa
4. Pullonkaulan paikantaminen ja vaiheiden suhteen johdonmukainen arviointi
5. Latenttiavaruuden sijaismittarien parannusten auditointi dekoodattua tekstiä vasten

## Rajoitukset

## 

- Empiirisessä tutkimuksessa käytetään ainoastaan TinyStories-aineistoa.
- Pääanalyysi kattaa yhden voimakkaan 64:stä 16:een -pakkausasetelman.
- Arvioitu järjestelmä yhdistää yhden hierarkkisen VQ-VAE-2-koodekkiperheen ja yhden MDLM-generaattorin.
- Vertailut perustuvat yksittäisiin ajoihin ja ovat kuvailevia eivätkä useisiin satunnaissiemeniin perustuvia tilastollisia estimaatteja.
- Ulkoinen GPT-2-perpleksisyys on yhteinen diagnostinen mittari, ei yleispätevä semanttisen laadun mittari.
- Johtopäätöksiä ei pidä siirtää sellaisinaan kaikkiin aineistoihin, koodekkiarkkitehtuureihin tai pakkaussuhteisiin.

## Artikkelissa siteeratut lähteet

## 

Nämä merkinnät vastaavat artikkelin PDF-version numeroitua References-osiota.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Aineistot ja toistettavuus

## 

### Aineistoseloste

## Versiot

## 

1. **Julkaistu versio** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **arXiv-tietue** [Avaa esipainoksen tietue, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Tekoälytutkimuksen hakemisto** [Hugging Face Paper Page, jossa ensimmäisen kirjoittajan henkilöllisyys on varmennettu ja tulosyhteenveto linkitetty](https://huggingface.co/papers/2607.24176)
4. **Kirjoittajan käsikirjoitus** [Tekstimuodossa saavutettava paikallinen PDF](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Konferenssiesitelmä** [FRUCT 39 -esitys](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Konferenssijulkaisujen hakemisto** [Virallinen FRUCT 39 -julkaisu](https://fruct.org/publications/volume-39/fruct39)
7. **Konferenssijulkaisun PDF** [FRUCTin avoin kokoteksti](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Avaa tieteellinen tietue** [OpenAlex](https://openalex.org/W7160914887)
9. **Viittausgraafin tietue** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Kirjoittajan jakama kokoteksti** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Julkaistu DOI on ensisijainen bibliografinen tunniste. Tämä sivu säilyy hankkeen ainoana kanonisena URL-osoitteena kaikissa versioissa.

## Aiheeseen liittyvä julkaisu

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/fi/publications/inspectable-control/)

Lue [Koodekin pullonkaulan diagnosointi](https://aogavrilov.com/fi/projects/codec-bottleneck-diagnosis/) tutkimusopas. [Tietoa kirjoittajasta](https://aogavrilov.com/about/) .

### Kohdennetut tutkimusmuistiinpanot

Tavoitekohtaisia vastauksia, joissa näytön rajat ilmaistaan ja joista on linkit takaisin tähän artikkeliin.

- [Koodiavaruuden ja tokenavaruuden maskattu diffuusio: miten niitä vertaillaan](https://aogavrilov.com/fi/research-notes/code-space-vs-token-space-masked-diffusion/)
