# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/sw/publications/where-quality-breaks/

Document language: sw

Mahali Ubora Unapodorora katika Uzalishaji wa Matini Fupi Zilizobanwa: Ubainishaji wa Hatua kwa Hatua wa Kikwazo

Uchunguzi wa hatua kwa hatua wa uzalishaji wa matini fupi iliyobanwa unaotenganisha hasara ya ujenzi upya wa kodeki na hasara ya uzalishaji katika nafasi fiche.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Soma makala kamili katika HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Matini inayotafutika yenye fomula, majedwali, vielelezo na marejeleo.

Hati ya mwisho iliyokubaliwa (toleo lililochapishwa na mwandishi lenye DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Masharti ya uchapishaji na matumizi upya](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## Muhtasari wa makala kwa sekunde 30

**Swali la utafiti** Kupungua kwa ubora katika mchakato wa uzalishaji wa matini iliyofinyazwa kunawezaje kuhusishwa kando na kodeki na kizalishaji cha nafasi fiche?

### Tatizo

Katika uzalishaji wa matini fupi iliyobanwa, ubora duni wa matini iliyosimbuliwa unaweza kutokana na taarifa iliyopotezwa na kodeki au uzalishaji dhaifu katika nafasi fiche. Alama za mwanzo hadi mwisho huficha tofauti kati ya aina hizo za hitilafu na zinaweza kuelekeza juhudi za uboreshaji kwenye kijenzi kisichofaa.

### Mkabala

Itifaki ya hatua kwa hatua hupima matini asili, ujenzi upya wa kodeki uliopangwa kwa jozi, matokeo ya MDLM ya nafasi ya tokeni, na matokeo ya usambazaji katika nafasi ya msimbo kwa kitathmini kimoja cha nje cha GPT-2. Vipimo vya kamusi ya misimbo na jiometri hubaki kuwa zana za uchunguzi badala ya vibadala vya ubora wa matini iliyosimbuliwa.

### Tokeo kuu

Ujenzi upya wa kodeki huongeza perplexity ya kati iliyopimwa na kikadiriaji cha nje kutoka 15.17 hadi 27.36 na p95 kutoka 25.10 hadi 98.91. Hata hivyo, MDLM ya nafasi ya msimbo hupunguza perplexity ya kati kwa 30.9% ikilinganishwa na MDLM ya nafasi ya tokeni.

### Umuhimu wake

Matokeo yanageuza utambuzi wa kikwazo cha kodeki kuwa mpangilio wa kazi unaotekelezeka: tanguliza maboresho ya kodeki, kisha linganisha uzalishaji wa nafasi ya tokeni na wa nafasi ya msimbo, na uamini faida za viwakilishi mbadala vya nafasi fiche pale tu matini iliyosimbuliwa inapoboreka pia.

## Muhtasari

Vizalishaji vya matini fupi iliyobanwa vinaweza kushindwa katika sehemu mbili tofauti: kodeki inaweza kupoteza taarifa kabla ya uzalishaji kuanza, au kizalishaji cha nafasi fiche kinaweza kutoa misimbo dhaifu. Bila kutenganisha aina hizi za hitilafu, watafiti wanaweza kutumia rasilimali za ukokotoaji kuboresha kijenzi kisichofaa. Tunachunguza tatizo hili katika uchunguzi kifani dhibitiwa wa TinyStories wa 64-kwa-16, unaotumia kodeki ya VQ-VAE-2 ya kihierarkia na kizalishaji tambufu cha uenezaji wenye ufichaji (MDLM). Tunatumia itifaki ya uthibitishaji wa hatua kadhaa inayotenganisha uaminifu wa ujenzi upya wa kodeki, ubora wa uzalishaji katika nafasi fiche na viashiria saidizi vya uchunguzi wa nafasi fiche kwa kikadiriaji kimoja cha pamoja cha nje cha GPT-2, huku tukiripoti vipimo vya ziada vya kisemantiki kwa uchunguzi wa jiometria. Katika usanidi uliojaribiwa, ujenzi upya wa kodeki pekee huongeza perplexity ya kati iliyopimwa na kikadiriaji cha nje kutoka 15.17 hadi 27.36 (+80.4%) na p95 kutoka 25.10 hadi 98.91 (+294.1%), jambo linaloonyesha kuwa sehemu kubwa ya upotevu wa ubora hutokea kabla ya uzalishaji katika nafasi fiche kuanza. Kwa kikadiriaji hicho hicho, MDLM ya nafasi ya msimbo hubaki bora zaidi kuliko uenezaji katika nafasi ya tokeni, huku ikipunguza wastani, thamani ya kati na p95 kwa 32.9%, 30.9% na 36.6%, mtawalia. Urekebishaji unaozingatia jiometria huboresha viashiria mbadala vya ndani vya nafasi fiche lakini hauboresha vipimo vya matini iliyosimbuliwa katika majaribio yanayopatikana. Mchango huu ni wa kimbinu, si wa kialgoriti: makala inawasilisha uchunguzi wa hatua kadhaa unaoweza kutumiwa tena kwa mkondo mmoja mahususi na kuonyesha kuwa, katika mazingira haya, uaminifu wa kodeki—si uondoaji kelele katika nafasi fiche—ndio unaoweka kikomo cha juu cha ubora wa kiutendaji.

Imechapishwa katika 2026 39th Conference of Open Innovations Association (FRUCT)

Aina ya mchango Mbinu ya kiutambuzi

28 Aprili 2026 toleo la 1 kur. 69–76 Mkutano mkuu

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Yaliyomo Katika ukurasa huu

## Matokeo makuu

| Hatua ya tathmini | n | Wastani wa PPL | Mediani ya PPL | PPL ya p95 |
| --- | --- | --- | --- | --- |
| Maandishi asilia | 256 | 16.24 | 15.17 | 25.1 |
| Matokeo ya ujengaji upya wa kodeki | 256 | 37.26 | 27.36 | 98.91 |
| Msingi wa AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM ya nafasi ya tokeni | 256 | 44.74 | 38.42 | 93.6 |
| MDLM ya nafasi ya msimbo | 256 | 30.01 | 26.55 | 59.36 |

**Tokeo kuu.** Sehemu kubwa ya upotevu wa ubora ulioonekana hutokea kabla ya uzalishaji; hata hivyo, uenezaji katika nafasi ya msimbo hupunguza perplexity ya kati kwa 30.9% ikilinganishwa na uenezaji katika nafasi ya tokeni.

Pakua matokeo: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Nakala ya nje: [Kadi ya seti ya data ya Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF na rejeleo

**Rejelea makala hii** BibTeX ndiyo muundo unaopendekezwa. Kila toleo lililo hapa chini huzalishwa kutoka rekodi ileile ya chapisho.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Faili za marejeleo: [Matini ya APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Matini ya IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [XML ya metadata ya JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [JATS 1.4 XML ya matini kamili](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Seti ya Viungo (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Seti ya Viungo (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Mwongozo kamili

## Mwongozo kamili wa utafiti

## Mbinu

## 

Makala hutumia kitathmini kimoja katika hatua tatu za tathmini ili kila ugeuzaji wa ziada uweze kuhusishwa na pengo la ubora linalopimika.

1. Jenga upya Simba kila sampuli ya TinyStories yenye tokeni 64 kuwa misimbo 16 ya ngazi ya juu, kisha uisimbue mara moja ili kupima hasara ya ujenzi upya wa kodeki.
2. Zalisha Zalisha tokeni za matini au misimbo fiche tambufu kwa MDLM, kisha simbua sampuli za nafasi ya msimbo kupitia kodeki ileile iliyofunzwa.
3. Linganisha Pima matini asilia, miundo iliyojengwa upya na matini zilizozalishwa kwa itifaki ileile ya nje ya GPT-2, ikijumuisha takwimu za thamani ya kati na za mikia ya mgawanyo.

![Mkondo wa hatua kwa hatua wa uzalishaji wa matini iliyobanwa, unaolinganisha matini asilia, ujenzi upya wa kodeki, MDLM ya nafasi ya msimbo na matini iliyosimbuliwa ili kutenganisha hasara ya kodeki na hasara ya uzalishaji.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**Ubainishaji wa kikwazo kwa hatua hutenganisha hasara ya ujenzi upya wa kodeki na hasara ya uzalishaji katika nafasi fiche kwa kutumia itifaki moja ya pamoja ya kutathmini matini iliyosimbuliwa.* Chanzo: [Mchoro wa ufafanuzi uliotengenezwa na mwandishi kwa kuzingatia mbinu na matokeo yaliyochapishwa.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Masharti ya matumizi tena: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Nukuu inayopendekezwa: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Pakua SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Wazo kuu

Kizalishi cha hatua inayofuata hakiwezi kurejesha taarifa ambayo kodeki tayari imepoteza. Kwa hiyo, hatua ya ujenzi upya lazima ikaguliwe kabla ya kufasiri matokeo ya uzalishaji katika nafasi fiche.

### Tofauti na mikabala inayokaribiana

Ulinganisho wa kawaida wa mwanzo hadi mwisho huripoti alama moja ya mwisho ya uzalishaji. Itifaki hii huweka kituo cha ukaguzi cha uundaji upya uliooanishwa na kutenganisha vipimo vya afya katika nafasi fiche na ushahidi wa matini iliyosimbuliwa.

### Kilicho kipya

Mchango huu ni mbinu ya uchunguzi wa hatua kwa hatua inayoweza kutumiwa tena katika mkondo mmoja mahususi wa matini iliyobanwa, si algoriti mpya ya kuondoa kelele.

## Maswali ambayo makala hii husaidia kujibu

## 

Fungua swali ili kupata jibu fupi linalotegemea makala. Mipaka ya kina ya ushahidi imeorodheshwa katika Mapungufu.

1. Ubora huharibikia wapi katika uzalishaji wa matini fupi iliyogandamizwa? Katika mchakato wa TinyStories wa 64-kwa-16 uliojaribiwa, upungufu mkubwa wa ubora unaonekana katika ujenzi upya wa kodeki, kabla uzalishaji katika nafasi fiche haujaanza. Perplexity ya nje ya GPT-2 ya kati huongezeka kutoka 15.17 kwa matini asilia hadi 27.36 baada ya ujenzi upya, huku p95 ikiongezeka kutoka 25.10 hadi 98.91. Hili ni tokeo la usanidi mmoja, si upangaji wa jumla wa kodeki.
2. Hasara ya kodeki inawezaje kutenganishwa na hasara ya uzalishaji katika nafasi fiche? Itifaki ya hatua kwa hatua hutathmini matini asili, ujenzi upya wa kodeki uliopangwa kwa jozi, na matini ya mwisho iliyozalishwa kwa kipimaji kimoja cha nje kinachotumiwa kwa pamoja. Pengo kati ya matini asili na iliyojengwa upya hukadiria mchango wa kodeki, ilhali ulinganisho wa matini iliyojengwa upya na towe lililozalishwa husaidia kubainisha hasara ya ziada katika hatua ya uzalishaji. Vipimo vya afya ya nafasi fiche huripotiwa kando na ushahidi wa matini iliyosimbuliwa.
3. Uzalishaji wa matini kwa viwakilishi fiche bainifu unapaswa kutathminiwaje? Makala inapendekeza kukagua uaminifu wa uundaji upya kabla ya kulinganisha vizalishaji, kutumia kitathmini kilekile cha matini iliyosimbuliwa katika kila hatua, na kuripoti takwimu za kitovu na mikia ya usambazaji. Pia inachukulia matumizi ya kitabu cha misimbo, jiometria na viwakilishi vingine mbadala vya nafasi fiche kuwa zana za uchunguzi badala ya vibadala vya ubora wa matini iliyosimbuliwa.
4. Je, ueneaji katika nafasi ya msimbo unaizidi ueneaji katika nafasi ya tokeni? Chini ya kipimaji cha pamoja na mpangilio uliojaribiwa, MDLM ya nafasi ya msimbo inapunguza wastani, thamani ya kati na perplexity ya p95 kwa 32.9%, 30.9% na 36.6% ikilinganishwa na MDLM ya nafasi ya tokeni. Ulinganisho huu ni wa kimaelezo na mahususi kwa usanidi; hauthibitishi upangaji wa jumla katika seti za data, uwiano wa mgandamizo, kodeki au usanifu wa usambazaji.
5. Je, vipimo bora vya jiometria ya nafasi fiche vinahakikisha matini bora inayozalishwa? Hapana. Katika marudio linganifu yaliyopatikana, udhibiti unaozingatia jiometria uliboresha viashiria mbadala vya ndani vya nafasi fiche lakini haukuboresha vipimo vya maandishi yaliyosimbuliwa. Matokeo haya yanaunga mkono ukaguzi wa kila ongezeko la kiashiria mbadala katika towe la mwisho lililosimbuliwa, na kuchukulia kutokuwepo kwa uhamisho kuwa tokeo hasi lenye manufaa badala ya ushahidi wa kuimarika kwa uzalishaji.

## Ulinganisho na mikabala inayokaribiana

## 

| Mkabala | Uwakilishi | Udhibiti / utambuzi | Kinachohifadhiwa au kupimwa |
| --- | --- | --- | --- |
| Usambazaji katika nafasi ya tokeni | Tokeni za matini | Ubora wa uzalishaji katika nafasi ya tokeni | Ufasaha na tabia ya kitathmini katika uzalishaji wa moja kwa moja |
| Uzalishaji uliobanwa wa viwakilishi fiche | Misimbo fiche ya kipekee kupitia kodeki | Ubora wa mwisho wa uzalishaji kuanzia mwanzo hadi mwisho | Tabia ya pamoja ya kodeki na kizalishaji cha viwakilishi fiche |
| Ujanibishaji wa kikwazo kwa hatua | Matini, miundo iliyojengwa upya na kodeki, na viwakilishi fiche tambufu | Tenganisha hasara ya kodeki na hasara ya uzalishaji | Mahali ambapo ubora hushuka chini ya kipimaji kimoja cha pamoja |

Ulinganisho hutofautisha mawanda ya tathmini na ushahidi; si upangaji wa jumla wa mikabala hii.

## Umuhimu na mawanda

## 

Itifaki ya hatua kwa hatua hufaa wakati mnyororo wa uzalishaji una kodeki iliyofunzwa na kizalishaji cha nafasi fiche, lakini chanzo cha kushuka kwa ubora wa towe hakijulikani.

1. Uzalishaji wa matini uliobanwa kwa viwakilishi fiche vyenye thamani bainifu
2. Uaminifu wa ujengaji upya wa kodeki katika mifumo-tiririko zalishi
3. Uundaji wa lugha kwa uenezaji wenye ufichaji katika nafasi ya msimbo
4. Ubainishaji wa kikwazo na tathmini inayolingana kwa kila hatua
5. Kukagua maboresho ya vipimo mbadala vya nafasi fiche dhidi ya matini iliyosimbuliwa

## Mapungufu

## 

- Utafiti wa kimajaribio unatumia TinyStories pekee.
- Uchanganuzi mkuu unahusu mpangilio mmoja mkali wa ubanaji kutoka 64 hadi 16.
- Mfumo uliotathminiwa huunganisha familia moja ya kodeki ya VQ-VAE-2 ya kihierarkia na kizalishaji kimoja cha MDLM.
- Ulinganisho unatokana na majaribio ya mara moja na ni wa kimaelezo, si makadirio ya kitakwimu yanayotumia mbegu nyingi.
- Perplexity inayopimwa na GPT-2 ya nje ni kiashiria cha pamoja cha uchunguzi, si kipimo cha jumla cha ubora wa kisemantiki.
- Hitimisho halipaswi kuhamishwa moja kwa moja kwa seti zote za data, usanifu wa kodeki au viwango vya ubanaji.

## Marejeleo yaliyotajwa katika makala

## 

Maingizo haya yanalingana na sehemu ya Marejeleo yenye nambari katika PDF ya makala.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Rasilimali na uwezo wa kuzalisha matokeo upya

## 

### Taarifa kuhusu data

## Matoleo

## 

1. **Toleo lililochapishwa** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Rekodi ya arXiv** [Fungua rekodi ya chapisho la awali, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Faharasa ya utafiti wa AI** [Ukurasa wa Makala wa Hugging Face wenye utambulisho uliothibitishwa wa mwandishi wa kwanza na muhtasari wa matokeo uliounganishwa](https://huggingface.co/papers/2607.24176)
4. **Muswada wa mwandishi** [PDF ya ndani inayofikika kama matini](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Wasilisho la kongamano** [Wasilisho la FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Faharasa ya kumbukumbu za kongamano** [Juzuu rasmi ya FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF ya kumbukumbu za kongamano** [Matini kamili ya FRUCT yenye ufikiaji wazi](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Fungua rekodi ya kitaaluma** [OpenAlex](https://openalex.org/W7160914887)
9. **Rekodi ya grafu ya marejeleo** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Matini kamili iliyoshirikiwa na mwandishi** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

DOI iliyochapishwa ndiyo kitambulishi kikuu cha kibibliografia. Ukurasa huu unabaki URL moja rasmi ya mradi katika matoleo yote.

## Chapisho linalohusiana

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/sw/publications/inspectable-control/)

Soma [Utambuzi wa kikwazo cha kodeki](https://aogavrilov.com/sw/projects/codec-bottleneck-diagnosis/) mwongozo wa utafiti. [Kuhusu mwandishi](https://aogavrilov.com/about/) .

### Madokezo mahsusi ya utafiti

Majibu yanayolenga dhamira mahususi, yenye mipaka ya ushahidi na viungo vinavyorejea makala hii.

- [Uenezaji wenye ufichaji katika nafasi ya msimbo dhidi ya nafasi ya tokeni: jinsi ya kuzilinganisha](https://aogavrilov.com/sw/research-notes/code-space-vs-token-space-masked-diffusion/)
