Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Kung Saan Bumibigay ang Kalidad sa Pagbuo ng Na-compress na Maiikling Teksto: Sunod-sunod na Pagtukoy sa Bottleneck

Yugtu-yugtong pagsusuri sa pagbuo ng compressed na maiikling teksto na naghihiwalay sa pagkawala ng kalidad sa rekonstruksiyon ng codec at sa latent generation.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Basahin ang buong papel sa HTMLNahahanapang teksto na may mga pormula, talahanayan, larawan, at sanggunian.

Pinal na tinanggap na manuskrito (bersiyong inilathala ng may-akda na may DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Mga tuntunin sa paglalathala at muling paggamit.

Ang papel sa 30 segundo

Tanong sa pananaliksikPaano matutukoy nang hiwalay ang bahagi ng codec at ng latent generator sa pagkawala ng kalidad sa isang pipeline ng pagbuo ng compressed na teksto?

Suliranin

Sa pagbuo ng compressed na maiikling teksto, maaaring magmula ang mahinang na-decode na teksto sa impormasyong nawala sa codec o sa mahinang latent-space generation. Pinagsasama ng mga end-to-end score ang dalawang uring ito ng kabiguan at maaaring maituon ang optimization sa maling bahagi.

Pamamaraan

Binibigyan ng score ng yugtu-yugtong protocol ang mga orihinal na teksto, magkapares na rekonstruksiyon ng codec, output ng token-space MDLM, at output ng code-space diffusion gamit ang iisang panlabas na GPT-2 evaluator. Nananatiling mga diagnostic ang mga sukatan ng codebook at geometry, hindi mga pamalit sa kalidad ng na-decode na teksto.

Pangunahing resulta

Itinataas ng rekonstruksiyon ng codec ang median external perplexity mula 15.17 tungong 27.36 at ang p95 mula 25.10 tungong 98.91. Gayunman, 30.9% pa ring mas mababa ang median perplexity ng code-space MDLM kaysa sa token-space MDLM.

Kung bakit ito mahalaga

Ginagawang praktikal na pagkakasunod-sunod ng gawain ng resulta ang pagtukoy sa bottleneck ng codec: unahin ang pagpapahusay sa codec, saka ihambing ang token-space at code-space generation, at ituring lamang na makabuluhan ang pagbuti ng latent proxy kapag bumuti rin ang na-decode na teksto.

Abstrak

Maaaring mabigo sa dalawang magkaibang yugto ang mga generator ng compressed na maiikling teksto: maaaring magtapon ng impormasyon ang codec bago magsimula ang generation, o maaaring lumikha ng mahihinang code ang latent generator. Kung hindi paghihiwalayin ang mga uring ito ng kabiguan, maaaring maubos ng mga mananaliksik ang compute sa pagpapahusay sa maling bahagi. Sinusuri namin ang problemang ito sa isang kontroladong 64-to-16 TinyStories case study na binuo gamit ang herarkikal na VQ-VAE-2 codec at masked discrete diffusion generator (MDLM). Gumagamit kami ng yugtu-yugtong validation protocol na naghihiwalay sa fidelity ng rekonstruksiyon ng codec, kalidad ng latent generation, at mga pantulong na latent diagnostic sa ilalim ng iisang panlabas na GPT-2 scorer, habang nag-uulat ng mga karagdagang semantic metric para sa geometry study. Sa sinubok na configuration, itinataas ng rekonstruksiyon ng codec lamang ang median external perplexity mula 15.17 tungong 27.36 (+80.4%) at ang p95 mula 25.10 tungong 98.91 (+294.1%), na nagpapakitang nangyayari ang pangunahing pagkawala ng kalidad bago magsimula ang latent generation. Sa ilalim ng parehong scorer, nananatiling higit na mahusay ang code-space MDLM kaysa token-space diffusion, na nagpapababa sa mean, median, at p95 nang 32.9%, 30.9%, at 36.6%, ayon sa pagkakasunod. Pinahuhusay ng geometry-aware regularization ang mga lokal na latent proxy ngunit hindi ang mga metric ng na-decode na teksto sa mga available na run. Metodolohikal, hindi algoritmiko, ang ambag: naglalahad ang papel ng magagamit-muling yugtu-yugtong pagsusuri para sa isang kongkretong pipeline at ipinakikita na, sa setting na ito, fidelity ng codec—hindi latent denoising—ang nagtatakda sa praktikal na pinakamataas na kalidad.

Inilathala sa 2026 39th Conference of Open Innovations Association (FRUCT)

Uri ng ambag Metodolohiya ng pagsusuri

isyu 1pp. 69–76Pangunahing kumperensiya

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Ibahagi ang papel na itoIbahagi

Mahahalagang resulta

Mahahalagang resulta ng Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Punto ng ebalwasyonnMean PPLMedian PPLp95 PPL
Mga orihinal na teksto25616.2415.1725.1
Mga rekonstruksiyon ng codec25637.2627.3698.91
AR baseline25130.9823.2756.11
MDLM sa espasyo ng token25644.7438.4293.6
MDLM sa espasyo ng code25630.0126.5559.36

Pangunahing resulta. Karamihan sa naobserbahang pagkawala ng kalidad ay nangyayari bago ang generation; gayunman, 30.9% pa ring mas mababa ang median perplexity ng code-space diffusion kaysa sa token-space diffusion.

Dataset
TinyStories
Laki ng sample
256 na magkapares na sample ng rekonstruksiyon; 251–256 na nabuong sample bawat mode; apat na magkatugmang geometry setting.
Mga sukatan
External GPT-2 perplexity: mean, median, p95, at maximum; paggamit ng codebook at laki ng support; SBERT, BERTScore, MAUVE, at buod ng LLM judge para sa mga geometry run
Kawalang-katiyakan
Ang mga iniulat na paghahambing ay mga deskriptibong single run; hindi kinalkula ang mga confidence interval at multi-seed significance estimate.
Mga kondisyon
Mga sequence ng GPT-2 token na may habang 64, na-compress sa 16 na top-level code gamit ang hierarchical VQ-VAE-2; ginagamit ng lahat ng mode ng pagbuo ang pinagsasaluhang panlabas na tagapuntos.

PDF at pagsipi

Paano sipiin ang papel na ito BibTeX ang inirerekomendang format. Ang lahat ng baryante sa ibaba ay binuo mula sa iisang tala ng publikasyon.

Buksan ang PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
I-download ang .bib

Mga file ng pagsipi:Tekstong APATekstong IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 metadata XMLJATS 1.4 XML ng buong tekstoRDF TurtleHanay ng mga link (JSON)Hanay ng mga link (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Buong gabay

Buong gabay sa pananaliksik

Pamamaraan

Gumagamit ang papel ng iisang tagatasa sa tatlong yugto ng pagsusuri upang maiugnay ang bawat karagdagang transpormasyon sa nasusukat na agwat sa kalidad.

  1. Muling buuin

    I-encode ang bawat 64-token na sample ng TinyStories bilang 16 na top-level code at agad itong i-decode upang sukatin ang pagkawala sa rekonstruksiyon ng codec.

  2. Bumuo

    Bumuo gamit ang MDLM ng alinman sa mga text token o discrete latent code, pagkatapos ay i-decode ang mga sample sa espasyo ng code sa pamamagitan ng parehong sinanay na codec.

  3. Ihambing

    Bigyan ng score ang mga orihinal, rekonstruksiyon, at nabuong teksto gamit ang iisang panlabas na protocol ng GPT-2, kabilang ang mga estadistika ng median at tail.

Yugtu-yugtong pipeline sa pagbuo ng pinaikling teksto na naghahambing sa orihinal na teksto, rekonstruksiyon ng codec, code-space MDLM, at na-decode na teksto upang ihiwalay ang pagkawala sa codec sa pagkawala sa pagbuo.
Inihihiwalay ng yugtu-yugtong pagtukoy sa bottleneck ang pagkawala sa rekonstruksiyon ng codec at ang pagkawala sa latent generation gamit ang iisang protocol sa pagsusuri ng na-decode na teksto.Pinagmulan: Paliwanag na diagram na ginawa ng may-akda batay sa inilathalang pamamaraan at mga resulta..Mga tuntunin sa muling paggamit: CC BY 4.0.Iminungkahing atribusyon: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. I-download ang SVG.

Pangunahing ideya

Hindi mababawi ng downstream generator ang impormasyong itinapon na ng codec. Samakatuwid, kailangang siyasatin ang yugto ng rekonstruksiyon bago bigyang-kahulugan ang mga resulta ng pagbuo sa espasyong latent.

Pagkakaiba sa mga kaugnay na lapit

Iisang pinal na generation score ang iniuulat ng karaniwang end-to-end na paghahambing. Nagdaragdag ang protocol na ito ng checkpoint para sa magkapares na rekonstruksiyon at inihihiwalay ang mga health metric sa latent space mula sa ebidensiya sa na-decode na teksto.

Ano ang bago

Ang ambag ay isang magagamit-muling yugtu-yugtong metodolohiya ng pagsusuri para sa isang kongkretong pipeline ng compressed na teksto, hindi isang bagong denoising algorithm.

Mga tanong na tinutulungang sagutin ng papel na ito

Magbukas ng tanong para sa maikling sagot na nakabatay sa papel. Nakalista sa Mga Limitasyon ang detalyadong mga hangganan ng ebidensiya.

  1. Saang bahagi bumabagsak ang kalidad sa compressed na pagbuo ng maikling teksto?

    Sa sinubok na 64-to-16 pipeline ng TinyStories, lumilitaw ang pangunahing pagbaba ng kalidad sa rekonstruksiyon ng codec, bago magsimula ang pagbuo sa espasyong latent. Tumataas ang median external GPT-2 perplexity mula 15.17 para sa orihinal na teksto tungong 27.36 matapos ang rekonstruksiyon, samantalang tumataas ang p95 mula 25.10 tungong 98.91. Resulta ito para sa iisang configuration, hindi isang pangkalahatang pagraranggo ng mga codec.

  2. Paano maihihiwalay ang pagkawala sa codec sa pagkawala sa pagbuo sa espasyong latent?

    Sinusuri ng nakayugtong na protocol ang mga orihinal, magkapares na rekonstruksiyon ng codec, at panghuling nabuong teksto gamit ang iisang panlabas na scorer. Tinatantiya ng agwat mula orihinal tungong rekonstruksiyon ang ambag ng codec, samantalang tumutulong ang paghahambing mula rekonstruksiyon tungong nabuong output na matukoy ang karagdagang pagkawala sa yugto ng pagbuo. Iniuulat nang hiwalay ang mga sukatan ng kalagayan ng latent at ang ebidensiya mula sa na-decode na teksto.

  3. Paano dapat suriin ang pagbuo ng teksto gamit ang diskretong latent representation?

    Inirerekomenda ng papel na suriin ang fidelity ng rekonstruksiyon bago paghambingin ang mga generator, gamitin ang iisang tagatasa ng na-decode na teksto sa bawat yugto, at iulat ang estadistika sa gitna at mga dulo. Itinuturing din nito ang paggamit ng codebook, geometry, at iba pang latent na proxy bilang mga diyagnostiko, hindi pamalit sa kalidad ng na-decode na teksto.

  4. Nahihigitan ba ng diffusion sa espasyo ng code ang diffusion sa espasyo ng token?

    Sa ilalim ng pinagsasaluhang scorer at sinubok na setup, binabawasan ng MDLM sa espasyo ng code ang mean, median, at p95 na perplexity nang 32.9%, 30.9%, at 36.6% kumpara sa MDLM sa espasyo ng token. Deskriptibo at partikular sa configuration ang paghahambing: hindi nito itinatatag ang pangkalahatang ranggo sa iba't ibang dataset, compression ratio, codec, o arkitektura ng diffusion.

  5. Ginagarantiyahan ba ng mas mahuhusay na panukat ng latent geometry ang mas mahusay na nabuong teksto?

    Hindi. Sa mga available na magkatugmang run, napahusay ng geometry-aware regularization ang mga lokal na proxy sa espasyong latent ngunit hindi ang mga sukatan ng decoded text. Sinusuportahan ng resultang ito ang pag-audit sa bawat pagbuti ng proxy sa pinal na decoded output at ang pagtrato sa kawalan ng transfer bilang kapaki-pakinabang na negatibong resulta, sa halip na ebidensiya ng pagbuti ng pagbuo.

Paghahambing sa mga kaugnay na lapit

Makatotohanang paghahambing ng Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization sa mga kaugnay na lapit
PamamaraanRepresentasyonKontrol / pagsusuriAno ang pinananatili o sinusukat
Diffusion sa espasyo ng tokenMga token ng tekstoKalidad ng pagbuo sa espasyo ng tokenKatatasan at gawi ng tagapuntos sa tuwirang pagbuo
Compressed latent generationMga discrete latent code sa pamamagitan ng codecPinal na kalidad ng end-to-end na pagbuoPinagsamang gawi ng codec at latent generator
Yugtu-yugtong pagtukoy sa lokasyon ng bottleneckTeksto, mga rekonstruksiyon ng codec, at mga discrete latentIhiwalay ang pagkawala sa codec sa pagkawala sa pagbuoKung saan humihina ang kalidad sa ilalim ng iisang scorer

Nililinaw ng paghahambing ang pagkakaiba sa saklaw ng pagsusuri at ebidensiya; hindi ito pangkalahatang pagraranggo sa mga pamamaraan.

Kaugnayan at saklaw

Kapaki-pakinabang ang yugtu-yugtong protocol kapag ang isang generative pipeline ay may natutuhang codec at latent-space generator ngunit hindi malinaw ang pinagmumulan ng pagbaba ng kalidad ng output.

  1. Compressed text generation gamit ang mga discrete latent

  2. Katapatan ng rekonstruksiyon ng codec sa mga generative pipeline

  3. Pagmomodelo ng wika gamit ang masked diffusion sa espasyo ng code

  4. Pagtukoy sa bottleneck at pagsusuring magkakatugma sa bawat yugto

  5. Pagsisiyasat sa mga pagpapahusay ng proxy sa espasyong latent laban sa na-decode na teksto

Tingnan ang mga limitasyon at hangganan ng ebidensiya

Mga limitasyon

  • TinyStories lamang ang ginagamit sa empirikal na pag-aaral.
  • Saklaw ng pangunahing pagsusuri ang isang agresibong 64-to-16 compression regime.
  • Pinagsasama ng sinuring sistema ang isang hirarkikal na VQ-VAE-2 codec family at isang MDLM generator.
  • Nakabatay ang mga paghahambing sa tig-iisang run at deskriptibo ang mga ito, hindi mga estadistikal na pagtatantiya mula sa maraming seed.
  • Ang panlabas na GPT-2 perplexity ay pinagsasaluhang diagnostic, hindi pangkalahatang panukat ng kalidad semantiko.
  • Hindi dapat tuwirang ilapat ang mga kongklusyon sa lahat ng dataset, arkitektura ng codec, o compression ratio.

Mga sangguniang sinipi sa papel

Tumutugma ang mga entry na ito sa may-bilang na seksiyong References sa PDF ng papel.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Mga mapagkukunan at reproducibility

Tagapaglathala
IEEE
Mga sanggunian at resource ng publikasyon
Makukuha rito ang pampublikong manuskrito, mga talahanayan ng resulta, larawang nagpapaliwanag, at mga file ng pagsipi. Hindi pampublikong inilabas ang implementation code at mga checkpoint.

Pahayag ukol sa datos

Pinagmulan
TinyStories, gaya ng pagkakalarawan sa papel.
Lisensiya
Nananatiling saklaw ng sariling mga tuntunin ng dataset ang paggamit ng TinyStories; walang file ng dataset na muling ipinamamahagi ng site na ito.
Paunang pagproseso
GPT-2 tokenization, mga nakapirming 64-token input, at hierarchical temporal compression mula 64 tungong 32 tungong 16 na posisyon.
Hatiin
Iniuulat ng publikasyon ang 256 na magkatambal na sample ng rekonstruksiyon at 251–256 na nabuong sample bawat mode; hindi ito naglalathala ng muling magagamit na train/validation split manifest.
Format
Mga sample ng maikling teksto, mga pagkakasunod-sunod ng GPT-2 token, mga pagkakasunod-sunod ng discrete code, mga log ng pagbuo, at mga talahanayang buod.
Bersiyon / checksum
Hindi iniulat sa papel ang checksum ng dataset o immutable snapshot identifier ng TinyStories.
Pagkuha
Walang pampublikong acquisition script na inilabas kasama ng pahina ng publikasyon.
Mga limitasyon sa paggamit
Saklaw ng ebidensiya ang maiikling sintetikong kuwento at hindi ito dapat ituring na benchmark para sa walang-limitasyong pagbuo ng likas na wika.

Mga bersiyon

  1. Nailathalang bersiyonIEEE / FRUCT, 2026
  2. Talumpati sa kumperensiyaPresentasyon sa FRUCT 39
  3. Indeks ng conference proceedingsOpisyal na tomo ng FRUCT 39
  4. PDF ng conference proceedingsBukas na buong teksto ng FRUCT
  5. Buksan ang akademikong recordOpenAlex
  6. Rekord sa graph ng pagsipiSemantic Scholar
  7. Buong tekstong ibinahagi ng may-akdaResearchGate

Ang inilathalang DOI ang pangunahing bibliograpikong identifier. Nananatili ang pahinang ito bilang nag-iisang canonical project URL sa lahat ng bersiyon.