Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Titik Kemerosotan Kualiti dalam Penjanaan Teks Pendek Termampat: Penyetempatan Cerutan Secara Berperingkat

Diagnosis berperingkat bagi penjanaan teks pendek termampat yang memisahkan kehilangan pembinaan semula kodek daripada kehilangan penjanaan pendam.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Baca makalah penuh dalam HTMLTeks yang boleh dicari, berserta formula, jadual, rajah dan rujukan.

Manuskrip akhir yang diterima (versi yang disiarkan oleh pengarang dengan DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Syarat penyiaran dan penggunaan semula.

Makalah dalam 30 saat

Soalan penyelidikanBagaimanakah kemerosotan kualiti dalam saluran penjanaan teks termampat dapat dikaitkan secara berasingan dengan kodek dan penjana ruang pendam?

Masalah

Dalam penjanaan teks pendek termampat, mutu teks ternyahkod yang rendah mungkin berpunca daripada kehilangan maklumat dalam kodek atau kelemahan penjanaan ruang pendam. Skor hujung ke hujung mengaburkan mod kegagalan tersebut dan boleh menyebabkan usaha pengoptimuman ditumpukan pada komponen yang salah.

Pendekatan

Protokol berperingkat memberikan skor kepada teks asal, pembinaan semula kodek berpasangan, output MDLM ruang token, dan output resapan ruang kod dengan satu penilai GPT-2 luaran. Ukuran buku kod dan geometri kekal sebagai diagnostik, bukan pengganti kualiti teks ternyahkod.

Hasil utama

Pembinaan semula kodek meningkatkan median perpleksiti luaran daripada 15.17 kepada 27.36 dan p95 daripada 25.10 kepada 98.91. MDLM ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding MDLM ruang token.

Mengapa hal ini penting

Hasil ini mengubah diagnosis cerutan kodek menjadi urutan kerja yang boleh dilaksanakan: utamakan penambahbaikan kodek, kemudian bandingkan penjanaan ruang token dengan ruang kod, dan terima peningkatan proksi ruang pendam sebagai bukti hanya apabila teks ternyahkod turut bertambah baik.

Abstrak

Penjana teks pendek termampat boleh gagal pada dua bahagian yang berbeza: kodek mungkin membuang maklumat sebelum penjanaan bermula, atau penjana pendam mungkin menghasilkan kod yang lemah. Tanpa memisahkan mod kegagalan ini, penyelidik mungkin menghabiskan sumber pengkomputeran untuk menambah baik komponen yang salah. Kami mengkaji masalah ini melalui kajian kes TinyStories 64-kepada-16 yang terkawal, dibina daripada kodek VQ-VAE-2 berhierarki dan penjana resapan diskret bertopeng (MDLM). Kami menggunakan protokol pengesahan berperingkat yang memisahkan kesetiaan pembinaan semula kodek, kualiti penjanaan pendam, dan diagnostik pendam tambahan di bawah satu penilai luaran GPT-2 yang dikongsi, di samping melaporkan metrik semantik pelengkap bagi kajian geometri. Dalam konfigurasi yang diuji, pembinaan semula kodek sahaja meningkatkan median keperpleksan luaran daripada 15.17 kepada 27.36 (+80.4%) dan p95 daripada 25.10 kepada 98.91 (+294.1%), yang menunjukkan bahawa kehilangan kualiti dominan muncul sebelum penjanaan pendam bermula. Di bawah penilai yang sama, MDLM ruang kod kekal jauh lebih kukuh berbanding resapan ruang token, masing-masing mengurangkan min, median, dan p95 sebanyak 32.9%, 30.9%, dan 36.6%. Regularisasi peka geometri menambah baik proksi pendam setempat tetapi tidak menambah baik metrik teks ternyahkod dalam larian yang tersedia. Sumbangannya bersifat metodologi dan bukannya algoritma: makalah ini mengemukakan diagnosis berperingkat yang boleh diguna semula bagi satu saluran paip konkrit serta menunjukkan bahawa, dalam tetapan ini, kesetiaan kodek dan bukannya penyahhingaran pendam menetapkan had maksimum kualiti praktikal.

Diterbitkan di 2026 39th Conference of Open Innovations Association (FRUCT)

Jenis sumbangan Metodologi diagnosis

isu 1pp. 69–76Persidangan utama

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Kongsi makalah iniKongsi

Hasil utama

Hasil utama Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Titik penilaiannPPL minPPL medianPPL p95
Teks asal25616.2415.1725.1
Hasil pembinaan semula kodek25637.2627.3698.91
Garis dasar AR25130.9823.2756.11
MDLM ruang token25644.7438.4293.6
MDLM ruang kod25630.0126.5559.36

Hasil utama. Sebahagian besar kehilangan kualiti yang diperhatikan berlaku sebelum penjanaan; resapan ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding resapan ruang token.

Set data
TinyStories
Saiz sampel
256 sampel pembinaan semula berpasangan; 251–256 sampel terjana bagi setiap mod; empat tetapan geometri yang dipadankan.
Metrik
Perpleksiti GPT-2 luaran: min, median, p95 dan maksimum; penggunaan buku kod dan saiz sokongan; SBERT, BERTScore, MAUVE serta ringkasan penilai LLM untuk larian geometri
Ketidakpastian
Perbandingan yang dilaporkan merupakan larian tunggal deskriptif; selang keyakinan dan anggaran keertian berbilang benih tidak dihitung.
Syarat
Jujukan token GPT-2 sepanjang 64 dimampatkan kepada 16 kod peringkat teratas menggunakan VQ-VAE-2 berhierarki; semua mod penjanaan menggunakan penilai luaran yang dikongsi.

PDF dan petikan

Petik makalah ini BibTeX ialah format yang disyorkan. Setiap varian di bawah dijana daripada rekod penerbitan yang sama.

Buka PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
Muat turun .bib

Fail sitasi:Teks APATeks IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML metadata JATS 1.4Teks penuh JATS 1.4 XMLRDF TurtleSet Pautan (JSON)Set Pautan (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

Panduan lengkap

Panduan penyelidikan lengkap

Kaedah

Makalah ini menggunakan satu penilai merentas tiga peringkat penilaian supaya setiap transformasi tambahan dapat dikaitkan dengan jurang kualiti yang boleh diukur.

  1. Bina semula

    Enkod setiap sampel TinyStories 64 token kepada 16 kod peringkat teratas dan nyahkodnya serta-merta untuk mengukur kehilangan pembinaan semula kodek.

  2. Jana

    Jana sama ada token teks atau kod pendam diskret menggunakan MDLM, kemudian nyahkod sampel ruang kod melalui kodek terlatih yang sama.

  3. Bandingkan

    Berikan skor kepada teks asal, pembinaan semula dan teks yang dijana menggunakan protokol GPT-2 luaran yang sama, termasuk statistik median dan ekor taburan.

Saluran penjanaan teks termampat berperingkat yang membandingkan teks asal, pembinaan semula kodek, MDLM ruang kod dan teks ternyahkod untuk mengasingkan kehilangan kodek daripada kehilangan penjanaan.
Penyetempatan cerutan secara berperingkat mengasingkan kehilangan pembinaan semula kodek daripada kehilangan penjanaan ruang pendam di bawah satu protokol penilaian teks ternyahkod yang dikongsi.Sumber: Rajah penerangan ciptaan pengarang berdasarkan kaedah dan hasil yang diterbitkan..Syarat penggunaan semula: CC BY 4.0.Atribusi yang dicadangkan: Gavrilov, Gazzaev, dan Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Muat turun SVG.

Gagasan utama

Penjana hiliran tidak dapat memulihkan maklumat yang telah dibuang oleh kodek. Oleh itu, peringkat pembinaan semula mesti diaudit sebelum hasil penjanaan pendam ditafsirkan.

Perbezaan daripada pendekatan yang berkaitan

Perbandingan hujung-ke-hujung piawai melaporkan satu skor penjanaan akhir. Protokol ini menyisipkan titik semak pembinaan semula berpasangan dan mengasingkan metrik kesihatan dalam ruang pendam daripada bukti pada teks ternyahkod.

Perkara yang baharu

Sumbangannya ialah metodologi diagnostik berperingkat yang boleh digunakan semula bagi satu saluran teks termampat yang khusus, bukannya algoritma penyahhinggaan baharu.

Soalan yang dibantu jawab oleh makalah ini

Buka soalan untuk mendapatkan jawapan ringkas yang berasaskan makalah. Sempadan bukti yang terperinci disenaraikan dalam Batasan.

  1. Di manakah kualiti merosot dalam penjanaan teks pendek termampat?

    Dalam saluran TinyStories 64-ke-16 yang diuji, kemerosotan utama berlaku pada peringkat pembinaan semula kodek, sebelum penjanaan ruang pendam bermula. Median perpleksiti GPT-2 luaran meningkat daripada 15.17 bagi teks asal kepada 27.36 selepas pembinaan semula, manakala p95 meningkat daripada 25.10 kepada 98.91. Hasil ini terpakai pada satu konfigurasi dan bukannya pemeringkatan kodek secara sejagat.

  2. Bagaimanakah kehilangan kodek dapat diasingkan daripada kehilangan penjanaan ruang pendam?

    Protokol berperingkat menilai teks asal, pembinaan semula kodek berpasangan, dan teks akhir yang dijana dengan satu penilai luaran yang dikongsi. Jurang antara teks asal dengan pembinaan semula menganggarkan sumbangan kodek, manakala perbandingan antara pembinaan semula dengan output terjana membantu menentukan lokasi kehilangan tambahan pada peringkat penjanaan. Metrik kesihatan pendam dilaporkan secara berasingan daripada bukti teks ternyahkod.

  3. Bagaimanakah penjanaan teks pendam diskret harus dinilai?

    Makalah ini menyarankan agar kesetiaan pembinaan semula diperiksa sebelum penjana dibandingkan, penilai teks ternyahkod yang sama digunakan pada setiap peringkat, serta statistik pusat dan ekor dilaporkan. Penggunaan buku kod, geometri dan proksi ruang pendam lain turut dianggap sebagai diagnostik, bukannya pengganti bagi kualiti teks ternyahkod.

  4. Adakah resapan ruang kod mengatasi resapan ruang token?

    Menurut penilai bersama dan dalam persediaan yang diuji, MDLM ruang kod mengurangkan min, median dan p95 perpleksiti masing-masing sebanyak 32.9%, 30.9% dan 36.6% berbanding MDLM ruang token. Perbandingan ini bersifat deskriptif dan khusus kepada konfigurasi; perbandingan ini tidak menetapkan pemeringkatan sejagat merentas set data, nisbah pemampatan, kodek atau seni bina resapan.

  5. Adakah metrik geometri pendam yang lebih baik menjamin teks janaan yang lebih baik?

    Tidak. Dalam pelaksanaan berpadanan yang tersedia, regularisasi berasaskan geometri menambah baik proksi setempat dalam ruang pendam, tetapi tidak menambah baik metrik teks ternyahkod. Dapatan ini menyokong pengauditan setiap peningkatan proksi pada output akhir yang dinyahkod serta pentafsiran ketiadaan pemindahan sebagai dapatan negatif yang berguna, bukannya bukti peningkatan penjanaan.

Perbandingan dengan pendekatan yang berkaitan

Perbandingan fakta antara Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization dengan pendekatan berkaitan
PendekatanPerwakilanKawalan / diagnosisPerkara yang dikekalkan atau diukur
Resapan ruang tokenToken teksKualiti penjanaan dalam ruang tokenKelancaran dan tingkah laku penilai bagi penjanaan langsung
Penjanaan pendam termampatKod pendam diskret melalui kodekKualiti akhir penjanaan hujung ke hujungTingkah laku gabungan kodek dan penjana pendam
Penyetempatan cerutan secara berperingkatTeks, pembinaan semula kodek dan pemboleh ubah pendam diskretAsingkan kehilangan kodek daripada kehilangan penjanaanLokasi kemerosotan kualiti di bawah satu penilai bersama

Perbandingan ini membezakan skop penilaian dan bukti; perbandingan tersebut bukan pemeringkatan universal bagi pendekatan berkenaan.

Kerelevanan dan skop

Protokol berperingkat berguna apabila talian paip generatif mengandungi kodek terpelajar dan penjana ruang pendam, tetapi punca kemerosotan kualiti output tidak jelas.

  1. Penjanaan teks termampat dengan pemboleh ubah pendam diskret

  2. Kesetiaan pembinaan semula kodek dalam saluran paip generatif

  3. Pemodelan bahasa berasaskan resapan bertopeng dalam ruang kod

  4. Penyetempatan cerutan dan penilaian yang tekal antara peringkat

  5. Mengaudit penambahbaikan proksi ruang pendam berdasarkan teks ternyahkod

Lihat batasan dan sempadan bukti

Batasan

  • Kajian empirikal ini hanya menggunakan TinyStories.
  • Analisis utama meliputi satu rejim mampatan agresif 64-kepada-16.
  • Sistem yang dinilai menggabungkan satu keluarga kodek VQ-VAE-2 berhierarki dengan satu penjana MDLM.
  • Perbandingan berasaskan larian tunggal dan bersifat deskriptif, bukannya anggaran statistik berbilang benih.
  • Perpleksiti GPT-2 luaran ialah ukuran diagnostik bersama, bukan metrik universal bagi kualiti semantik.
  • Kesimpulan ini tidak seharusnya diterapkan secara langsung pada semua set data, seni bina kodek atau nisbah mampatan.

Rujukan yang dipetik dalam makalah

Entri ini sepadan dengan bahagian Rujukan bernombor dalam PDF makalah.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Sumber dan kebolehulangan

Penerbit
IEEE
Sumber penerbitan
Manuskrip awam, jadual hasil, rajah penerangan dan fail petikan tersedia di sini. Kod pelaksanaan dan titik semak tidak dikeluarkan kepada umum.

Pernyataan data

Sumber
TinyStories, sebagaimana yang dihuraikan dalam makalah.
Lesen
Penggunaan TinyStories kekal tertakluk pada syarat set data itu sendiri; tiada fail set data diedarkan semula oleh laman ini.
Prapemprosesan
Pentokenan GPT-2, input tetap 64 token dan pemampatan temporal berhierarki daripada 64 kepada 32, kemudian 16 kedudukan.
Pisahkan
Penerbitan tersebut melaporkan 256 sampel pembinaan semula berpasangan dan 251–256 sampel terjana bagi setiap mod; penerbitan itu tidak menyediakan manifes pembahagian latihan/pengesahan yang boleh digunakan semula.
Format
Sampel teks pendek, jujukan token GPT-2, jujukan kod diskret, log penjanaan dan jadual ringkasan.
Versi / hasil tambah semak
Hasil tambah semak set data atau pengecam petikan keadaan TinyStories yang tak boleh ubah tidak dilaporkan dalam makalah tersebut.
Pemerolehan
Skrip pemerolehan awam tidak dikeluarkan bersama halaman penerbitan.
Batas penggunaan
Bukti ini meliputi cerita sintetik pendek dan tidak seharusnya dianggap sebagai penanda aras bagi penjanaan bahasa tabii tanpa kekangan.

Versi

  1. Versi terbitanIEEE / FRUCT, 2026
  2. Pembentangan persidanganPembentangan FRUCT 39
  3. Indeks prosiding persidanganJilid rasmi FRUCT 39
  4. PDF prosiding persidanganTeks penuh akses terbuka FRUCT
  5. Buka rekod ilmiahOpenAlex
  6. Rekod graf sitasiSemantic Scholar
  7. Teks penuh yang dikongsi pengarangResearchGate

DOI yang diterbitkan ialah pengecam bibliografi utama. Halaman ini kekal sebagai satu-satunya URL kanonik projek bagi semua versi.