Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Titik Kemerosotan Kualiti dalam Penjanaan Teks Pendek Termampat: Penyetempatan Cerutan Secara Berperingkat
Diagnosis berperingkat bagi penjanaan teks pendek termampat yang memisahkan kehilangan pembinaan semula kodek daripada kehilangan penjanaan pendam.
Baca makalah penuh dalam HTMLTeks yang boleh dicari, berserta formula, jadual, rajah dan rujukan.
Manuskrip akhir yang diterima (versi yang disiarkan oleh pengarang dengan DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Syarat penyiaran dan penggunaan semula.
Makalah dalam 30 saat
Soalan penyelidikanBagaimanakah kemerosotan kualiti dalam saluran penjanaan teks termampat dapat dikaitkan secara berasingan dengan kodek dan penjana ruang pendam?
Masalah
Dalam penjanaan teks pendek termampat, mutu teks ternyahkod yang rendah mungkin berpunca daripada kehilangan maklumat dalam kodek atau kelemahan penjanaan ruang pendam. Skor hujung ke hujung mengaburkan mod kegagalan tersebut dan boleh menyebabkan usaha pengoptimuman ditumpukan pada komponen yang salah.
Pendekatan
Protokol berperingkat memberikan skor kepada teks asal, pembinaan semula kodek berpasangan, output MDLM ruang token, dan output resapan ruang kod dengan satu penilai GPT-2 luaran. Ukuran buku kod dan geometri kekal sebagai diagnostik, bukan pengganti kualiti teks ternyahkod.
Hasil utama
Pembinaan semula kodek meningkatkan median perpleksiti luaran daripada 15.17 kepada 27.36 dan p95 daripada 25.10 kepada 98.91. MDLM ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding MDLM ruang token.
Mengapa hal ini penting
Hasil ini mengubah diagnosis cerutan kodek menjadi urutan kerja yang boleh dilaksanakan: utamakan penambahbaikan kodek, kemudian bandingkan penjanaan ruang token dengan ruang kod, dan terima peningkatan proksi ruang pendam sebagai bukti hanya apabila teks ternyahkod turut bertambah baik.
Abstrak
Penjana teks pendek termampat boleh gagal pada dua bahagian yang berbeza: kodek mungkin membuang maklumat sebelum penjanaan bermula, atau penjana pendam mungkin menghasilkan kod yang lemah. Tanpa memisahkan mod kegagalan ini, penyelidik mungkin menghabiskan sumber pengkomputeran untuk menambah baik komponen yang salah. Kami mengkaji masalah ini melalui kajian kes TinyStories 64-kepada-16 yang terkawal, dibina daripada kodek VQ-VAE-2 berhierarki dan penjana resapan diskret bertopeng (MDLM). Kami menggunakan protokol pengesahan berperingkat yang memisahkan kesetiaan pembinaan semula kodek, kualiti penjanaan pendam, dan diagnostik pendam tambahan di bawah satu penilai luaran GPT-2 yang dikongsi, di samping melaporkan metrik semantik pelengkap bagi kajian geometri. Dalam konfigurasi yang diuji, pembinaan semula kodek sahaja meningkatkan median keperpleksan luaran daripada 15.17 kepada 27.36 (+80.4%) dan p95 daripada 25.10 kepada 98.91 (+294.1%), yang menunjukkan bahawa kehilangan kualiti dominan muncul sebelum penjanaan pendam bermula. Di bawah penilai yang sama, MDLM ruang kod kekal jauh lebih kukuh berbanding resapan ruang token, masing-masing mengurangkan min, median, dan p95 sebanyak 32.9%, 30.9%, dan 36.6%. Regularisasi peka geometri menambah baik proksi pendam setempat tetapi tidak menambah baik metrik teks ternyahkod dalam larian yang tersedia. Sumbangannya bersifat metodologi dan bukannya algoritma: makalah ini mengemukakan diagnosis berperingkat yang boleh diguna semula bagi satu saluran paip konkrit serta menunjukkan bahawa, dalam tetapan ini, kesetiaan kodek dan bukannya penyahhingaran pendam menetapkan had maksimum kualiti praktikal.
Diterbitkan di 2026 39th Conference of Open Innovations Association (FRUCT)
Jenis sumbangan Metodologi diagnosis
isu 1pp. 69–76Persidangan utama
Hasil utama
| Titik penilaian | n | PPL min | PPL median | PPL p95 |
|---|---|---|---|---|
| Teks asal | 256 | 16.24 | 15.17 | 25.1 |
| Hasil pembinaan semula kodek | 256 | 37.26 | 27.36 | 98.91 |
| Garis dasar AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM ruang token | 256 | 44.74 | 38.42 | 93.6 |
| MDLM ruang kod | 256 | 30.01 | 26.55 | 59.36 |
Hasil utama. Sebahagian besar kehilangan kualiti yang diperhatikan berlaku sebelum penjanaan; resapan ruang kod masih mengurangkan median perpleksiti sebanyak 30.9% berbanding resapan ruang token.
- Set data
- TinyStories
- Saiz sampel
- 256 sampel pembinaan semula berpasangan; 251–256 sampel terjana bagi setiap mod; empat tetapan geometri yang dipadankan.
- Metrik
- Perpleksiti GPT-2 luaran: min, median, p95 dan maksimum; penggunaan buku kod dan saiz sokongan; SBERT, BERTScore, MAUVE serta ringkasan penilai LLM untuk larian geometri
- Ketidakpastian
- Perbandingan yang dilaporkan merupakan larian tunggal deskriptif; selang keyakinan dan anggaran keertian berbilang benih tidak dihitung.
- Syarat
- Jujukan token GPT-2 sepanjang 64 dimampatkan kepada 16 kod peringkat teratas menggunakan VQ-VAE-2 berhierarki; semua mod penjanaan menggunakan penilai luaran yang dikongsi.
Muat turun hasil:CSVJSONMarkdownCermin luaran:Kad set data Hugging Face
PDF dan petikan
Petik makalah ini BibTeX ialah format yang disyorkan. Setiap varian di bawah dijana daripada rekod penerbitan yang sama.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Fail sitasi:Teks APATeks IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML metadata JATS 1.4Teks penuh JATS 1.4 XMLRDF TurtleSet Pautan (JSON)Set Pautan (HTTP)RO-Crate
Panduan lengkap
Panduan penyelidikan lengkap
Kaedah
Makalah ini menggunakan satu penilai merentas tiga peringkat penilaian supaya setiap transformasi tambahan dapat dikaitkan dengan jurang kualiti yang boleh diukur.
Bina semula
Enkod setiap sampel TinyStories 64 token kepada 16 kod peringkat teratas dan nyahkodnya serta-merta untuk mengukur kehilangan pembinaan semula kodek.
Jana
Jana sama ada token teks atau kod pendam diskret menggunakan MDLM, kemudian nyahkod sampel ruang kod melalui kodek terlatih yang sama.
Bandingkan
Berikan skor kepada teks asal, pembinaan semula dan teks yang dijana menggunakan protokol GPT-2 luaran yang sama, termasuk statistik median dan ekor taburan.
Gagasan utama
Penjana hiliran tidak dapat memulihkan maklumat yang telah dibuang oleh kodek. Oleh itu, peringkat pembinaan semula mesti diaudit sebelum hasil penjanaan pendam ditafsirkan.
Perbezaan daripada pendekatan yang berkaitan
Perbandingan hujung-ke-hujung piawai melaporkan satu skor penjanaan akhir. Protokol ini menyisipkan titik semak pembinaan semula berpasangan dan mengasingkan metrik kesihatan dalam ruang pendam daripada bukti pada teks ternyahkod.
Perkara yang baharu
Sumbangannya ialah metodologi diagnostik berperingkat yang boleh digunakan semula bagi satu saluran teks termampat yang khusus, bukannya algoritma penyahhinggaan baharu.
Soalan yang dibantu jawab oleh makalah ini
Buka soalan untuk mendapatkan jawapan ringkas yang berasaskan makalah. Sempadan bukti yang terperinci disenaraikan dalam Batasan.
Di manakah kualiti merosot dalam penjanaan teks pendek termampat?
Dalam saluran TinyStories 64-ke-16 yang diuji, kemerosotan utama berlaku pada peringkat pembinaan semula kodek, sebelum penjanaan ruang pendam bermula. Median perpleksiti GPT-2 luaran meningkat daripada 15.17 bagi teks asal kepada 27.36 selepas pembinaan semula, manakala p95 meningkat daripada 25.10 kepada 98.91. Hasil ini terpakai pada satu konfigurasi dan bukannya pemeringkatan kodek secara sejagat.
Bagaimanakah kehilangan kodek dapat diasingkan daripada kehilangan penjanaan ruang pendam?
Protokol berperingkat menilai teks asal, pembinaan semula kodek berpasangan, dan teks akhir yang dijana dengan satu penilai luaran yang dikongsi. Jurang antara teks asal dengan pembinaan semula menganggarkan sumbangan kodek, manakala perbandingan antara pembinaan semula dengan output terjana membantu menentukan lokasi kehilangan tambahan pada peringkat penjanaan. Metrik kesihatan pendam dilaporkan secara berasingan daripada bukti teks ternyahkod.
Bagaimanakah penjanaan teks pendam diskret harus dinilai?
Makalah ini menyarankan agar kesetiaan pembinaan semula diperiksa sebelum penjana dibandingkan, penilai teks ternyahkod yang sama digunakan pada setiap peringkat, serta statistik pusat dan ekor dilaporkan. Penggunaan buku kod, geometri dan proksi ruang pendam lain turut dianggap sebagai diagnostik, bukannya pengganti bagi kualiti teks ternyahkod.
Adakah resapan ruang kod mengatasi resapan ruang token?
Menurut penilai bersama dan dalam persediaan yang diuji, MDLM ruang kod mengurangkan min, median dan p95 perpleksiti masing-masing sebanyak 32.9%, 30.9% dan 36.6% berbanding MDLM ruang token. Perbandingan ini bersifat deskriptif dan khusus kepada konfigurasi; perbandingan ini tidak menetapkan pemeringkatan sejagat merentas set data, nisbah pemampatan, kodek atau seni bina resapan.
Adakah metrik geometri pendam yang lebih baik menjamin teks janaan yang lebih baik?
Tidak. Dalam pelaksanaan berpadanan yang tersedia, regularisasi berasaskan geometri menambah baik proksi setempat dalam ruang pendam, tetapi tidak menambah baik metrik teks ternyahkod. Dapatan ini menyokong pengauditan setiap peningkatan proksi pada output akhir yang dinyahkod serta pentafsiran ketiadaan pemindahan sebagai dapatan negatif yang berguna, bukannya bukti peningkatan penjanaan.
Perbandingan dengan pendekatan yang berkaitan
| Pendekatan | Perwakilan | Kawalan / diagnosis | Perkara yang dikekalkan atau diukur |
|---|---|---|---|
| Resapan ruang token | Token teks | Kualiti penjanaan dalam ruang token | Kelancaran dan tingkah laku penilai bagi penjanaan langsung |
| Penjanaan pendam termampat | Kod pendam diskret melalui kodek | Kualiti akhir penjanaan hujung ke hujung | Tingkah laku gabungan kodek dan penjana pendam |
| Penyetempatan cerutan secara berperingkat | Teks, pembinaan semula kodek dan pemboleh ubah pendam diskret | Asingkan kehilangan kodek daripada kehilangan penjanaan | Lokasi kemerosotan kualiti di bawah satu penilai bersama |
Perbandingan ini membezakan skop penilaian dan bukti; perbandingan tersebut bukan pemeringkatan universal bagi pendekatan berkenaan.
Kerelevanan dan skop
Protokol berperingkat berguna apabila talian paip generatif mengandungi kodek terpelajar dan penjana ruang pendam, tetapi punca kemerosotan kualiti output tidak jelas.
Penjanaan teks termampat dengan pemboleh ubah pendam diskret
Kesetiaan pembinaan semula kodek dalam saluran paip generatif
Pemodelan bahasa berasaskan resapan bertopeng dalam ruang kod
Penyetempatan cerutan dan penilaian yang tekal antara peringkat
Mengaudit penambahbaikan proksi ruang pendam berdasarkan teks ternyahkod
Batasan
- Kajian empirikal ini hanya menggunakan TinyStories.
- Analisis utama meliputi satu rejim mampatan agresif 64-kepada-16.
- Sistem yang dinilai menggabungkan satu keluarga kodek VQ-VAE-2 berhierarki dengan satu penjana MDLM.
- Perbandingan berasaskan larian tunggal dan bersifat deskriptif, bukannya anggaran statistik berbilang benih.
- Perpleksiti GPT-2 luaran ialah ukuran diagnostik bersama, bukan metrik universal bagi kualiti semantik.
- Kesimpulan ini tidak seharusnya diterapkan secara langsung pada semua set data, seni bina kodek atau nisbah mampatan.
Rujukan yang dipetik dalam makalah
Entri ini sepadan dengan bahagian Rujukan bernombor dalam PDF makalah.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Sumber dan kebolehulangan
- Penerbit
- IEEE
- Sumber penerbitan
- Manuskrip awam, jadual hasil, rajah penerangan dan fail petikan tersedia di sini. Kod pelaksanaan dan titik semak tidak dikeluarkan kepada umum.
Pernyataan data
- Sumber
- TinyStories, sebagaimana yang dihuraikan dalam makalah.
- Lesen
- Penggunaan TinyStories kekal tertakluk pada syarat set data itu sendiri; tiada fail set data diedarkan semula oleh laman ini.
- Prapemprosesan
- Pentokenan GPT-2, input tetap 64 token dan pemampatan temporal berhierarki daripada 64 kepada 32, kemudian 16 kedudukan.
- Pisahkan
- Penerbitan tersebut melaporkan 256 sampel pembinaan semula berpasangan dan 251–256 sampel terjana bagi setiap mod; penerbitan itu tidak menyediakan manifes pembahagian latihan/pengesahan yang boleh digunakan semula.
- Format
- Sampel teks pendek, jujukan token GPT-2, jujukan kod diskret, log penjanaan dan jadual ringkasan.
- Versi / hasil tambah semak
- Hasil tambah semak set data atau pengecam petikan keadaan TinyStories yang tak boleh ubah tidak dilaporkan dalam makalah tersebut.
- Pemerolehan
- Skrip pemerolehan awam tidak dikeluarkan bersama halaman penerbitan.
- Batas penggunaan
- Bukti ini meliputi cerita sintetik pendek dan tidak seharusnya dianggap sebagai penanda aras bagi penjanaan bahasa tabii tanpa kekangan.
Versi
- Versi terbitanIEEE / FRUCT, 2026
- Rekod arXivBuka rekod pracetak, arXiv:2607.24176
- Manuskrip pengarangPDF setempat dengan teks boleh capai
- Pembentangan persidanganPembentangan FRUCT 39
- Indeks prosiding persidanganJilid rasmi FRUCT 39
- PDF prosiding persidanganTeks penuh akses terbuka FRUCT
- Buka rekod ilmiahOpenAlex
- Rekod graf sitasiSemantic Scholar
- Teks penuh yang dikongsi pengarangResearchGate
DOI yang diterbitkan ialah pengecam bibliografi utama. Halaman ini kekal sebagai satu-satunya URL kanonik projek bagi semua versi.