Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Titik Keruntuhan Mutu dalam Generasi Teks Pendek Terkompresi: Lokalisasi Bottleneck Bertahap
Diagnosis bertahap terhadap generasi teks pendek terkompresi yang memisahkan kehilangan mutu akibat rekonstruksi codec dari kehilangan tambahan akibat generasi laten.
Baca makalah lengkap dalam HTMLTeks yang dapat ditelusuri beserta rumus, tabel, gambar, dan referensi.
Naskah akhir yang diterima (versi yang diunggah penulis dengan DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Ketentuan publikasi dan penggunaan kembali.
Makalah dalam 30 detik
Pertanyaan risetBagaimana kehilangan mutu dalam alur generasi teks terkompresi dapat diuraikan menjadi kontribusi codec dan generator laten secara terpisah?
Masalah
Dalam generasi teks pendek terkompresi, rendahnya mutu teks hasil dekode dapat disebabkan oleh informasi yang hilang pada codec atau oleh generasi ruang laten yang lemah. Skor ujung-ke-ujung mengaburkan kedua modus kegagalan tersebut dan dapat mengarahkan upaya optimasi ke komponen yang keliru.
Pendekatan
Protokol bertahap menilai teks asli, rekonstruksi codec berpasangan, keluaran MDLM ruang token, dan keluaran difusi ruang kode dengan satu evaluator eksternal GPT-2. Ukuran codebook dan geometri tetap diperlakukan sebagai diagnostik, bukan pengganti ukuran mutu teks hasil dekode.
Hasil utama
Rekonstruksi codec meningkatkan median perpleksitas eksternal dari 15.17 menjadi 27.36 dan p95 dari 25.10 menjadi 98.91. Meski demikian, MDLM ruang kode menurunkan median perpleksitas sebesar 30.9% dibandingkan MDLM ruang token.
Mengapa hal ini penting
Hasil ini mengubah diagnosis bottleneck codec menjadi urutan kerja yang operasional: prioritaskan perbaikan codec, kemudian bandingkan generasi ruang token dan ruang kode, dan anggap peningkatan proksi laten sebagai kemajuan hanya jika mutu teks hasil dekode juga meningkat.
Abstrak
Generator teks pendek terkompresi dapat gagal pada dua tahap berbeda: codec dapat membuang informasi sebelum generasi dimulai, atau generator laten dapat menghasilkan kode yang lemah. Tanpa memisahkan kedua modus kegagalan ini, peneliti dapat menghabiskan sumber daya komputasi untuk memperbaiki komponen yang keliru. Kami mengkaji masalah ini melalui studi kasus TinyStories 64-ke-16 yang terkendali, dengan codec VQ-VAE-2 hierarkis dan generator difusi diskret bertopeng (MDLM). Kami menggunakan protokol validasi bertahap yang memisahkan fidelitas rekonstruksi codec, mutu generasi laten, dan diagnostik laten tambahan dengan satu penilai eksternal GPT-2 yang sama, serta melaporkan metrik semantik pelengkap untuk kajian geometri. Pada konfigurasi yang diuji, rekonstruksi codec saja meningkatkan median perpleksitas eksternal dari 15.17 menjadi 27.36 (+80.4%) dan p95 dari 25.10 menjadi 98.91 (+294.1%), yang menunjukkan bahwa kehilangan mutu terbesar terjadi sebelum generasi laten dimulai. Dengan penilai yang sama, MDLM ruang kode tetap jauh lebih baik daripada difusi ruang token, dengan penurunan perpleksitas rata-rata, median, dan p95 masing-masing sebesar 32.9%, 30.9%, dan 36.6%. Regularisasi yang mempertimbangkan geometri memperbaiki proksi laten lokal, tetapi tidak memperbaiki metrik teks hasil dekode pada eksperimen yang tersedia. Kontribusi penelitian ini bersifat metodologis, bukan algoritmis: makalah ini menyajikan diagnosis bertahap yang dapat digunakan kembali untuk satu alur konkret dan menunjukkan bahwa, dalam konfigurasi ini, fidelitas codec—bukan denoising laten—menentukan batas atas mutu praktis.
Diterbitkan di 2026 39th Conference of Open Innovations Association (FRUCT)
Jenis kontribusi Metodologi diagnostik
edisi 1hlm. 69–76Konferensi utama
Hasil utama
| Titik evaluasi | n | PPL rata-rata | PPL median | PPL p95 |
|---|---|---|---|---|
| Teks asli | 256 | 16.24 | 15.17 | 25.1 |
| Hasil rekonstruksi codec | 256 | 37.26 | 27.36 | 98.91 |
| Baseline AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM ruang token | 256 | 44.74 | 38.42 | 93.6 |
| MDLM ruang-kode | 256 | 30.01 | 26.55 | 59.36 |
Hasil utama. Sebagian besar kehilangan mutu yang teramati terjadi sebelum generasi; meski demikian, difusi ruang kode menurunkan median perpleksitas sebesar 30.9% dibandingkan difusi ruang token.
- Dataset
- TinyStories
- Ukuran sampel
- 256 sampel rekonstruksi berpasangan; 251–256 sampel hasil generasi per mode; empat pengaturan geometri yang dipadankan.
- Metrik
- Perpleksitas eksternal GPT-2: rata-rata, median, p95, dan maksimum; penggunaan codebook dan ukuran himpunan dukungan; SBERT, BERTScore, MAUVE, serta ringkasan penilaian LLM untuk eksperimen geometri
- Ketidakpastian
- Perbandingan yang dilaporkan berasal dari satu kali eksperimen dan bersifat deskriptif; interval kepercayaan dan estimasi signifikansi dengan beberapa seed tidak dihitung.
- Kondisi
- Urutan token GPT-2 sepanjang 64 dikompresi menjadi 16 kode tingkat atas dengan VQ-VAE-2 hierarkis; seluruh mode pembangkitan menggunakan penilai eksternal bersama.
Unduh hasil:CSVJSONMarkdownCermin eksternal:Kartu dataset Hugging Face
PDF & sitasi
Cara menyitasi makalah ini BibTeX merupakan format yang disarankan. Semua varian di bawah ini dihasilkan dari rekaman publikasi yang sama.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
Berkas sitasi:Teks APATeks IEEERISCSL-JSONSchema.org JSON-LDXML OAI-DCXML OpenAIRE v4XML MODSXML metadata JATS 1.4Teks lengkap JATS 1.4 XMLRDF TurtleKumpulan Tautan (JSON)Kumpulan Tautan (HTTP)RO-Crate
Panduan lengkap
Panduan riset lengkap
Metode
Makalah ini menggunakan satu penilai pada tiga tahap evaluasi agar setiap transformasi tambahan dapat dikaitkan dengan kesenjangan kualitas yang terukur.
Merekonstruksi
Enkode setiap sampel TinyStories sepanjang 64 token menjadi 16 kode tingkat atas, lalu segera dekode untuk mengukur rugi rekonstruksi kodek.
Bangkitkan
Bangkitkan token teks atau kode laten diskret dengan MDLM, lalu dekode sampel ruang kode melalui kodek terlatih yang sama.
Bandingkan
Nilai teks asli, rekonstruksi, dan teks hasil generasi dengan protokol eksternal GPT-2 yang sama, termasuk statistik median dan ekor.
Gagasan utama
Generator hilir tidak dapat memulihkan informasi yang telah dibuang oleh codec. Oleh karena itu, tahap rekonstruksi harus diaudit sebelum hasil generasi laten ditafsirkan.
Perbedaan dari pendekatan terkait
Perbandingan ujung-ke-ujung standar hanya melaporkan satu skor akhir generasi. Protokol ini menambahkan titik pemeriksaan rekonstruksi berpasangan dan memisahkan metrik kondisi ruang laten dari bukti berdasarkan teks hasil dekode.
Apa yang baru
Kontribusinya adalah metodologi diagnosis bertahap yang dapat digunakan kembali untuk satu alur generasi teks terkompresi yang konkret, bukan algoritme denoising baru.
Pertanyaan yang turut dijawab oleh makalah ini
Buka pertanyaan untuk memperoleh jawaban ringkas yang berlandaskan makalah. Batas bukti terperinci dicantumkan pada bagian Keterbatasan.
Pada tahap mana kualitas menurun dalam generasi teks pendek terkompresi?
Dalam pipeline TinyStories 64-ke-16 yang diuji, degradasi dominan muncul pada rekonstruksi codec, sebelum generasi laten dimulai. Median perplexity eksternal GPT-2 meningkat dari 15.17 untuk teks asli menjadi 27.36 setelah rekonstruksi, sedangkan p95 meningkat dari 25.10 menjadi 98.91. Temuan ini berlaku untuk satu konfigurasi, bukan merupakan pemeringkatan codec yang universal.
Bagaimana kerugian codec dapat dipisahkan dari kerugian generasi laten?
Protokol bertahap mengevaluasi teks asli, pasangan rekonstruksi kodek, dan teks hasil generasi akhir dengan satu penilai eksternal yang sama. Kesenjangan antara teks asli dan rekonstruksi mengestimasi kontribusi kodek, sedangkan perbandingan antara rekonstruksi dan keluaran hasil generasi membantu melokalisasi kerugian tambahan pada tahap generasi. Metrik kesehatan laten dilaporkan secara terpisah dari bukti berbasis teks hasil dekode.
Bagaimana generasi teks dengan laten diskret perlu dievaluasi?
Makalah ini merekomendasikan pemeriksaan fidelitas rekonstruksi sebelum membandingkan generator, penerapan penilai teks terdekode yang sama pada setiap tahap, serta pelaporan statistik pusat dan ekor. Penggunaan codebook, geometri, dan proksi laten lainnya juga diperlakukan sebagai diagnostik, bukan sebagai pengganti kualitas teks terdekode.
Apakah difusi di ruang kode mengungguli difusi di ruang token?
Dengan penilai bersama dan konfigurasi yang diuji, MDLM ruang kode menurunkan perplexity rata-rata, median, dan p95 masing-masing sebesar 32.9%, 30.9%, dan 36.6% relatif terhadap MDLM ruang token. Perbandingan ini bersifat deskriptif dan khusus untuk konfigurasi tersebut: hasilnya tidak menetapkan peringkat universal lintas himpunan data, rasio kompresi, kodek, ataupun arsitektur difusi.
Apakah metrik geometri laten yang lebih baik menjamin teks hasil pembangkitan yang lebih baik?
Tidak. Dalam eksekusi berpasangan yang tersedia, regularisasi sadar-geometri meningkatkan proksi lokal ruang laten, tetapi tidak meningkatkan metrik teks terdekode. Hasil ini mendukung audit atas setiap peningkatan proksi pada keluaran akhir yang terdekode dan penafsiran ketiadaan transfer sebagai hasil negatif yang berguna, bukan sebagai bukti peningkatan generasi.
Perbandingan dengan pendekatan terkait
| Pendekatan | Representasi | Kontrol / diagnosis | Apa yang dilestarikan atau diukur |
|---|---|---|---|
| Difusi ruang token | Token teks | Kualitas pembangkitan di ruang token | Kefasihan dan perilaku penilai pada pembangkitan langsung |
| Generasi laten terkompresi | Kode laten diskret melalui kodek | Kualitas akhir pembangkitan ujung-ke-ujung | Perilaku gabungan codec dan generator laten |
| Pelokalan bottleneck bertahap | Teks, rekonstruksi codec, dan laten diskret | Pisahkan loss codec dari loss generasi | Tahap penurunan kualitas berdasarkan satu penilai bersama |
Perbandingan ini membedakan cakupan evaluasi dan bukti; perbandingan tersebut bukan pemeringkatan universal atas pendekatan-pendekatan ini.
Relevansi & cakupan
Protokol bertahap berguna ketika suatu alur generatif memuat codec hasil pembelajaran sekaligus generator ruang laten, tetapi sumber penurunan mutu keluarannya belum jelas.
Generasi teks terkompresi dan berlaten diskret
Fidelitas rekonstruksi codec dalam pipeline generatif
Pemodelan bahasa dengan difusi bertopeng dalam ruang kode
Lokalisasi bottleneck dan evaluasi yang konsisten antar-tahap
Mengaudit peningkatan proksi ruang laten terhadap teks hasil dekode
Keterbatasan
- Studi empiris ini hanya menggunakan TinyStories.
- Analisis utama mencakup satu rezim kompresi agresif 64-ke-16.
- Sistem yang dievaluasi menggabungkan satu keluarga codec VQ-VAE-2 hierarkis dengan satu generator MDLM.
- Perbandingan didasarkan pada satu kali eksperimen dan bersifat deskriptif, bukan estimasi statistik dengan beberapa seed.
- Perpleksitas GPT-2 eksternal merupakan diagnostik bersama, bukan metrik universal untuk kualitas semantik.
- Kesimpulan ini tidak boleh diterapkan secara langsung pada semua dataset, arsitektur codec, atau rasio kompresi.
Referensi yang disitasi dalam makalah
Entri-entri ini bersesuaian dengan bagian Referensi bernomor dalam PDF makalah.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
Sumber daya & reprodusibilitas
- Penerbit
- IEEE
- Sumber daya publikasi
- Naskah publik, tabel hasil, gambar penjelas, dan berkas sitasi tersedia di sini. Kode implementasi dan checkpoint tidak dirilis kepada publik.
Pernyataan data
- Sumber
- TinyStories, sebagaimana dijelaskan dalam makalah.
- Lisensi
- Penggunaan TinyStories tetap tunduk pada ketentuan himpunan data itu sendiri; situs ini tidak mendistribusikan ulang berkas himpunan data apa pun.
- Prapemrosesan
- Tokenisasi GPT-2, masukan tetap sepanjang 64 token, dan kompresi temporal hierarkis dari 64 ke 32 hingga 16 posisi.
- Pembagian
- Publikasi tersebut melaporkan 256 sampel rekonstruksi berpasangan dan 251–256 sampel hasil generasi per mode; publikasi itu tidak menyediakan manifes pembagian train/validation yang dapat digunakan kembali.
- Format
- Sampel teks pendek, urutan token GPT-2, urutan kode diskret, log generasi, dan tabel ringkasan.
- Versi / checksum
- Checksum set data atau pengenal snapshot TinyStories yang tetap tidak dilaporkan dalam makalah tersebut.
- Akuisisi
- Skrip akuisisi publik tidak dirilis bersama halaman publikasi.
- Batas penggunaan
- Bukti yang tersedia mencakup cerita sintetis pendek dan tidak boleh diperlakukan sebagai benchmark untuk generasi bahasa alami tanpa batasan.
Versi
- Versi terbitanIEEE / FRUCT, 2026
- Rekaman arXivBuka rekaman pracetak, arXiv:2607.24176
- Naskah penulisPDF lokal dengan teks yang dapat diakses
- Presentasi konferensiPresentasi FRUCT 39
- Indeks prosiding konferensiVolume resmi FRUCT 39
- PDF prosiding konferensiTeks lengkap akses terbuka FRUCT
- Buka rekaman ilmiahOpenAlex
- Rekaman graf sitasiSemantic Scholar
- Teks lengkap yang dibagikan penulisResearchGate
DOI yang dipublikasikan merupakan pengenal bibliografis utama. Halaman ini tetap menjadi satu-satunya URL proyek kanonis di seluruh versi.