# Cara menentukan sama ada penjana teks termampat gagal pada peringkat kodek atau penjana

Canonical HTML: https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/

Document language: ms

Diagnosis praktikal bagi sistem dua peringkat yang mula-mula memampatkan teks menjadi kod diskret, kemudian menjana dalam ruang kod. Matlamatnya adalah untuk mengenal pasti peringkat yang membatasi output ternyahkod sebelum sumber pengkomputeran dibelanjakan pada komponen yang salah.

Diterbitkan 29 Julai 2026 Dikemas kini 30 Julai 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## Jawapan ringkas

Berikan skor kepada teks asal, pembinaan semula kodek berpasangannya dan teks akhir yang dijana menggunakan penilai luaran yang sama. Jurang antara teks asal dengan pembinaan semula mengukur had atas kualiti yang dikenakan sebelum penjanaan. Seterusnya, jurang antara pembinaan semula dengan penjanaan mengasingkan kemerosotan tambahan yang diperkenalkan oleh penjana pendam.

**Jangan gantikan output ternyahkod dengan proksi ruang pendam.** Geometri, penggunaan atau sokongan buku kod yang lebih baik boleh menjadi diagnostik yang berguna, tetapi hanya membuktikan peningkatan kualiti apabila teks ternyahkod bertambah baik menurut metrik akhir yang relevan.

## Diagnosis empat titik semak

1. Tetapkan rujukan Berikan skor kepada teks asal yang diketepikan menggunakan penilai luaran yang digunakan untuk semua peringkat berikutnya.
2. Ukur pembinaan semula kodek Enkod dan nyahkod contoh yang sama tanpa penjanaan. Langkah ini mendedahkan maklumat yang hilang pada titik cerutan.
3. Ukur penjanaan pendam Jana kod, nyahkodkan kod tersebut dan berikan skor kepada teks yang terhasil menggunakan penilai yang tidak diubah.
4. Audit pemindahan proksi Bandingkan diagnostik pendam dengan metrik akhir teks ternyahkod dan jangan mengandaikan bahawa peningkatan proksi akan turut berpindah.

## Cara mentafsir jurang antara peringkat

| Corak yang diperhatikan | Cerutan yang paling berkemungkinan | Eksperimen seterusnya |
| --- | --- | --- |
| Teks asal memperoleh skor yang baik; hasil pembinaan semula merosot dengan ketara | Kesetiaan kodek | Tingkatkan pembinaan semula atau kurangkan pemampatan sebelum menala penjana |
| Pembinaan semula kekal kukuh; output yang dijana merosot | Penjana ruang pendam | Periksa penyahhinggaan, pensampelan, pengkondisian dan ketakpadanan taburan kod |
| Proksi pendam bertambah baik; metrik ternyahkod kekal mendatar | Pemindahan proksi | Nilai semula sama ada proksi menjejaki sifat hiliran yang menjadi tumpuan |
| Setiap peringkat memperoleh skor yang rendah | Data, penilai, atau persediaan eksperimen | Sahkan taburan rujukan dan penilai sebelum mengaitkan kegagalan dengan model |

## Dapatan kajian kes TinyStories yang diterbitkan

Dalam [*Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization*](https://aogavrilov.com/ms/publications/where-quality-breaks/) , teks 64 token dimampatkan kepada 16 kod peringkat atas menggunakan VQ-VAE-2 berhierarki. Berdasarkan satu penilai GPT-2 luaran, median perpleksiti meningkat daripada **15.17** bagi teks asal kepada **27.36** bagi pembinaan semula kodek, manakala p95 meningkat daripada **25.10** kepada **98.91** .

### Pemodelan bahasa resapan bertopeng dalam ruang kod berbanding ruang token

Jurang pembinaan semula mendominasi saluran yang diuji. Dalam batas atas tersebut, pemodelan bahasa resapan bertopeng (MDLM) ruang kod masih berprestasi lebih baik daripada MDLM ruang token menurut penilai yang dikongsi: median perpleksiti ialah **26.55** berbanding **38.42** , iaitu pengurangan sebanyak 30.9%.

Penyelarasan yang peka terhadap geometri memperbaik proksi pendam setempat dalam larian sepadan yang tersedia, tetapi tidak memperbaik metrik teks ternyahkod. Hasil pemindahan negatif tersebut merupakan sebahagian daripada diagnosis, bukannya bukti bahawa penyelaras itu memperbaik teks akhir.

## Perkara yang perlu diukur pada setiap peringkat

## Soalan penyelidikan yang dijawab oleh panduan ini

Jawapan ringkas ini menghubungkan soalan diagnostik lazim dengan bukti terukur bagi setiap peringkat.

1. Bagaimanakah resapan bertopeng dalam ruang kod berbanding dengan ruang token dalam eksperimen teks yang dilaporkan? Menurut penilai luaran yang sama, MDLM ruang kod mencatatkan median perpleksiti 26.55 berbanding 38.42 bagi garis dasar ruang token, iaitu pengurangan 30.9%. Median pembinaan semula kodek sudah pun 27.36, maka hasil tersebut mesti ditafsirkan bersama-sama dengan cerutan pembinaan semula. [Periksa angka mengikut peringkat yang dilaporkan](https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. Bagaimanakah resapan bertopeng dalam ruang kod dan ruang token harus dibandingkan apabila kodek bersifat lesap? Gunakan sampel pegangan dan penilai teks ternyahkod yang sama bagi teks asal, pembinaan semula kodek, output ruang token, dan output ruang kod. Laporkan jurang pembinaan semula secara berasingan kerana penjana pendam yang lebih kukuh tidak dapat memulihkan maklumat yang telah disingkirkan oleh kodek. [Bandingkan semua peringkat menggunakan satu penilai](https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. Bagaimanakah kemerosotan kualiti dapat didiagnosis dalam penjana teks dua peringkat? Ukur jurang antara teks asal dengan pembinaan semula sebelum jurang antara pembinaan semula dengan penjanaan, menggunakan satu penilai teks ternyahkod yang tidak berubah. Langkah ini memisahkan had atas kualiti yang dikenakan oleh kodek daripada kemerosotan tambahan yang diperkenalkan oleh penjanaan pendam. [Ikuti diagnosis empat pusat pemeriksaan](https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/#workflow) .
4. Bilakah metrik ruang pendam yang lebih baik gagal meningkatkan output ternyahkod? Proksi pendam boleh bertambah baik tanpa menjejaki sifat hiliran yang menjadi tumpuan. Uji pemindahan dengan menyahkod output terpadan dan menilainya menggunakan metrik akhir yang sama; jika tidak, geometri atau penggunaan buku kod kekal sebagai bukti diagnostik, bukannya peningkatan kualiti teks. [Gunakan diagnostik pemindahan proksi](https://aogavrilov.com/ms/projects/codec-bottleneck-diagnosis/#decision-table) .

## Kesilapan diagnosis yang lazim

### Membandingkan keluaran akhir sahaja

Skor hujung ke hujung tidak dapat menentukan sama ada perwakilan atau penjana yang menyebabkan kehilangan tersebut.

### Menukar penilai antara peringkat

Penilai yang berbeza menyebabkan jurang antara peringkat tidak dapat dibandingkan dan melemahkan atribusi sebab-akibat.

### Menganggap tahap kesihatan buku kod sebagai “kualiti teks”

Penggunaan yang sihat mungkin wujud serentak dengan pembinaan semula yang lemah atau hasil penjanaan ternyahkod yang lemah.

### Pengitlakan satu rejim pemampatan

Bukti yang diterbitkan meliputi satu konfigurasi TinyStories 64-kepada-16 dan larian tunggal yang bersifat deskriptif.

## Latar belakang utama

Sumber ini mentakrifkan set data dan keluarga model yang dirujuk oleh kajian diagnostik tersebut.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Memperkenalkan VQ-VAE dan cerutan diskret terpelajar yang digunakan oleh penjana ruang pendam terkemudian.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Membangunkan perwakilan diskret berhierarki dengan aras kod yang berasingan.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Memperkenalkan korpus cerita pendek sintetik yang digunakan dalam kajian kes diagnostik.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Menyediakan perumusan resapan diskret bertopeng yang digunakan untuk penjana pendam.

## Sempadan bukti

Kaedah berperingkat ini boleh diguna semula, tetapi kedudukan yang dilaporkan tidak bersifat sejagat. Eksperimen yang diterbitkan menggunakan TinyStories, satu rejim pemampatan agresif, satu keluarga kodek berhierarki, satu penjana diskret bertopeng, dan larian tunggal yang bersifat deskriptif. Terapkan protokol diagnostik pada sistem baharu; jangan pindahkan kesimpulan berangka itu kepada tetapan yang berbeza.

## Penerbitan berkaitan

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/ms/publications/where-quality-breaks/)

Titik Kemerosotan Kualiti dalam Penjanaan Teks Pendek Termampat: Penyetempatan Cerutan Secara Berperingkat

Metodologi diagnosis FRUCT 39 2026 Persidangan utama

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ms/publications/inspectable-control/)

Kawalan Boleh Periksa untuk Penjanaan Semula Perisian yang Mengekalkan Struktur

Kaedah kawalan ruang pendam FSE Companion '26 2026 Poster pengiring
