# Cara menentukan apakah kegagalan generator teks terkompresi bersumber dari codec atau generator

Canonical HTML: https://aogavrilov.com/id/projects/codec-bottleneck-diagnosis/

Document language: id

Diagnosis praktis untuk sistem dua tahap yang mula-mula mengompresi teks menjadi kode diskret, lalu melakukan generasi dalam ruang kode. Tujuannya ialah mengidentifikasi tahap yang membatasi keluaran hasil dekode sebelum sumber daya komputasi dihabiskan pada komponen yang keliru.

Diterbitkan 29 Juli 2026 Diperbarui 30 Juli 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## Jawaban singkat

Nilai teks asli, rekonstruksi codec pasangannya, dan teks akhir hasil generasi dengan evaluator eksternal yang sama. Kesenjangan antara teks asli dan rekonstruksi mengukur batas atas kualitas yang telah ditetapkan sebelum generasi. Selanjutnya, kesenjangan antara rekonstruksi dan generasi mengisolasi penurunan mutu tambahan yang ditimbulkan oleh generator laten.

**Jangan menggantikan keluaran terdekode dengan proksi ruang laten.** Geometri, pemanfaatan, atau dukungan buku kode yang lebih baik dapat menjadi diagnostik yang berguna, tetapi hanya membuktikan peningkatan mutu apabila teks hasil dekode membaik menurut metrik akhir yang relevan.

## Diagnosis dengan empat titik pemeriksaan

1. Tetapkan acuan Nilai teks asli yang disisihkan dengan evaluator eksternal yang digunakan untuk semua tahap berikutnya.
2. Ukur rekonstruksi codec Enkode dan dekode contoh yang sama tanpa pembangkitan. Prosedur ini mengungkap informasi yang hilang pada leher botol.
3. Ukur generasi laten Bangkitkan kode, dekode kode tersebut, lalu nilai teks yang dihasilkan dengan evaluator yang tidak diubah.
4. Audit transfer proksi Bandingkan diagnostik laten dengan metrik akhir teks hasil dekode, alih-alih mengasumsikan bahwa peningkatan metrik proksi akan terbawa.

## Cara menafsirkan kesenjangan antartahap

| Pola yang teramati | Bottleneck yang paling mungkin | Eksperimen berikutnya |
| --- | --- | --- |
| Teks asli memperoleh skor tinggi; hasil rekonstruksi mengalami degradasi tajam | Fidelitas codec | Perbaiki rekonstruksi atau kurangi kompresi sebelum menyetel generator |
| Rekonstruksi tetap baik; keluaran hasil generasi mengalami penurunan mutu | Generator laten | Periksa denoising, sampling, pengondisian, dan ketidakselarasan distribusi kode |
| Proksi laten membaik; metrik hasil dekode tetap datar | Transfer proksi | Nilai kembali apakah proksi mencerminkan properti hilir yang menjadi perhatian |
| Setiap tahap memperoleh skor buruk | Data, evaluator, atau rancangan eksperimen | Validasi distribusi acuan dan penilai sebelum mengatribusikan kegagalan kepada model |

## Apa yang ditemukan oleh studi kasus TinyStories yang telah dipublikasikan

Dalam [*Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization*](https://aogavrilov.com/id/publications/where-quality-breaks/) , teks sepanjang 64 token dikompresi menjadi 16 kode tingkat atas dengan VQ-VAE-2 hierarkis. Menurut satu penilai GPT-2 eksternal, median perplexity meningkat dari **15.17** untuk teks asli menjadi **27.36** untuk rekonstruksi kodek, sedangkan p95 meningkat dari **25.10** ke **98.91** .

### Pemodelan bahasa dengan difusi bertopeng pada ruang-kode versus ruang-token

Kesenjangan rekonstruksi mendominasi pipeline yang diuji. Di bawah batas atas tersebut, pemodelan bahasa difusi bermask (MDLM) pada ruang kode masih berkinerja lebih baik daripada MDLM pada ruang token menurut penilai yang sama: median perplexity adalah **26.55** dibandingkan dengan **38.42** , yakni penurunan sebesar 30,9%.

Regularisasi yang mempertimbangkan geometri memperbaiki proksi laten lokal pada eksperimen berpadanan yang tersedia, tetapi tidak memperbaiki metrik teks terdekode. Hasil transfer negatif tersebut merupakan bagian dari diagnosis, bukan bukti bahwa regularisator memperbaiki teks akhir.

## Apa yang perlu diukur pada setiap tahap

## Pertanyaan riset yang dijawab panduan ini

Jawaban ringkas ini menghubungkan pertanyaan diagnostik umum dengan bukti terukur pada setiap tahap.

1. Bagaimana perbandingan difusi diskret bertopeng di ruang kode dan ruang token dalam eksperimen teks yang dilaporkan? Dengan penilai eksternal yang sama, MDLM ruang kode mencatat median perplexity 26.55 dibandingkan 38.42 pada baseline ruang token, yakni penurunan 30.9%. Median rekonstruksi kodek sendiri sudah mencapai 27.36, sehingga hasil tersebut harus ditafsirkan bersama dengan bottleneck rekonstruksi. [Periksa angka per tahap yang dilaporkan](https://aogavrilov.com/id/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. Bagaimana difusi diskret bertopeng di ruang kode dan ruang token perlu dibandingkan ketika codec bersifat lossy? Gunakan sampel uji tertahan dan penilai teks hasil dekode yang sama untuk teks asli, rekonstruksi kodek, keluaran ruang token, dan keluaran ruang kode. Laporkan kesenjangan rekonstruksi secara terpisah karena generator laten yang lebih kuat tidak dapat memulihkan informasi yang telah dihilangkan oleh kodek. [Bandingkan seluruh tahap dengan satu penilai](https://aogavrilov.com/id/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. Bagaimana penurunan kualitas dapat didiagnosis pada generator teks dua tahap? Ukur kesenjangan antara teks asli dan rekonstruksi sebelum kesenjangan antara rekonstruksi dan generasi dengan satu evaluator teks terdekode yang tidak berubah. Pengukuran ini memisahkan batas atas kualitas yang ditentukan codec dari degradasi tambahan akibat generasi laten. [Ikuti diagnostik empat titik pemeriksaan](https://aogavrilov.com/id/projects/codec-bottleneck-diagnosis/#workflow) .
4. Kapan metrik ruang laten yang lebih baik gagal meningkatkan keluaran hasil dekode? Proksi laten dapat membaik tanpa merepresentasikan properti hilir yang menjadi perhatian. Uji transfer dengan mendekode keluaran yang dipadankan dan mengevaluasinya menggunakan metrik akhir yang sama; jika tidak, geometri atau pemanfaatan buku kode tetap sekadar bukti diagnostik, bukan peningkatan mutu teks. [Gunakan diagnostik transfer proksi](https://aogavrilov.com/id/projects/codec-bottleneck-diagnosis/#decision-table) .

## Kesalahan diagnosis yang umum

### Hanya membandingkan keluaran akhir

Skor ujung ke ujung tidak dapat menunjukkan apakah kerugian disebabkan oleh representasi atau generator.

### Mengganti penilai antartahap

Evaluator yang berbeda menyebabkan kesenjangan antartahap tidak dapat dibandingkan dan memperlemah atribusi kausal.

### Menyebut kesehatan codebook sebagai “kualitas teks”

Tingkat pemanfaatan yang sehat dapat terjadi bersamaan dengan rekonstruksi yang buruk atau hasil pembangkitan terdekode yang buruk.

### Generalisasi dari satu rezim kompresi

Bukti yang dipublikasikan mencakup satu konfigurasi TinyStories 64-ke-16 dan eksperimen tunggal yang bersifat deskriptif.

## Latar belakang utama

Sumber-sumber ini mendefinisikan himpunan data dan keluarga model yang dirujuk oleh studi diagnostik.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Memperkenalkan VQ-VAE dan bottleneck diskret terpelajar yang digunakan oleh generator laten selanjutnya.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Mengembangkan representasi diskret hierarkis dengan tingkat kode yang terpisah.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Memperkenalkan korpus cerita pendek sintetis yang digunakan dalam studi kasus diagnostik.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Menyajikan formulasi difusi diskret bertopeng yang digunakan untuk generator laten.

## Batas bukti

Metode bertahap tersebut dapat digunakan kembali, tetapi pemeringkatan yang dilaporkan tidak berlaku universal. Eksperimen yang dipublikasikan menggunakan TinyStories, satu rezim kompresi agresif, satu keluarga kodek hierarkis, satu generator diskret bertopeng, dan eksekusi tunggal yang bersifat deskriptif. Terapkan protokol diagnostik pada sistem baru; jangan menyalin kesimpulan numeriknya ke lingkungan yang berbeda.

## Publikasi terkait

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/id/publications/where-quality-breaks/)

Titik Keruntuhan Mutu dalam Generasi Teks Pendek Terkompresi: Lokalisasi Bottleneck Bertahap

Metodologi diagnostik FRUCT 39 2026 Konferensi utama

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/id/publications/inspectable-control/)

Kendali yang Dapat Diperiksa untuk Regenerasi Perangkat Lunak yang Melestarikan Struktur

Metode kontrol ruang laten FSE Companion '26 2026 Poster pendamping
