# Paano matutukoy kung nasa codec o nasa tagabuo ang kabiguan ng isang tagabuo ng naka-compress na teksto

Canonical HTML: https://aogavrilov.com/fil/research/codec-bottleneck-diagnosis/

Document language: fil

Praktikal na diagnostiko para sa mga sistemang may dalawang yugto na unang nagko-compress ng teksto tungo sa mga discrete code at saka bumubuo sa code space. Layunin nitong tukuyin kung aling yugto ang naglilimita sa na-decode na output bago gugulin ang compute sa maling component.

Nailathala Hulyo 29, 2026 Na-update Hulyo 30, 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## Ang maikling sagot

Bigyan ng score ang orihinal na teksto, ang katambal nitong rekonstruksiyon ng codec, at ang panghuling nabuong teksto gamit ang iisang panlabas na evaluator. Sinusukat ng agwat mula orihinal tungong rekonstruksiyon ang pinakamataas na kalidad na itinakda bago ang pagbuo. Pagkatapos, ibinubukod ng agwat mula rekonstruksiyon tungong pagbuo ang karagdagang pagbaba ng kalidad na dulot ng latent generator.

**Huwag ipalit ang proxy ng espasyong latent sa na-decode na output.** Maaaring maging kapaki-pakinabang na diagnostiko ang mas mahusay na geometry, utilization, o support ng codebook, ngunit napapatunayan lamang ng mga ito ang pagtaas ng kalidad kapag bumuti ang na-decode na teksto ayon sa mga kaugnay na pinal na metric.

## Isang diagnostikong may apat na checkpoint

1. Itakda ang sanggunian Bigyan ng score ang mga ibinukod na orihinal na teksto gamit ang panlabas na evaluator na gagamitin sa lahat ng susunod na yugto.
2. Sukatin ang rekonstruksiyon ng codec I-encode at i-decode ang parehong mga halimbawa nang walang pagbuo. Inilalantad nito ang impormasyong nawala sa bottleneck.
3. Sukatin ang latent na pagbuo Bumuo ng mga code, i-decode ang mga ito, at puntusan ang nagresultang teksto gamit ang hindi binagong tagasuri.
4. Siyasatin ang transfer ng proxy Ihambing ang mga diagnostic ng latent sa panghuling sukatan ng na-decode na teksto sa halip na ipalagay na naililipat ang mga pakinabang sa proxy.

## Paano bibigyang-kahulugan ang mga agwat sa bawat yugto

| Naobserbahang padron | Pinakamalamang na bottleneck | Susunod na eksperimento |
| --- | --- | --- |
| Mataas ang score ng mga orihinal; matindi ang paglala ng mga rekonstruksiyon | Katapatan ng codec | Pagbutihin ang rekonstruksiyon o bawasan ang compression bago i-tune ang tagabuo |
| Nananatiling mahusay ang mga rekonstruksiyon; bumababa ang kalidad ng mga nabuong output | Tagabuo sa espasyong latent | Suriin ang denoising, sampling, conditioning, at hindi pagtutugma ng distribusyon ng code |
| Bumabuti ang mga latent proxy; hindi nagbabago ang mga sukatan matapos ang decoding | Paglilipat ng proxy | Muling suriin kung nasusubaybayan ng proxy ang downstream na katangiang pinag-aaralan |
| Mababa ang puntos sa bawat yugto | Datos, evaluator, o eksperimental na setup | Balidahin ang reference distribution at scorer bago iugnay sa modelo ang kabiguan |

## Ano ang natuklasan ng nailathalang case study sa TinyStories

Sa [*Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization*](https://aogavrilov.com/fil/publications/where-quality-breaks/) , ang mga tekstong may 64 token ay kino-compress sa 16 na top-level code gamit ang isang herarkikal na VQ-VAE-2. Sa ilalim ng iisang panlabas na GPT-2 scorer, tumataas ang median perplexity mula **15.17** para sa mga orihinal na teksto tungo sa **27.36** para sa mga rekonstruksiyon ng codec, samantalang tumataas ang p95 mula **25.10** tungo sa **98.91** .

### Masked diffusion language modeling sa espasyo ng code kumpara sa espasyo ng token

Nangingibabaw ang agwat sa rekonstruksiyon sa sinubok na pipeline. Sa loob ng kisameng iyon, mas mahusay pa rin ang code-space masked diffusion language modeling (MDLM) kaysa token-space MDLM sa ilalim ng iisang tagatasa: ang median perplexity ay **26.55** kumpara sa **38.42** , isang pagbawas na 30.9%.

Pinahuhusay ng geometry-aware regularization ang mga lokal na latent proxy sa magkatugmang run na magagamit, ngunit hindi nito pinahuhusay ang mga panukat ng na-decode na teksto. Bahagi ng diagnosis ang negatibong resultang ito sa transfer, at hindi ito ebidensiyang pinahusay ng regularizer ang pinal na teksto.

## Ano ang susukatin sa bawat yugto

## Mga tanong sa pananaliksik na sinasagot ng gabay na ito

Iniuugnay ng maiikling sagot na ito ang mga karaniwang tanong sa pagsusuri sa nasukat na ebidensiya sa bawat yugto.

1. Paano naghambing ang masked diffusion sa espasyo ng code at sa espasyo ng token sa iniulat na eksperimento sa teksto? Sa ilalim ng parehong panlabas na scorer, nagkaroon ang MDLM sa espasyo ng code ng median na perplexity na 26.55 kumpara sa 38.42 ng baseline sa espasyo ng token, isang pagbawas na 30.9%. Nasa 27.36 na ang median ng rekonstruksiyon ng codec, kaya dapat bigyang-kahulugan ang resulta kasabay ng bottleneck sa rekonstruksiyon. [Suriin ang mga iniulat na bilang sa bawat yugto](https://aogavrilov.com/fil/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. Paano dapat ihambing ang masked diffusion sa espasyo ng code at sa espasyo ng token kapag lossy ang codec? Gamitin ang parehong held-out sample at scorer ng na-decode na teksto para sa mga orihinal, rekonstruksiyon ng codec, output sa espasyo ng token, at output sa espasyo ng code. Iulat nang hiwalay ang agwat sa rekonstruksiyon sapagkat hindi mababawi ng mas mahusay na latent generator ang impormasyong inalis na ng codec. [Ihambing ang mga yugto gamit ang iisang scorer](https://aogavrilov.com/fil/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. Paano matutukoy ang sanhi ng pagbaba ng kalidad sa isang dalawang-yugtong tagabuo ng teksto? Sukatin muna ang agwat mula orihinal tungo sa rekonstruksiyon bago ang agwat mula rekonstruksiyon tungo sa pagbuo, gamit ang iisang di-binagong evaluator ng decoded text. Sa ganitong paraan, naihihiwalay ang pinakamataas na kalidad na ipinapataw ng codec sa karagdagang paglala na dulot ng latent na pagbuo. [Sundin ang diagnostic na may apat na checkpoint](https://aogavrilov.com/fil/research/codec-bottleneck-diagnosis/#workflow) .
4. Kailan maaaring hindi mapahusay ng mas mahusay na mga sukatan sa espasyo ng latent ang na-decode na output? Maaaring bumuti ang latent proxy nang hindi nasusubaybayan ang downstream na katangiang mahalaga. Subukin ang transfer sa pamamagitan ng pag-decode ng magkatugmang output at pagsusuri sa mga ito gamit ang parehong pinal na metric; kung hindi, nananatiling diagnostikong ebidensiya lamang ang geometry o utilization ng codebook, hindi pagtaas ng kalidad ng teksto. [Gamitin ang diagnostic sa paglilipat ng proxy](https://aogavrilov.com/fil/research/codec-bottleneck-diagnosis/#decision-table) .

## Mga karaniwang pagkakamali sa pagsusuri

### Paghahambing lamang sa mga panghuling output

Hindi matutukoy ng end-to-end score kung ang representasyon o ang generator ang sanhi ng pagkalugi.

### Pagpapalit ng mga scorer sa pagitan ng mga yugto

Dahil sa magkakaibang tagasuri, hindi maihahambing ang mga agwat sa bawat yugto at humihina ang pagtukoy sa sanhi.

### Pagturing sa kalagayan ng codebook bilang “kalidad ng teksto”

Maaaring kasabay ng malusog na utilization ang mahihinang rekonstruksiyon o mahihinang na-decode na pagbuo.

### Paglalahat mula sa iisang rehimen ng compression

Saklaw ng inilathalang ebidensiya ang isang TinyStories 64-to-16 configuration at mga deskriptibong single run.

## Pangunahing batayang kaalaman

Itinatakda ng mga source na ito ang dataset at mga pamilya ng modelong tinutukoy sa diagnostic na pag-aaral.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Ipinakikilala ang VQ-VAE at ang natutuhang discrete bottleneck na ginagamit ng mga sumunod na tagabuo sa espasyong latent.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Bumubuo ng herarkikal na discrete representation na may magkakahiwalay na antas ng code.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Ipinakikilala ang sintetikong corpus ng maiikling kuwento na ginamit sa diagnostic case study.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Inilalahad ang pormulasyon ng masked discrete diffusion na ginagamit para sa latent generator.

## Hangganan ng ebidensiya

Maaaring muling gamitin ang nakayugtong na pamamaraan, ngunit hindi pangkalahatan ang iniulat na ranggo. Gumagamit ang nailathalang eksperimento ng TinyStories, isang agresibong rehimen ng compression, isang pamilya ng herarkikal na codec, isang masked discrete generator, at mga deskriptibong tig-iisang run. Ilapat ang protocol ng pagsusuri sa bagong sistema; huwag ilipat ang numerikal na kongklusyon sa ibang setting.

## Mga kaugnay na publikasyon

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/fil/publications/where-quality-breaks/)

Kung Saan Bumibigay ang Kalidad sa Pagbuo ng Na-compress na Maiikling Teksto: Sunod-sunod na Pagtukoy sa Bottleneck

Metodolohiya ng pagsusuri FRUCT 39 2026 Pangunahing kumperensiya

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/fil/publications/inspectable-control/)

Nasusuring Kontrol para sa Muling Pagbuo ng Software na Nagpapanatili ng Estruktura

Pamamaraan ng kontrol sa espasyong latent FSE Companion '26 2026 Kalakip na poster
