# 코드 공간과 토큰 공간 마스크 확산: 공정한 비교 방법

표준 HTML: https://aogavrilov.com/ko/research-notes/code-space-vs-token-space-masked-diffusion/
영어 버전: https://aogavrilov.com/research-notes/code-space-vs-token-space-masked-diffusion/
문서 언어: ko
출처 논문: https://aogavrilov.com/ko/publications/where-quality-breaks/
영어 논문 전문: https://aogavrilov.com/publications/where-quality-breaks/full-text/
DOI: https://doi.org/10.23919/FRUCT70069.2026.11506553

손실이 있는 이산 코덱을 사용할 때 코드 공간과 토큰 공간 마스크 확산 언어 모델을 같은 단계와 평가 기준으로 비교하는 방법.

## 짧은 답

### 코드 공간과 토큰 공간 마스크 확산 언어 모델은 어떻게 비교해야 하는가?

원문, 코덱 재구성, 토큰 공간 출력, 디코딩한 코드 공간 출력을 같은 외부 평가기와 전처리로 측정한다. 코덱 재구성 격차는 따로 보고해야 한다. 코드 공간 생성기는 코덱이 이미 제거한 정보를 복구할 수 없기 때문이다.

## 이 구분이 중요한 이유

토큰 공간 모델은 텍스트 토큰을 직접 생성한다. 코드 공간 모델은 먼저 이산 잠재 코드를 생성한 뒤 디코더에 의존해 텍스트를 복원한다. 최종 출력은 비교할 수 있지만 코드 공간 파이프라인에는 추가 실패 지점이 있다. 잠재 생성이 시작되기 전에 재구성 손실이 품질 상한을 낮출 수 있다.

따라서 공정한 비교에는 하나가 아니라 두 질문이 필요하다. 먼저 생성 없이 코덱이 얼마나 많은 품질을 보존하는지 묻고, 그다음 동일한 디코딩 텍스트 평가 절차에서 각 생성기가 얼마나 추가 손실을 만드는지 측정한다.

## 실행 절차

1. **원문 기준선 구축.** 이후 모든 단계에 사용할 평가기와 전처리로 보류한 원문 텍스트를 점수화한다.
2. **생성 전에 재구성 측정.** 새 코드를 샘플링하지 않고 같은 예제를 인코딩하고 디코딩한다. 이 과정은 코덱이 정한 품질 상한을 분리한다.
3. **디코딩 뒤 두 생성 공간 평가.** 토큰 공간 샘플은 직접 평가하고 코드 공간 샘플은 먼저 디코딩한 뒤 평가한다. 잠재 대리 지표와 디코딩 텍스트 지표를 직접 비교하지 않는다.
4. **분포와 불확실성 보고.** 중앙값과 꼬리 구간, 샘플 수, 전처리, 반복 실행의 불확실성을 함께 제시한다. 평균 하나만으로는 심각한 재구성 실패를 가릴 수 있다.

## 요구해야 할 근거

- 모든 체크포인트에서 같은 외부 디코딩 텍스트 평가기와 전처리를 사용한다.
- 원문, 재구성, 토큰 공간, 디코딩한 코드 공간 결과를 따로 보고한다.
- 코덱 재구성 격차를 잠재 생성기의 손실로 돌리지 않는다.
- 평균을 제시할 때 중앙값과 꼬리 구간도 함께 제시한다.
- 작은 차이를 일반화하기 전에 시드 또는 불확실성 추정치를 보고한다.

## 연결된 연구가 실제로 보고한 내용

- 보고된 TinyStories 64→16 설정에서 코덱 재구성만으로 외부 perplexity 중앙값이 15.17에서 27.36으로 증가했다.
- 같은 평가기에서 코드 공간 MDLM의 중앙값 perplexity는 26.55, 토큰 공간 기준선은 38.42였으며, 해당 실험에서 코드 공간 생성은 30.9% 낮았다.
- 비교 가능한 실행에서 기하 인식 정규화는 국소 잠재 진단 지표를 개선했지만 디코딩 텍스트 지표는 개선하지 못했다.

## 적용 범위와 한계

- 이 수치는 하나의 TinyStories 압축 체계, 하나의 계층적 코덱, 보고된 평가 설정을 설명하며 코드 공간 모델이 항상 우수하다는 뜻이 아니다.
- Perplexity는 유용하지만 의미 품질, 다양성, 사실성, 실용성을 모두 측정하지는 않는다.
- 비교 결과는 논문에 명시된 샘플 수와 불확실성 한계와 함께 해석해야 한다.

전체 연구 안내서: https://aogavrilov.com/ko/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space

## 주요 출처와 인접 연구

- [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/publications/where-quality-breaks/): 주요 논문과 보고된 단계별 측정값.
- [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524): 잠재 생성기에 사용된 마스크 이산 확산 정식화.
- [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937): 학습된 이산 표현의 기초 방법.

이 유지 관리형 노트는 기존 근거만 요약하며 인용된 출처를 넘어서는 새로운 실험 결과를 추가하지 않는다.
