# 編碼空間與詞元空間遮罩式擴散:如何比較

Canonical HTML: https://aogavrilov.com/zh-hant/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: zh-Hant

研究札記

離散編解碼器有損時,用於比較編碼空間與詞元空間遮罩式擴散語言模型的跨階段一致評估協定。

已出版 2026 年 7 月 30 日 [Alexey Gavrilov](https://aogavrilov.com/about/)

直接回答

## 應如何比較編碼空間與詞元空間的遮罩式擴散語言模型?

以相同的外部評分器與預處理流程評估原始文字、編解碼器重建結果、詞元空間輸出及解碼後的編碼空間輸出。編解碼器重建落差應另行報告,因為編碼空間生成無法恢復已被編解碼器移除的資訊。

## 此項區分為何重要

方法與所宣稱的保證必須採用相同的可觀察邊界。

詞元空間模型直接生成文字詞元;編碼空間模型則先生成離散潛在碼,再由解碼器還原文字。兩者的最終輸出雖可比較,但編碼空間管線多了一個可能的失效環節:重建損失可能在潛在生成開始前便壓低品質上限。

因此,公平比較必須回答兩個而非一個問題。首先,應考察編解碼器在完全不進行生成時保留了多少品質;其次,應在同一套不變的解碼文本評估協定下,考察各生成器額外引入多少損失。

## 實務流程

1. 建立來源基線 採用後續每一階段皆會使用的評估器與前處理流程,為留出來源文本評分。
2. 先衡量重建,再衡量生成 對同一批範例進行編碼與解碼,但不取樣新碼。如此可單獨辨識編解碼器所施加的效能上限。
3. 解碼後評估兩種生成空間 直接評分詞元空間樣本;編碼空間樣本則先解碼再評分。不得將潛在空間代理指標與解碼文字指標直接比較。
4. 報告分布與不確定性 呈現中位數與尾端行為、樣本數、前處理方式及重複執行的不確定性。單一平均值可能掩蓋嚴重的重建失效。

## 必須具備的證據

一項主張的可信度,取決於生成或解碼後實際量測的性質所能提供的證據強度。

- 每個檢查點皆採用相同的外部解碼文字評估器與前處理方式。
- 原始文字、重建結果、詞元空間結果與解碼後的編碼空間結果分別報告。
- 編解碼器重建落差不歸因於潛在生成器。
- 任何平均值比較均應同時呈現中位數與尾端行為。
- 在將微小差異概括推廣之前,應先報告隨機種子或不確定性估計。

### 所連結研究的報告內容

- 在所報告的 TinyStories 64-to-16 設定中,僅編解碼器重建便使外部困惑度中位數從 15.17 升至 27.36。
- 在同一評分器下,編碼空間 MDLM 的困惑度中位數為 26.55,詞元空間基準則為 38.42;在該實驗中,編碼空間生成降低了 30.9%。
- 在現有的配對實驗中,幾何感知正則化改善了局部潛在診斷指標,卻未改善解碼文本的指標。

[閱讀出版成果概覽](https://aogavrilov.com/zh-hant/publications/where-quality-breaks/) [搜尋論文全文](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## 範圍邊界

- 這些數值描述的是一種 TinyStories 壓縮設定、一個階層式編解碼器及文中所報告的評估配置;它們並未確立編碼空間模型與詞元空間模型之間的普遍排序。
- 困惑度具有參考價值,但無法完整衡量語意品質、多樣性、事實正確性或實用性。
- 解讀現有比較時,應同時考量其所述樣本數及不確定性限制。

## 主要與鄰近文獻來源

原始方法、量測結果與明列限制,請參閱所連結的論文。

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/zh-hant/publications/where-quality-breaks/) 主要論文及其報告的分階段測量結果。
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) 潛在生成器所採用的遮罩式離散擴散形式化方法。
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) 奠基性的學習式離散表徵方法。

維護者 Alexey Gavrilov 。本頁彙整既有證據,未加入引述來源之外的任何實驗結果。
