{
  "title": "Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization",
  "doi": "10.23919/FRUCT70069.2026.11506553",
  "dataset": "TinyStories",
  "metrics": [
    "External GPT-2 perplexity: mean, median, p95, and maximum",
    "Codebook usage and support size",
    "SBERT, BERTScore, MAUVE, and an LLM-judge summary for geometry runs"
  ],
  "sample_size": "256 paired reconstruction samples; 251–256 generated samples per mode; four matched geometry settings.",
  "uncertainty": "The reported comparisons are descriptive single runs; confidence intervals and multi-seed significance estimates were not computed.",
  "conditions": "GPT-2 token sequences of length 64 compressed to 16 top-level codes with a hierarchical VQ-VAE-2; all generation modes use the shared external scorer.",
  "columns": [
    {
      "key": "evaluation",
      "label": "Evaluation point"
    },
    {
      "key": "n",
      "label": "n"
    },
    {
      "key": "mean",
      "label": "Mean PPL"
    },
    {
      "key": "median",
      "label": "Median PPL"
    },
    {
      "key": "p95",
      "label": "p95 PPL"
    }
  ],
  "rows": [
    {
      "evaluation": "Original texts",
      "n": 256,
      "mean": 16.24,
      "median": 15.17,
      "p95": 25.1
    },
    {
      "evaluation": "Codec reconstructions",
      "n": 256,
      "mean": 37.26,
      "median": 27.36,
      "p95": 98.91
    },
    {
      "evaluation": "AR baseline",
      "n": 251,
      "mean": 30.98,
      "median": 23.27,
      "p95": 56.11
    },
    {
      "evaluation": "Token-space MDLM",
      "n": 256,
      "mean": 44.74,
      "median": 38.42,
      "p95": 93.6
    },
    {
      "evaluation": "Code-space MDLM",
      "n": 256,
      "mean": 30.01,
      "median": 26.55,
      "p95": 59.36
    }
  ],
  "takeaway": "Most of the observed quality loss is introduced before generation; code-space diffusion still reduces median perplexity by 30.9% versus token-space diffusion."
}
