# Maskeret diffusion i kode- kontra tokenrummet: Sådan sammenlignes de

Canonical HTML: https://aogavrilov.com/da/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: da

FORSKNINGSNOTAT

En trinkonsistent protokol til sammenligning af sprogmodeller med maskeret diffusion i kode- og tokenrummet, når det diskrete codec er tabsgivende.

Udgivet 30. juli 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

DIREKTE SVAR

## Hvordan bør sprogmodellering med maskeret diffusion i kode- og tokenrummet sammenlignes?

Evaluer kildetekst, codec-rekonstruktioner, output fra tokenrummet og afkodet output fra koderummet med den samme eksterne evaluator og forbehandling. Rapportér forskellen ved codec-rekonstruktion særskilt: Generering i koderummet kan ikke genskabe information, som codec'et allerede har fjernet.

## Hvorfor sondringen er vigtig

Metoden og den hævdede garanti skal have den samme observerbare grænse.

En model i tokenrummet genererer teksttokens direkte. En model i koderummet genererer først diskrete latente koder og er derefter afhængig af en afkoder til at genskabe teksten. Deres endelige output kan sammenlignes, men koderumspipelinen har endnu et muligt fejlpunkt: Rekonstruktionstab kan sænke kvalitetsloftet, før den latente generering begynder.

En retfærdig sammenligning kræver derfor to spørgsmål, ikke ét. Spørg først, hvor meget kvalitet codec'et bevarer uden nogen generering. Spørg dernæst, hvor stort et yderligere tab hver generator tilfører under én uændret evalueringsprotokol for afkodet tekst.

## En praktisk fremgangsmåde

1. Fastlæg kildens baseline Bedøm tilbageholdte kildetekster med den evaluator og forbehandling, der skal anvendes i samtlige efterfølgende trin.
2. Mål rekonstruktionen før genereringen Indkod og afkod de samme eksempler uden at sample nye koder. Det isolerer den øvre grænse, som codec'en pålægger.
3. Evaluer begge genereringsrum efter afkodning Evaluer prøver i tokenrummet direkte, og afkod prøver i koderummet, før de evalueres. Sammenlign ikke en latent proxy med et mål for afkodet tekst.
4. Rapportér fordelinger og usikkerhed Vis median- og haleadfærd, antal prøver, forbehandling og usikkerhed på tværs af gentagne kørsler. Et enkelt gennemsnit kan skjule alvorlige rekonstruktionsfejl.

## Påkrævet evidens

En påstand er kun så stærk som den egenskab, der måles efter generering eller afkodning.

- Den samme eksterne evaluator for afkodet tekst og den samme forbehandling anvendes ved hvert kontrolpunkt.
- Resultater for kilde, rekonstruktion, tokenrum og afkodet koderum rapporteres særskilt.
- Forskellen i codec-rekonstruktion tilskrives ikke den latente generator.
- Enhver sammenligning af gennemsnit ledsages af median- og haleadfærd.
- Seeds eller usikkerhedsestimater rapporteres, før små forskelle generaliseres.

### Hvad det linkede studie rapporterer

- I den rapporterede TinyStories-konfiguration med komprimering fra 64 til 16 øgede codec-rekonstruktionen alene den eksterne medianperpleksitet fra 15.17 til 27.36.
- Med den samme evaluator opnåede MDLM i koderummet en medianperpleksitet på 26.55, mens baselinen i tokenrummet nåede 38.42; i dette eksperiment var reduktionen for generering i koderummet 30.9%.
- Geometribevidst regularisering forbedrede lokale diagnostiske mål i latentrummet i de tilgængelige matchede kørsler, men forbedrede ikke metrikkerne for afkodet tekst.

[Læs publikationsoversigten](https://aogavrilov.com/da/publications/where-quality-breaks/) [Søg i artiklens fulde tekst](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Afgrænsning

- Disse tal beskriver ét TinyStories-komprimeringsregime, ét hierarkisk codec og den rapporterede evalueringsopsætning; de fastslår ikke en universel rangordning af modeller i kode- og tokenrummet.
- Perpleksitet er informativ, men ikke et fuldstændigt mål for semantisk kvalitet, diversitet, faktuel korrekthed eller anvendelighed.
- De tilgængelige sammenligninger bør læses i lyset af de angivne stikprøvestørrelser og begrænsninger vedrørende usikkerhed.

## Primære og nært beslægtede kilder

Konsultér de linkede artikler for de oprindelige metoder, målinger og anførte begrænsninger.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/da/publications/where-quality-breaks/) Hovedartikel og rapporterede målinger for hvert trin.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Formulering med maskeret diskret diffusion, som anvendes af den latente generator.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Grundlæggende metode til indlærte diskrete repræsentationer.

Vedligeholdes af Alexey Gavrilov . Denne side sammenfatter eksisterende evidens og tilføjer ingen forsøgsresultater ud over de citerede kilder.
