# Maskerad diffusion i kodrummet kontra tokenrummet: hur de bör jämföras

Canonical HTML: https://aogavrilov.com/sv/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: sv

FORSKNINGSANTECKNING

Ett stegkonsistent jämförelseprotokoll för maskerade diffusionsspråkmodeller i kod- respektive tokenrum när den diskreta kodeken är informationsförlorande.

Publicerad 30 juli 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

DIREKT SVAR

## Hur bör språkmodellering med maskerad diffusion i kodutrymmet respektive tokenutrymmet jämföras?

Utvärdera källtext, kodekrekonstruktioner, utdata från tokenutrymmet och avkodade utdata från kodutrymmet med samma externa poängsättare och förbehandling. Redovisa kodekens rekonstruktionsgap separat: generering i kodutrymmet kan inte återvinna information som kodeken redan har avlägsnat.

## Varför åtskillnaden är viktig

Metoden och den påstådda garantin måste ha samma observerbara gräns.

En modell i tokenrummet genererar texttoken direkt. En modell i kodrummet genererar först diskreta latenta koder och förlitar sig sedan på en avkodare för att återställa texten. Deras slutliga utdata kan jämföras, men kodrumspipelinen har ytterligare en felkälla: rekonstruktionsförlusten kan sänka kvalitetstaket innan den latenta genereringen börjar.

En rättvis jämförelse kräver därför två frågor, inte en. Fråga först hur mycket kvalitet kodeken bevarar utan någon generering. Fråga därefter hur stor ytterligare förlust varje generator tillför under ett och samma oförändrade utvärderingsprotokoll för avkodad text.

## Praktiskt tillvägagångssätt

1. Fastställ baslinjen för källan Poängsätt undanhållna källtexter med den utvärderare och förbehandling som kommer att användas i varje efterföljande steg.
2. Mät rekonstruktionen före genereringen Koda och avkoda samma exempel utan att sampla nya koder. Därmed isoleras det övre tak som kodeken sätter.
3. Utvärdera båda genereringsutrymmena efter avkodning Poängsätt sampel i tokenrymden direkt och avkoda sampel i kodrymden innan de poängsätts. Jämför inte ett latent proxymått med ett mått på avkodad text.
4. Redovisa fördelningar och osäkerhet Redovisa median- och svansbeteende, antal sampel, förbehandling och osäkerhet över upprepade körningar. Ett enda medelvärde kan dölja allvarliga rekonstruktionsfel.

## Belägg som krävs

Ett påstående är inte starkare än den egenskap som mäts efter generering eller avkodning.

- Samma externa utvärderare för avkodad text och samma förbehandling används vid varje kontrollpunkt.
- Resultat för källa, rekonstruktion, tokenrymd och avkodad kodrymd redovisas separat.
- Gapet i kodekrekonstruktionen tillskrivs inte den latenta generatorn.
- Redovisa median- och svansbeteende vid varje jämförelse av medelvärden.
- Slumptalsfrön eller osäkerhetsskattningar redovisas innan små skillnader generaliseras.

### Vad den länkade studien rapporterar

- I den redovisade TinyStories-konfigurationen med komprimering från 64 till 16 höjde enbart kodekrekonstruktionen den externa medianperplexiteten från 15.17 till 27.36.
- Med samma bedömare uppnådde MDLM i kodrymden medianperplexitet 26.55, medan referensmodellen i tokenrymden nådde 38.42, en minskning med 30.9% för generering i kodrymden i detta experiment.
- Geometrimedveten regularisering förbättrade den lokala latentdiagnostiken i de tillgängliga matchade körningarna, men förbättrade inte måtten för avkodad text.

[Läs publikationsöversikten](https://aogavrilov.com/sv/publications/where-quality-breaks/) [Sök i artikelns fulltext](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Avgränsning

- Dessa tal beskriver en komprimeringsregim för TinyStories, en hierarkisk kodek och den rapporterade utvärderingskonfigurationen; de fastställer ingen universell rangordning av modeller i kod- respektive tokenrymden.
- Perplexitet är informativt men inte ett fullständigt mått på semantisk kvalitet, mångfald, faktamässig korrekthet eller användbarhet.
- De tillgängliga jämförelserna bör tolkas mot bakgrund av de angivna sampelstorlekarna och begränsningarna i osäkerhetsskattningen.

## Primära och närliggande källor

Se de länkade artiklarna för originalmetoderna, mätningarna och de angivna begränsningarna.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/sv/publications/where-quality-breaks/) Huvudartikel och redovisade mätningar för varje steg.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Formulering med maskerad diskret diffusion som används av latentgeneratorn.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Grundläggande metod för inlärda diskreta representationer.

Underhålls av Alexey Gavrilov . Denna sida sammanfattar befintlig evidens och tillför inga experimentella resultat utöver de citerade källorna.
