# Difusión enmascarada en el espacio de códigos frente al espacio de tokens: cómo compararlas

Canonical HTML: https://aogavrilov.com/es/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: es

NOTA DE INVESTIGACIÓN

Un protocolo de comparación coherente entre etapas para modelos de lenguaje de difusión enmascarada en el espacio de códigos y en el espacio de tokens cuando el códec discreto presenta pérdidas.

Publicado 30 de julio de 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

RESPUESTA DIRECTA

## ¿Cómo deben compararse los modelos de lenguaje de difusión enmascarada en el espacio de códigos y en el espacio de tokens?

Evalúe el texto fuente, las reconstrucciones del códec, las salidas del espacio de tókenes y las salidas decodificadas del espacio de códigos con el mismo evaluador externo y el mismo preprocesamiento. Informe por separado la brecha de reconstrucción del códec: la generación en el espacio de códigos no puede recuperar información que el códec ya eliminó.

## Por qué importa esta distinción

El método y la garantía que se afirma ofrecer deben referirse al mismo límite observable.

Un modelo en el espacio de tokens genera directamente tokens de texto. Un modelo en el espacio de códigos genera primero códigos latentes discretos y después depende de un decodificador para recuperar el texto. Sus salidas finales pueden compararse, pero el flujo del espacio de códigos tiene un punto de fallo adicional: la pérdida de reconstrucción puede reducir el techo de calidad antes de que comience la generación latente.

Por consiguiente, una comparación justa exige dos preguntas, no una. Primero, cuánto de la calidad preserva el códec sin generación alguna. Después, cuánta pérdida adicional introduce cada generador bajo un mismo protocolo, sin cambios, de evaluación del texto decodificado.

## Un procedimiento práctico

1. Establecer la línea base del texto fuente Evaluar los textos fuente reservados mediante el evaluador y el preprocesamiento que se utilizarán en cada etapa posterior.
2. Medir la reconstrucción antes que la generación Codifique y decodifique los mismos ejemplos sin muestrear códigos nuevos. Así se aísla el límite máximo impuesto por el códec.
3. Evaluar ambos espacios de generación tras la decodificación Evalúe directamente las muestras del espacio de tókenes y decodifique las del espacio de código antes de puntuarlas. No compare un indicador indirecto latente con una métrica aplicada al texto decodificado.
4. Presentar las distribuciones y la incertidumbre Muestre la mediana y el comportamiento de las colas, el número de muestras, el preprocesamiento y la incertidumbre entre ejecuciones repetidas. Un único promedio puede ocultar fallos graves de reconstrucción.

## Evidencia que debe requerirse

Una afirmación solo es tan sólida como la propiedad medida tras la generación o la decodificación.

- En cada punto de control se utilizan el mismo evaluador externo del texto decodificado y el mismo preprocesamiento.
- Los resultados de la fuente, la reconstrucción, el espacio de tókenes y el espacio de código decodificado se presentan por separado.
- La brecha de reconstrucción del códec no se atribuye al generador latente.
- Toda comparación de medias se acompaña de la mediana y del comportamiento en las colas.
- Se comunican las semillas o las estimaciones de incertidumbre antes de generalizar diferencias pequeñas.

### Qué documenta el estudio enlazado

- En la configuración 64-a-16 de TinyStories descrita, la reconstrucción del códec por sí sola elevó la perplejidad externa mediana de 15.17 a 27.36.
- Con el mismo evaluador, el MDLM en el espacio de códigos alcanzó una perplejidad mediana de 26.55, mientras que la referencia en el espacio de tókenes obtuvo 38.42: una reducción del 30.9% para la generación en el espacio de códigos en ese experimento.
- La regularización sensible a la geometría mejoró los diagnósticos latentes locales en las ejecuciones comparables disponibles, pero no mejoró las métricas del texto decodificado.

[Leer el resumen de la publicación](https://aogavrilov.com/es/publications/where-quality-breaks/) [Buscar en el texto completo del artículo](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Límite del alcance

- Estas cifras describen un régimen de compresión de TinyStories, un códec jerárquico y la configuración de evaluación documentada; no establecen una ordenación universal de los modelos en el espacio de códigos y en el espacio de tókenes.
- La perplejidad aporta información, pero no es una medida completa de la calidad semántica, la diversidad, la veracidad factual ni la utilidad.
- Las comparaciones disponibles deben interpretarse teniendo en cuenta los tamaños muestrales declarados y las limitaciones relativas a la incertidumbre.

## Fuentes principales y afines

Consulte los artículos enlazados para conocer los métodos originales, las mediciones y las limitaciones declaradas.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/es/publications/where-quality-breaks/) Artículo principal y mediciones por etapas comunicadas en él.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Formulación de difusión discreta enmascarada empleada por el generador latente.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Método fundacional de representación discreta aprendida.

Mantenido por Alexey Gavrilov . Esta página resume la evidencia existente y no añade ningún resultado experimental más allá de las fuentes citadas.
