# Cómo determinar si el fallo de un generador de texto comprimido reside en el códec o en el generador

Canonical HTML: https://aogavrilov.com/es/research/codec-bottleneck-diagnosis/

Document language: es

Un diagnóstico práctico para sistemas de dos etapas que primero comprimen el texto en códigos discretos y después generan en el espacio de códigos. El objetivo es identificar qué etapa limita la salida decodificada antes de dedicar recursos computacionales al componente equivocado.

Publicado 29 de julio de 2026 Actualizado 30 de julio de 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## La respuesta breve

Evaluar con el mismo evaluador externo el texto original, su reconstrucción del códec emparejada y el texto final generado. La brecha entre el original y la reconstrucción mide el techo de calidad impuesto antes de la generación. A continuación, la brecha entre la reconstrucción y la generación aísla el deterioro adicional introducido por el generador latente.

**No sustituya la salida decodificada por un indicador indirecto del espacio latente.** Una mejor geometría, utilización o cobertura del libro de códigos puede ofrecer diagnósticos útiles, pero solo demuestra una mejora de la calidad cuando el texto decodificado mejora según las métricas finales pertinentes.

## Un diagnóstico con cuatro puntos de control

1. Establecer la referencia Evaluar los textos originales reservados con el evaluador externo empleado en todas las etapas posteriores.
2. Medir la reconstrucción del códec Codifique y decodifique los mismos ejemplos sin generar. Esto permite observar la información perdida en el cuello de botella.
3. Medir la generación latente Genere códigos, decodifíquelos y puntúe el texto resultante con el evaluador sin modificar.
4. Auditar la transferencia de medidas sustitutivas Comparar los diagnósticos latentes con las métricas finales del texto decodificado, en vez de suponer que las mejoras en indicadores indirectos se transfieren.

## Cómo interpretar las diferencias entre etapas

| Patrón observado | Cuello de botella más probable | Siguiente experimento |
| --- | --- | --- |
| Los originales obtienen buenas puntuaciones; las reconstrucciones se degradan notablemente | Fidelidad del códec | Mejorar la reconstrucción o reducir la compresión antes de ajustar el generador |
| Las reconstrucciones mantienen una calidad elevada; las salidas generadas se deterioran | Generador latente | Examinar la eliminación de ruido, el muestreo, el condicionamiento y el desajuste en la distribución de códigos |
| Los indicadores indirectos latentes mejoran; las métricas del resultado decodificado permanecen estables | Transferencia de la métrica indirecta | Reevaluar si la métrica indirecta refleja la propiedad posterior de interés |
| Todas las etapas obtienen resultados deficientes | Datos, evaluador o configuración experimental | Valide la distribución de referencia y el evaluador antes de atribuir el fallo al modelo |

## Qué reveló el estudio de caso publicado sobre TinyStories

En [*Dónde se degrada la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella*](https://aogavrilov.com/es/publications/where-quality-breaks/) , los textos de 64 tokens se comprimen en 16 códigos de nivel superior mediante un VQ-VAE-2 jerárquico. Según un evaluador GPT-2 externo, la perplejidad mediana aumenta de **15.17** para los textos originales a **27.36** para las reconstrucciones del códec, mientras que p95 aumenta de **25.10** a **98.91** .

### Modelado del lenguaje mediante difusión enmascarada en el espacio de códigos frente al espacio de tokens

La brecha de reconstrucción domina el proceso evaluado. Dentro de ese límite superior, el modelado del lenguaje por difusión enmascarada en el espacio de código (MDLM) sigue superando al MDLM en el espacio de tókenes según el evaluador compartido: la perplejidad mediana es **26.55** frente a **38.42** , lo que supone una reducción del 30.9 %.

La regularización sensible a la geometría mejora los indicadores indirectos latentes locales en las ejecuciones comparables disponibles, pero no mejora las métricas del texto decodificado. Este resultado de transferencia negativa forma parte del diagnóstico; no demuestra que el regularizador haya mejorado el texto final.

## Qué medir en cada etapa

## Preguntas de investigación a las que responde esta guía

Estas respuestas concisas vinculan preguntas habituales de diagnóstico con la evidencia medida en cada etapa.

1. ¿Qué comparación se observó entre la difusión enmascarada en el espacio de códigos y en el espacio de tokens en el experimento de texto descrito? Con el mismo evaluador externo, el MDLM en el espacio de códigos obtuvo una perplejidad mediana de 26.55, frente a 38.42 para la referencia en el espacio de tókenes, lo que supone una reducción del 30.9%. La mediana de la reconstrucción del códec ya era de 27.36, por lo que el resultado debe interpretarse junto con el cuello de botella de la reconstrucción. [Examinar las cifras desglosadas por etapas](https://aogavrilov.com/es/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. ¿Cómo deben compararse la difusión enmascarada en el espacio de códigos y en el espacio de tokens cuando el códec presenta pérdidas? Utilice las mismas muestras reservadas y el mismo evaluador de texto decodificado para los originales, las reconstrucciones del códec y las salidas en los espacios de tókenes y de códigos. Informe por separado de la brecha de reconstrucción, pues un generador latente más potente no puede recuperar información que el códec ya haya eliminado. [Comparar las etapas con un único evaluador](https://aogavrilov.com/es/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. ¿Cómo se puede diagnosticar la pérdida de calidad en un generador de texto de dos etapas? Medir primero la brecha entre el original y la reconstrucción, y después la brecha entre la reconstrucción y la generación, mediante un mismo evaluador de texto decodificado sin modificaciones. Así se distingue el límite máximo de calidad impuesto por el códec de la degradación adicional introducida por la generación latente. [Siga el diagnóstico de cuatro puntos de control](https://aogavrilov.com/es/research/codec-bottleneck-diagnosis/#workflow) .
4. ¿Cuándo pueden unas métricas mejores del espacio latente no traducirse en una mejora de la salida decodificada? Una medida sustitutiva latente puede mejorar sin reflejar la propiedad posterior de interés. Compruebe la transferencia decodificando salidas equiparadas y evaluándolas con las mismas métricas finales; de lo contrario, la geometría o la utilización del libro de códigos sigue siendo evidencia diagnóstica, no una mejora de la calidad textual. [Utilice el diagnóstico de transferencia de indicadores indirectos](https://aogavrilov.com/es/research/codec-bottleneck-diagnosis/#decision-table) .

## Errores habituales de diagnóstico

### Comparar únicamente los resultados finales

Una puntuación de extremo a extremo no permite determinar si la pérdida se debe a la representación o al generador.

### Cambiar de evaluador entre etapas

El uso de evaluadores distintos impide comparar las brechas entre etapas y debilita la atribución causal.

### Denominar «calidad del texto» al estado del libro de códigos

Una utilización adecuada puede coexistir con reconstrucciones deficientes o generaciones decodificadas de baja calidad.

### Generalización a partir de un único régimen de compresión

La evidencia publicada abarca una configuración de TinyStories de 64 a 16 y ejecuciones únicas de carácter descriptivo.

## Antecedentes principales

Estas fuentes definen el conjunto de datos y las familias de modelos citados en el estudio diagnóstico.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Presenta VQ-VAE y el cuello de botella discreto aprendido que emplean generadores latentes posteriores.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Desarrolla una representación discreta jerárquica con niveles de código separados.
3. [TinyStories: ¿hasta qué punto pueden ser pequeños los modelos de lenguaje y seguir produciendo un inglés coherente?](https://arxiv.org/abs/2305.07759) Presenta el corpus sintético de relatos breves utilizado en el estudio de caso diagnóstico.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Presenta la formulación de difusión discreta enmascarada empleada en el generador latente.

## Límite de la evidencia

El método por etapas es reutilizable, pero la clasificación presentada no es universal. El experimento publicado emplea TinyStories, un régimen de compresión agresiva, una familia de códecs jerárquicos, un generador discreto enmascarado y ejecuciones únicas de carácter descriptivo. Aplique el protocolo de diagnóstico al sistema nuevo; no extrapole la conclusión numérica a un contexto distinto.

## Publicaciones relacionadas

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/es/publications/where-quality-breaks/)

Dónde se degrada la calidad en la generación comprimida de textos breves: localización por etapas del cuello de botella

Metodología de diagnóstico FRUCT 39 2026 Conferencia principal

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/es/publications/inspectable-control/)

Control inspeccionable para la regeneración de software con preservación de la estructura

Método de control en el espacio latente FSE Companion '26 2026 Póster complementario
