# Comment déterminer si la défaillance d’un générateur de texte compressé provient du codec ou du générateur

Canonical HTML: https://aogavrilov.com/fr/research/codec-bottleneck-diagnosis/

Document language: fr

Un diagnostic pratique destiné aux systèmes en deux étapes, qui compressent d’abord le texte en codes discrets avant de générer dans l’espace des codes. L’objectif est de déterminer quelle étape limite la sortie décodée avant de consacrer des ressources de calcul au mauvais composant.

Publié 29 juillet 2026 Mis à jour 30 juillet 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## La réponse courte

Évaluer le texte original, sa reconstruction appariée par le codec et le texte généré final avec le même évaluateur externe. L’écart entre l’original et la reconstruction mesure le plafond de qualité imposé avant la génération. L’écart entre la reconstruction et la génération isole ensuite la dégradation supplémentaire introduite par le générateur latent.

**Ne substituez pas un indicateur indirect de l’espace latent à la sortie décodée.** Une meilleure géométrie, utilisation ou couverture du dictionnaire de codes peut fournir des diagnostics utiles, mais elle n’établit un gain de qualité que si le texte décodé s’améliore selon les métriques finales pertinentes.

## Un diagnostic en quatre points de contrôle

1. Établir la référence Évaluer les textes originaux réservés au moyen de l’évaluateur externe utilisé à toutes les étapes ultérieures.
2. Mesurer la reconstruction par le codec Encoder puis décoder les mêmes exemples sans génération. Cette opération révèle l’information perdue au niveau du goulot d’étranglement.
3. Mesurer la génération latente Générer des codes, les décoder, puis évaluer le texte obtenu avec l’évaluateur inchangé.
4. Auditer le transfert des indicateurs de substitution Comparer les diagnostics latents aux métriques finales du texte décodé, plutôt que de supposer que les gains obtenus sur des indicateurs indirects se transposent.

## Comment interpréter les écarts entre étapes

| Tendance observée | Goulot d’étranglement le plus probable | Expérience suivante |
| --- | --- | --- |
| Les originaux obtiennent de bons scores ; les reconstructions se dégradent fortement | Fidélité du codec | Améliorer la reconstruction ou réduire la compression avant de régler le générateur |
| Les reconstructions restent de bonne qualité, tandis que les sorties générées se dégradent | Générateur latent | Examiner le débruitage, l’échantillonnage, le conditionnement et l’inadéquation de la distribution des codes |
| Les indicateurs indirects latents s’améliorent, tandis que les métriques après décodage stagnent | Transfert de l’indicateur indirect | Réévaluer si l’indicateur indirect rend bien compte de la propriété d’intérêt en aval |
| Toutes les étapes obtiennent de faibles scores | Données, évaluateur ou protocole expérimental | Valider la distribution de référence et l’évaluateur avant d’attribuer l’échec au modèle |

## Résultats de l’étude de cas publiée sur TinyStories

Dans [*Dégradation de la qualité dans la génération compressée de textes courts : localisation du goulot d’étranglement par étapes*](https://aogavrilov.com/fr/publications/where-quality-breaks/) , des textes de 64 jetons sont compressés en 16 codes de haut niveau au moyen d’un VQ-VAE-2 hiérarchique. Selon un même évaluateur GPT-2 externe, la perplexité médiane passe de **15.17** pour les textes originaux à **27.36** pour les reconstructions par le codec, tandis que le p95 passe de **25.10** vers **98.91** .

### Modélisation du langage par diffusion masquée dans l’espace des codes ou dans celui des jetons

L’écart de reconstruction domine le pipeline testé. Sous ce plafond, la modélisation du langage par diffusion masquée (MDLM) dans l’espace des codes reste plus performante que le MDLM dans l’espace des tokens selon l’évaluateur commun : la perplexité médiane est de **26.55** contre **38.42** , soit une réduction de 30,9 %.

Dans les expériences appariées disponibles, la régularisation tenant compte de la géométrie améliore les indicateurs indirects latents locaux, mais pas les métriques portant sur le texte décodé. Ce résultat de transfert négatif fait partie du diagnostic ; il ne prouve pas que le régulariseur a amélioré le texte final.

## Mesures à effectuer à chaque étape

## Questions de recherche auxquelles répond ce guide

Ces réponses concises relient les questions de diagnostic courantes aux résultats mesurés à chaque étape.

1. Dans l’expérience textuelle présentée, comment la diffusion masquée dans l’espace des codes se compare-t-elle à celle opérant dans l’espace des jetons ? Avec le même évaluateur externe, le MDLM dans l’espace des codes a obtenu une perplexité médiane de 26.55, contre 38.42 pour la référence dans l’espace des jetons, soit une réduction de 30.9%. La médiane de la reconstruction par le codec atteignait déjà 27.36 ; ce résultat doit donc être interprété à la lumière du goulot d’étranglement de la reconstruction. [Examiner les valeurs présentées pour chaque étape](https://aogavrilov.com/fr/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. Comment comparer la diffusion masquée dans l’espace des codes et dans l’espace des jetons lorsque le codec entraîne des pertes ? Utiliser les mêmes échantillons de validation et le même évaluateur du texte décodé pour les originaux, les reconstructions par le codec, les sorties dans l’espace des jetons et celles dans l’espace des codes. Présenter séparément l’écart de reconstruction, car un générateur latent plus performant ne peut récupérer l’information déjà supprimée par le codec. [Comparer les étapes avec une même fonction d’évaluation](https://aogavrilov.com/fr/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. Comment diagnostiquer la perte de qualité dans un générateur de texte à deux étapes ? Avec un même évaluateur de texte décodé inchangé, mesurer d’abord l’écart entre l’original et la reconstruction, puis celui entre la reconstruction et la génération. On distingue ainsi le plafond de qualité imposé par le codec de la dégradation supplémentaire introduite par la génération latente. [Suivre le diagnostic en quatre points de contrôle](https://aogavrilov.com/fr/research/codec-bottleneck-diagnosis/#workflow) .
4. Dans quels cas de meilleures métriques de l’espace latent ne se traduisent-elles pas par une amélioration de la sortie décodée ? Un indicateur de substitution latent peut s’améliorer sans refléter la propriété aval qui nous intéresse. Testez le transfert en décodant des sorties appariées et en les évaluant avec les mêmes métriques finales ; sans cela, la géométrie ou l’utilisation du dictionnaire de codes demeure un indice diagnostique, et non un gain de qualité textuelle. [Appliquer le diagnostic de transfert des indicateurs indirects](https://aogavrilov.com/fr/research/codec-bottleneck-diagnosis/#decision-table) .

## Erreurs de diagnostic courantes

### Ne comparer que les sorties finales

Un score de bout en bout ne permet pas de déterminer si la perte provient de la représentation ou du générateur.

### Changer de fonction d’évaluation entre les étapes

Le recours à des évaluateurs différents rend les écarts entre étapes incomparables et fragilise l’attribution causale.

### Assimiler la qualité du dictionnaire de codes à la « qualité du texte »

Une utilisation satisfaisante peut coexister avec des reconstructions médiocres ou des générations décodées de faible qualité.

### Généralisation à partir d’un seul régime de compression

Les résultats publiés portent sur une seule configuration TinyStories de 64 à 16 et sur des exécutions uniques à visée descriptive.

## Contexte principal

Ces sources définissent le jeu de données et les familles de modèles auxquels se réfère l’étude diagnostique.

1. [Apprentissage neuronal de représentations discrètes](https://arxiv.org/abs/1711.00937) Présente VQ-VAE ainsi que le goulot d’étranglement discret appris qu’utilisent les générateurs latents ultérieurs.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Élabore une représentation discrète hiérarchique comportant des niveaux de code distincts.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Présente le corpus synthétique de récits courts employé dans l’étude de cas diagnostique.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Présente la formulation de diffusion discrète masquée employée pour le générateur latent.

## Limite des données probantes

La méthode par étapes est réutilisable, mais le classement rapporté n’est pas universel. L’expérience publiée repose sur TinyStories, un régime de compression élevée, une famille de codecs hiérarchiques, un générateur discret masqué et des exécutions uniques analysées de façon descriptive. Il convient d’appliquer le protocole de diagnostic à tout nouveau système, sans transposer la conclusion numérique à un autre contexte.

## Publications connexes

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/fr/publications/where-quality-breaks/)

Dégradation de la qualité dans la génération compressée de textes courts : localisation du goulot d’étranglement par étapes

Méthodologie de diagnostic FRUCT 39 2026 Conférence principale

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/fr/publications/inspectable-control/)

Contrôle inspectable pour la régénération de logiciels avec préservation de la structure

Méthode de contrôle dans l’espace latent FSE Companion '26 2026 Poster associé
