# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/fr/publications/where-quality-breaks/

Document language: fr

Dégradation de la qualité dans la génération compressée de textes courts : localisation du goulot d’étranglement par étapes

Un diagnostic par étapes de la génération de textes courts compressés, qui distingue la perte de reconstruction par le codec de la perte de génération latente.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[Lire l’article intégral au format HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) Texte interrogeable comprenant les formules, tableaux, figures et références.

Manuscrit final accepté (version déposée par l’auteur avec DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [Conditions de publication et de réutilisation](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## L’article en 30 secondes

**Question de recherche** Comment attribuer séparément au codec et au générateur latent la perte de qualité d’une chaîne de génération de texte compressé ?

### Problème

Dans la génération de textes courts compressés, la médiocre qualité du texte décodé peut résulter d’informations perdues par le codec ou d’une génération déficiente dans l’espace latent. Les scores de bout en bout confondent ces modes de défaillance et risquent d’orienter les efforts d’optimisation vers le mauvais composant.

### Approche

Le protocole par étapes évalue les originaux, les reconstructions appariées par le codec, les sorties du MDLM dans l’espace des jetons et celles de la diffusion dans l’espace des codes à l’aide d’un même évaluateur GPT-2 externe. Les mesures relatives au dictionnaire de codes et à la géométrie restent des outils de diagnostic et ne se substituent pas à la qualité du texte décodé.

### Résultat principal

La reconstruction par le codec fait passer la perplexité externe médiane de 15,17 à 27,36 et le 95e centile de 25,10 à 98,91. Le MDLM dans l’espace des codes réduit néanmoins la perplexité médiane de 30,9 % par rapport au MDLM dans l’espace des jetons.

### Pourquoi est-ce important ?

Ce résultat permet de traduire le diagnostic du goulot d’étranglement du codec en priorités concrètes : améliorer d’abord le codec, puis comparer la génération dans l’espace des jetons à celle dans l’espace des codes, et ne considérer comme probants les gains des indicateurs indirects latents que si le texte décodé s’améliore lui aussi.

## Résumé

Les générateurs de textes courts comprimés peuvent échouer à deux endroits distincts : le codec peut éliminer de l’information avant le début de la génération, ou le générateur latent peut produire des codes de piètre qualité. Sans dissocier ces modes de défaillance, les chercheurs risquent de consacrer des ressources de calcul à l’amélioration du mauvais composant. Nous étudions ce problème au moyen d’une étude de cas contrôlée TinyStories avec compression de 64 à 16, fondée sur un codec VQ-VAE-2 hiérarchique et un générateur par diffusion discrète masquée (MDLM). Nous employons un protocole de validation par étapes qui distingue la fidélité de la reconstruction du codec, la qualité de la génération latente et les diagnostics latents auxiliaires, avec une même fonction d’évaluation externe GPT-2, tout en présentant des métriques sémantiques complémentaires pour l’étude de la géométrie. Dans la configuration testée, la seule reconstruction du codec fait passer la perplexité externe médiane de 15.17 à 27.36 (+80.4%) et le p95 de 25.10 à 98.91 (+294.1%), ce qui indique que la perte de qualité dominante survient avant le début de la génération latente. Avec la même fonction d’évaluation, le MDLM dans l’espace des codes demeure nettement supérieur à la diffusion dans l’espace des tokens : il réduit respectivement la moyenne, la médiane et le p95 de 32.9%, 30.9% et 36.6%. La régularisation tenant compte de la géométrie améliore les indicateurs indirects latents locaux, mais pas les métriques du texte décodé dans les exécutions disponibles. La contribution est méthodologique plutôt qu’algorithmique : l’article présente un diagnostic par étapes réutilisable pour un pipeline concret et montre que, dans ce cadre, la fidélité du codec, plutôt que le débruitage latent, détermine le plafond de qualité pratique.

Publié dans 2026 39th Conference of Open Innovations Association (FRUCT)

Type de contribution Méthodologie de diagnostic

28 avril 2026 numéro 1 pp. 69–76 Conférence principale

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## Sommaire Sur cette page

## Principaux résultats

| Point d’évaluation | n | PPL moyenne | PPL médiane | PPL au 95e centile |
| --- | --- | --- | --- | --- |
| Textes originaux | 256 | 16.24 | 15.17 | 25.1 |
| Reconstructions du codec | 256 | 37.26 | 27.36 | 98.91 |
| Référence autorégressive | 251 | 30.98 | 23.27 | 56.11 |
| MDLM dans l’espace des jetons | 256 | 44.74 | 38.42 | 93.6 |
| MDLM dans l’espace des codes | 256 | 30.01 | 26.55 | 59.36 |

**Résultat principal.** L’essentiel de la perte de qualité observée survient avant la génération ; la diffusion dans l’espace des codes réduit néanmoins la perplexité médiane de 30.9% par rapport à la diffusion dans l’espace des jetons.

Télécharger les résultats : [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) Miroir externe : [Fiche de jeu de données Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF et citation

**Citer cet article** BibTeX est le format recommandé. Toutes les variantes ci-dessous sont produites à partir de la même notice de publication.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

Fichiers de citation : [Texte APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [Texte IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [XML OAI-DC](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [XML OpenAIRE v4](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [XML MODS](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [Métadonnées XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [Texte intégral au format XML JATS 1.4](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [Ensemble de liens (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [Ensemble de liens (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI : [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

Guide complet

## Guide de recherche complet

## Méthode

## 

L’article utilise un même évaluateur aux trois étapes de l’évaluation, de sorte que chaque transformation supplémentaire puisse être associée à un écart de qualité mesurable.

1. Reconstruire Encoder chaque échantillon TinyStories de 64 tokens en 16 codes de niveau supérieur, puis le décoder immédiatement afin de mesurer la perte de reconstruction du codec.
2. Générer Générer avec le MDLM soit des jetons textuels, soit des codes latents discrets, puis décoder les échantillons issus de l’espace des codes avec le même codec entraîné.
3. Comparer Évaluer les originaux, les reconstructions et les textes générés selon le même protocole GPT-2 externe, en incluant la médiane et les statistiques de queue.

![Pipeline par étapes de génération de texte compressé comparant le texte original, la reconstruction par le codec, le MDLM dans l’espace des codes et le texte décodé, afin de distinguer la perte du codec de la perte de génération.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**La localisation par étapes des goulots d’étranglement distingue la perte de reconstruction par le codec de la perte de génération latente au moyen d’un protocole commun d’évaluation du texte décodé.* Source : [Schéma explicatif créé par l’auteur à partir de la méthode et des résultats publiés.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . Conditions de réutilisation : [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Attribution suggérée : Gavrilov, Gazzaev et Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [Télécharger le fichier SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### Idée centrale

Un générateur en aval ne peut récupérer les informations que le codec a déjà éliminées. Il faut donc auditer l’étape de reconstruction avant d’interpréter les résultats de la génération latente.

### Différences par rapport aux approches apparentées

Les comparaisons de bout en bout usuelles ne donnent qu’un score final de génération. Ce protocole ajoute un point de contrôle apparié de la reconstruction et distingue les métriques de bon fonctionnement dans l’espace latent des résultats observés sur le texte décodé.

### Apport nouveau

La contribution réside dans une méthodologie réutilisable de diagnostic par étapes pour un pipeline concret de texte compressé, et non dans un nouvel algorithme de débruitage.

## Questions auxquelles cet article contribue à répondre

## 

Ouvrez une question pour obtenir une réponse concise fondée sur l’article. Les frontières détaillées des éléments probants figurent dans la section Limites.

1. À quelle étape la qualité se dégrade-t-elle dans la génération comprimée de textes courts ? Dans la chaîne TinyStories testée, avec compression de 64 à 16, la dégradation dominante apparaît lors de la reconstruction par le codec, avant le début de la génération latente. La perplexité externe médiane mesurée avec GPT-2 passe de 15.17 pour le texte original à 27.36 après reconstruction, tandis que le p95 passe de 25.10 à 98.91. Ce résultat concerne une seule configuration et ne constitue pas un classement universel des codecs.
2. Comment distinguer la perte du codec de la perte de génération dans l’espace latent ? Le protocole par étapes évalue, au moyen d’un même évaluateur externe, les originaux, les reconstructions appariées par le codec et le texte finalement généré. L’écart entre l’original et la reconstruction estime la contribution du codec, tandis que la comparaison entre la reconstruction et la sortie générée aide à localiser la perte supplémentaire imputable à l’étape de génération. Les métriques de qualité de l’espace latent sont présentées séparément des résultats portant sur le texte décodé.
3. Comment évaluer la génération de texte à variables latentes discrètes ? L’article recommande de vérifier la fidélité de la reconstruction avant de comparer les générateurs, d’appliquer à chaque étape le même évaluateur du texte décodé et de présenter les statistiques centrales comme celles des queues de distribution. Il considère en outre l’utilisation du dictionnaire de codes, sa géométrie et les autres indicateurs indirects latents comme des outils diagnostiques, non comme des substituts à la qualité du texte décodé.
4. La diffusion dans l’espace des codes surpasse-t-elle la diffusion dans l’espace des tokens ? Avec l’évaluateur commun et la configuration testée, le MDLM dans l’espace des codes réduit respectivement la perplexité moyenne, médiane et au 95e centile de 32.9%, 30.9% et 36.6% par rapport au MDLM dans l’espace des jetons. Cette comparaison est descriptive et propre à la configuration : elle n’établit aucun classement universel entre jeux de données, taux de compression, codecs ou architectures de diffusion.
5. De meilleures métriques de géométrie latente garantissent-elles un texte généré de meilleure qualité ? Non. Dans les exécutions appariées disponibles, la régularisation tenant compte de la géométrie a amélioré les indicateurs indirects locaux de l’espace latent, sans améliorer les métriques du texte décodé. Ce résultat invite à contrôler tout gain d’un indicateur indirect sur la sortie décodée finale et à considérer l’absence de transfert comme un résultat négatif utile, plutôt que comme la preuve d’une amélioration de la génération.

## Comparaison avec les approches apparentées

## 

| Approche | Représentation | Contrôle / diagnostic | Ce qui est préservé ou mesuré |
| --- | --- | --- | --- |
| Diffusion dans l’espace des jetons | Jetons textuels | Qualité de la génération dans l’espace des jetons | Fluidité de la génération directe et comportement de l’évaluateur |
| Génération latente comprimée | Codes latents discrets obtenus au moyen d’un codec | Qualité finale de la génération de bout en bout | Comportement conjoint du codec et du générateur latent |
| Localisation par étapes des goulots d’étranglement | Texte, reconstructions par le codec et variables latentes discrètes | Distinguer la perte du codec de la perte de génération | Étape où la qualité se dégrade selon un évaluateur commun |

La comparaison distingue le périmètre d’évaluation et les éléments probants ; elle ne constitue pas un classement universel des approches.

## Pertinence et périmètre

## 

Le protocole par étapes est utile lorsqu’une chaîne de génération comprend à la fois un codec appris et un générateur opérant dans l’espace latent, mais que l’origine de la dégradation de la sortie demeure incertaine.

1. Génération de texte comprimée à variables latentes discrètes
2. Fidélité de la reconstruction du codec dans les pipelines génératifs
3. Modélisation du langage par diffusion masquée dans l’espace des codes
4. Localisation des goulots d’étranglement et évaluation cohérente entre les étapes
5. Évaluer les gains des indicateurs de substitution dans l’espace latent à l’aune du texte décodé

## Limites

## 

- L’étude empirique repose exclusivement sur TinyStories.
- L’analyse principale porte sur un seul régime de compression prononcée de 64 à 16.
- Le système évalué associe une famille de codecs VQ-VAE-2 hiérarchiques à un générateur MDLM.
- Les comparaisons reposent sur des exécutions uniques et sont descriptives, plutôt que fondées sur des estimations statistiques à plusieurs graines.
- La perplexité externe de GPT-2 est un diagnostic commun, et non une métrique universelle de qualité sémantique.
- Les conclusions ne doivent pas être transposées directement à tous les jeux de données, à toutes les architectures de codec ni à tous les taux de compression.

## Références citées dans l’article

## 

Ces entrées correspondent à la section numérotée « References » du PDF de l’article.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## Ressources et reproductibilité

## 

### Déclaration relative aux données

## Versions

## 

1. **Version publiée** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **Notice arXiv** [Ouvrir la notice de la prépublication, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **Index de la recherche en IA** [Page d’article Hugging Face avec identité vérifiée du premier auteur et lien vers la synthèse des résultats](https://huggingface.co/papers/2607.24176)
4. **Manuscrit de l’auteur** [PDF local accessible sous forme textuelle](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **Présentation en conférence** [Présentation à FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **Index des actes de la conférence** [Volume officiel FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **PDF des actes de la conférence** [Texte intégral en libre accès de FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **Ouvrir la notice scientifique** [OpenAlex](https://openalex.org/W7160914887)
9. **Notice du graphe de citations** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **Texte intégral diffusé par l’auteur** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

Le DOI publié constitue l’identifiant bibliographique principal. Cette page demeure l’unique URL canonique du projet pour toutes les versions.

## Publication connexe

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/fr/publications/inspectable-control/)

Consulter le guide consacré à [Diagnostic du goulot d’étranglement du codec](https://aogavrilov.com/fr/projects/codec-bottleneck-diagnosis/) pour approfondir. [À propos de l’auteur](https://aogavrilov.com/about/) .

### Notes de recherche ciblées

Réponses adaptées à l’intention, assorties de limites probantes et de liens vers cet article.

- [Diffusion masquée dans l’espace des codes ou dans celui des jetons : comment les comparer](https://aogavrilov.com/fr/research-notes/code-space-vs-token-space-masked-diffusion/)
