Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Dégradation de la qualité dans la génération compressée de textes courts : localisation du goulot d’étranglement par étapes

Un diagnostic par étapes de la génération de textes courts compressés, qui distingue la perte de reconstruction par le codec de la perte de génération latente.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

Lire l’article intégral au format HTMLTexte interrogeable comprenant les formules, tableaux, figures et références.

Manuscrit final accepté (version déposée par l’auteur avec DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. Conditions de publication et de réutilisation.

L’article en 30 secondes

Question de rechercheComment attribuer séparément au codec et au générateur latent la perte de qualité d’une chaîne de génération de texte compressé ?

Problème

Dans la génération de textes courts compressés, la médiocre qualité du texte décodé peut résulter d’informations perdues par le codec ou d’une génération déficiente dans l’espace latent. Les scores de bout en bout confondent ces modes de défaillance et risquent d’orienter les efforts d’optimisation vers le mauvais composant.

Approche

Le protocole par étapes évalue les originaux, les reconstructions appariées par le codec, les sorties du MDLM dans l’espace des jetons et celles de la diffusion dans l’espace des codes à l’aide d’un même évaluateur GPT-2 externe. Les mesures relatives au dictionnaire de codes et à la géométrie restent des outils de diagnostic et ne se substituent pas à la qualité du texte décodé.

Résultat principal

La reconstruction par le codec fait passer la perplexité externe médiane de 15,17 à 27,36 et le 95e centile de 25,10 à 98,91. Le MDLM dans l’espace des codes réduit néanmoins la perplexité médiane de 30,9 % par rapport au MDLM dans l’espace des jetons.

Pourquoi est-ce important ?

Ce résultat permet de traduire le diagnostic du goulot d’étranglement du codec en priorités concrètes : améliorer d’abord le codec, puis comparer la génération dans l’espace des jetons à celle dans l’espace des codes, et ne considérer comme probants les gains des indicateurs indirects latents que si le texte décodé s’améliore lui aussi.

Résumé

Les générateurs de textes courts comprimés peuvent échouer à deux endroits distincts : le codec peut éliminer de l’information avant le début de la génération, ou le générateur latent peut produire des codes de piètre qualité. Sans dissocier ces modes de défaillance, les chercheurs risquent de consacrer des ressources de calcul à l’amélioration du mauvais composant. Nous étudions ce problème au moyen d’une étude de cas contrôlée TinyStories avec compression de 64 à 16, fondée sur un codec VQ-VAE-2 hiérarchique et un générateur par diffusion discrète masquée (MDLM). Nous employons un protocole de validation par étapes qui distingue la fidélité de la reconstruction du codec, la qualité de la génération latente et les diagnostics latents auxiliaires, avec une même fonction d’évaluation externe GPT-2, tout en présentant des métriques sémantiques complémentaires pour l’étude de la géométrie. Dans la configuration testée, la seule reconstruction du codec fait passer la perplexité externe médiane de 15.17 à 27.36 (+80.4%) et le p95 de 25.10 à 98.91 (+294.1%), ce qui indique que la perte de qualité dominante survient avant le début de la génération latente. Avec la même fonction d’évaluation, le MDLM dans l’espace des codes demeure nettement supérieur à la diffusion dans l’espace des tokens : il réduit respectivement la moyenne, la médiane et le p95 de 32.9%, 30.9% et 36.6%. La régularisation tenant compte de la géométrie améliore les indicateurs indirects latents locaux, mais pas les métriques du texte décodé dans les exécutions disponibles. La contribution est méthodologique plutôt qu’algorithmique : l’article présente un diagnostic par étapes réutilisable pour un pipeline concret et montre que, dans ce cadre, la fidélité du codec, plutôt que le débruitage latent, détermine le plafond de qualité pratique.

Publié dans 2026 39th Conference of Open Innovations Association (FRUCT)

Type de contribution Méthodologie de diagnostic

numéro 1pp. 69–76Conférence principale

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

Partager cet articlePartager

Principaux résultats

Principaux résultats de Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Point d’évaluationnPPL moyennePPL médianePPL au 95e centile
Textes originaux25616.2415.1725.1
Reconstructions du codec25637.2627.3698.91
Référence autorégressive25130.9823.2756.11
MDLM dans l’espace des jetons25644.7438.4293.6
MDLM dans l’espace des codes25630.0126.5559.36

Résultat principal. L’essentiel de la perte de qualité observée survient avant la génération ; la diffusion dans l’espace des codes réduit néanmoins la perplexité médiane de 30.9% par rapport à la diffusion dans l’espace des jetons.

Jeu de données
TinyStories
Taille de l’échantillon
256 échantillons appariés de reconstruction ; 251 à 256 échantillons générés par mode ; quatre configurations géométriques appariées.
Métriques
Perplexité externe de GPT-2 : moyenne, médiane, p95 et maximum ; utilisation du dictionnaire de codes et taille du support ; SBERT, BERTScore, MAUVE et synthèse produite par un LLM juge pour les expériences de géométrie
Incertitude
Les comparaisons présentées reposent sur des exécutions uniques à visée descriptive ; aucun intervalle de confiance ni aucune estimation de significativité sur plusieurs graines n’ont été calculés.
Conditions
Séquences de tokens GPT-2 de longueur 64, compressées en 16 codes de niveau supérieur au moyen d’un VQ-VAE-2 hiérarchique ; tous les modes de génération emploient le même évaluateur externe.

PDF et citation

Citer cet article BibTeX est le format recommandé. Toutes les variantes ci-dessous sont produites à partir de la même notice de publication.

Ouvrir le PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}

Fichiers de citation :Texte APATexte IEEERISCSL-JSONSchema.org JSON-LDXML OAI-DCXML OpenAIRE v4XML MODSMétadonnées XML JATS 1.4Texte intégral au format XML JATS 1.4RDF TurtleEnsemble de liens (JSON)Ensemble de liens (HTTP)RO-Crate

DOI :https://doi.org/10.23919/FRUCT70069.2026.11506553

Guide complet

Guide de recherche complet

Méthode

L’article utilise un même évaluateur aux trois étapes de l’évaluation, de sorte que chaque transformation supplémentaire puisse être associée à un écart de qualité mesurable.

  1. Reconstruire

    Encoder chaque échantillon TinyStories de 64 tokens en 16 codes de niveau supérieur, puis le décoder immédiatement afin de mesurer la perte de reconstruction du codec.

  2. Générer

    Générer avec le MDLM soit des jetons textuels, soit des codes latents discrets, puis décoder les échantillons issus de l’espace des codes avec le même codec entraîné.

  3. Comparer

    Évaluer les originaux, les reconstructions et les textes générés selon le même protocole GPT-2 externe, en incluant la médiane et les statistiques de queue.

Pipeline par étapes de génération de texte compressé comparant le texte original, la reconstruction par le codec, le MDLM dans l’espace des codes et le texte décodé, afin de distinguer la perte du codec de la perte de génération.
La localisation par étapes des goulots d’étranglement distingue la perte de reconstruction par le codec de la perte de génération latente au moyen d’un protocole commun d’évaluation du texte décodé.Source : Schéma explicatif créé par l’auteur à partir de la méthode et des résultats publiés..Conditions de réutilisation : CC BY 4.0.Attribution suggérée : Gavrilov, Gazzaev et Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. Télécharger le fichier SVG.

Idée centrale

Un générateur en aval ne peut récupérer les informations que le codec a déjà éliminées. Il faut donc auditer l’étape de reconstruction avant d’interpréter les résultats de la génération latente.

Différences par rapport aux approches apparentées

Les comparaisons de bout en bout usuelles ne donnent qu’un score final de génération. Ce protocole ajoute un point de contrôle apparié de la reconstruction et distingue les métriques de bon fonctionnement dans l’espace latent des résultats observés sur le texte décodé.

Apport nouveau

La contribution réside dans une méthodologie réutilisable de diagnostic par étapes pour un pipeline concret de texte compressé, et non dans un nouvel algorithme de débruitage.

Questions auxquelles cet article contribue à répondre

Ouvrez une question pour obtenir une réponse concise fondée sur l’article. Les frontières détaillées des éléments probants figurent dans la section Limites.

  1. À quelle étape la qualité se dégrade-t-elle dans la génération comprimée de textes courts ?

    Dans la chaîne TinyStories testée, avec compression de 64 à 16, la dégradation dominante apparaît lors de la reconstruction par le codec, avant le début de la génération latente. La perplexité externe médiane mesurée avec GPT-2 passe de 15.17 pour le texte original à 27.36 après reconstruction, tandis que le p95 passe de 25.10 à 98.91. Ce résultat concerne une seule configuration et ne constitue pas un classement universel des codecs.

  2. Comment distinguer la perte du codec de la perte de génération dans l’espace latent ?

    Le protocole par étapes évalue, au moyen d’un même évaluateur externe, les originaux, les reconstructions appariées par le codec et le texte finalement généré. L’écart entre l’original et la reconstruction estime la contribution du codec, tandis que la comparaison entre la reconstruction et la sortie générée aide à localiser la perte supplémentaire imputable à l’étape de génération. Les métriques de qualité de l’espace latent sont présentées séparément des résultats portant sur le texte décodé.

  3. Comment évaluer la génération de texte à variables latentes discrètes ?

    L’article recommande de vérifier la fidélité de la reconstruction avant de comparer les générateurs, d’appliquer à chaque étape le même évaluateur du texte décodé et de présenter les statistiques centrales comme celles des queues de distribution. Il considère en outre l’utilisation du dictionnaire de codes, sa géométrie et les autres indicateurs indirects latents comme des outils diagnostiques, non comme des substituts à la qualité du texte décodé.

  4. La diffusion dans l’espace des codes surpasse-t-elle la diffusion dans l’espace des tokens ?

    Avec l’évaluateur commun et la configuration testée, le MDLM dans l’espace des codes réduit respectivement la perplexité moyenne, médiane et au 95e centile de 32.9%, 30.9% et 36.6% par rapport au MDLM dans l’espace des jetons. Cette comparaison est descriptive et propre à la configuration : elle n’établit aucun classement universel entre jeux de données, taux de compression, codecs ou architectures de diffusion.

  5. De meilleures métriques de géométrie latente garantissent-elles un texte généré de meilleure qualité ?

    Non. Dans les exécutions appariées disponibles, la régularisation tenant compte de la géométrie a amélioré les indicateurs indirects locaux de l’espace latent, sans améliorer les métriques du texte décodé. Ce résultat invite à contrôler tout gain d’un indicateur indirect sur la sortie décodée finale et à considérer l’absence de transfert comme un résultat négatif utile, plutôt que comme la preuve d’une amélioration de la génération.

Comparaison avec les approches apparentées

Comparaison factuelle de Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization avec des approches apparentées
ApprocheReprésentationContrôle / diagnosticCe qui est préservé ou mesuré
Diffusion dans l’espace des jetonsJetons textuelsQualité de la génération dans l’espace des jetonsFluidité de la génération directe et comportement de l’évaluateur
Génération latente compriméeCodes latents discrets obtenus au moyen d’un codecQualité finale de la génération de bout en boutComportement conjoint du codec et du générateur latent
Localisation par étapes des goulots d’étranglementTexte, reconstructions par le codec et variables latentes discrètesDistinguer la perte du codec de la perte de générationÉtape où la qualité se dégrade selon un évaluateur commun

La comparaison distingue le périmètre d’évaluation et les éléments probants ; elle ne constitue pas un classement universel des approches.

Pertinence et périmètre

Le protocole par étapes est utile lorsqu’une chaîne de génération comprend à la fois un codec appris et un générateur opérant dans l’espace latent, mais que l’origine de la dégradation de la sortie demeure incertaine.

  1. Génération de texte comprimée à variables latentes discrètes

  2. Fidélité de la reconstruction du codec dans les pipelines génératifs

  3. Modélisation du langage par diffusion masquée dans l’espace des codes

  4. Localisation des goulots d’étranglement et évaluation cohérente entre les étapes

  5. Évaluer les gains des indicateurs de substitution dans l’espace latent à l’aune du texte décodé

Voir les limites et le périmètre des éléments probants

Limites

  • L’étude empirique repose exclusivement sur TinyStories.
  • L’analyse principale porte sur un seul régime de compression prononcée de 64 à 16.
  • Le système évalué associe une famille de codecs VQ-VAE-2 hiérarchiques à un générateur MDLM.
  • Les comparaisons reposent sur des exécutions uniques et sont descriptives, plutôt que fondées sur des estimations statistiques à plusieurs graines.
  • La perplexité externe de GPT-2 est un diagnostic commun, et non une métrique universelle de qualité sémantique.
  • Les conclusions ne doivent pas être transposées directement à tous les jeux de données, à toutes les architectures de codec ni à tous les taux de compression.

Références citées dans l’article

Ces entrées correspondent à la section numérotée « References » du PDF de l’article.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Ressources et reproductibilité

Éditeur
IEEE
Ressources de la publication
Le manuscrit public, les tableaux de résultats, la figure explicative et les fichiers de citation sont disponibles ici. Le code d’implémentation et les points de contrôle ne sont pas rendus publics.

Déclaration relative aux données

Source
TinyStories, tel que décrit dans l’article.
Licence
L’utilisation de TinyStories reste soumise aux conditions propres au jeu de données ; ce site n’en redistribue aucun fichier.
Prétraitement
Tokenisation GPT-2, entrées fixes de 64 tokens et compression temporelle hiérarchique de 64 à 32, puis à 16 positions.
Répartition
La publication fait état de 256 échantillons de reconstruction appariés et de 251 à 256 échantillons générés par mode ; elle ne publie pas de manifeste réutilisable de la répartition entraînement/validation.
Format
Échantillons de textes courts, séquences de tokens GPT-2, séquences de codes discrets, journaux de génération et tableaux récapitulatifs.
Version / somme de contrôle
L’article ne fournit ni somme de contrôle du jeu de données ni identifiant immuable de l’instantané TinyStories.
Acquisition
Aucun script public d’acquisition n’est diffusé avec la page de la publication.
Limites d’utilisation
Les résultats portent sur de courts récits synthétiques et ne doivent pas être considérés comme un benchmark de la génération non contrainte en langue naturelle.

Versions

  1. Version publiéeIEEE / FRUCT, 2026
  2. Présentation en conférencePrésentation à FRUCT 39
  3. Index des actes de la conférenceVolume officiel FRUCT 39
  4. PDF des actes de la conférenceTexte intégral en libre accès de FRUCT
  5. Ouvrir la notice scientifiqueOpenAlex
  6. Notice du graphe de citationsSemantic Scholar
  7. Texte intégral diffusé par l’auteurResearchGate

Le DOI publié constitue l’identifiant bibliographique principal. Cette page demeure l’unique URL canonique du projet pour toutes les versions.