Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

壓縮式短文本生成的品質瓶頸何在:分階段瓶頸定位

分階段診斷壓縮式短文本生成,區分編解碼器重建損失與潛在生成損失。

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

閱讀 HTML 格式全文包含公式、表格、圖與參考文獻的可搜尋文字。

最終接受稿(作者發布且附 DOI 的版本)。 © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. 發布與重複使用條款.

30 秒掌握論文

研究問題如何將壓縮文字生成管線中的品質損失分別歸因於編解碼器與潛在生成器?

問題

在壓縮短文字生成中,解碼文字品質不佳,可能源於編解碼器造成的資訊流失,也可能源於潛在空間生成能力不足。端到端分數會混淆這些失效模式,因而可能將最佳化工作錯置於不當元件。

方法

此分階段流程使用同一個外部 GPT-2 評估器,評分原始文本、成對的編解碼器重建結果、詞元空間 MDLM 輸出及編碼空間擴散輸出。碼本與幾何度量仍屬診斷工具,不能取代解碼文本的品質評估。

主要結果

編解碼器重建使外部困惑度中位數由 15.17 升至 27.36,p95 由 25.10 升至 98.91;相較於詞元空間 MDLM,編碼空間 MDLM 仍使困惑度中位數降低 30.9%。

其重要性

此結果將編解碼器瓶頸診斷轉化為可執行的工作次序:先改良編解碼器,再比較詞元空間與編碼空間生成;只有解碼文字也有所改善時,才可採信潛在空間代理指標的增益。

摘要

壓縮式短文字生成器可能在兩個不同環節失效:編解碼器可能在生成開始前便丟失資訊,或潛在生成器可能產生品質不佳的碼。若未區分這些失敗模式,研究人員可能耗費運算資源改善錯誤的元件。我們以一項受控的 TinyStories 64-to-16 個案研究探討此問題;該系統由階層式 VQ-VAE-2 編解碼器與遮罩式離散擴散生成器(MDLM)構成。我們採用分階段驗證協定,在同一個外部 GPT-2 評分器下,分別評估編解碼器重建保真度、潛在生成品質與輔助潛在診斷,並為幾何研究報告互補的語意指標。在受測設定中,僅編解碼器重建便使外部困惑度中位數由 15.17 升至 27.36(+80.4%),p95 由 25.10 升至 98.91(+294.1%);這顯示主要品質損失在潛在生成開始之前即已出現。在同一評分器下,碼空間 MDLM 的表現仍明顯優於詞元空間擴散,其平均值、中位數與 p95 分別降低 32.9%、30.9% 與 36.6%。幾何感知正則化雖改善局部潛在代理指標,卻未在現有執行結果中改善解碼文字指標。本文的貢獻在於方法論而非演算法:論文針對一條具體管線提出可重複使用的分階段診斷,並顯示在此設定下,實際品質上限是由編解碼器保真度而非潛在去雜訊所決定。

發表於 2026 39th Conference of Open Innovations Association (FRUCT)

貢獻類型 診斷方法論

第 1 期第 69–76 頁主會議

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

分享本論文分享

主要結果

《壓縮式短文本生成的品質從何處開始劣化:分階段定位瓶頸》的主要結果
評估節點n平均 PPLPPL 中位數第 95 百分位 PPL
原始文字25616.2415.1725.1
編解碼器重建結果25637.2627.3698.91
AR 基準線25130.9823.2756.11
詞元空間 MDLM25644.7438.4293.6
編碼空間 MDLM25630.0126.5559.36

主要結果。 觀察到的品質損失多半在生成前便已產生;儘管如此,相較於詞元空間擴散,編碼空間擴散仍使困惑度中位數降低 30.9%。

資料集
TinyStories
樣本數
256 組成對重建樣本;各模式有 251–256 個生成樣本;四組相互匹配的幾何設定。
指標
外部 GPT-2 困惑度:平均值、中位數、p95 與最大值;碼本使用率與支撐集大小;SBERT、BERTScore、MAUVE,以及幾何實驗的 LLM 評審摘要
不確定性
所報告的比較皆為描述性的單次執行;未計算信賴區間或多隨機種子的顯著性估計。
條件
使用階層式 VQ-VAE-2,將長度為 64 的 GPT-2 詞元序列壓縮成 16 個頂層碼;所有生成模式皆採用共用的外部評分器。

PDF 與引用資訊

引用本論文 建議使用 BibTeX 格式。下列各種格式皆由同一筆出版品紀錄產生。

開啟 PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
下載 .bib

引用檔案:APA 純文字IEEE 純文字RISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 中繼資料 XML全文 JATS 1.4 XMLRDF Turtle連結集(JSON)連結集(HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

完整指南

完整研究指南

方法

本論文在三個評估階段採用同一評分器,使每項新增轉換都能對應至可量測的品質落差。

  1. 重建

    將每個含 64 個詞元的 TinyStories 樣本編碼為 16 個頂層碼,隨即解碼,以衡量編解碼器重建損失。

  2. 生成

    以 MDLM 生成文字詞元或離散潛在碼,再使用同一個已訓練的編解碼器將編碼空間樣本解碼。

  3. 比較

    以相同的外部 GPT-2 協定為原始文本、重建文本及生成文本評分,並納入中位數與尾部分布統計量。

分階段的壓縮文字生成管線,透過比較原始文字、編解碼器重建結果、編碼空間 MDLM 與最終解碼文字,區分編解碼器損失與生成損失。
分階段瓶頸定位在同一套共用的解碼文字評估協定下,區分編解碼器重建損失與潛在生成損失。來源: 作者依據已發表的方法與結果製作的解說圖。.再利用條款: CC BY 4.0.建議署名:Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation。 下載 SVG.

核心構想

下游生成器無法復原編解碼器已捨棄的資訊。因此,在詮釋潛在變數生成結果之前,必須先稽核重建階段。

與相關方法的差異

標準的端對端比較只報告一項最終生成分數。本協定加入成對重建檢查點,並將潛在空間中的健全度指標與解碼文字上的證據分開。

新增內容

本研究的貢獻,是針對一套具體壓縮文字管線提出可重複使用的分階段診斷方法,而非提出新的去雜訊演算法。

本文有助於回答的問題

開啟問題,以取得以論文為依據的精簡答覆。詳細的證據邊界列於「限制」一節。

  1. 壓縮式短文本生成的品質從何處開始劣化?

    在受測的 TinyStories 64-to-16 管線中,主要劣化發生於潛在生成開始之前的編解碼器重建階段。外部 GPT-2 困惑度中位數由原始文字的 15.17 增至重建後的 27.36,p95 則由 25.10 增至 98.91。此結果僅適用於單一設定,並非對各種編解碼器的普遍排名。

  2. 如何區分編解碼器損失與潛在生成損失?

    此分階段流程以同一個外部評分器評估原始文本、成對的編解碼器重建結果與最終生成文本。原始文本與重建結果之間的落差可估計編解碼器造成的影響;重建結果與生成輸出之間的比較,則有助於定位生成階段額外產生的損失。潛在表徵健全度指標與解碼文本證據分開報告。

  3. 應如何評估離散潛在表示的文字生成?

    本論文建議在比較生成器前先檢查重建忠實度、於每個階段採用相同的解碼文字評分器,並報告中央趨勢與尾端統計量。此外,論文將碼本使用情形、幾何特性及其他潛在代理指標視為診斷工具,而非解碼文字品質的替代品。

  4. 編碼空間擴散是否優於詞元空間擴散?

    在共用評分器與受測設定下,相較於詞元空間 MDLM,編碼空間 MDLM 的平均、中位數及 p95 困惑度分別降低 32.9%、30.9% 與 36.6%。此比較屬描述性結果,且僅適用於特定配置;它無法確立跨資料集、壓縮率、編解碼器或擴散架構的普遍排序。

  5. 較佳的潛在幾何指標是否保證生成更好的文本?

    否。在現有的配對執行結果中,幾何感知正則化改善了潛在空間的局部代理指標,卻未改善解碼文字指標。此結果支持在最終解碼輸出上稽核每一項代理指標增益,並將未能轉移視為具參考價值的負面結果,而非生成有所改善的證據。

與相關方法比較

《壓縮式短文本生成的品質從何處開始劣化:分階段定位瓶頸》與相關方法的實證比較
方法表徵控制/診斷保留或量測的項目
詞元空間擴散文字詞元詞元空間中的生成品質直接生成的流暢度與評分器行為
壓縮式潛在生成透過編解碼器取得離散潛在碼最終的端對端生成品質編解碼器與潛在生成器的整體行為
分階段瓶頸定位文字、編解碼器重建結果及離散潛在表示區分編解碼器損失與生成損失在同一評分器下定位品質劣化之處

此比較旨在區分評估範圍與證據,並非對各種方法作普遍適用的排名。

相關性與範圍

當生成管線同時包含學習式編解碼器與潛在空間生成器,卻無法確定輸出品質劣化的來源時,此分階段流程特別有用。

  1. 壓縮式與離散潛在文字生成

  2. 生成管線中的編解碼器重建保真度

  3. 程式碼空間中的遮罩式擴散語言建模

  4. 瓶頸定位與階段一致性評估

  5. 以解碼文本稽核潛在空間代理指標的改善

查看限制與證據邊界

限制

  • 實證研究僅使用 TinyStories。
  • 主要分析僅涵蓋一種較為激進的 64-to-16 壓縮設定。
  • 受評估系統結合一個階層式 VQ-VAE-2 編解碼器系列與一個 MDLM 生成器。
  • 比較結果均以單次執行為基礎,屬於描述性結果,而非多個隨機種子的統計估計。
  • 外部 GPT-2 困惑度是共用的診斷指標,而非普遍適用的語意品質度量。
  • 這些結論不應直接套用至所有資料集、編解碼器架構或壓縮比。

論文引用的參考文獻

這些條目對應論文 PDF 中按編號排列的參考文獻章節。

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

資源與可重現性

出版者
IEEE
出版資源
此處提供公開手稿、結果表、說明圖及引用檔案。實作程式碼與檢查點並未公開釋出。

資料聲明

來源
論文所述的 TinyStories。
授權條款
TinyStories 的使用仍受該資料集自身條款約束;本站不重新散布任何資料集檔案。
前處理
GPT-2 詞元化、固定的 64 詞元輸入,以及位置數由 64 降至 32、再降至 16 的階層式時間壓縮。
分割
該出版品報告 256 組成對重建樣本,以及每種模式 251–256 個生成樣本;但未公布可重複使用的訓練/驗證分割清單。
格式
短文字樣本、GPT-2 詞元序列、離散碼序列、生成日誌及彙總表。
版本/總和檢查碼
論文未報告資料集校驗和或不可變的 TinyStories 快照識別碼。
資料取得
出版品頁面未同步釋出公開的資料取得指令碼。
使用限制
相關證據涵蓋短篇合成故事,不應視為無限制自然語言生成的基準。

版本

  1. 正式出版版本IEEE / FRUCT, 2026
  2. 會議演講FRUCT 39 簡報
  3. 會議論文集索引FRUCT 39 官方論文集
  4. 會議論文集 PDFFRUCT 開放取用全文
  5. 開啟學術紀錄OpenAlex
  6. 引用圖譜紀錄Semantic Scholar
  7. 作者分享的全文ResearchGate

已發布的 DOI 是主要書目識別符。本頁在各版本間皆維持為唯一的專案標準 URL。