Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
نقطهٔ فروپاشی کیفیت در تولید متن کوتاهِ فشرده: مکانیابی مرحلهای گلوگاه
تشخیص مرحلهای در تولید متن کوتاهِ فشرده که افت بازسازی کُدک را از افت تولید نهفته جدا میکند.
متن کامل مقاله را در قالب HTML بخوانیدمتن قابل جستوجو همراه با فرمولها، جدولها، شکلها و منابع.
نسخهٔ نهایی پذیرفتهشدهٔ دستنوشته (نسخهٔ منتشرشده بهدست نویسنده، همراه با DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. شرایط انتشار و استفادهٔ مجدد.
مقاله در ۳۰ ثانیه
پرسش پژوهشافت کیفیت در خط لولهٔ فشردهٔ تولید متن را چگونه میتوان بهطور جداگانه به کُدک و مولد نهفته نسبت داد؟
مسئله
در تولید متن کوتاهِ فشرده، کیفیت پایین متن رمزگشاییشده ممکن است از اطلاعات ازدسترفته در کُدک یا ضعف تولید در فضای نهفته ناشی شود. امتیازهای سرتاسری این حالتهای شکست را درهم میآمیزند و ممکن است تلاش بهینهسازی را بهسوی مؤلفهٔ نادرست سوق دهند.
رویکرد
پروتکل مرحلهای، نمونههای اصلی، بازسازیهای متناظر کُدک، خروجیهای MDLM در فضای توکن و خروجیهای پخش در فضای کُد را با یک ارزیاب بیرونی GPT-2 امتیازدهی میکند. سنجههای کتاب کُد و هندسه همچنان ابزار تشخیصیاند، نه جایگزینی برای سنجش کیفیت متن رمزگشاییشده.
نتیجهٔ اصلی
بازسازی کُدک، میانهٔ سرگشتگی بیرونی را از 15.17 به 27.36 و p95 را از 25.10 به 98.91 افزایش میدهد. بااینحال، MDLM در فضای کُد در مقایسه با MDLM در فضای توکن، میانهٔ سرگشتگی را 30.9% کاهش میدهد.
چرا اهمیت دارد
این نتیجه، تشخیص گلوگاه کُدک را به ترتیب کاری عملیاتی تبدیل میکند: ابتدا بهبودهای کُدک را در اولویت قرار دهید، سپس تولید در فضای توکن و فضای کُد را مقایسه کنید و تنها هنگامی به بهبود شاخصهای جانشین نهفته اعتماد کنید که متن رمزگشاییشده نیز بهتر شود.
چکیده
مولدهای فشردهٔ متن کوتاه ممکن است در دو نقطهٔ متفاوت دچار خرابی شوند: کُدک میتواند پیش از آغاز تولید، اطلاعات را از دست بدهد؛ یا مولدِ نهفته کُدهای ضعیفی تولید کند. بدون تفکیک این حالتهای خرابی، پژوهشگران ممکن است توان محاسباتی را صرف بهبود مؤلفهٔ نادرست کنند. این مسئله را در یک مطالعهٔ موردیِ کنترلشدهٔ 64-به-16 روی TinyStories بررسی میکنیم که بر کُدک سلسلهمراتبی VQ-VAE-2 و مولد انتشار گسستهٔ نقابدار (MDLM) بنا شده است. از پروتکل اعتبارسنجی مرحلهای استفاده میکنیم که وفاداری بازسازی کُدک، کیفیت تولید نهفته و تشخیصهای کمکی فضای نهفته را زیر نظر یک ارزیاب بیرونی مشترک GPT-2 از هم جدا میکند؛ همزمان، سنجههای معنایی مکمل را برای مطالعهٔ هندسه گزارش میکنیم. در پیکربندی آزمودهشده، بازسازی کُدک بهتنهایی میانهٔ سرگشتگی بیرونی را از 15.17 به 27.36 (+80.4%) و p95 را از 25.10 به 98.91 (+294.1%) افزایش میدهد؛ این امر نشان میدهد اتلاف غالب کیفیت پیش از آغاز تولید نهفته رخ میدهد. با همان ارزیاب، MDLM در فضای کُد همچنان بهطور محسوسی از انتشار در فضای توکن قویتر است و میانگین، میانه و p95 را بهترتیب 32.9%، 30.9% و 36.6% کاهش میدهد. منظمسازی آگاه از هندسه، سنجههای جانشین موضعیِ فضای نهفته را بهبود میبخشد، اما در اجراهای موجود سنجههای متن رمزگشاییشده را بهتر نمیکند. دستاورد مقاله روششناختی است، نه الگوریتمی: مقاله تشخیصی مرحلهای و بازاستفادهپذیر برای یک خطلولهٔ مشخص ارائه میکند و نشان میدهد که در این محیط، وفاداری کُدک ــ و نه نویززدایی نهفته ــ سقف عملی کیفیت را تعیین میکند.
محل انتشار 2026 39th Conference of Open Innovations Association (FRUCT)
نوع دستاورد روششناسی تشخیصی
شمارهٔ 1صص. 69–76کنفرانس اصلی
نتایج کلیدی
| نقطهٔ ارزیابی | n | میانگین PPL | میانهٔ PPL | صدک 95ام PPL |
|---|---|---|---|---|
| متنهای اصلی | 256 | 16.24 | 15.17 | 25.1 |
| بازسازیهای کُدک | 256 | 37.26 | 27.36 | 98.91 |
| خط پایهٔ AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM در فضای توکن | 256 | 44.74 | 38.42 | 93.6 |
| MDLM در فضای کُد | 256 | 30.01 | 26.55 | 59.36 |
نتیجهٔ کلیدی. بخش عمدهٔ افت کیفیت مشاهدهشده پیش از مرحلهٔ تولید رخ میدهد؛ بااینحال، انتشار در فضای کُد در مقایسه با انتشار در فضای توکن، میانهٔ سرگشتگی را 30.9% کاهش میدهد.
- مجموعهداده
- TinyStories
- اندازهٔ نمونه
- ۲۵۶ نمونهٔ بازسازی جفتشده؛ ۲۵۱ تا ۲۵۶ نمونهٔ تولیدشده در هر حالت؛ چهار تنظیم هندسی همتاسازیشده.
- سنجهها
- سرگشتگیِ محاسبهشده با GPT-2 بیرونی: میانگین، میانه، p95 و بیشینه؛ میزان استفاده از کتاب کُد و اندازهٔ تکیهگاه؛ SBERT، BERTScore، MAUVE و خلاصهٔ داوری LLM برای اجراهای مربوط به هندسه
- عدمقطعیت
- مقایسههای گزارششده اجراهای منفرد توصیفیاند؛ فاصلههای اطمینان و برآوردهای معناداری چندبذری محاسبه نشدهاند.
- شرایط
- دنبالههای توکن GPT-2 با طول 64 که بهوسیلهٔ VQ-VAE-2 سلسلهمراتبی به 16 کد سطحبالا فشرده شدهاند؛ همهٔ حالتهای تولید از امتیازدهندهٔ بیرونی مشترک استفاده میکنند.
دریافت نتایج:CSVJSONمارکداونآینهٔ بیرونی:کارت مجموعهدادهٔ Hugging Face
PDF و استناد
به این مقاله استناد کنید BibTeX قالب پیشنهادی است. همهٔ گونههای زیر از یک رکورد انتشار واحد تولید شدهاند.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
فایلهای استناد:متن APAمتن IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLفرادادهٔ XML با قالب JATS 1.4متن کامل JATS 1.4 XMLRDF Turtleمجموعهپیوند (JSON)مجموعهپیوند (HTTP)RO-Crate
راهنمای کامل
راهنمای کامل پژوهش
روش
مقاله در سه مرحلهٔ ارزیابی از یک امتیازدهنده استفاده میکند تا هر تبدیل افزوده را بتوان به شکاف کیفیتی سنجشپذیر نسبت داد.
بازسازی
هر نمونهٔ 64-توکنی TinyStories را به 16 کد سطحبالا رمزگذاری و بیدرنگ رمزگشایی کنید تا زیان بازسازی کُدک اندازهگیری شود.
تولید
با MDLM توکنهای متن یا کدهای نهفتهٔ گسسته تولید کنید؛ سپس نمونههای فضای کد را با همان کُدک آموزشدیده رمزگشایی کنید.
مقایسه
متنهای اصلی، بازسازیها و متنهای تولیدشده را با پروتکل بیرونی یکسان GPT-2، شامل آمار میانه و دنباله، امتیازدهی کنید.
ایدهٔ کلیدی
مولد پاییندستی نمیتواند اطلاعاتی را بازیابی کند که کُدک پیشتر کنار گذاشته است. بنابراین، پیش از تفسیر نتایج تولید نهفته، باید مرحلهٔ بازسازی ممیزی شود.
تفاوت با رویکردهای نزدیک
مقایسههای استاندارد سرتاسری یک امتیاز نهایی تولید را گزارش میکنند. این پروتکل یک نقطهٔ وارسی بازسازی جفتشده میافزاید و سنجههای سلامت در فضای نهفته را از شواهد مربوط به متن رمزگشاییشده تفکیک میکند.
نوآوری چیست
دستاورد این کار، روشی تشخیصی، مرحلهای و بازاستفادهپذیر برای یک خط لولهٔ مشخص متن فشرده است، نه الگوریتمی جدید برای نویززدایی.
پرسشهایی که این مقاله به پاسخدادن به آنها کمک میکند
برای دریافت پاسخی کوتاه و مستند به مقاله، یکی از پرسشها را باز کنید. مرزهای تفصیلی شواهد در بخش محدودیتها آمدهاند.
کیفیت در تولید فشردهٔ متن کوتاه در کجا افت میکند؟
در خط لولهٔ آزمودهشدهٔ 64-به-16 از TinyStories، افت غالب در مرحلهٔ بازسازی کُدک و پیش از آغاز تولید نهفته رخ میدهد. میانهٔ سرگشتگی خارجی GPT-2 از 15.17 برای متن اصلی به 27.36 پس از بازسازی میرسد، درحالیکه p95 از 25.10 به 98.91 افزایش مییابد. این نتیجه به یک پیکربندی خاص مربوط است و رتبهبندی جهانشمولی برای کُدکها بهشمار نمیآید.
افت کُدک را چگونه میتوان از افت تولید در فضای نهفته تفکیک کرد؟
پروتکل مرحلهای، نمونههای اصلی، بازسازیهای متناظر کُدک و متن نهایی تولیدشده را با یک امتیازدهندهٔ خارجی مشترک ارزیابی میکند. شکاف میان نمونهٔ اصلی و بازسازی، سهم کُدک را برآورد میکند؛ مقایسهٔ بازسازی با خروجی تولیدشده نیز به مکانیابی افتِ افزودهٔ مرحلهٔ تولید کمک میکند. سنجههای سلامت فضای نهفته جدا از شواهد متن رمزگشاییشده گزارش میشوند.
تولید متن با متغیرهای نهفتهٔ گسسته چگونه باید ارزیابی شود؟
مقاله توصیه میکند پیش از مقایسهٔ مولدها، وفاداری بازسازی بررسی شود، در همهٔ مراحل همان امتیازدهندهٔ متن رمزگشاییشده به کار رود و آمار مرکزی و دُم توزیع گزارش شود. همچنین میزان استفاده از کتاب کُد، هندسه و دیگر شاخصهای جانشین نهفته را ابزار تشخیصی میداند، نه جایگزینی برای سنجش کیفیت متن رمزگشاییشده.
آیا انتشار در فضای کد از انتشار در فضای توکن عملکرد بهتری دارد؟
با امتیازدهندهٔ مشترک و تنظیمات آزمودهشده، MDLM در فضای کُد، میانگین، میانه و p95 سرگشتگی را نسبت به MDLM در فضای توکن بهترتیب 32.9%، 30.9% و 36.6% کاهش میدهد. این مقایسه توصیفی و مختص همان پیکربندی است و رتبهبندی همگانی در مجموعهدادهها، نسبتهای فشردهسازی، کُدکها یا معماریهای انتشار را اثبات نمیکند.
آیا معیارهای بهتر هندسهٔ نهفته، متن تولیدشدهٔ بهتر را تضمین میکنند؟
خیر. در اجراهای تطبیقیافتهٔ موجود، منظمسازی آگاه از هندسه سنجههای جانشین محلی در فضای نهفته را بهبود داد، اما سنجههای متن رمزگشاییشده بهتر نشدند. این نتیجه مؤید آن است که هر بهبود در سنجههای جانشین باید در خروجی نهایی رمزگشاییشده ممیزی شود و نبود انتقال، نه شاهدی بر بهبود تولید، بلکه نتیجهای منفی و سودمند تلقی گردد.
مقایسه با رویکردهای نزدیک
| رویکرد | بازنمایی | کنترل / تشخیص | چه چیزی حفظ یا اندازهگیری میشود |
|---|---|---|---|
| انتشار در فضای توکن | توکنهای متن | کیفیت تولید در فضای توکن | روانی و رفتار امتیازدهنده در تولید مستقیم |
| تولید نهفتهٔ فشرده | کدهای نهفتهٔ گسسته با استفاده از کُدک | کیفیت نهایی تولید سرتاسری | رفتار ترکیبی کُدک و مولدِ نهفته |
| مکانیابی مرحلهای گلوگاه | متن، بازسازیهای کُدک و نهفتههای گسسته | زیان کُدک را از زیان تولید جدا کنید | محل افت کیفیت زیر نظر یک امتیازدهندهٔ مشترک |
این مقایسه میان دامنهٔ ارزیابی و شواهد تمایز میگذارد؛ رتبهبندی جهانشمولی از رویکردها نیست.
ارتباط و دامنه
پروتکل مرحلهای زمانی سودمند است که خط لولهٔ مولد هم کُدک آموختهشده و هم مولد فضای نهفته داشته باشد، اما منشأ افت کیفیت خروجی روشن نباشد.
تولید متن فشرده با متغیرهای نهفتهٔ گسسته
وفاداری بازسازی کُدک در خطلولههای مولد
مدلسازی زبان با پخش نقابدار در فضای کُد
مکانیابی گلوگاه و ارزیابی سازگار میان مراحل
ممیزی بهبود شاخصهای جانشین فضای نهفته در برابر متن رمزگشاییشده
محدودیتها
- مطالعهٔ تجربی فقط از TinyStories استفاده میکند.
- تحلیل اصلی یک رژیم فشردهسازی تهاجمی 64 به 16 را پوشش میدهد.
- سامانهٔ ارزیابیشده یک خانوادهٔ کُدک VQ-VAE-2 سلسلهمراتبی را با یک مولد MDLM ترکیب میکند.
- مقایسهها بر اجراهای منفرد استوارند و ماهیتی توصیفی دارند، نه اینکه برآوردهای آماریِ چندبذری باشند.
- سرگشتگیِ محاسبهشده با GPT-2 بیرونی، شاخص تشخیصی مشترک است، نه سنجهای جهانشمول برای کیفیت معنایی.
- نتیجهگیریها نباید مستقیماً به همهٔ مجموعهدادهها، معماریهای کُدک یا نسبتهای فشردهسازی تعمیم داده شوند.
منابع مورد استناد مقاله
این مدخلها با بخش شمارهگذاریشدهٔ References در فایل PDF مقاله متناظرند.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
منابع و بازتولیدپذیری
- ناشر
- IEEE
- منابع انتشار
- نسخهٔ عمومی مقاله، جدولهای نتایج، شکل توضیحی و فایلهای استناد در اینجا در دسترساند. کُد پیادهسازی و نقاط وارسی بهصورت عمومی منتشر نشدهاند.
بیانیهٔ داده
- منبع
- TinyStories، مطابق توصیف مقاله.
- مجوز
- استفاده از TinyStories همچنان تابع شرایط خود مجموعهداده است؛ این وبگاه هیچیک از فایلهای مجموعهداده را بازتوزیع نمیکند.
- پیشپردازش
- توکنسازی GPT-2، ورودیهای ثابت 64-توکنی و فشردهسازی زمانی سلسلهمراتبی از 64 به 32 و سپس 16 موقعیت.
- تفکیک
- این اثر 256 نمونهٔ جفتشدهٔ بازسازی و برای هر حالت 251–256 نمونهٔ تولیدشده گزارش میکند؛ اما فهرست بازاستفادهپذیری از تفکیک آموزش/اعتبارسنجی منتشر نمیکند.
- قالب
- نمونههای متن کوتاه، دنبالههای توکن GPT-2، دنبالههای کُد گسسته، گزارشهای تولید و جدولهای خلاصه.
- نسخه / جمعِ مقابلهای
- در مقاله، سرجمع مقابلهای مجموعهداده یا شناسهٔ تغییرناپذیر اسنپشات TinyStories گزارش نشده است.
- گردآوری
- هیچ اسکریپت عمومی گردآوری همراه صفحهٔ مقاله منتشر نشده است.
- محدودیتهای استفاده
- شواهد، داستانهای مصنوعی کوتاه را پوشش میدهند و نباید معیار ارزیابی تولید نامقید زبان طبیعی تلقی شوند.
نسخهها
- نسخهٔ منتشرشدهIEEE / FRUCT, 2026
- رکورد arXivبازکردن رکورد پیشچاپ، arXiv:2607.24176
- نمایهٔ پژوهش هوش مصنوعیصفحهٔ مقاله در Hugging Face با هویت راستیآزماییشدهٔ نویسندهٔ اول و پیوند به خلاصهٔ نتایج
- دستنوشتهٔ نویسندهPDF محلی با متن دسترسپذیر
- سخنرانی همایشارائهٔ FRUCT 39
- نمایهٔ مجموعهمقالات همایشمجلد رسمی FRUCT 39
- فایل PDF مجموعهمقالات همایشمتن کامل با دسترسی آزاد FRUCT
- بازکردن رکورد علمیOpenAlex
- رکورد گراف استنادSemantic Scholar
- متن کاملِ بهاشتراکگذاشتهشده از سوی نویسندهResearchGate
DOI منتشرشده شناسهٔ اصلی کتابشناختی است. این صفحه در همهٔ نسخهها تنها URL مرجع پروژه باقی میماند.