Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
مواضع تدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع الاختناق
تشخيص مرحلي لتوليد النصوص القصيرة المضغوطة يفصل خسارة إعادة بناء المُرمِّز–مُفكِّك الترميز عن خسارة التوليد الكامن.
قراءة البحث كاملًا بصيغة HTMLنص قابل للبحث، يتضمن المعادلات والجداول والأشكال والمراجع.
المخطوطة النهائية المقبولة (نسخة نشرها المؤلف وتتضمن DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. شروط النشر وإعادة الاستخدام.
الورقة في 30 ثانية
سؤال البحثكيف يمكن عزو تراجع الجودة في مسار توليد النص المضغوط، كلٌّ على حدة، إلى المُرمِّز-مُفكِّك الترميز وإلى المولّد الكامن؟
المشكلة
في توليد النصوص القصيرة المضغوطة، قد ينشأ ضعف النص المفكوك ترميزه من معلومات فقدها المُرمِّز-مُفكِّك الترميز أو من ضعف التوليد في الفضاء الكامن. تطمس المقاييس من طرف إلى طرف هذين النمطين من الإخفاق، وقد توجّه جهود التحسين إلى المكوّن الخطأ.
المنهج
يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، ومخرجات MDLM في فضاء الرموز، ومخرجات الانتشار في فضاء الشفرات، باستخدام مُقيِّم خارجي واحد من GPT-2. وتظل مقاييس دفتر الشفرات والهندسة أدوات تشخيصية، لا بدائل لجودة النص بعد فك الترميز.
النتيجة الرئيسة
ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وسيط الحيرة الخارجية من 15.17 إلى 27.36، وp95 من 25.10 إلى 98.91. ومع ذلك، يخفض MDLM في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بـ MDLM في فضاء الرموز.
لماذا يهم ذلك؟
تحوّل النتيجة تشخيص اختناق المُرمِّز–مُفكِّك الترميز إلى ترتيب عمل قابل للتنفيذ: أعطِ الأولوية لتحسين هذا المكوّن، ثم قارن التوليد في فضاء الرموز بالتوليد في فضاء الشفرات، ولا تعتدّ بمكاسب المؤشرات البديلة في الفضاء الكامن إلا إذا تحسّن النص بعد فك الترميز أيضًا.
الملخص
قد تُخفق مولّدات النصوص القصيرة المضغوطة في موضعين مختلفين: فقد يفقد المُرمِّز–مُفكِّك الترميز معلومات قبل بدء التوليد، أو قد ينتج المولّد الكامن شفرات ضعيفة. ومن دون فصل نمطي الإخفاق هذين، قد يهدر الباحثون موارد حاسوبية في تحسين المكوّن الخطأ. ندرس هذه المشكلة في دراسة حالة مضبوطة تضغط نصوص TinyStories من 64 إلى 16، ومبنية على مُرمِّز–مُفكِّك ترميز هرمي من نوع VQ-VAE-2 ومولّد بالانتشار المتقطع المقنّع (MDLM). ونستخدم بروتوكول تحقق مرحليًا يفصل بين أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز، وجودة التوليد الكامن، والتشخيصات المساعدة للفضاء الكامن، باستخدام مُقيِّم خارجي مشترك واحد من GPT-2، مع الإبلاغ عن مقاييس دلالية تكميلية لدراسة الهندسة. في الإعداد المختبَر، ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وحدها وسيط الحيرة الخارجية من 15.17 إلى 27.36 (+80.4%)، وp95 من 25.10 إلى 98.91 (+294.1%)، مما يدل على أن الخسارة الغالبة في الجودة تظهر قبل بدء التوليد الكامن. وباستخدام المُقيِّم نفسه، يظل MDLM في فضاء الشفرات أقوى بوضوح من الانتشار في فضاء الرموز، إذ يخفض المتوسط والوسيط وp95 بنسب 32.9% و30.9% و36.6% على التوالي. ويحسّن التنظيم المراعي للهندسة المؤشرات البديلة المحلية في الفضاء الكامن، لكنه لا يحسّن مقاييس النص بعد فك الترميز في التشغيلات المتاحة. والإسهام منهجي لا خوارزمي: تقدم الورقة تشخيصًا مرحليًا قابلًا لإعادة الاستخدام لمسار توليد محدد، وتبيّن أن أمانة المُرمِّز–مُفكِّك الترميز، لا إزالة الضوضاء الكامنة، هي التي تحدد سقف الجودة العملي في هذا الإعداد.
منشور في 2026 39th Conference of Open Innovations Association (FRUCT)
نوع الإسهام منهجية التشخيص
العدد 1ص 69–76المؤتمر الرئيس
النتائج الرئيسة
| نقطة التقييم | n | متوسط PPL | وسيط PPL | PPL عند المئين 95 |
|---|---|---|---|---|
| النصوص الأصلية | 256 | 16.24 | 15.17 | 25.1 |
| إعادات بناء المُرمِّز–مُفكِّك الترميز | 256 | 37.26 | 27.36 | 98.91 |
| خط أساس AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM في فضاء الرموز | 256 | 44.74 | 38.42 | 93.6 |
| MDLM في فضاء الشفرات | 256 | 30.01 | 26.55 | 59.36 |
النتيجة الرئيسة. ينشأ معظم فقدان الجودة المرصود قبل التوليد؛ ومع ذلك، يخفض الانتشار في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بالانتشار في فضاء الرموز.
- مجموعة البيانات
- TinyStories
- حجم العينة
- 256 عينة إعادة بناء مقترنة؛ و251–256 عينة مولّدة لكل نمط؛ وأربعة إعدادات هندسية متطابقة.
- المقاييس
- حيرة GPT-2 الخارجية: المتوسط، والوسيط، وp95، والقيمة القصوى؛ واستخدام قاموس الرموز وحجم مجموعة الدعم؛ وSBERT وBERTScore وMAUVE، وملخص مقيّم LLM لتجارب الهندسة
- عدم اليقين
- المقارنات المعلنة عبارة عن تشغيلات مفردة وصفية؛ ولم تُحسب فواصل الثقة أو تقديرات الدلالة متعددة البذور.
- الشروط
- سلاسل وحدات GPT-2 بطول 64، مضغوطة إلى 16 رمزًا عالي المستوى باستخدام VQ-VAE-2 هرمي؛ وتستخدم جميع أوضاع التوليد المقيّم الخارجي المشترك.
تنزيل النتائج:CSVJSONMarkdownالمرآة الخارجية:بطاقة مجموعة بيانات Hugging Face
ملف PDF والاستشهاد المرجعي
استشهد بهذه الورقة صيغة BibTeX هي الموصى بها. وتُنشأ جميع الصيغ أدناه من سجل المنشور نفسه.
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
ملفات الاستشهاد:نص وفق APAنص IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLبيانات JATS 1.4 الوصفية بصيغة XMLالنص الكامل بصيغة JATS 1.4 XMLRDF Turtleمجموعة الروابط (JSON)مجموعة الروابط (HTTP)RO-Crate
الدليل الكامل
الدليل البحثي الكامل
المنهج
تستخدم الورقة مقيّمًا واحدًا عبر ثلاث مراحل تقييم، بحيث يمكن ربط كل تحويل إضافي بفجوة جودة قابلة للقياس.
إعادة البناء
رمّز كل عينة من TinyStories بطول 64 وحدة نصية إلى 16 رمزًا عالي المستوى، ثم فك ترميزها فورًا لقياس خسارة إعادة البناء بالمرمِّز–مفكِّك الترميز.
توليد
ولّد إما وحدات نصية وإما رموزًا كامنة متقطعة باستخدام MDLM، ثم فك ترميز عينات فضاء الرموز عبر المرمِّز–مفكِّك الترميز المدرّب نفسه.
قارن
قيّم النصوص الأصلية وإعادات البناء والنصوص المولَّدة ببروتوكول GPT-2 الخارجي نفسه، مع تضمين إحصاءات الوسيط والذيل.
الفكرة الرئيسة
لا يستطيع مولِّد لاحق استعادة معلومات سبق أن أسقطها المُرمِّز–مُفكِّك الترميز. لذلك يجب تدقيق مرحلة إعادة البناء قبل تفسير نتائج التوليد الكامن.
الاختلاف عن المقاربات ذات الصلة
تعرض المقارنات القياسية من طرف إلى طرف درجة نهائية واحدة للتوليد. أما هذا البروتوكول فيضيف نقطة تحقق مزدوجة لإعادة البناء، ويفصل مقاييس السلامة في الفضاء الكامن عن الأدلة المستمدة من النص المفكوك ترميزه.
ما الجديد؟
تتمثل المساهمة في منهجية تشخيص مرحلية قابلة لإعادة الاستخدام لخط أنابيب محدد للنص المضغوط، لا في خوارزمية جديدة لإزالة الضوضاء.
أسئلة يساعد هذا البحث في الإجابة عنها
افتح سؤالًا للحصول على إجابة موجزة مستندة إلى الورقة. وترد حدود الأدلة المفصلة في قسم القيود.
أين تتدهور الجودة في توليد النصوص القصيرة المضغوطة؟
في مسار TinyStories المختبَر ذي الضغط من 64 إلى 16، يظهر التدهور الغالب عند إعادة بناء المُرمِّز-مُفكِّك الترميز، قبل بدء التوليد الكامن. يرتفع وسيط حيرة GPT-2 الخارجية من 15.17 للنص الأصلي إلى 27.36 بعد إعادة البناء، بينما ترتفع p95 من 25.10 إلى 98.91. وهذه نتيجة تخص إعدادًا واحدًا، وليست ترتيبًا عامًا للمُرمِّزات-مُفكِّكات الترميز.
كيف يمكن فصل خسارة المُرمِّز-مُفكِّك الترميز عن خسارة التوليد في الفضاء الكامن؟
يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، والنص النهائي المولّد، باستخدام مُقيِّم خارجي مشترك واحد. وتقدّر الفجوة بين الأصل وإعادة البناء إسهام المُرمِّز–مُفكِّك الترميز، في حين تساعد مقارنة إعادة البناء بالمخرجات المولّدة على تحديد موضع الفقد الإضافي في مرحلة التوليد. وتُعرض مقاييس سلامة التمثيل الكامن منفصلةً عن أدلة النص المفكوك ترميزه.
كيف ينبغي تقييم توليد النص ذي التمثيلات الكامنة المتقطعة؟
توصي الورقة بفحص أمانة إعادة البناء قبل مقارنة المولِّدات، وتطبيق مقيّم النص المفكوك ترميزه نفسه في كل مرحلة، والإبلاغ عن إحصاءات المركز والأطراف. كما تتعامل مع استخدام دفتر الشفرات وهندسته وغيرها من المؤشرات الكامنة البديلة بوصفها أدوات تشخيص، لا بدائل عن جودة النص المفكوك ترميزه.
هل يتفوق الانتشار في فضاء الرموز على الانتشار في فضاء الوحدات النصية؟
في ظل المُقيِّم المشترك والإعداد المختبَر، يخفض MDLM في فضاء الشفرات متوسط الحيرة ووسيطها وقيمتها عند p95 بنسبة 32.9% و30.9% و36.6%، على التوالي، مقارنةً بـ MDLM في فضاء الرموز. والمقارنة وصفية ومخصوصة بهذا الإعداد؛ فلا تثبت ترتيبًا عامًا عبر مجموعات البيانات أو نسب الضغط أو المُرمِّزات–مُفكِّكات الترميز أو معماريات الانتشار.
هل تضمن مقاييس أفضل لهندسة الفضاء الكامن نصًا مولّدًا أفضل؟
لا. في التشغيلات المتطابقة المتاحة، حسّن التنظيم المراعي للهندسة مؤشرات بديلة محلية في الفضاء الكامن، لكنه لم يحسّن مقاييس النص المفكوك الترميز. وتدعم هذه النتيجة تدقيق كل تحسن في المؤشرات البديلة عند المخرج النهائي المفكوك الترميز، واعتبار غياب انتقال التحسن نتيجة سلبية مفيدة لا دليلًا على تحسن التوليد.
مقارنة بالمقاربات ذات الصلة
| المنهج | التمثيل | التحكم / التشخيص | ما الذي يُحفَظ أو يُقاس؟ |
|---|---|---|---|
| الانتشار في فضاء الرموز | الرموز النصية | جودة التوليد في فضاء الوحدات النصية | طلاقة التوليد المباشر وسلوك المقيّم |
| التوليد الكامن المضغوط | رموز كامنة متقطعة عبر مرمِّز–مفكِّك ترميز | جودة التوليد النهائية من طرف إلى طرف | السلوك المجمّع للمرمّز ومولّد المتغيرات الكامنة |
| تحديد مرحلي لموضع الاختناق | النص، وعمليات إعادة بناء المُرمِّز-فكّ المُرمِّز، والتمثيلات الكامنة المتقطعة | افصل خسارة المُرمِّز-فكّ المُرمِّز عن خسارة التوليد | موضع تدهور الجودة في ظل مُقيِّم مشترك واحد |
تميّز المقارنة بين نطاق التقييم والأدلة؛ وليست ترتيبًا شاملًا للمقاربات.
الصلة والنطاق
يفيد البروتوكول المرحلي عندما يضم مسار التوليد مُرمِّزًا–مُفكِّك ترميز متعلَّمًا ومولّدًا يعمل في الفضاء الكامن، بينما يظل مصدر تدهور جودة المخرجات غير واضح.
توليد النص المضغوط وبمتغيرات كامنة متقطعة
أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز في مسارات التوليد
نمذجة اللغة بالانتشار المقنّع في فضاء الشفرة
تحديد موضع الاختناق والتقييم المتسق بين المراحل
تدقيق تحسينات المقاييس البديلة في الفضاء الكامن بمقارنتها بالنص المفكوك ترميزه
القيود
- تستخدم الدراسة التجريبية TinyStories فقط.
- يغطي التحليل الرئيس نظام ضغط مكثفًا واحدًا بنسبة 64 إلى 16.
- يجمع النظام المقيَّم بين عائلة واحدة هرمية من مُرمِّزات-فكّ مُرمِّزات VQ-VAE-2 ومولِّد MDLM واحد.
- تستند المقارنات إلى تشغيلات منفردة، وهي وصفية وليست تقديرات إحصائية متعددة البذور.
- تُعد حيرة GPT-2 الخارجية أداة تشخيص مشتركة، وليست مقياسًا عالميًا للجودة الدلالية.
- ينبغي عدم تعميم الاستنتاجات مباشرة على جميع مجموعات البيانات أو معماريات المُرمِّز-فكّ المُرمِّز أو نسب الضغط.
المراجع التي استشهد بها البحث
تقابل هذه المدخلات قسم المراجع المرقّم في ملف PDF للورقة.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
الموارد وقابلية إعادة الإنتاج
- الناشر
- IEEE
- ملف PDF محلي للنص
- المخطوطة النهائية المقبولة (نسخة نشرها المؤلف وتتضمن DOI)
- موارد المنشور
- تتوفر هنا المخطوطة العامة وجداول النتائج والشكل التوضيحي وملفات الاستشهاد. أما شفرة التنفيذ ونقاط التحقق فلم تُنشر علنًا.
بيان البيانات
- المصدر
- TinyStories، وفق الوصف الوارد في الورقة.
- الترخيص
- يظل استخدام TinyStories خاضعًا لشروط مجموعة البيانات نفسها؛ ولا يعيد هذا الموقع توزيع أي من ملفاتها.
- المعالجة المسبقة
- تجزئة GPT-2 إلى وحدات، ومدخلات ثابتة بطول 64 وحدة، وضغط زمني هرمي من 64 إلى 32 ثم إلى 16 موضعًا.
- التقسيم
- يفيد المنشور باستخدام 256 عينة مزدوجة لإعادة البناء و251–256 عينة مولَّدة لكل نمط؛ ولا ينشر بيانًا قابلًا لإعادة الاستخدام لتقسيم التدريب/التحقق.
- التنسيق
- عينات نصية قصيرة، ومتتاليات رموز GPT-2، ومتتاليات شفرات متقطعة، وسجلات توليد، وجداول تلخيصية.
- الإصدار / المجموع الاختباري
- لا تورد الورقة قيمة تحقق لمجموعة البيانات ولا معرّف لقطة ثابتة غير قابلة للتغيير لـ TinyStories.
- الحصول على البيانات
- لم يُنشر نص برمجي عام لجلب البيانات مع صفحة المنشور.
- حدود الاستخدام
- تغطي الأدلة قصصًا اصطناعية قصيرة، ولا ينبغي اعتبارها معيارًا مرجعيًا لتوليد اللغة الطبيعية غير المقيّد.
الإصدارات
- النسخة المنشورةIEEE / FRUCT, 2026
- فهرس أبحاث الذكاء الاصطناعيصفحة الورقة على Hugging Face مع هوية موثّقة للمؤلف الأول وملخص مرتبط للنتائج
- مخطوطة المؤلفملف PDF محلي متاح نصيًا
- محاضرة المؤتمرعرض FRUCT 39
- فهرس وقائع المؤتمرالمجلد الرسمي لـ FRUCT 39
- ملف PDF لوقائع المؤتمرالنص الكامل المفتوح في FRUCT
- فتح السجل العلميOpenAlex
- سجل مخطط الاستشهاداتSemantic Scholar
- النص الكامل الذي أتاحه المؤلفResearchGate
يمثل DOI المنشور المعرّف الببليوغرافي الرئيس. وتظل هذه الصفحة عنوان URL المرجعي الوحيد للمشروع عبر الإصدارات.