Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

مواضع تدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع الاختناق

تشخيص مرحلي لتوليد النصوص القصيرة المضغوطة يفصل خسارة إعادة بناء المُرمِّز–مُفكِّك الترميز عن خسارة التوليد الكامن.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

قراءة البحث كاملًا بصيغة HTMLنص قابل للبحث، يتضمن المعادلات والجداول والأشكال والمراجع.

المخطوطة النهائية المقبولة (نسخة نشرها المؤلف وتتضمن DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. شروط النشر وإعادة الاستخدام.

الورقة في 30 ثانية

سؤال البحثكيف يمكن عزو تراجع الجودة في مسار توليد النص المضغوط، كلٌّ على حدة، إلى المُرمِّز-مُفكِّك الترميز وإلى المولّد الكامن؟

المشكلة

في توليد النصوص القصيرة المضغوطة، قد ينشأ ضعف النص المفكوك ترميزه من معلومات فقدها المُرمِّز-مُفكِّك الترميز أو من ضعف التوليد في الفضاء الكامن. تطمس المقاييس من طرف إلى طرف هذين النمطين من الإخفاق، وقد توجّه جهود التحسين إلى المكوّن الخطأ.

المنهج

يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، ومخرجات MDLM في فضاء الرموز، ومخرجات الانتشار في فضاء الشفرات، باستخدام مُقيِّم خارجي واحد من GPT-2. وتظل مقاييس دفتر الشفرات والهندسة أدوات تشخيصية، لا بدائل لجودة النص بعد فك الترميز.

النتيجة الرئيسة

ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وسيط الحيرة الخارجية من 15.17 إلى 27.36، وp95 من 25.10 إلى 98.91. ومع ذلك، يخفض MDLM في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بـ MDLM في فضاء الرموز.

لماذا يهم ذلك؟

تحوّل النتيجة تشخيص اختناق المُرمِّز–مُفكِّك الترميز إلى ترتيب عمل قابل للتنفيذ: أعطِ الأولوية لتحسين هذا المكوّن، ثم قارن التوليد في فضاء الرموز بالتوليد في فضاء الشفرات، ولا تعتدّ بمكاسب المؤشرات البديلة في الفضاء الكامن إلا إذا تحسّن النص بعد فك الترميز أيضًا.

الملخص

قد تُخفق مولّدات النصوص القصيرة المضغوطة في موضعين مختلفين: فقد يفقد المُرمِّز–مُفكِّك الترميز معلومات قبل بدء التوليد، أو قد ينتج المولّد الكامن شفرات ضعيفة. ومن دون فصل نمطي الإخفاق هذين، قد يهدر الباحثون موارد حاسوبية في تحسين المكوّن الخطأ. ندرس هذه المشكلة في دراسة حالة مضبوطة تضغط نصوص TinyStories من 64 إلى 16، ومبنية على مُرمِّز–مُفكِّك ترميز هرمي من نوع VQ-VAE-2 ومولّد بالانتشار المتقطع المقنّع (MDLM). ونستخدم بروتوكول تحقق مرحليًا يفصل بين أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز، وجودة التوليد الكامن، والتشخيصات المساعدة للفضاء الكامن، باستخدام مُقيِّم خارجي مشترك واحد من GPT-2، مع الإبلاغ عن مقاييس دلالية تكميلية لدراسة الهندسة. في الإعداد المختبَر، ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وحدها وسيط الحيرة الخارجية من 15.17 إلى 27.36 (+80.4%)، وp95 من 25.10 إلى 98.91 (+294.1%)، مما يدل على أن الخسارة الغالبة في الجودة تظهر قبل بدء التوليد الكامن. وباستخدام المُقيِّم نفسه، يظل MDLM في فضاء الشفرات أقوى بوضوح من الانتشار في فضاء الرموز، إذ يخفض المتوسط والوسيط وp95 بنسب 32.9% و30.9% و36.6% على التوالي. ويحسّن التنظيم المراعي للهندسة المؤشرات البديلة المحلية في الفضاء الكامن، لكنه لا يحسّن مقاييس النص بعد فك الترميز في التشغيلات المتاحة. والإسهام منهجي لا خوارزمي: تقدم الورقة تشخيصًا مرحليًا قابلًا لإعادة الاستخدام لمسار توليد محدد، وتبيّن أن أمانة المُرمِّز–مُفكِّك الترميز، لا إزالة الضوضاء الكامنة، هي التي تحدد سقف الجودة العملي في هذا الإعداد.

منشور في 2026 39th Conference of Open Innovations Association (FRUCT)

نوع الإسهام منهجية التشخيص

العدد 1ص 69–76المؤتمر الرئيس

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

مشاركة هذه الورقةمشاركة

النتائج الرئيسة

النتائج الرئيسة لـ «أين تتدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع عنق الزجاجة»
نقطة التقييمnمتوسط PPLوسيط PPLPPL عند المئين 95
النصوص الأصلية25616.2415.1725.1
إعادات بناء المُرمِّز–مُفكِّك الترميز25637.2627.3698.91
خط أساس AR25130.9823.2756.11
MDLM في فضاء الرموز25644.7438.4293.6
MDLM في فضاء الشفرات25630.0126.5559.36

النتيجة الرئيسة. ينشأ معظم فقدان الجودة المرصود قبل التوليد؛ ومع ذلك، يخفض الانتشار في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بالانتشار في فضاء الرموز.

مجموعة البيانات
TinyStories
حجم العينة
256 عينة إعادة بناء مقترنة؛ و251–256 عينة مولّدة لكل نمط؛ وأربعة إعدادات هندسية متطابقة.
المقاييس
حيرة GPT-2 الخارجية: المتوسط، والوسيط، وp95، والقيمة القصوى؛ واستخدام قاموس الرموز وحجم مجموعة الدعم؛ وSBERT وBERTScore وMAUVE، وملخص مقيّم LLM لتجارب الهندسة
عدم اليقين
المقارنات المعلنة عبارة عن تشغيلات مفردة وصفية؛ ولم تُحسب فواصل الثقة أو تقديرات الدلالة متعددة البذور.
الشروط
سلاسل وحدات GPT-2 بطول 64، مضغوطة إلى 16 رمزًا عالي المستوى باستخدام VQ-VAE-2 هرمي؛ وتستخدم جميع أوضاع التوليد المقيّم الخارجي المشترك.

ملف PDF والاستشهاد المرجعي

استشهد بهذه الورقة صيغة BibTeX هي الموصى بها. وتُنشأ جميع الصيغ أدناه من سجل المنشور نفسه.

فتح ملف PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
تنزيل .bib

ملفات الاستشهاد:نص وفق APAنص IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLبيانات JATS 1.4 الوصفية بصيغة XMLالنص الكامل بصيغة JATS 1.4 XMLRDF Turtleمجموعة الروابط (JSON)مجموعة الروابط (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

الدليل الكامل

الدليل البحثي الكامل

المنهج

تستخدم الورقة مقيّمًا واحدًا عبر ثلاث مراحل تقييم، بحيث يمكن ربط كل تحويل إضافي بفجوة جودة قابلة للقياس.

  1. إعادة البناء

    رمّز كل عينة من TinyStories بطول 64 وحدة نصية إلى 16 رمزًا عالي المستوى، ثم فك ترميزها فورًا لقياس خسارة إعادة البناء بالمرمِّز–مفكِّك الترميز.

  2. توليد

    ولّد إما وحدات نصية وإما رموزًا كامنة متقطعة باستخدام MDLM، ثم فك ترميز عينات فضاء الرموز عبر المرمِّز–مفكِّك الترميز المدرّب نفسه.

  3. قارن

    قيّم النصوص الأصلية وإعادات البناء والنصوص المولَّدة ببروتوكول GPT-2 الخارجي نفسه، مع تضمين إحصاءات الوسيط والذيل.

مسار مرحلي لتوليد النص المضغوط يقارن النص الأصلي، وإعادة بناء المُرمِّز–مُفكِّك الترميز، وMDLM في فضاء الشفرات، والنص بعد فك الترميز، بغرض فصل خسارة المُرمِّز–مُفكِّك الترميز عن خسارة التوليد.
يفصل التحديد المرحلي لموضع الاختناق خسارة إعادة بناء المُرمِّز-فكّ المُرمِّز عن خسارة التوليد الكامن، وفق بروتوكول مشترك واحد لتقييم النص المفكوك ترميزه.المصدر: مخطط توضيحي أعدّه المؤلف استنادًا إلى المنهج والنتائج المنشورة..شروط إعادة الاستخدام: CC BY 4.0.الإحالة المقترحة: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. تنزيل SVG.

الفكرة الرئيسة

لا يستطيع مولِّد لاحق استعادة معلومات سبق أن أسقطها المُرمِّز–مُفكِّك الترميز. لذلك يجب تدقيق مرحلة إعادة البناء قبل تفسير نتائج التوليد الكامن.

الاختلاف عن المقاربات ذات الصلة

تعرض المقارنات القياسية من طرف إلى طرف درجة نهائية واحدة للتوليد. أما هذا البروتوكول فيضيف نقطة تحقق مزدوجة لإعادة البناء، ويفصل مقاييس السلامة في الفضاء الكامن عن الأدلة المستمدة من النص المفكوك ترميزه.

ما الجديد؟

تتمثل المساهمة في منهجية تشخيص مرحلية قابلة لإعادة الاستخدام لخط أنابيب محدد للنص المضغوط، لا في خوارزمية جديدة لإزالة الضوضاء.

أسئلة يساعد هذا البحث في الإجابة عنها

افتح سؤالًا للحصول على إجابة موجزة مستندة إلى الورقة. وترد حدود الأدلة المفصلة في قسم القيود.

  1. أين تتدهور الجودة في توليد النصوص القصيرة المضغوطة؟

    في مسار TinyStories المختبَر ذي الضغط من 64 إلى 16، يظهر التدهور الغالب عند إعادة بناء المُرمِّز-مُفكِّك الترميز، قبل بدء التوليد الكامن. يرتفع وسيط حيرة GPT-2 الخارجية من 15.17 للنص الأصلي إلى 27.36 بعد إعادة البناء، بينما ترتفع p95 من 25.10 إلى 98.91. وهذه نتيجة تخص إعدادًا واحدًا، وليست ترتيبًا عامًا للمُرمِّزات-مُفكِّكات الترميز.

  2. كيف يمكن فصل خسارة المُرمِّز-مُفكِّك الترميز عن خسارة التوليد في الفضاء الكامن؟

    يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، والنص النهائي المولّد، باستخدام مُقيِّم خارجي مشترك واحد. وتقدّر الفجوة بين الأصل وإعادة البناء إسهام المُرمِّز–مُفكِّك الترميز، في حين تساعد مقارنة إعادة البناء بالمخرجات المولّدة على تحديد موضع الفقد الإضافي في مرحلة التوليد. وتُعرض مقاييس سلامة التمثيل الكامن منفصلةً عن أدلة النص المفكوك ترميزه.

  3. كيف ينبغي تقييم توليد النص ذي التمثيلات الكامنة المتقطعة؟

    توصي الورقة بفحص أمانة إعادة البناء قبل مقارنة المولِّدات، وتطبيق مقيّم النص المفكوك ترميزه نفسه في كل مرحلة، والإبلاغ عن إحصاءات المركز والأطراف. كما تتعامل مع استخدام دفتر الشفرات وهندسته وغيرها من المؤشرات الكامنة البديلة بوصفها أدوات تشخيص، لا بدائل عن جودة النص المفكوك ترميزه.

  4. هل يتفوق الانتشار في فضاء الرموز على الانتشار في فضاء الوحدات النصية؟

    في ظل المُقيِّم المشترك والإعداد المختبَر، يخفض MDLM في فضاء الشفرات متوسط الحيرة ووسيطها وقيمتها عند p95 بنسبة 32.9% و30.9% و36.6%، على التوالي، مقارنةً بـ MDLM في فضاء الرموز. والمقارنة وصفية ومخصوصة بهذا الإعداد؛ فلا تثبت ترتيبًا عامًا عبر مجموعات البيانات أو نسب الضغط أو المُرمِّزات–مُفكِّكات الترميز أو معماريات الانتشار.

  5. هل تضمن مقاييس أفضل لهندسة الفضاء الكامن نصًا مولّدًا أفضل؟

    لا. في التشغيلات المتطابقة المتاحة، حسّن التنظيم المراعي للهندسة مؤشرات بديلة محلية في الفضاء الكامن، لكنه لم يحسّن مقاييس النص المفكوك الترميز. وتدعم هذه النتيجة تدقيق كل تحسن في المؤشرات البديلة عند المخرج النهائي المفكوك الترميز، واعتبار غياب انتقال التحسن نتيجة سلبية مفيدة لا دليلًا على تحسن التوليد.

مقارنة بالمقاربات ذات الصلة

مقارنة وقائعية بين «أين تتدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع عنق الزجاجة» والمقاربات القريبة
المنهجالتمثيلالتحكم / التشخيصما الذي يُحفَظ أو يُقاس؟
الانتشار في فضاء الرموزالرموز النصيةجودة التوليد في فضاء الوحدات النصيةطلاقة التوليد المباشر وسلوك المقيّم
التوليد الكامن المضغوطرموز كامنة متقطعة عبر مرمِّز–مفكِّك ترميزجودة التوليد النهائية من طرف إلى طرفالسلوك المجمّع للمرمّز ومولّد المتغيرات الكامنة
تحديد مرحلي لموضع الاختناقالنص، وعمليات إعادة بناء المُرمِّز-فكّ المُرمِّز، والتمثيلات الكامنة المتقطعةافصل خسارة المُرمِّز-فكّ المُرمِّز عن خسارة التوليدموضع تدهور الجودة في ظل مُقيِّم مشترك واحد

تميّز المقارنة بين نطاق التقييم والأدلة؛ وليست ترتيبًا شاملًا للمقاربات.

الصلة والنطاق

يفيد البروتوكول المرحلي عندما يضم مسار التوليد مُرمِّزًا–مُفكِّك ترميز متعلَّمًا ومولّدًا يعمل في الفضاء الكامن، بينما يظل مصدر تدهور جودة المخرجات غير واضح.

  1. توليد النص المضغوط وبمتغيرات كامنة متقطعة

  2. أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز في مسارات التوليد

  3. نمذجة اللغة بالانتشار المقنّع في فضاء الشفرة

  4. تحديد موضع الاختناق والتقييم المتسق بين المراحل

  5. تدقيق تحسينات المقاييس البديلة في الفضاء الكامن بمقارنتها بالنص المفكوك ترميزه

اطّلع على القيود وحدود الأدلة

القيود

  • تستخدم الدراسة التجريبية TinyStories فقط.
  • يغطي التحليل الرئيس نظام ضغط مكثفًا واحدًا بنسبة 64 إلى 16.
  • يجمع النظام المقيَّم بين عائلة واحدة هرمية من مُرمِّزات-فكّ مُرمِّزات VQ-VAE-2 ومولِّد MDLM واحد.
  • تستند المقارنات إلى تشغيلات منفردة، وهي وصفية وليست تقديرات إحصائية متعددة البذور.
  • تُعد حيرة GPT-2 الخارجية أداة تشخيص مشتركة، وليست مقياسًا عالميًا للجودة الدلالية.
  • ينبغي عدم تعميم الاستنتاجات مباشرة على جميع مجموعات البيانات أو معماريات المُرمِّز-فكّ المُرمِّز أو نسب الضغط.

المراجع التي استشهد بها البحث

تقابل هذه المدخلات قسم المراجع المرقّم في ملف PDF للورقة.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

الموارد وقابلية إعادة الإنتاج

الناشر
IEEE
موارد المنشور
تتوفر هنا المخطوطة العامة وجداول النتائج والشكل التوضيحي وملفات الاستشهاد. أما شفرة التنفيذ ونقاط التحقق فلم تُنشر علنًا.

بيان البيانات

المصدر
TinyStories، وفق الوصف الوارد في الورقة.
الترخيص
يظل استخدام TinyStories خاضعًا لشروط مجموعة البيانات نفسها؛ ولا يعيد هذا الموقع توزيع أي من ملفاتها.
المعالجة المسبقة
تجزئة GPT-2 إلى وحدات، ومدخلات ثابتة بطول 64 وحدة، وضغط زمني هرمي من 64 إلى 32 ثم إلى 16 موضعًا.
التقسيم
يفيد المنشور باستخدام 256 عينة مزدوجة لإعادة البناء و251–256 عينة مولَّدة لكل نمط؛ ولا ينشر بيانًا قابلًا لإعادة الاستخدام لتقسيم التدريب/التحقق.
التنسيق
عينات نصية قصيرة، ومتتاليات رموز GPT-2، ومتتاليات شفرات متقطعة، وسجلات توليد، وجداول تلخيصية.
الإصدار / المجموع الاختباري
لا تورد الورقة قيمة تحقق لمجموعة البيانات ولا معرّف لقطة ثابتة غير قابلة للتغيير لـ TinyStories.
الحصول على البيانات
لم يُنشر نص برمجي عام لجلب البيانات مع صفحة المنشور.
حدود الاستخدام
تغطي الأدلة قصصًا اصطناعية قصيرة، ولا ينبغي اعتبارها معيارًا مرجعيًا لتوليد اللغة الطبيعية غير المقيّد.

الإصدارات

  1. النسخة المنشورةIEEE / FRUCT, 2026
  2. محاضرة المؤتمرعرض FRUCT 39
  3. فهرس وقائع المؤتمرالمجلد الرسمي لـ FRUCT 39
  4. ملف PDF لوقائع المؤتمرالنص الكامل المفتوح في FRUCT
  5. فتح السجل العلميOpenAlex
  6. سجل مخطط الاستشهاداتSemantic Scholar
  7. النص الكامل الذي أتاحه المؤلفResearchGate

يمثل DOI المنشور المعرّف الببليوغرافي الرئيس. وتظل هذه الصفحة عنوان URL المرجعي الوحيد للمشروع عبر الإصدارات.