# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/ar/publications/where-quality-breaks/

Document language: ar

مواضع تدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع الاختناق

تشخيص مرحلي لتوليد النصوص القصيرة المضغوطة يفصل خسارة إعادة بناء المُرمِّز–مُفكِّك الترميز عن خسارة التوليد الكامن.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[قراءة البحث كاملًا بصيغة HTML](https://aogavrilov.com/publications/where-quality-breaks/full-text/) نص قابل للبحث، يتضمن المعادلات والجداول والأشكال والمراجع.

المخطوطة النهائية المقبولة (نسخة نشرها المؤلف وتتضمن DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [شروط النشر وإعادة الاستخدام](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## الورقة في 30 ثانية

**سؤال البحث** كيف يمكن عزو تراجع الجودة في مسار توليد النص المضغوط، كلٌّ على حدة، إلى المُرمِّز-مُفكِّك الترميز وإلى المولّد الكامن؟

### المشكلة

في توليد النصوص القصيرة المضغوطة، قد ينشأ ضعف النص المفكوك ترميزه من معلومات فقدها المُرمِّز-مُفكِّك الترميز أو من ضعف التوليد في الفضاء الكامن. تطمس المقاييس من طرف إلى طرف هذين النمطين من الإخفاق، وقد توجّه جهود التحسين إلى المكوّن الخطأ.

### المنهج

يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، ومخرجات MDLM في فضاء الرموز، ومخرجات الانتشار في فضاء الشفرات، باستخدام مُقيِّم خارجي واحد من GPT-2. وتظل مقاييس دفتر الشفرات والهندسة أدوات تشخيصية، لا بدائل لجودة النص بعد فك الترميز.

### النتيجة الرئيسة

ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وسيط الحيرة الخارجية من 15.17 إلى 27.36، وp95 من 25.10 إلى 98.91. ومع ذلك، يخفض MDLM في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بـ MDLM في فضاء الرموز.

### لماذا يهم ذلك؟

تحوّل النتيجة تشخيص اختناق المُرمِّز–مُفكِّك الترميز إلى ترتيب عمل قابل للتنفيذ: أعطِ الأولوية لتحسين هذا المكوّن، ثم قارن التوليد في فضاء الرموز بالتوليد في فضاء الشفرات، ولا تعتدّ بمكاسب المؤشرات البديلة في الفضاء الكامن إلا إذا تحسّن النص بعد فك الترميز أيضًا.

## الملخص

قد تُخفق مولّدات النصوص القصيرة المضغوطة في موضعين مختلفين: فقد يفقد المُرمِّز–مُفكِّك الترميز معلومات قبل بدء التوليد، أو قد ينتج المولّد الكامن شفرات ضعيفة. ومن دون فصل نمطي الإخفاق هذين، قد يهدر الباحثون موارد حاسوبية في تحسين المكوّن الخطأ. ندرس هذه المشكلة في دراسة حالة مضبوطة تضغط نصوص TinyStories من 64 إلى 16، ومبنية على مُرمِّز–مُفكِّك ترميز هرمي من نوع VQ-VAE-2 ومولّد بالانتشار المتقطع المقنّع (MDLM). ونستخدم بروتوكول تحقق مرحليًا يفصل بين أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز، وجودة التوليد الكامن، والتشخيصات المساعدة للفضاء الكامن، باستخدام مُقيِّم خارجي مشترك واحد من GPT-2، مع الإبلاغ عن مقاييس دلالية تكميلية لدراسة الهندسة. في الإعداد المختبَر، ترفع إعادة بناء المُرمِّز–مُفكِّك الترميز وحدها وسيط الحيرة الخارجية من 15.17 إلى 27.36 (+80.4%)، وp95 من 25.10 إلى 98.91 (+294.1%)، مما يدل على أن الخسارة الغالبة في الجودة تظهر قبل بدء التوليد الكامن. وباستخدام المُقيِّم نفسه، يظل MDLM في فضاء الشفرات أقوى بوضوح من الانتشار في فضاء الرموز، إذ يخفض المتوسط والوسيط وp95 بنسب 32.9% و30.9% و36.6% على التوالي. ويحسّن التنظيم المراعي للهندسة المؤشرات البديلة المحلية في الفضاء الكامن، لكنه لا يحسّن مقاييس النص بعد فك الترميز في التشغيلات المتاحة. والإسهام منهجي لا خوارزمي: تقدم الورقة تشخيصًا مرحليًا قابلًا لإعادة الاستخدام لمسار توليد محدد، وتبيّن أن أمانة المُرمِّز–مُفكِّك الترميز، لا إزالة الضوضاء الكامنة، هي التي تحدد سقف الجودة العملي في هذا الإعداد.

منشور في 2026 39th Conference of Open Innovations Association (FRUCT)

نوع الإسهام منهجية التشخيص

28 أبريل 2026 العدد 1 ص 69–76 المؤتمر الرئيس

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## المحتويات في هذه الصفحة

## النتائج الرئيسة

| نقطة التقييم | n | متوسط PPL | وسيط PPL | PPL عند المئين 95 |
| --- | --- | --- | --- | --- |
| النصوص الأصلية | 256 | 16.24 | 15.17 | 25.1 |
| إعادات بناء المُرمِّز–مُفكِّك الترميز | 256 | 37.26 | 27.36 | 98.91 |
| خط أساس AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM في فضاء الرموز | 256 | 44.74 | 38.42 | 93.6 |
| MDLM في فضاء الشفرات | 256 | 30.01 | 26.55 | 59.36 |

**النتيجة الرئيسة.** ينشأ معظم فقدان الجودة المرصود قبل التوليد؛ ومع ذلك، يخفض الانتشار في فضاء الشفرات وسيط الحيرة بنسبة 30.9% مقارنةً بالانتشار في فضاء الرموز.

تنزيل النتائج: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [Markdown](https://aogavrilov.com/publications/where-quality-breaks/results.md) المرآة الخارجية: [بطاقة مجموعة بيانات Hugging Face](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## ملف PDF والاستشهاد المرجعي

**استشهد بهذه الورقة** صيغة BibTeX هي الموصى بها. وتُنشأ جميع الصيغ أدناه من سجل المنشور نفسه.

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

ملفات الاستشهاد: [نص وفق APA](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [نص IEEE](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [بيانات JATS 1.4 الوصفية بصيغة XML](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [النص الكامل بصيغة JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [مجموعة الروابط (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [مجموعة الروابط (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

الدليل الكامل

## الدليل البحثي الكامل

## المنهج

## 

تستخدم الورقة مقيّمًا واحدًا عبر ثلاث مراحل تقييم، بحيث يمكن ربط كل تحويل إضافي بفجوة جودة قابلة للقياس.

1. إعادة البناء رمّز كل عينة من TinyStories بطول 64 وحدة نصية إلى 16 رمزًا عالي المستوى، ثم فك ترميزها فورًا لقياس خسارة إعادة البناء بالمرمِّز–مفكِّك الترميز.
2. توليد ولّد إما وحدات نصية وإما رموزًا كامنة متقطعة باستخدام MDLM، ثم فك ترميز عينات فضاء الرموز عبر المرمِّز–مفكِّك الترميز المدرّب نفسه.
3. قارن قيّم النصوص الأصلية وإعادات البناء والنصوص المولَّدة ببروتوكول GPT-2 الخارجي نفسه، مع تضمين إحصاءات الوسيط والذيل.

![مسار مرحلي لتوليد النص المضغوط يقارن النص الأصلي، وإعادة بناء المُرمِّز–مُفكِّك الترميز، وMDLM في فضاء الشفرات، والنص بعد فك الترميز، بغرض فصل خسارة المُرمِّز–مُفكِّك الترميز عن خسارة التوليد.](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**يفصل التحديد المرحلي لموضع الاختناق خسارة إعادة بناء المُرمِّز-فكّ المُرمِّز عن خسارة التوليد الكامن، وفق بروتوكول مشترك واحد لتقييم النص المفكوك ترميزه.* المصدر: [مخطط توضيحي أعدّه المؤلف استنادًا إلى المنهج والنتائج المنشورة.](https://doi.org/10.23919/FRUCT70069.2026.11506553) . شروط إعادة الاستخدام: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . الإحالة المقترحة: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [تنزيل SVG](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### الفكرة الرئيسة

لا يستطيع مولِّد لاحق استعادة معلومات سبق أن أسقطها المُرمِّز–مُفكِّك الترميز. لذلك يجب تدقيق مرحلة إعادة البناء قبل تفسير نتائج التوليد الكامن.

### الاختلاف عن المقاربات ذات الصلة

تعرض المقارنات القياسية من طرف إلى طرف درجة نهائية واحدة للتوليد. أما هذا البروتوكول فيضيف نقطة تحقق مزدوجة لإعادة البناء، ويفصل مقاييس السلامة في الفضاء الكامن عن الأدلة المستمدة من النص المفكوك ترميزه.

### ما الجديد؟

تتمثل المساهمة في منهجية تشخيص مرحلية قابلة لإعادة الاستخدام لخط أنابيب محدد للنص المضغوط، لا في خوارزمية جديدة لإزالة الضوضاء.

## أسئلة يساعد هذا البحث في الإجابة عنها

## 

افتح سؤالًا للحصول على إجابة موجزة مستندة إلى الورقة. وترد حدود الأدلة المفصلة في قسم القيود.

1. أين تتدهور الجودة في توليد النصوص القصيرة المضغوطة؟ في مسار TinyStories المختبَر ذي الضغط من 64 إلى 16، يظهر التدهور الغالب عند إعادة بناء المُرمِّز-مُفكِّك الترميز، قبل بدء التوليد الكامن. يرتفع وسيط حيرة GPT-2 الخارجية من 15.17 للنص الأصلي إلى 27.36 بعد إعادة البناء، بينما ترتفع p95 من 25.10 إلى 98.91. وهذه نتيجة تخص إعدادًا واحدًا، وليست ترتيبًا عامًا للمُرمِّزات-مُفكِّكات الترميز.
2. كيف يمكن فصل خسارة المُرمِّز-مُفكِّك الترميز عن خسارة التوليد في الفضاء الكامن؟ يقيّم البروتوكول المرحلي النصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز المقترنة بها، والنص النهائي المولّد، باستخدام مُقيِّم خارجي مشترك واحد. وتقدّر الفجوة بين الأصل وإعادة البناء إسهام المُرمِّز–مُفكِّك الترميز، في حين تساعد مقارنة إعادة البناء بالمخرجات المولّدة على تحديد موضع الفقد الإضافي في مرحلة التوليد. وتُعرض مقاييس سلامة التمثيل الكامن منفصلةً عن أدلة النص المفكوك ترميزه.
3. كيف ينبغي تقييم توليد النص ذي التمثيلات الكامنة المتقطعة؟ توصي الورقة بفحص أمانة إعادة البناء قبل مقارنة المولِّدات، وتطبيق مقيّم النص المفكوك ترميزه نفسه في كل مرحلة، والإبلاغ عن إحصاءات المركز والأطراف. كما تتعامل مع استخدام دفتر الشفرات وهندسته وغيرها من المؤشرات الكامنة البديلة بوصفها أدوات تشخيص، لا بدائل عن جودة النص المفكوك ترميزه.
4. هل يتفوق الانتشار في فضاء الرموز على الانتشار في فضاء الوحدات النصية؟ في ظل المُقيِّم المشترك والإعداد المختبَر، يخفض MDLM في فضاء الشفرات متوسط الحيرة ووسيطها وقيمتها عند p95 بنسبة 32.9% و30.9% و36.6%، على التوالي، مقارنةً بـ MDLM في فضاء الرموز. والمقارنة وصفية ومخصوصة بهذا الإعداد؛ فلا تثبت ترتيبًا عامًا عبر مجموعات البيانات أو نسب الضغط أو المُرمِّزات–مُفكِّكات الترميز أو معماريات الانتشار.
5. هل تضمن مقاييس أفضل لهندسة الفضاء الكامن نصًا مولّدًا أفضل؟ لا. في التشغيلات المتطابقة المتاحة، حسّن التنظيم المراعي للهندسة مؤشرات بديلة محلية في الفضاء الكامن، لكنه لم يحسّن مقاييس النص المفكوك الترميز. وتدعم هذه النتيجة تدقيق كل تحسن في المؤشرات البديلة عند المخرج النهائي المفكوك الترميز، واعتبار غياب انتقال التحسن نتيجة سلبية مفيدة لا دليلًا على تحسن التوليد.

## مقارنة بالمقاربات ذات الصلة

## 

| المنهج | التمثيل | التحكم / التشخيص | ما الذي يُحفَظ أو يُقاس؟ |
| --- | --- | --- | --- |
| الانتشار في فضاء الرموز | الرموز النصية | جودة التوليد في فضاء الوحدات النصية | طلاقة التوليد المباشر وسلوك المقيّم |
| التوليد الكامن المضغوط | رموز كامنة متقطعة عبر مرمِّز–مفكِّك ترميز | جودة التوليد النهائية من طرف إلى طرف | السلوك المجمّع للمرمّز ومولّد المتغيرات الكامنة |
| تحديد مرحلي لموضع الاختناق | النص، وعمليات إعادة بناء المُرمِّز-فكّ المُرمِّز، والتمثيلات الكامنة المتقطعة | افصل خسارة المُرمِّز-فكّ المُرمِّز عن خسارة التوليد | موضع تدهور الجودة في ظل مُقيِّم مشترك واحد |

تميّز المقارنة بين نطاق التقييم والأدلة؛ وليست ترتيبًا شاملًا للمقاربات.

## الصلة والنطاق

## 

يفيد البروتوكول المرحلي عندما يضم مسار التوليد مُرمِّزًا–مُفكِّك ترميز متعلَّمًا ومولّدًا يعمل في الفضاء الكامن، بينما يظل مصدر تدهور جودة المخرجات غير واضح.

1. توليد النص المضغوط وبمتغيرات كامنة متقطعة
2. أمانة إعادة بناء المُرمِّز–مُفكِّك الترميز في مسارات التوليد
3. نمذجة اللغة بالانتشار المقنّع في فضاء الشفرة
4. تحديد موضع الاختناق والتقييم المتسق بين المراحل
5. تدقيق تحسينات المقاييس البديلة في الفضاء الكامن بمقارنتها بالنص المفكوك ترميزه

## القيود

## 

- تستخدم الدراسة التجريبية TinyStories فقط.
- يغطي التحليل الرئيس نظام ضغط مكثفًا واحدًا بنسبة 64 إلى 16.
- يجمع النظام المقيَّم بين عائلة واحدة هرمية من مُرمِّزات-فكّ مُرمِّزات VQ-VAE-2 ومولِّد MDLM واحد.
- تستند المقارنات إلى تشغيلات منفردة، وهي وصفية وليست تقديرات إحصائية متعددة البذور.
- تُعد حيرة GPT-2 الخارجية أداة تشخيص مشتركة، وليست مقياسًا عالميًا للجودة الدلالية.
- ينبغي عدم تعميم الاستنتاجات مباشرة على جميع مجموعات البيانات أو معماريات المُرمِّز-فكّ المُرمِّز أو نسب الضغط.

## المراجع التي استشهد بها البحث

## 

تقابل هذه المدخلات قسم المراجع المرقّم في ملف PDF للورقة.

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## الموارد وقابلية إعادة الإنتاج

## 

### بيان البيانات

## الإصدارات

## 

1. **النسخة المنشورة** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **سجل arXiv** [فتح سجل النسخة الأولية، arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **فهرس أبحاث الذكاء الاصطناعي** [صفحة الورقة على Hugging Face مع هوية موثّقة للمؤلف الأول وملخص مرتبط للنتائج](https://huggingface.co/papers/2607.24176)
4. **مخطوطة المؤلف** [ملف PDF محلي متاح نصيًا](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **محاضرة المؤتمر** [عرض FRUCT 39](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **فهرس وقائع المؤتمر** [المجلد الرسمي لـ FRUCT 39](https://fruct.org/publications/volume-39/fruct39)
7. **ملف PDF لوقائع المؤتمر** [النص الكامل المفتوح في FRUCT](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **فتح السجل العلمي** [OpenAlex](https://openalex.org/W7160914887)
9. **سجل مخطط الاستشهادات** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **النص الكامل الذي أتاحه المؤلف** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

يمثل DOI المنشور المعرّف الببليوغرافي الرئيس. وتظل هذه الصفحة عنوان URL المرجعي الوحيد للمشروع عبر الإصدارات.

## منشور ذو صلة

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ar/publications/inspectable-control/)

اقرأ [تشخيص عنق الزجاجة في المرمّز](https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/) دليل البحث. [نبذة عن المؤلف](https://aogavrilov.com/about/) .

### ملاحظات بحثية مركّزة

إجابات مخصّصة للغرض، مع حدود للأدلة وروابط إحالة إلى هذه الورقة.

- [الانتشار المقنّع في فضاء الشفرات مقابل فضاء الرموز: كيف نقارن بينهما؟](https://aogavrilov.com/ar/research-notes/code-space-vs-token-space-masked-diffusion/)
