# كيفية تحديد ما إذا كان إخفاق مولّد النص المضغوط يقع في المُرمِّز-مُفكِّك الترميز أم في المولّد

Canonical HTML: https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/

Document language: ar

تشخيص عملي للأنظمة ثنائية المرحلة التي تضغط النص أولًا إلى شفرات متقطعة ثم تولّد في فضاء الشفرات. والهدف هو تحديد المرحلة التي تحدّ من جودة المخرجات بعد فك الترميز قبل إنفاق الموارد الحاسوبية على المكوّن غير المسؤول.

منشور 29 يوليو 2026 حُدِّث 30 يوليو 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## الإجابة الموجزة

قيّم النص الأصلي، وإعادة بناء المُرمِّز–فكّ المُرمِّز المقترنة به، والنص النهائي المولَّد باستخدام المقيِّم الخارجي نفسه. تقيس الفجوة بين الأصل وإعادة البناء سقف الجودة المفروض قبل التوليد، ثم تعزل الفجوة بين إعادة البناء والتوليد التدهور الإضافي الذي يحدثه المولِّد الكامن.

**لا تستبدل بالمخرجات المفكوكة الترميز مقياسًا بديلًا في الفضاء الكامن.** قد تمثل هندسة قاموس الترميزات أو درجة استخدامه أو نطاق دعمه الأفضل مؤشرات تشخيصية مفيدة، لكنها لا تثبت تحسن الجودة إلا عندما يتحسن النص المفكوك ترميزه وفق المقاييس النهائية ذات الصلة.

## تشخيص بأربع نقاط تحقق

1. حدّد المرجع قيّم النصوص الأصلية المحجوزة باستخدام المقيِّم الخارجي المستعمل في جميع المراحل اللاحقة.
2. قياس إعادة البناء بالمرمّز–مفكّك الترميز رمّز الأمثلة نفسها وافكك ترميزها من دون توليد. يكشف ذلك المعلومات المفقودة عند عنق الزجاجة.
3. قياس التوليد الكامن ولّد الرموز، وافكك ترميزها، ثم قيّم النص الناتج بالمقيّم نفسه من دون تغيير.
4. دقّق انتقال أثر المقياس البديل قارن تشخيصات الفضاء الكامن بالمقاييس النهائية للنص المفكوك، بدل افتراض انتقال التحسن في المقاييس البديلة.

## كيفية تفسير الفجوات بين المراحل

| النمط المرصود | عنق الزجاجة الأرجح | التجربة التالية |
| --- | --- | --- |
| تحقق النصوص الأصلية درجات جيدة، بينما تتدهور إعادات البناء بشدة | دقة المرمّز | حسّن إعادة البناء أو خفّض الضغط قبل ضبط المولّد |
| تظل إعادات البناء قوية، بينما تتدهور المخرجات المولَّدة | المولّد الكامن | افحص إزالة الضوضاء وأخذ العينات والإشراط وعدم تطابق توزيع الشيفرات |
| تتحسن المؤشرات البديلة الكامنة، بينما تظل مقاييس النص المفكوك ترميزه ثابتة | انتقال المقياس البديل | أعِد تقييم ما إذا كان المقياس البديل يتتبع الخاصية اللاحقة محل الاهتمام |
| تحرز كل مرحلة نتائج ضعيفة | البيانات أو أداة التقييم أو الإعداد التجريبي | تحقق من التوزيع المرجعي والمُقيِّم قبل عزو الإخفاق إلى النموذج |

## ما الذي خلصت إليه دراسة حالة TinyStories المنشورة؟

في [*مواضع تدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع الاختناق*](https://aogavrilov.com/ar/publications/where-quality-breaks/) ، تُضغط النصوص المكوّنة من 64 رمزًا إلى 16 ترميزًا عالي المستوى باستخدام VQ-VAE-2 هرمي. ووفق مقيِّم خارجي واحد من نوع GPT-2، يرتفع وسيط الحيرة من **15.17** للنصوص الأصلية إلى **27.36** لإعادات البناء بالمرمِّز–مفكِّك الترميز، بينما يرتفع p95 من **25.10** إلى **98.91** .

### نمذجة اللغة بالانتشار المقنّع: فضاء الشفرات مقابل فضاء الرموز

تهيمن فجوة إعادة البناء على خط الأنابيب المختبَر. وضمن هذا السقف، تظل نمذجة اللغة بالانتشار المقنّع في فضاء الشفرة (MDLM) أفضل أداءً من MDLM في فضاء الرموز وفق المقيّم المشترك: وسيط الحيرة هو **26.55** مقابل **38.42** ، أي بانخفاض قدره 30.9%.

يحسّن التنظيم المراعي للهندسة المقاييس البديلة الكامنة المحلية في التجارب المتطابقة المتاحة، لكنه لا يحسّن مقاييس النص المفكوك الترميز. وتُعد نتيجة النقل السلبية هذه جزءًا من التشخيص، لا دليلًا على أن المنظِّم حسّن النص النهائي.

## ما الذي ينبغي قياسه في كل مرحلة؟

## الأسئلة البحثية التي يجيب عنها هذا الدليل

تربط هذه الإجابات الموجزة أسئلة التشخيص الشائعة بالأدلة المقيسة في كل مرحلة.

1. كيف تقارن الانتشار المقنّع في فضاء الشيفرات بنظيره في فضاء الرموز ضمن تجربة النص المُبلّغ عنها؟ باستخدام المُقيِّم الخارجي نفسه، بلغ وسيط الحيرة لـ MDLM في فضاء الشفرات 26.55، مقابل 38.42 لخط الأساس في فضاء الرموز، أي بانخفاض قدره 30.9%. وكان وسيط حيرة إعادة بناء المُرمِّز–مُفكِّك الترميز 27.36 أصلًا، لذا يجب تفسير النتيجة في ضوء عنق زجاجة إعادة البناء أيضًا. [افحص الأرقام المُبلّغ عنها لكل مرحلة](https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. كيف ينبغي مقارنة الانتشار المقنّع في فضاء الشيفرات بنظيره في فضاء الرموز عندما يكون المُرمِّز-مُفكِّك الترميز فاقدًا للمعلومات؟ استخدم عينات الاختبار المحجوزة نفسها ومُقيِّم النص المفكوك ترميزه نفسه للنصوص الأصلية، وإعادات بناء المُرمِّز–مُفكِّك الترميز، ومخرجات فضاء الرموز، ومخرجات فضاء الشفرات. وأبلغ عن فجوة إعادة البناء منفصلةً، لأن المولّد الكامن الأقوى لا يستطيع استعادة معلومات أزالها المُرمِّز–مُفكِّك الترميز من قبل. [قارن المراحل باستخدام دالة تقييم واحدة](https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. كيف يمكن تشخيص تراجع الجودة في مولّد نصوص ذي مرحلتين؟ قياس الفجوة بين النص الأصلي وإعادة البناء قبل قياس الفجوة بين إعادة البناء والتوليد، باستخدام مقيّم واحد ثابت للنص المفكوك الترميز. ويفصل ذلك سقف الجودة الذي يفرضه المرمّز–مفكّك الترميز عن التدهور الإضافي الناجم عن التوليد الكامن. [اتبع التشخيص ذا نقاط التحقق الأربع](https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/#workflow) .
4. متى قد تعجز مقاييس الفضاء الكامن الأفضل عن تحسين المخرجات المفكوكة الترميز؟ قد يتحسن مقياس بديل في الفضاء الكامن من دون أن يتتبع الخاصية اللاحقة محل الاهتمام. اختبر قابلية الانتقال بفك ترميز مخرجات متطابقة وتقييمها بالمقاييس النهائية نفسها؛ وإلا ظلّت هندسة قاموس الترميزات أو درجة استخدامه دليلًا تشخيصيًا، لا تحسنًا في جودة النص. [استخدم تشخيص انتقال المؤشر البديل](https://aogavrilov.com/ar/projects/codec-bottleneck-diagnosis/#decision-table) .

## أخطاء التشخيص الشائعة

### مقارنة المخرجات النهائية وحدها

لا تستطيع درجة شاملة من طرف إلى طرف تحديد ما إذا كان التمثيل أم المولِّد هو سبب الخسارة.

### تغيير دوال التقييم بين المراحل

يؤدي اختلاف المقيّمين إلى تعذّر مقارنة الفجوات بين المراحل، ويضعف عزو النتائج إلى أسبابها.

### وصف سلامة دفتر الشفرات بأنها «جودة النص»

قد يتزامن الاستخدام السليم مع إعادات بناء ضعيفة أو توليدات مفكوكة الترميز رديئة.

### تعميم نظام ضغط واحد

تغطي الأدلة المنشورة إعدادًا واحدًا لـ TinyStories بنسبة 64 إلى 16، وتشغيلات مفردة وصفية.

## الخلفية الأساسية

تعرّف هذه المصادر مجموعة البيانات وعائلات النماذج التي تحيل إليها الدراسة التشخيصية.

1. [تعلم التمثيلات العصبية المتقطعة](https://arxiv.org/abs/1711.00937) يقدّم VQ-VAE وعنق الزجاجة المتقطع المتعلَّم الذي تستخدمه المولّدات الكامنة اللاحقة.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) يطوّر تمثيلًا متقطعًا هرميًا ذا مستويات شفرة منفصلة.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) يقدّم مدوّنة القصص القصيرة الاصطناعية المستخدمة في دراسة الحالة التشخيصية.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) يقدّم صياغة التوليد الانتشاري المتقطع المقنّع المستخدمة في المولِّد الكامن.

## حدود الأدلة

المنهج المرحلي قابل لإعادة الاستخدام، لكن الترتيب المُبلّغ عنه لا يصحّ على نحو عام. تستخدم التجربة المنشورة TinyStories، ونظام ضغط شديدًا واحدًا، وعائلة واحدة من المُرمِّزات–مُفكِّكات الترميز الهرمية، ومولّدًا متقطعًا مقنّعًا واحدًا، وتشغيلات مفردة وصفية. طبّق بروتوكول التشخيص على النظام الجديد، ولا تنقل الاستنتاج العددي إلى بيئة مختلفة.

## منشورات ذات صلة

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/ar/publications/where-quality-breaks/)

مواضع تدهور الجودة في توليد النصوص القصيرة المضغوطة: تحديد مرحلي لموضع الاختناق

منهجية التشخيص FRUCT 39 2026 المؤتمر الرئيس

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ar/publications/inspectable-control/)

تحكم قابل للفحص في إعادة توليد البرمجيات مع الحفاظ على البنية

طريقة للتحكم في الفضاء الكامن FSE Companion '26 2026 الملصق المصاحب
