# الانتشار المقنّع في فضاء الشفرات مقابل فضاء الرموز: كيف نقارن بينهما؟

Canonical HTML: https://aogavrilov.com/ar/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: ar

مذكرة بحثية

بروتوكول مقارنة متسق بين المراحل لنماذج اللغة بالانتشار المقنّع في فضاء الشفرات وفضاء الرموز عندما يكون المُرمِّز–مُفكِّك الترميز المتقطع فاقدًا للمعلومات.

منشور 30 يوليو 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

إجابة مباشرة

## كيف ينبغي مقارنة نمذجة اللغة بالانتشار المقنّع في فضاء الشيفرات ونظيرتها في فضاء الرموز؟

قيّم النص المصدر، وإعادات بناء المُرمِّز–مُفكِّك الترميز، ومخرجات فضاء الرموز، ومخرجات فضاء الشفرات بعد فك الترميز، باستخدام المُقيِّم الخارجي نفسه والمعالجة المسبقة ذاتها. وأبلغ عن فجوة إعادة بناء المُرمِّز–مُفكِّك الترميز على حدة: فتوليد فضاء الشفرات لا يستطيع استعادة معلومات أزالها المُرمِّز–مُفكِّك الترميز بالفعل.

## لماذا يهم هذا التمييز؟

يحتاج المنهج والضمان المدّعى إلى الحدود القابلة للملاحظة نفسها.

يولّد نموذج فضاء الرموز وحدات النص مباشرةً. أما نموذج فضاء الشفرات فيولّد أولًا شفرات كامنة متقطعة، ثم يعتمد على مُفكِّك ترميز لاستعادة النص. ويمكن مقارنة مخرجاتهما النهائية، لكن مسار فضاء الشفرات يضم موضع إخفاق إضافيًا: فقد تخفض خسارة إعادة البناء سقف الجودة قبل بدء التوليد الكامن.

ومن ثم تتطلب المقارنة العادلة سؤالين لا سؤالًا واحدًا. اسأل أولًا عن مقدار الجودة التي يحفظها المُرمِّز–مُفكِّك الترميز من دون أي توليد، ثم عن مقدار الخسارة الإضافية التي يُدخلها كل مولِّد في ظل بروتوكول واحد ثابت لتقييم النص المفكوك ترميزه.

## إجراء عملي

1. حدّد خط الأساس للنص المصدر قيّم نصوص المصدر المحجوزة باستخدام المقيِّم والمعالجة المسبقة اللذين سيُستخدمان في كل مرحلة لاحقة.
2. قياس إعادة البناء قبل التوليد رمّز الأمثلة نفسها وافكك ترميزها من دون أخذ عينات لرموز جديدة. يعزل ذلك الحد الأعلى الذي يفرضه المرمِّز–مفكِّك الترميز.
3. قيّم فضاءَي التوليد كليهما بعد فك الترميز قيِّم عينات فضاء الرموز مباشرة، وفك ترميز عينات فضاء الشفرة قبل تقييمها. لا تقارن مؤشرًا بديلًا كامنًا بمقياس مطبَّق على النص المفكوك ترميزه.
4. الإبلاغ عن التوزيعات وعدم اليقين اعرض الوسيط وسلوك الأطراف وأعداد العينات والمعالجة المسبقة وعدم اليقين عبر التشغيلات المتكررة. فقد يخفي متوسط واحد إخفاقات جسيمة في إعادة البناء.

## الأدلة الواجب اشتراطها

لا تتجاوز قوة الادعاء قوة الخاصية المقيسة بعد التوليد أو فك الترميز.

- يُستخدم مقيّم النص المفكوك ترميزه الخارجي نفسه والمعالجة المسبقة ذاتها عند كل نقطة تحقق.
- تُعرض نتائج المصدر وإعادة البناء وفضاء الرموز وفضاء الشفرة المفكوك ترميزه كلٌّ على حدة.
- لا تُعزى فجوة إعادة بناء المُرمِّز-فكّ المُرمِّز إلى المولِّد الكامن.
- ينبغي إرفاق سلوك الوسيط والذيل بأي مقارنة للمتوسطات.
- تُذكر البذور أو تقديرات عدم اليقين قبل تعميم الفروق الطفيفة.

### ما الذي تبلّغ عنه الدراسة المرتبطة؟

- في إعداد TinyStories المُبلّغ عنه ذي الضغط من 64 إلى 16، رفعت إعادة بناء المُرمِّز-مُفكِّك الترميز وحدها وسيط الحيرة الخارجية من 15.17 إلى 27.36.
- باستخدام المُقيِّم نفسه، بلغ وسيط الحيرة لـ MDLM في فضاء الشفرات 26.55، فيما بلغ 38.42 لخط الأساس في فضاء الرموز؛ أي إن توليد فضاء الشفرات حقق انخفاضًا قدره 30.9% في تلك التجربة.
- حسّن التنظيم المراعي للهندسة مؤشرات التشخيص الكامنة المحلية في التجارب المتطابقة المتاحة، لكنه لم يحسّن مقاييس النص المفكوك الترميز.

[قراءة النظرة العامة على المنشور](https://aogavrilov.com/ar/publications/where-quality-breaks/) [البحث في النص الكامل للورقة](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## حدود النطاق

- تصف هذه الأرقام نظام ضغط واحدًا لـ TinyStories، ومُرمِّزًا–مُفكِّك ترميز هرميًا واحدًا، وإعداد التقييم المُبلّغ عنه؛ ولا تثبت ترتيبًا عامًا لنماذج فضاء الشفرات ونماذج فضاء الرموز.
- توفر الحيرة معلومات مفيدة، لكنها ليست مقياسًا شاملًا للجودة الدلالية أو التنوع أو الصحة الواقعية أو الفائدة.
- ينبغي قراءة المقارنات المتاحة في ضوء أحجام العينات المعلنة وقيود عدم اليقين.

## المصادر الأساسية والقريبة

ارجع إلى الأوراق المرتبطة للاطلاع على الأساليب والقياسات والقيود المعلنة في مصادرها الأصلية.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/ar/publications/where-quality-breaks/) البحث الأساسي والقياسات المُبلَّغ عنها لكل مرحلة.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) صياغة الانتشار المتقطع المقنّع التي يستخدمها المولّد الكامن.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) منهج تأسيسي لتعلّم التمثيلات المتقطعة.

يتولى صيانته Alexey Gavrilov . تلخّص هذه الصفحة الأدلة القائمة ولا تضيف أي نتيجة تجريبية تتجاوز المصادر المستشهد بها.
