# דיפוזיה ממוסכת במרחב הקוד לעומת מרחב האסימונים: כיצד להשוות ביניהן

Canonical HTML: https://aogavrilov.com/he/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: he

הערת מחקר

פרוטוקול השוואה עקבי בין שלבים למודלי שפה בדיפוזיה ממוסכת במרחב הקוד ובמרחב האסימונים, כאשר הקודק הבדיד מאבד מידע.

פורסם 30 ביולי 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

תשובה ישירה

## כיצד יש להשוות בין מידול שפה בדיפוזיה בדידה ממוסכת במרחב הקוד לבין מידול כזה במרחב האסימונים?

יש להעריך את טקסט המקור, את שחזורי הקודק, את הפלטים במרחב האסימונים ואת הפלטים המפוענחים ממרחב הקוד באמצעות אותו מעריך חיצוני ואותו עיבוד מקדים. את פער השחזור של הקודק יש לדווח בנפרד: יצירה במרחב הקוד אינה יכולה להשיב מידע שהקודק כבר הסיר.

## מדוע ההבחנה חשובה

השיטה והערובה הנטענת מחייבות אותו גבול נצפה.

מודל במרחב הטוקנים יוצר טוקני טקסט ישירות. מודל במרחב הקודים יוצר תחילה קודים לטנטיים בדידים, ואז מסתמך על מפענח לשחזור הטקסט. אפשר להשוות בין הפלטים הסופיים שלהם, אך בצינור מרחב הקודים קיימת נקודת כשל נוספת: אובדן השחזור עלול להנמיך את תקרת האיכות עוד לפני תחילת היצירה הלטנטית.

השוואה הוגנת מחייבת אפוא שתי שאלות, ולא אחת. תחילה יש לשאול כמה מן האיכות הקודק משמר ללא יצירה כלל. לאחר מכן יש לשאול כמה אובדן נוסף מכניס כל מחולל תחת פרוטוקול אחיד וקבוע להערכת הטקסט המפוענח.

## הליך מעשי

1. קביעת קו הבסיס של טקסט המקור יש להעריך טקסטי מקור שהוחזקו בצד באמצעות המעריך והעיבוד המקדים שישמשו בכל שלב מאוחר יותר.
2. יש למדוד את השחזור לפני היצירה יש לקודד ולפענח את אותן הדוגמאות בלי לדגום קודים חדשים. כך אפשר לבודד את תקרת הביצועים שמציב הקודק.
3. הערכת שני מרחבי היצירה לאחר הפענוח יש להעריך דגימות ממרחב האסימונים ישירות, ולפענח דגימות ממרחב הקוד לפני הערכתן. אין להשוות מדד עקיף במרחב הלטנטי למדד המחושב על טקסט מפוענח.
4. דיווח על התפלגויות ואי־ודאות יש להציג את החציון ואת התנהגות הזנבות, את מספר הדגימות, את העיבוד המקדים ואת אי-הוודאות בין הרצות חוזרות. ממוצע יחיד עלול להסתיר כשלי שחזור חמורים.

## הראיות הנדרשות

חוזקה של טענה אינו עולה על חוזקה של התכונה שנמדדה לאחר היצירה או הפענוח.

- בכל נקודת ביקורת נעשה שימוש באותו מעריך חיצוני לטקסט מפוענח ובאותו עיבוד מקדים.
- התוצאות עבור המקור, השחזור, מרחב האסימונים ומרחב הקוד המפוענח מדווחות בנפרד.
- פער שחזור הקודק אינו מיוחס למחולל הלטנטי.
- לכל השוואת ממוצעים יש לצרף את החציון ואת התנהגות הזנבות.
- לפני שמכלילים הבדלים קטנים, מדווחים על זרעי האתחול או על אומדני אי-הוודאות.

### מה מדווח המחקר המקושר

- בתצורת 64-to-16 המדווחת של TinyStories, שחזור הקודק לבדו העלה את חציון המבוכה החיצונית מ־15.17 ל־27.36.
- לפי אותו מעריך, MDLM במרחב הקוד השיג חציון מבוכה של 26.55, ואילו קו הבסיס במרחב האסימונים השיג 38.42 — הפחתה של 30.9% ביצירה במרחב הקוד באותו ניסוי.
- רגולריזציה המודעת לגאומטריה שיפרה מדדי אבחון מקומיים במרחב הסמוי בהרצות המותאמות הזמינות, אך לא שיפרה את מדדי הטקסט המפוענח.

[לקריאת סקירת הפרסום](https://aogavrilov.com/he/publications/where-quality-breaks/) [חיפוש בטקסט המלא של המאמר](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## גבול ההיקף

- מספרים אלה מתארים משטר דחיסה יחיד של TinyStories, קודק היררכי יחיד ואת מערך ההערכה שדווח; הם אינם קובעים דירוג אוניברסלי של מודלים במרחב הקוד ובמרחב האסימונים.
- מבוכה מספקת מידע, אך אינה מדד שלם לאיכות סמנטית, לגיוון, לנכונות עובדתית או לתועלת.
- יש לפרש את ההשוואות הזמינות בהתחשב בגדלי המדגם שצוינו ובמגבלות אי-הוודאות שלהן.

## מקורות ראשיים ומחקרים קרובים

יש לעיין במאמרים המקושרים לקבלת השיטות המקוריות, המדידות והמגבלות המוצהרות.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/he/publications/where-quality-breaks/) המאמר המרכזי והמדידות המדווחות לפי שלבים.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) ניסוח הדיפוזיה הבדידה הממוסכת המשמש את המחולל הלטנטי.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) שיטה יסודית ללמידת ייצוגים בדידים.

מתוחזק בידי Alexey Gavrilov . דף זה מסכם ראיות קיימות ואינו מוסיף תוצאה ניסויית מעבר למקורות המצוטטים.
