Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

היכן נפגעת האיכות ביצירת טקסט קצר דחוס: איתור מדורג של צוואר הבקבוק

אבחון מדורג של יצירת טקסט קצר דחוס, המפריד בין אובדן שחזור הקודק לבין אובדן יצירה לטנטית.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. אוניברסיטת ITMO, סנקט פטרבורג, רוסיה

לקריאת המאמר המלא ב־HTMLטקסט המאפשר חיפוש וכולל נוסחאות, טבלאות, איורים ומקורות.

כתב היד הסופי שהתקבל (גרסה שהמחבר פרסם ובה DOI). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. תנאי פרסום ושימוש חוזר.

המאמר ב־30 שניות

שאלת מחקרכיצד אפשר לייחס בנפרד את הירידה באיכות בצינור עיבוד דחוס ליצירת טקסט לקודק ולמחולל במרחב הסמוי?

הבעיה

ביצירת טקסט קצר דחוס, איכות ירודה של הטקסט המפוענח עשויה לנבוע ממידע שאבד בקודק או מיצירה חלשה במרחב הלטנטי. מדדים מקצה לקצה מטשטשים את ההבחנה בין אופני הכשל האלה ועלולים להפנות את מאמצי המיטוב לרכיב הלא נכון.

גישה

הפרוטוקול המדורג מעריך באמצעות מעריך GPT-2 חיצוני יחיד את טקסטי המקור, את שחזורי הקודק המזווגים, את פלטי ה־MDLM במרחב האסימונים ואת פלטי הדיפוזיה במרחב הקוד. מדדי ספר הקודים והגאומטריה משמשים לאבחון, ולא תחליף למדידת איכות הטקסט המפוענח.

תוצאה עיקרית

שחזור הקודק מעלה את חציון המבוכה החיצונית מ־15.17 ל־27.36 ואת p95 מ־25.10 ל־98.91. עם זאת, MDLM במרחב הקוד מפחית את חציון המבוכה ב־30.9% לעומת MDLM במרחב האסימונים.

מדוע זה חשוב

התוצאה מתרגמת את אבחון צוואר הבקבוק בקודק לסדר פעולות מעשי: תחילה לשפר את הקודק, אחר כך להשוות בין יצירה במרחב האסימונים ליצירה במרחב הקוד, ולראות בשיפור של מדדים עקיפים במרחב הלטנטי עדות להתקדמות רק אם גם הטקסט המפוענח משתפר.

תקציר

מחוללים של טקסט קצר דחוס עלולים להיכשל בשני שלבים שונים: הקודק עשוי לאבד מידע עוד לפני תחילת היצירה, או שהמחולל הלטנטי עשוי להפיק קודים באיכות ירודה. בלי להפריד בין אופני הכשל האלה, חוקרים עלולים להשקיע משאבי חישוב בשיפור הרכיב הלא נכון. אנו בוחנים את הבעיה בחקר מקרה מבוקר של TinyStories בדחיסה מ־64 ל־16, המבוסס על קודק VQ-VAE-2 היררכי ועל מחולל דיפוזיה בדידה ממוסכת (MDLM). פרוטוקול אימות מדורג מפריד בין נאמנות שחזור הקודק, איכות היצירה הלטנטית ומדדי אבחון מסייעים במרחב הלטנטי, תוך שימוש במעריך GPT-2 חיצוני משותף ודיווח על מדדים סמנטיים משלימים למחקר הגאומטריה. בתצורה שנבדקה, שחזור הקודק לבדו מעלה את חציון המבוכה החיצונית מ־15.17 ל־27.36 (+80.4%) ואת p95 מ־25.10 ל־98.91 (+294.1%); מכאן שעיקר אובדן האיכות מתרחש לפני תחילת היצירה הלטנטית. לפי אותו מעריך, MDLM במרחב הקוד עדיין עדיף במידה ניכרת על דיפוזיה במרחב האסימונים: המבוכה הממוצעת, החציונית ובאחוזון ה־95 נמוכה ב־32.9%, ב־30.9% וב־36.6%, בהתאמה. רגולריזציה מודעת לגאומטריה משפרת מדדים עקיפים מקומיים במרחב הלטנטי, אך אינה משפרת את מדדי הטקסט המפוענח בהרצות הזמינות. התרומה היא מתודולוגית ולא אלגוריתמית: המאמר מציג אבחון מדורג הניתן לשימוש חוזר עבור צינור עיבוד קונקרטי אחד, ומראה כי בתצורה זו נאמנות הקודק, ולא הסרת הרעש במרחב הלטנטי, קובעת את תקרת האיכות המעשית.

פורסם במסגרת הכנס ה־39 של Open Innovations Association ‏(FRUCT), ‏2026

סוג התרומה מתודולוגיית אבחון

גיליון 1עמ' 69–76הכנס הראשי

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

שיתוף מאמר זהשיתוף

תוצאות מרכזיות

התוצאות המרכזיות של „היכן נפגעת האיכות ביצירת טקסט קצר ודחוס: מיקום מדורג של צוואר הבקבוק”
נקודת הערכהnPPL ממוצעחציון PPLאחוזון 95 של PPL
הטקסטים המקוריים25616.2415.1725.1
שחזורי קודק25637.2627.3698.91
קו בסיס AR25130.9823.2756.11
MDLM במרחב האסימונים25644.7438.4293.6
MDLM במרחב הקוד25630.0126.5559.36

תוצאה מרכזית. רוב אובדן האיכות שנצפה מתרחש עוד לפני שלב היצירה; עם זאת, דיפוזיה במרחב הקוד מפחיתה את חציון המבוכה ב־30.9% לעומת דיפוזיה במרחב האסימונים.

מערך נתונים
TinyStories
גודל המדגם
256 דגימות שחזור מזווגות; 251–256 דגימות שנוצרו בכל מצב; ארבע תצורות גאומטריות תואמות.
מדדים
Perplexity חיצוני של GPT-2: ממוצע, חציון, p95 ומקסימום; שיעור השימוש בספר הקודים וגודל התמך; SBERT, BERTScore, MAUVE וסיכום של שופט מבוסס LLM להרצות הגאומטריה
אי-ודאות
ההשוואות המדווחות מבוססות על הרצות יחידות ותיאוריות; לא חושבו רווחי סמך או אומדני מובהקות על פני זרעי אתחול מרובים.
תנאים
רצפי טוקנים של GPT-2 באורך 64 נדחסים ל־16 קודים ברמה העליונה באמצעות VQ-VAE-2 היררכי; כל אופני היצירה משתמשים באותו מעריך חיצוני משותף.

PDF וציטוט ביבליוגרפי

כיצד לצטט מאמר זה BibTeX הוא הפורמט המומלץ. כל הגרסאות שלהלן מופקות מאותה רשומת פרסום.

פתיחת PDF
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
הורדת ‎.bib

קובצי ציטוט:טקסט APAטקסט IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLמטא־נתונים XML בתקן JATS 1.4טקסט מלא בפורמט JATS 1.4 XMLRDF Turtleמערך קישורים (JSON)מערך קישורים (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

המדריך המלא

מדריך המחקר המלא

שיטה

המאמר משתמש במעריך אחד לאורך שלושה שלבי הערכה, כך שניתן לשייך לכל התמרה נוספת פער איכות מדיד.

  1. שחזור

    יש לקודד כל דגימת TinyStories בת 64 טוקנים ל־16 קודים ברמה העליונה ולפענח אותה מיד, כדי למדוד את אובדן השחזור של הקודק.

  2. יצירה

    יש ליצור באמצעות MDLM טוקנים של טקסט או קודים סמויים בדידים, ולאחר מכן לפענח דגימות ממרחב הקוד באמצעות אותו קודק מאומן.

  3. השוואה

    יש להעריך טקסטים מקוריים, שחזורים וטקסטים שנוצרו באמצעות אותו פרוטוקול GPT-2 חיצוני, לרבות סטטיסטיקות חציון וזנבות.

צינור עיבוד מדורג ליצירת טקסט דחוס, המשווה בין הטקסט המקורי, שחזור הקודק, MDLM במרחב הקוד והטקסט המפוענח, כדי להפריד בין אובדן הקודק לאובדן היצירה.
איתור מדורג של צוואר הבקבוק מפריד בין אובדן בשחזור הקודק לאובדן בשלב היצירה הלטנטית, במסגרת פרוטוקול משותף אחד להערכת הטקסט המפוענח.מקור: תרשים הסבר שיצרו המחברים על סמך השיטה והתוצאות שפורסמו..תנאי שימוש חוזר: CC BY 4.0.אזכור מוצע: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. הורדת SVG.

רעיון מרכזי

מחולל המשך אינו יכול לשחזר מידע שהקודק כבר השליך. משום כך יש לבקר את שלב השחזור לפני שמפרשים תוצאות של יצירה לטנטית.

הבדלים מגישות קרובות

השוואות מקצה לקצה מקובלות מדווחות על ציון יצירה סופי יחיד. פרוטוקול זה מוסיף נקודת ביקורת זוגית לשחזור ומפריד בין מדדי תקינות במרחב הלטנטי לבין ראיות מן הטקסט המפוענח.

מה חדש

התרומה היא מתודולוגיית אבחון מדורגת וניתנת לשימוש חוזר עבור צינור עיבוד ממשי אחד של טקסט דחוס, ולא אלגוריתם חדש להסרת רעש.

שאלות שמאמר זה מסייע להשיב עליהן

פתחו שאלה לקבלת תשובה תמציתית המעוגנת במאמר. גבולות הראיות המפורטים מופיעים בסעיף המגבלות.

  1. היכן נפגעת האיכות ביצירת טקסט קצר ודחוס?

    בצינור העיבוד 64-to-16 של TinyStories שנבדק, עיקר הירידה באיכות מופיע בשחזור הקודק, עוד לפני תחילת היצירה במרחב הסמוי. חציון המבוכה החיצונית של GPT-2 עולה מ־15.17 בטקסט המקורי ל־27.36 לאחר השחזור, ואילו p95 עולה מ־25.10 ל־98.91. זוהי תוצאה של תצורה אחת, ולא דירוג אוניברסלי של קודקים.

  2. כיצד אפשר להפריד בין אובדן הקודק לבין אובדן היצירה במרחב הסמוי?

    הפרוטוקול המדורג מעריך טקסטים מקוריים, שחזורי קודק מזווגים וטקסט סופי שנוצר באמצעות מעריך חיצוני משותף אחד. הפער בין המקור לשחזור אומד את תרומת הקודק, ואילו ההשוואה בין השחזור לפלט שנוצר מסייעת למקם את אובדן היצירה הנוסף. מדדי תקינות של הייצוג החבוי מדווחים בנפרד מן הראיות המבוססות על הטקסט המפוענח.

  3. כיצד יש להעריך יצירת טקסט באמצעות ייצוגים סמויים בדידים?

    המאמר ממליץ לבדוק את נאמנות השחזור לפני השוואת מחוללים, להחיל בכל שלב אותו מעריך לטקסט מפוענח ולדווח על סטטיסטיקות מרכז וזנבות. כמו כן, הוא מתייחס לשימוש בספר הקודים, לגאומטריה ולמדדים לטנטיים עקיפים אחרים כאמצעי אבחון, ולא כתחליף לאיכות הטקסט המפוענח.

  4. האם דיפוזיה במרחב הקוד עולה בביצועיה על דיפוזיה במרחב הטוקנים?

    לפי המעריך המשותף ובמערך שנבדק, MDLM במרחב הקוד מפחית את המבוכה הממוצעת, החציונית ובאחוזון p95 ב-32.9%, ב-30.9% וב-36.6%, בהתאמה, ביחס ל-MDLM במרחב האסימונים. ההשוואה תיאורית וייחודית לתצורה: היא אינה קובעת דירוג אוניברסלי בין מערכי נתונים, יחסי דחיסה, קודקים או ארכיטקטורות דיפוזיה.

  5. האם מדדי גאומטריה טובים יותר במרחב הסמוי מבטיחים טקסט מיוצר טוב יותר?

    לא. בהרצות המותאמות הזמינות, רגולריזציה מודעת לגאומטריה שיפרה מדדי קירוב מקומיים במרחב הלטנטי, אך לא שיפרה את מדדי הטקסט המפוענח. התוצאה מצדיקה בחינה של כל שיפור במדד קירוב בפלט המפוענח הסופי, והתייחסות להיעדר ההעברה כתוצאה שלילית מועילה ולא כראיה לשיפור ביצירה.

השוואה לגישות קרובות

השוואה עובדתית בין „היכן נפגעת האיכות ביצירת טקסט קצר ודחוס: מיקום מדורג של צוואר הבקבוק” לבין גישות קרובות
גישהייצוגשליטה / אבחוןמה נשמר או נמדד
דיפוזיה במרחב האסימוניםאסימוני טקסטאיכות היצירה במרחב הטוקניםשטף הטקסט והתנהגות המעריך ביצירה ישירה
יצירה לטנטית דחוסהקודים סמויים בדידים באמצעות קודקהאיכות הסופית של היצירה מקצה לקצהההתנהגות המשולבת של הקודק ושל המחולל הלטנטי
איתור מדורג של צוואר הבקבוקטקסט, שחזורי קודק ומשתנים לטנטיים בדידיםיש להפריד בין אובדן הקודק לאובדן היצירההיכן האיכות יורדת לפי מעריך משותף יחיד

ההשוואה מבחינה בין תחולת ההערכה לבין הראיות; אין מדובר בדירוג אוניברסלי של הגישות.

רלוונטיות והיקף

הפרוטוקול המדורג מועיל כאשר צינור יצירה כולל הן קודק נלמד והן מחולל במרחב חבוי, אך המקור לירידה באיכות הפלט אינו ברור.

  1. יצירת טקסט דחוסה באמצעות משתנים לטנטיים בדידים

  2. נאמנות שחזור הקודק בצינורות יצירה

  3. מידול שפה באמצעות דיפוזיה ממוסכת במרחב הקוד

  4. איתור צוואר הבקבוק והערכה עקבית בין שלבים

  5. ביקורת שיפורים במדדים עקיפים במרחב הלטנטי כנגד הטקסט המפוענח

לעיון במגבלות ובגבולות הראיות

מגבלות

  • המחקר האמפירי מתבסס על TinyStories בלבד.
  • הניתוח העיקרי עוסק במשטר דחיסה אגרסיבי אחד, מ-64 ל-16.
  • המערכת המוערכת משלבת משפחת קודק היררכית אחת מסוג VQ-VAE-2 עם מחולל MDLM אחד.
  • ההשוואות מבוססות על הרצות יחידות והן תיאוריות, ולא אומדנים סטטיסטיים מרובי־זרעים.
  • Perplexity חיצוני של GPT-2 הוא כלי אבחון משותף, ולא מדד אוניברסלי לאיכות סמנטית.
  • אין להחיל את המסקנות במישרין על כל מערכי הנתונים, ארכיטקטורות הקודק או יחסי הדחיסה.

מקורות המצוטטים במאמר

רשומות אלה תואמות לסעיפים הממוספרים בפרק References בקובץ ה-PDF של המאמר.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

משאבים ויכולת שחזור

מוציא לאור
IEEE
משאבי הפרסום
כתב היד הפומבי, טבלאות התוצאות, האיור המסביר וקובצי הציטוט זמינים כאן. קוד המימוש ונקודות הביקורת לא פורסמו לציבור.

הצהרת נתונים

מקור
TinyStories, כפי שהוא מתואר במאמר.
רישיון
השימוש ב-TinyStories כפוף לתנאים של מערך הנתונים עצמו; אתר זה אינו מפיץ מחדש קבצים ממערך הנתונים.
עיבוד מקדים
טוקניזציה של GPT-2, קלטים קבועים בני 64 טוקנים ודחיסה זמנית היררכית מ־64 ל־32 ול־16 מיקומים.
פיצול
הפרסום מדווח על 256 דגימות שחזור מזווגות ועל 251–256 דגימות שנוצרו בכל מצב; הוא אינו מפרסם מניפסט ניתן לשימוש חוזר של חלוקת אימון/אימות.
פורמט
דגימות טקסט קצר, רצפי אסימונים של GPT-2, רצפי קוד בדידים, יומני יצירה וטבלאות סיכום.
גרסה / סיכום ביקורת
במאמר לא דווחו סיכום ביקורת של מערך הנתונים או מזהה תמונת מצב בלתי־ניתנת לשינוי של TinyStories.
איסוף
סקריפט איסוף ציבורי אינו מופץ לצד דף הפרסום.
מגבלות שימוש
הראיות נוגעות לסיפורים סינתטיים קצרים, ואין לראות בהן אמת מידה ליצירת שפה טבעית ללא הגבלות.

גרסאות

  1. גרסה שפורסמהIEEE / FRUCT, 2026
  2. כתב יד של המחבריםPDF מקומי הנגיש כטקסט
  3. הרצאה בכנסמצגת FRUCT 39
  4. מפתח קובץ מאמרי הכנסהכרך הרשמי של FRUCT 39
  5. PDF של קובץ מאמרי הכנסהטקסט המלא בגישה פתוחה של FRUCT
  6. פתיחת הרשומה האקדמיתOpenAlex
  7. רשומת גרף ציטוטיםSemantic Scholar
  8. טקסט מלא ששיתפו המחבריםResearchGate

ה-DOI שפורסם הוא המזהה הביבליוגרפי העיקרי. עמוד זה נותר כתובת ה-URL הקנונית היחידה של הפרויקט בכל הגרסאות.