# कोड-अवकाश विरुद्ध टोकन-अवकाश मुखवटित प्रसरण: त्यांची तुलना कशी करावी

Canonical HTML: https://aogavrilov.com/mr/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: mr

संशोधन टिपण

विविक्त कोडेक हानियुक्त असताना कोड-अवकाश आणि टोकन-अवकाशातील मुखवटित प्रसरण भाषा प्रतिमानांची तुलना करण्यासाठी टप्पा-सुसंगत प्रोटोकॉल.

प्रकाशित 30 जुलै 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

थेट उत्तर

## कोड-अवकाश आणि टोकन-अवकाशातील मुखवटित-विसरण भाषा प्रतिमानांची तुलना कशी करावी?

स्रोत मजकूर, कोडेक पुनर्रचना, टोकन-अवकाश निष्पत्ती आणि विसंकेतित संकेत-अवकाश निष्पत्ती यांचे समान बाह्य गुणांकनकर्ता व पूर्वप्रक्रिया वापरून मूल्यमापन करा. कोडेक पुनर्रचना तफावत स्वतंत्रपणे नोंदवा: कोडेकने आधीच काढून टाकलेली माहिती संकेत-अवकाश निर्मिती परत मिळवू शकत नाही.

## हा भेद महत्त्वाचा का आहे

पद्धत आणि दावा केलेली हमी यांसाठी समान निरीक्षणयोग्य सीमा आवश्यक आहे.

टोकन-अवकाश प्रतिमान थेट मजकूर-टोकन निर्माण करते. संकेतांक-अवकाश प्रतिमान प्रथम विविक्त सुप्त संकेतांक निर्माण करते आणि नंतर मजकूर पुनर्प्राप्त करण्यासाठी विसंकेतकावर अवलंबून राहते. त्यांच्या अंतिम निष्पत्तींची तुलना करता येते; मात्र संकेतांक-अवकाश कार्यप्रवाहात अपयशाचा एक अतिरिक्त बिंदू असतो: सुप्त निर्मिती सुरू होण्यापूर्वीच पुनर्रचना हानी गुणवत्तेची कमाल मर्यादा खाली आणू शकते.

म्हणून न्याय्य तुलनेसाठी एक नव्हे, तर दोन प्रश्न आवश्यक आहेत. प्रथम, कोणतीही निर्मिती न करता कोडेक किती गुणवत्ता जपतो हे विचारा. त्यानंतर, एकाच अपरिवर्तित विसंकेतित-मजकूर मूल्यमापन प्रोटोकॉलअंतर्गत प्रत्येक जनक किती अतिरिक्त हानी घडवतो हे विचारा.

## व्यावहारिक कार्यपद्धती

1. स्रोत आधाररेषा प्रस्थापित करा पुढील प्रत्येक टप्प्यात वापरल्या जाणाऱ्या मूल्यमापक आणि पूर्वप्रक्रियेने राखून ठेवलेल्या स्रोत-मजकुरांचे गुणांकन करा.
2. निर्मितीपूर्वी पुनर्रचनेचे मापन करा नवीन संकेतांचे नमुने न घेता त्याच उदाहरणांचे संकेतन आणि विसंकेतन करा. यामुळे कोडेकने घातलेली कमाल मर्यादा स्वतंत्रपणे स्पष्ट होते.
3. विसंकेतनानंतर दोन्ही निर्मिती-अवकाशांचे मूल्यमापन करा टोकन-अवकाशातील नमुन्यांचे थेट गुणांकन करा आणि कोड-अवकाशातील नमुन्यांचे गुणांकन करण्यापूर्वी त्यांचे विकोडन करा. सुप्त प्रतिनिधी निर्देशकाची तुलना विकोडित-मजकूर मापनाशी करू नका.
4. वितरणे आणि अनिश्चितता नोंदवा मध्यक, वितरणाच्या शेपटीतील वर्तन, नमुना-संख्या, पूर्वप्रक्रिया आणि पुनरावृत्त धावांतील अनिश्चितता दर्शवा. एकच सरासरी गंभीर पुनर्रचना अपयशे लपवू शकते.

## आवश्यक पुरावा

निर्मिती किंवा विसंकेतनानंतर मोजलेल्या गुणधर्माइतकाच एखादा दावा सबळ असतो.

- प्रत्येक तपासणी-बिंदूवर समान बाह्य विकोडित-मजकूर मूल्यमापक आणि पूर्वप्रक्रिया वापरली आहे.
- स्रोत, पुनर्रचना, टोकन-अवकाश आणि विकोडित कोड-अवकाश यांचे निष्कर्ष स्वतंत्रपणे नोंदवले आहेत.
- कोडेक पुनर्रचनेतील तफावत सुप्त जनकामुळे झाली असे मानलेले नाही.
- कोणत्याही सरासरीच्या तुलनेसोबत मध्यक आणि वितरणाच्या शेपटीतील वर्तनही द्या.
- लहान फरकांचे सामान्यीकरण करण्यापूर्वी बीज-मूल्ये किंवा अनिश्चिततेचे अंदाज नोंदवले आहेत.

### जोडलेला अभ्यास काय नोंदवतो

- नोंदवलेल्या 64-to-16 TinyStories मांडणीत, केवळ कोडेक पुनर्रचनेमुळे बाह्य मध्यक संभ्रमता 15.17 वरून 27.36 झाली.
- त्याच गुणदात्याखाली कोड-अवकाश MDLM ची मध्यक संदिग्धता 26.55, तर टोकन-अवकाश आधाररेषेची 38.42 झाली; त्या प्रयोगातील कोड-अवकाश निर्मितीसाठी ही 30.9% घट होती.
- भूमिती-जागरूक नियमितीकरणाने उपलब्ध जुळवलेल्या प्रयोगांतील स्थानिक सुप्त निदान सुधारले; मात्र विसंकेतित मजकुराची मेट्रिक्स सुधारली नाहीत.

[प्रकाशनाचा आढावा वाचा](https://aogavrilov.com/mr/publications/where-quality-breaks/) [शोधनिबंधाच्या संपूर्ण मजकुरात शोधा](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## व्याप्ती-सीमा

- हे आकडे TinyStories ची एक संपीडन व्यवस्था, एक श्रेणीबद्ध कोडेक आणि नोंदवलेली मूल्यमापन मांडणी यांचे वर्णन करतात; ते कोड-अवकाश व टोकन-अवकाश मॉडेलांची सार्वत्रिक क्रमवारी सिद्ध करत नाहीत.
- गोंधळमान माहितीपूर्ण असले, तरी ते अर्थवैज्ञानिक गुणवत्ता, विविधता, तथ्यात्मकता किंवा उपयुक्तता यांचे परिपूर्ण मापन नाही.
- उपलब्ध तुलना त्यांतील नमूद नमुना-आकार आणि अनिश्चिततेच्या मर्यादा लक्षात घेऊन वाचल्या पाहिजेत.

## प्राथमिक आणि संबंधित स्रोत

मूळ पद्धती, मोजमापे आणि नमूद मर्यादांसाठी जोडलेले शोधनिबंध पाहा.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/mr/publications/where-quality-breaks/) मुख्य शोधलेख आणि नोंदवलेली टप्पानिहाय मोजमापे.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) सुप्त निर्मितीकाराने वापरलेली मुखवटित विविक्त विसरणाची मांडणी.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) अध्ययनित विविक्त निरूपणाची पायाभूत पद्धत.

अनुरक्षणकर्ता Alexey Gavrilov . या पृष्ठावर विद्यमान पुराव्याचा सारांश दिला आहे; उद्धृत स्रोतांपलीकडील कोणताही प्रायोगिक निष्कर्ष त्यात जोडलेला नाही.
