# संशोधन प्रकल्प

Canonical HTML: https://aogavrilov.com/mr/projects/

Document language: mr

निरीक्षण करता येणाऱ्या अपयशापासून सुरुवात करा; नंतर त्याला अनुरूप पद्धत, पुरावा आणि व्याप्ती-सीमा अनुसरा.

## आढळलेल्या अपयशानुसार निवड करा

एकच लक्षण प्रतिनिधित्व, निर्मिती, नियंत्रण किंवा सत्यापन यांपैकी कोणत्याही घटकातून उद्भवू शकते.

| निरीक्षित समस्या | प्रथम निदान | आवश्यक पुरावा | पद्धत |
| --- | --- | --- | --- |
| विकोडित निष्पन्न निकृष्ट आहे, परंतु अपयशी टप्पा अज्ञात आहे | स्रोत, त्याची जोडीतली पुनर्रचना आणि निर्मित आउटपुट यांचे एकाच बाह्य मूल्यमापकाने गुणांकन करा. | प्रत्येक टप्प्यावर तुलनीय वितरणे आणि पुच्छ-वर्तन. | [टप्पानिहाय अडथळा निदान](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#workflow) |
| सुप्त-अवकाशातील मापन सुधारते, पण अंतिम गुणवत्ता सुधारत नाही | प्रतिनिधी निर्देशकातील सुधारणा विकोडनानंतरही टिकते का ते तपासा. | केवळ सुप्त निदान नव्हे, तर जोडीनुसार विकोडित-निष्पत्ती मापन निकष. | [प्रतिनिधी-मापन हस्तांतरणाची तपासणी](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#decision-table) |
| कोड संपादक विनंती केलेल्या भागापेक्षा अधिक मजकूर पुन्हा लिहितो | स्पष्ट जतन-सीमा नमूद करा आणि त्या क्षेत्राबाहेरील फरक मोजा. | स्थानिकता आणि कार्यसिद्धी यांचे एकत्रित मापन. | [स्थानिकीकृत-संपादन मूल्यमापन](https://aogavrilov.com/mr/projects/discrete-latent-generation/#measurement) |
| पुनर्रचनेने केवळ वाक्यरचना नव्हे, तर वर्तन जपले पाहिजे | प्रस्ताव, अंमलबजावणी आणि सत्यापन स्वतंत्र ठेवा. | संकलन, चाचण्या, स्थिर तपासण्या आणि पुनर्रचना शोध. | [नियंत्रण-पृष्ठभाग निर्णय नकाशा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#control-surface) |

सक्रिय संशोधन-दिशा

## विविक्त सुप्त निर्मिती

निवडक संकेत-पुनर्निर्मितीसाठी विविक्त निरूपणे; तसेच निर्बंधित निर्मिती, AI-साहाय्यित पुनर्रचना आणि पूर्वानुमेय संकेत-संपादन यांमधील पुराव्याधारित निवडी.

मूल्यमापन मार्गदर्शिका

## कोडेक अडथळ्याचे निदान

विसंकेतित गुणवत्ता पुनर्रचनेमुळे, सुप्त निर्मितीमुळे की अंतिम मजकुरात संक्रमित न होणाऱ्या प्रतिनिधी मापनामुळे मर्यादित होते हे ठरवण्याची टप्पानिहाय पद्धत.

## केंद्रित उत्तरे

शोधनिबंधाच्या शीर्षकापासून सुरू न होणाऱ्या व्यापक शोधांसाठी स्वतंत्र पुरावा-नोंदी. प्रत्येक नोंद संबंधित प्रकाशन आणि संपूर्ण मजकुराकडे परत नेते.

1. [कोड-अवकाश विरुद्ध टोकन-अवकाश मुखवटित प्रसरण: त्यांची तुलना कशी करावी](https://aogavrilov.com/mr/research-notes/code-space-vs-token-space-masked-diffusion/) विविक्त कोडेक हानियुक्त असताना कोड-अवकाश आणि टोकन-अवकाशातील मुखवटित प्रसरण भाषा प्रतिमानांची तुलना करण्यासाठी टप्पा-सुसंगत प्रोटोकॉल.
2. [निर्मितीक्षम प्रतिमानांसह स्थानिकीकृत कोड बदल](https://aogavrilov.com/mr/research-notes/localized-code-modification-generative-models/) निर्मितिक्षम प्रतिमानाला अपेक्षित कोड-बदल करण्याइतके स्वातंत्र्य राखून संपूर्ण फलनाचे अनावश्यक पुनर्लेखन कसे टाळावे.
3. [सॉफ्टवेअर अभियांत्रिकीसाठी निर्बंधित कोड-निर्मिती](https://aogavrilov.com/mr/research-notes/constrained-code-generation-software-engineering/) निर्मित कोडासाठी व्याकरणात्मक निर्बंध, प्रकार-निर्बंध, संरक्षण सीमा आणि वर्तन-स्तरीय स्वीकार तपासण्या यांतील व्यावहारिक भेद.
4. [AI-सहाय्यित पुनर्रचना: पद्धती आणि पुरावे](https://aogavrilov.com/mr/research-notes/ai-assisted-refactoring-evidence/) विश्वसनीय भासणारा निर्मित patch आणि पडताळलेले वर्तन-संरक्षण यांची गल्लत न करता अलीकडील AI-सहाय्यित पुनर्रचना पद्धतींचे मूल्यमापन कसे करावे.
5. [पूर्वानुमेय संहिता-निर्मितीसाठी संरक्षण-करार आवश्यक आहे](https://aogavrilov.com/mr/research-notes/predictable-code-generation-preservation-contract/) नियतात्मक नमुना-निवड पुरेशी का नाही आणि निरीक्षणयोग्य संरक्षित गुणधर्म व स्वीकार-तपासण्या कोड-निर्मितीचे वर्तन चाचणीयोग्य कसे करतात.

## हे संकेतस्थळ ज्या संशोधन प्रश्नांची उत्तरे देऊ शकते

संक्षिप्त उत्तरासाठी एखादा व्यावहारिक प्रश्न उघडा; त्यानंतर पद्धती, मापन आणि मर्यादांसाठी पुराव्याचा दुवा पाहा. हे संशोधनाकडे जाणारे मार्ग आहेत, सार्वत्रिक हमी नव्हेत.

1. संपूर्ण फलन पुन्हा न लिहिता निर्मितिक्षम मॉडेल संकेतामध्ये बदल कसे करू शकते? निर्मितीपूर्वी संपादनाची सीमा निश्चित करा, तिच्याबाहेरील स्रोत जतन करा किंवा पुन्हा वापरा, केवळ संभाव्य बदल निर्माण करा आणि कार्यात अपयशी ठरणारी किंवा संरक्षित प्रदेश बदलणारी निष्पन्ने नाकारा. श्रेणीबद्ध सुप्त कुलूपन हा एक प्रायोगिक नियंत्रण पृष्ठभाग आहे; मात्र तो समान स्रोत-विस्तारांची हमी देत नाही. [स्थानिकीकृत संपादन नियंत्रण पृष्ठभागांची तुलना करा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#control-surface) .
2. कोड-संपादन केवळ वाक्यरचनात्मकदृष्ट्या वैध नसून स्थानिक आहे, हे कोणता पुरावा दाखवतो? विनंती केलेल्या क्षेत्राबाहेरील फरक हा कार्याचे यश, संपादनयोग्य क्षेत्रातील बदल, संरचनात्मक अपरिवर्तनीय गुणधर्म, चाचण्या किंवा स्थिर तपासण्या आणि पुनरावृत्त धावांतील परिवर्तनशीलता यांसह मोजा. केवळ पार्सिंग दरातून फक्त वाक्यरचनात्मक सुगठितता सिद्ध होते. [स्थानिकतेच्या पुराव्याची तपासणी-सूची पाहा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#measurement) .
3. कोड-संपादनाची स्थानिकता आणि निर्मितीतील विविधता यांचा समतोल कसा साधावा? संपादनयोग्य भागातील स्वातंत्र्य आणि उमेदवारांचे अद्वितीयत्व यांसह संरक्षित भागाचे स्थैर्य नोंदवा. इनपुटची प्रत केल्याने कार्यात कोणतीही प्रगती न होताही स्थैर्य कमाल होऊ शकते; निर्बंधरहित पुनर्लेखनामुळे स्थानिकता नष्ट होऊन बदल कमाल होऊ शकतो. [मर्यादित स्थैर्य–स्वातंत्र्य पुरावा पाहा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#evidence) .
4. स्थानिकीकृत कोड संपादन, निर्बंधित निर्मिती आणि प्रोग्राम दुरुस्ती यांत काय फरक आहे? स्थानिकीकृत संपादनात काय अपरिवर्तित राहिले पाहिजे यावर भर असतो; निर्बंधित निर्मिती व्याकरण-सदस्यत्वासारखा औपचारिक निर्गम-गुणधर्म लागू करते; तर प्रोग्राम दुरुस्तीत बदलाने दोष-विनिर्देश किंवा कार्य-विनिर्देश पूर्ण करणे आवश्यक असते. केवळ वाक्यरचना अर्थविषयक समतुल्यता, कार्यात्मक अचूकता, कार्यसिद्धी किंवा स्थानिकता सिद्ध करत नाही. [तीन उद्दिष्टांची तुलना करा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#comparison) .
5. Python फंक्शनचे निवडक भाग पुन्हा निर्माण करताना उर्वरित भाग स्थिर कसे राखता येतील? निर्मितीपूर्वी संरक्षित आणि संपादनक्षम प्रदेश निश्चित करा, केवळ संपादनक्षम निरूपण बदला, विकोडन करा आणि संरक्षित कोड बदलणारे किंवा वाक्यरचना, चाचण्या, स्थिर तपासण्या अथवा कार्य-विशिष्ट अपरिवर्तनीय गुणधर्मांत अपयशी ठरणारे उमेदवार नाकारा. नोंदवलेला श्रेणीबद्ध-सुप्त प्रयोग 64-token फलनांवरील संभाव्यताधारित स्थैर्य मोजतो; तो अपरिवर्तित विस्तारांची किंवा वर्तनाची हमी देत नाही. [निवडक पुनर्निर्मिती कार्यप्रवाहाचे निरीक्षण करा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#workflow) .
6. AI-सहाय्यित वर्तन-जतन करणाऱ्या पुनर्रचनेसाठी कोणती नियंत्रण-रणनीती अनुरूप आहे? रूपांतरण ओळखण्यासाठी किंवा सुचवण्यासाठी मॉडेल वापरा; त्यानंतर शक्य असेल तेथे विश्वासार्ह पुनर्रचना इंजिनाने ते कार्यान्वित करा आणि संकलन, चाचण्या, स्थिर तपासण्या व अभिप्रेत पुनर्रचना पडताळा. विश्वासार्ह भासणारा निर्मित patch हा पुरेसा पुरावा नाही. [पुनर्रचना-निर्णयाची पंक्ती उघडा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#control-surface) .
7. कोड-निर्मिती केवळ नियंत्रणयोग्य न राहता पूर्वानुमानयोग्य कशामुळे होते? जनक निवडण्यापूर्वी निरीक्षणयोग्य जतन-करार आणि स्वीकृती तपासण्या नमूद करा. पूर्वानुमेयता केवळ प्रॉम्प्ट, मुखवटा, व्याकरण किंवा सुप्त कोड स्थिर केला होता का यावर नव्हे, तर विकोडन आणि सत्यापनानंतर काय स्थिर राहते यावर अवलंबून असते. [जतन करार निश्चित करा](https://aogavrilov.com/mr/projects/discrete-latent-generation/#core-idea) .
8. नोंदवलेल्या मजकूर प्रयोगात कोड-अवकाश आणि टोकन-अवकाशातील मुखवटित विसरण यांची तुलना कशी झाली? त्याच बाह्य गुणदात्याखाली कोड-अवकाश MDLM ची मध्यक संदिग्धता 26.55 होती, तर टोकन-अवकाश आधाररेषेची 38.42; म्हणजे 30.9% घट. कोडेक पुनर्रचनेचा मध्यक आधीच 27.36 होता, त्यामुळे पुनर्रचना अडथळ्याच्या संदर्भातच या निकालाचा अर्थ लावला पाहिजे. [नोंदवलेल्या टप्पानिहाय संख्यांचे निरीक्षण करा](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
9. कोडेक हानिकारक असताना कोड-अवकाश आणि टोकन-अवकाशातील मुखवटित विसरण यांची तुलना कशी करावी? मूळ मजकूर, कोडेक पुनर्रचना, टोकन-अवकाश निष्पत्ती आणि कोड-अवकाश निष्पत्ती यांसाठी तेच राखीव नमुने व विकोडित-मजकूर गुणदाता वापरा. पुनर्रचनेतील अंतर स्वतंत्रपणे नोंदवा, कारण अधिक सक्षम सुप्त जनित्रही कोडेकने आधीच काढून टाकलेली माहिती परत मिळवू शकत नाही. [एका गुणांकनकर्त्याखाली टप्प्यांची तुलना करा](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
10. द्वि-टप्पीय मजकूर जनित्रातील गुणवत्तेच्या हानीचे निदान कसे करता येईल? एकाच, अपरिवर्तित विकोडित-मजकूर मूल्यमापकाखाली प्रथम मूळ मजकूर ते पुनर्रचना यांतील अंतर आणि त्यानंतर पुनर्रचना ते निर्मिती यांतील अंतर मोजा. त्यामुळे कोडेकने घातलेली गुणवत्तेची कमाल मर्यादा आणि सुप्त निर्मितीमुळे उद्भवलेली अतिरिक्त अवनती वेगळी ओळखता येते. [चार तपासणी-बिंदूंच्या निदानाचे अनुसरण करा](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#workflow) .
11. सुप्त-अवकाशाची अधिक चांगली मापके विकोडित निष्पत्ती सुधारण्यात केव्हा अपयशी ठरू शकतात? पुढील टप्प्यातील स्वारस्यपूर्ण गुणधर्माचा मागोवा न घेताही सुप्त प्रतिनिधी मापन सुधारू शकते. जुळणाऱ्या निष्पत्ती विसंकेतित करून आणि त्यांचे त्याच अंतिम मापनांनी मूल्यमापन करून संक्रमण तपासा; अन्यथा संकेतांक-पुस्तकाची भूमिती किंवा वापर हे निदानात्मक पुरावेच राहतात, मजकूर-गुणवत्तेतील सुधारणा नव्हे. [प्रतिनिधी-मापक हस्तांतरण निदान वापरा](https://aogavrilov.com/mr/projects/codec-bottleneck-diagnosis/#decision-table) .

## मर्यादित पुराव्याची दोन झलक

हे आकडे काय मोजले गेले ते दर्शवतात; ते मॉडेलच्या सार्वत्रिक हमी नाहीत.

### संपीडन निदान

एका TinyStories 64-to-16 मांडणीत, मध्यक संभ्रमता येथून वाढली **15.17** स्रोत मजकुरासाठी येथपर्यंत **27.36** पुनर्रचनेनंतर. संकेतांक-अवकाशातील MDLM ने ही पातळी गाठली: **26.55** विरुद्ध **38.42** त्याच बाह्य गुणांकनकर्त्याखालील टोकन-अवकाश आधाररेषेसाठी.

### निरीक्षणक्षम संपादन नियंत्रण

एका 64-टोकन Python-फंक्शन मांडणीत, चार सर्वोच्च-स्तरीय कोड कुलूपबंद केल्याने विश्लेषण दर येथून वाढला **0.453** ते **0.591** , तर कुलूपमुक्त स्थाने या दराने बदलली: **0.936** आणि सशर्त नमुने असेच राहिले: **0.998** अद्वितीय.

## हा नकाशा कोणता दावा करत नाही

प्रकाशित प्रयोग अचूक AST जतन, अर्थविषयक समतुल्यता, कार्यात्मक अचूकता, रिपॉझिटरी-स्तरीय दुरुस्ती किंवा कोडेक व जनक अडथळ्यांचा सार्वत्रिक क्रम प्रस्थापित करत नाहीत. मार्गदर्शिका मर्यादित पुराव्याचे पुनर्वापरयोग्य निदान प्रक्रियांत रूपांतर करतात; तरीही प्रत्येक नव्या प्रणालीस स्वतःचे विकोडित-निर्गम आणि वर्तन-स्तरीय सत्यापन आवश्यक आहे.
