# ஆராய்ச்சித் திட்டங்கள்

Canonical HTML: https://aogavrilov.com/ta/projects/

Document language: ta

நீங்கள் கவனிக்கக்கூடிய தோல்வியிலிருந்து தொடங்கி, அதற்குப் பொருந்தும் முறை, சான்று, செயலெல்லை ஆகியவற்றைப் பின்பற்றுக.

## நீங்கள் காணும் தோல்வியின் அடிப்படையில் தேர்ந்தெடுக்கவும்

ஒரே அறிகுறி பிரதிநிதித்துவம், உருவாக்கம், கட்டுப்பாடு அல்லது சரிபார்ப்பு ஆகியவற்றில் எதிலிருந்தும் தோன்றலாம்.

| காணப்பட்ட சிக்கல் | முதல் கண்டறிதல் ஆய்வு | தேவைப்படுத்த வேண்டிய ஆதாரம் | முறை |
| --- | --- | --- | --- |
| குறிவிலக்கப்பட்ட வெளியீடு தரமற்றது; ஆனால் தோல்வியுறும் கட்டம் தெரியவில்லை | ஒரே வெளிப்புற மதிப்பீட்டாளரைக் கொண்டு மூலம், அதனுடன் இணையான மறுகட்டமைப்பு, மற்றும் உருவாக்கப்பட்ட வெளியீடு ஆகியவற்றுக்கு மதிப்பெண் வழங்கவும். | ஒவ்வொரு கட்டத்திலும் ஒப்பிடத்தக்க பரவல்களும் வால் நடத்தையும். | [படிநிலையான இடையூறு நோயறிதல்](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#workflow) |
| மறைநிலை வெளி அளவீடு மேம்படுகிறது; ஆனால் இறுதித் தரம் மேம்படவில்லை | பதிலீட்டு அளவீட்டின் முன்னேற்றம் குறிவிலக்கத்திற்குப் பின்னரும் தொடர்கிறதா எனச் சோதிக்கவும். | இணைசேர்க்கப்பட்ட குறிவிலக்கப்பட்ட-வெளியீட்டு அளவீடுகள் தேவை; மறைநிலை நோயறிதல்கள் மட்டும் போதாது. | [பதிலிக் குறியீட்டு மாற்றச் சரிபார்ப்பு](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#decision-table) |
| குறியீட்டுத் திருத்தி கோரப்பட்ட பகுதிக்கு அதிகமாக மீண்டும் எழுதுகிறது | வெளிப்படையான பேணல் எல்லையைக் கூறி, அதற்கு வெளியிலுள்ள பகுதியின் diff-ஐ அளவிடுக. | இடம்சார் தன்மையும் பணிவெற்றியும் இணைத்து அளவிடப்படுகின்றன. | [இடம்சார் திருத்த மதிப்பீடு](https://aogavrilov.com/ta/projects/discrete-latent-generation/#measurement) |
| மறுகாரணியாக்கம் தொடரியலை மட்டுமல்ல, நடத்தையையும் பாதுகாக்க வேண்டும் | முன்மொழிவைச் செயலாக்கம் மற்றும் சரிபார்ப்பிலிருந்து பிரித்திடுக. | தொகுத்தல், சோதனைகள், நிலைச் சோதனைகள் மற்றும் மறுகட்டமைப்பைக் கண்டறிதல். | [கட்டுப்பாட்டுத் தள முடிவு வரைபடம்](https://aogavrilov.com/ta/projects/discrete-latent-generation/#control-surface) |

செயலில் உள்ள ஆய்வுத்திசை

## தனித்த மறைநிலை உருவாக்கம்

தேர்ந்தெடுக்கப்பட்ட நிரற்குறி மறுஉருவாக்கத்திற்கான தனித்த பிரதிநிதித்துவங்களுடன், கட்டுப்படுத்தப்பட்ட உருவாக்கம், AI-உதவிய மறுகாரணியாக்கம், முன்கணிக்கத்தக்க நிரற்குறித் திருத்தம் ஆகியவற்றில் ஆதார வழிகாட்டுதலுடன் தேர்வுசெய்தல்.

மதிப்பீட்டு வழிகாட்டி

## கோடெக் இடர்ப்புள்ளி நோயறிதல்

குறிவிலக்கப்பட்ட தரத்தை மீள்கட்டமைப்பா, மறைநிலை உருவாக்கமா, அல்லது இறுதி உரைக்கு மாற்றுப்பயன் தராத பதிலளவீடா வரம்பிடுகிறது எனத் தீர்மானிப்பதற்கான படிநிலை முறை.

## குவிமையப் பதில்கள்

கட்டுரைத் தலைப்பிலிருந்து தொடங்காத விரிவான தேடல்களுக்கான தனித்த சான்றுக் குறிப்புகள். ஒவ்வொன்றும் தொடர்புடைய வெளியீட்டுக்கும் முழு உரைக்கும் மீண்டும் வழிகாட்டுகிறது.

1. [குறியீட்டு வெளி–டோக்கன் வெளி முகமூடி விரவல்: எவ்வாறு ஒப்பிடுவது?](https://aogavrilov.com/ta/research-notes/code-space-vs-token-space-masked-diffusion/) தனித்த கோடெக் தகவலிழப்புடையதாக இருக்கும்போது, குறியீட்டு வெளி மற்றும் டோக்கன் வெளி முகமூடி விரவல் மொழி மாதிரிகளை ஒரே கட்டங்களில் ஒப்பிடுவதற்கான நெறிமுறை.
2. [உருவாக்க மாதிரிகளைக் கொண்டு இடம்சார் நிரற்குறி மாற்றம்](https://aogavrilov.com/ta/research-notes/localized-code-modification-generative-models/) கோரப்பட்ட நிரற்குறி மாற்றத்தைச் செய்ய உருவாக்க மாதிரிக்குப் போதிய சுதந்திரம் அளித்தபடியே, முழுச் செயல்கூற்றையும் தேவையின்றி மறுஎழுதுவதைத் தடுப்பது எப்படி.
3. [மென்பொருள் பொறியியலுக்கான கட்டுப்படுத்தப்பட்ட நிரல் உருவாக்கம்](https://aogavrilov.com/ta/research-notes/constrained-code-generation-software-engineering/) உருவாக்கப்பட்ட நிரற்குறிக்கான இலக்கணக் கட்டுப்பாடுகள், வகைக் கட்டுப்பாடுகள், பேணல் எல்லைகள், நடத்தைநிலை ஏற்புச் சரிபார்ப்புகள் ஆகியவற்றுக்கு இடையிலான நடைமுறை வேறுபாடு.
4. [AI உதவியுடனான மறுகட்டமைப்பு: முறைகளும் சான்றுகளும்](https://aogavrilov.com/ta/research-notes/ai-assisted-refactoring-evidence/) நம்பத்தகுந்ததாகத் தோன்றும் உருவாக்கப்பட்ட ஒட்டினை, சரிபார்க்கப்பட்ட நடத்தைப் பேணலாகத் தவறாகக் கருதாமல், அண்மைய AI உதவியுடனான மறுகட்டமைப்பு முறைகளை மதிப்பிடுவது எப்படி.
5. [முன்கணிக்கத்தக்க நிரல் உருவாக்கத்திற்குப் பேணல் ஒப்பந்தம் தேவை](https://aogavrilov.com/ta/research-notes/predictable-code-generation-preservation-contract/) தீர்மானகரமான மாதிரியெடுத்தல் மட்டும் ஏன் போதாது என்பதையும், அவதானிக்கக்கூடிய பாதுகாக்கப்பட்ட பண்புகளும் ஏற்புச் சரிபார்ப்புகளும் நிரல் உருவாக்க நடத்தையை எவ்வாறு சோதிக்கத்தக்கதாக்குகின்றன என்பதையும் விளக்குகிறது.

## இந்தத் தளம் விடையளிக்கக்கூடிய ஆராய்ச்சிக் கேள்விகள்

சுருக்கமான விடையைப் பெற ஒரு நடைமுறைக் கேள்வியைத் திறந்து, பின்னர் முறைகள், அளவீடுகள், வரம்புகள் ஆகியவற்றுக்கான சான்று இணைப்பைப் பின்தொடர்க. இவை ஆய்வை அணுகும் வழிகளே அன்றி, பொதுவான உத்தரவாதங்கள் அல்ல.

1. முழுச் செயல்கூற்றையும் மீண்டும் எழுதாமல், உருவாக்க மாதிரி நிரற்குறியை எவ்வாறு மாற்ற முடியும்? உருவாக்கத்திற்கு முன் திருத்தத்தக்க எல்லையை வரையறுத்து, அதற்கு வெளியே உள்ள மூலத்தைப் பாதுகாக்கவோ மீள்பயன்படுத்தவோ செய்து, முன்மொழியப்பட்ட மாற்றங்களை மட்டும் உருவாக்கி, பணியில் தோல்வியுறும் அல்லது பாதுகாக்கப்பட்ட பகுதிகளை மாற்றும் வெளியீடுகளை நிராகரிக்கவும். படிநிலை மறைநிலைப் பூட்டல் ஒரு பரிசோதனைக் கட்டுப்பாட்டுத் தளம்; ஆனால் ஒரே மாதிரியான மூலப் பரப்புகளுக்கு அது உத்தரவாதமளிக்காது. [இடஞ்சார் திருத்தக் கட்டுப்பாட்டுத் தளங்களை ஒப்பிடுக](https://aogavrilov.com/ta/projects/discrete-latent-generation/#control-surface) .
2. ஒரு நிரல் திருத்தம் வெறும் தொடரியல் செல்லுபடித்தன்மை கொண்டதல்ல, உள்ளூர்மையானது என்பதை எந்தச் சான்று காட்டுகிறது? கோரப்பட்ட பகுதிக்கு வெளியிலுள்ள வேறுபாட்டை, பணியின் வெற்றி, திருத்தக்கூடிய பகுதியின் மாற்றம், கட்டமைப்பு மாறிலிகள், சோதனைகள் அல்லது நிலையான பகுப்பாய்வுச் சரிபார்ப்புகள், மீளியக்க மாறுபாடு ஆகியவற்றுடன் சேர்த்து அளவிடுக. அலகிடல் விகிதம் மட்டும் தொடரியல் நன்கமைவை மட்டுமே நிறுவுகிறது. [இடச்சார்பு ஆதாரச் சரிபார்ப்புப் பட்டியலை மீளாய்வு செய்யவும்](https://aogavrilov.com/ta/projects/discrete-latent-generation/#measurement) .
3. நிரற்குறித் திருத்தத்தின் இடம்சார் தன்மையையும் உருவாக்கப் பல்வகைமையையும் எவ்வாறு சமநிலைப்படுத்த வேண்டும்? திருத்தக்கூடிய பகுதியின் சுதந்திரம் மற்றும் வேட்புகளின் தனித்துவத்துடன், பாதுகாக்கப்பட்ட பகுதியின் நிலைத்தன்மையையும் அறிக்கையிடவும். உள்ளீட்டை நகலெடுப்பது பணியில் எந்த முன்னேற்றமும் இல்லாமலேயே நிலைத்தன்மையை அதிகபட்சமாக்கலாம்; கட்டுப்பாடற்ற மறுஎழுத்தாக்கம் இடச்சார்பை அழித்தவாறே மாற்றத்தை அதிகபட்சமாக்கலாம். [வரம்பிட்ட நிலைத்தன்மை–சுதந்திரச் சான்றைக் காண்க](https://aogavrilov.com/ta/projects/discrete-latent-generation/#evidence) .
4. இடம்சார் நிரற்குறித் திருத்தம், கட்டுப்படுத்தப்பட்ட உருவாக்கம், நிரல் பழுதுநீக்கம் ஆகியவை எவ்வாறு வேறுபடுகின்றன? இடம்சார் திருத்தம் எது மாறாமல் இருக்க வேண்டும் என்பதை முன்னிறுத்துகிறது; கட்டுப்படுத்தப்பட்ட உருவாக்கம் இலக்கண உறுப்புரிமை போன்ற முறையான வெளியீட்டுப் பண்பை அமல்படுத்துகிறது; நிரல் பழுதுநீக்கம் மாற்றம் ஒரு குறைபாடு அல்லது பணிக் குறிப்பீட்டை நிறைவேற்ற வேண்டும் எனக் கோருகிறது. தொடரியல் மட்டும் பொருண்மைச் சமத்துவம், செயல்பாட்டுச் சரிநிலை, பணிவெற்றி அல்லது இடம்சார் தன்மை ஆகியவற்றை நிரூபிக்காது. [மூன்று குறிக்கோள்களையும் ஒப்பிடுக](https://aogavrilov.com/ta/projects/discrete-latent-generation/#comparison) .
5. ஒரு Python செயல்கூற்றின் தேர்ந்தெடுக்கப்பட்ட பகுதிகளை மட்டும் மீளுருவாக்கி, எஞ்சிய பகுதிகளை எவ்வாறு நிலையாக வைத்திருக்கலாம்? உருவாக்கத்திற்கு முன் பாதுகாக்கப்பட்ட மற்றும் திருத்தத்தக்க பகுதிகளை வரையறுத்து, திருத்தத்தக்க பிரதிநிதித்துவத்தை மட்டும் மாற்றி, குறிவிலக்கி, பாதுகாக்கப்பட்ட நிரலை மாற்றும் அல்லது தொடரியல், சோதனைகள், நிலைச் சோதனைகள் அல்லது பணி-சார் மாறிலிகளில் தோல்வியுறும் முன்மொழிவுகளை நிராகரிக்கவும். அறிக்கையிடப்பட்ட படிநிலை-மறைநிலைப் பரிசோதனை 64-சொற்கூறு செயல்கூறுகளில் நிகழ்தகவு நிலைத்தன்மையை அளவிடுகிறது; மாறாத பரப்புகளுக்கோ நடத்தைக்கோ அது உத்தரவாதமளிக்கவில்லை. [தேர்ந்தெடுத்த மீளுருவாக்கப் பணிப்பாய்வை ஆய்வு செய்க](https://aogavrilov.com/ta/projects/discrete-latent-generation/#workflow) .
6. AI-உதவிய நடத்தைப் பாதுகாக்கும் மறுகட்டமைப்புக்கு எந்தக் கட்டுப்பாட்டு உத்தி பொருந்துகிறது? ஓர் உருமாற்றத்தை அடையாளம் காணவோ முன்மொழியவோ மாதிரியைப் பயன்படுத்தி, இயன்ற இடங்களில் நம்பகமான மறுகட்டமைப்பு இயந்திரத்தால் அதைச் செயல்படுத்துங்கள்; தொகுத்தல், சோதனைகள், நிலைச் சரிபார்ப்புகள் மற்றும் நோக்கப்பட்ட மறுகட்டமைப்பைச் சரிபாருங்கள். நம்பத்தகுந்ததாகத் தோன்றும் உருவாக்கப்பட்ட patch மட்டும் போதுமான சான்றல்ல. [மறுகாரணியாக்க முடிவு வரிசையைத் திறக்கவும்](https://aogavrilov.com/ta/projects/discrete-latent-generation/#control-surface) .
7. நிரல் உருவாக்கத்தை வெறும் கட்டுப்படுத்தத்தக்கதாக அல்லாமல் முன்கணிக்கத்தக்கதாக ஆக்குவது எது? உருவாக்கியைத் தேர்வதற்கு முன் கவனிக்கக்கூடிய பேணல் ஒப்பந்தத்தையும் ஏற்புச் சரிபார்ப்புகளையும் குறிப்பிடுக. முன்தூண்டல், முகமூடி, இலக்கணம் அல்லது மறைநிலைக் குறியீடு நிலைநிறுத்தப்பட்டதா என்பதில் மட்டும் அல்லாமல், குறிவிலக்கம் மற்றும் சரிபார்ப்புக்குப் பின்னர் எது நிலையாக நீடிக்கிறது என்பதிலும் முன்கணிப்புத்தன்மை சார்ந்துள்ளது. [பாதுகாப்பு ஒப்பந்தத்தை வரையறுக்கவும்](https://aogavrilov.com/ta/projects/discrete-latent-generation/#core-idea) .
8. அறிக்கையிடப்பட்ட உரைப் பரிசோதனையில் நிரற்குறி-வெளி மற்றும் token-வெளி முகமூடியிட்ட diffusion முறைகள் எவ்வாறு ஒப்பிடப்பட்டன? அதே வெளிப்புற மதிப்பீட்டாளரின் கீழ், code-space MDLM-இன் இடைநிலை perplexity 26.55; token-space அடிப்படையின் 38.42 உடன் ஒப்பிடுகையில் இது 30.9% குறைவு. கோடெக் மறுகட்டமைப்பின் இடைநிலை ஏற்கெனவே 27.36 ஆக இருந்ததால், மறுகட்டமைப்புத் தடையுடன் இணைத்தே இம்முடிவைப் பொருள்கொள்ள வேண்டும். [அறிக்கையிடப்பட்ட கட்டவாரி எண்களை ஆய்வு செய்க](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
9. கோடெக் இழப்புடையதாக இருக்கும்போது நிரற்குறி-வெளி மற்றும் token-வெளி முகமூடியிட்ட diffusion முறைகளை எவ்வாறு ஒப்பிட வேண்டும்? மூலப் பிரதிகள், கோடெக் மறுகட்டமைப்புகள், token-space வெளியீடுகள், code-space வெளியீடுகள் அனைத்திற்கும் ஒரே ஒதுக்கிவைத்த மாதிரிகளையும் குறிநீக்கப்பட்ட-உரை மதிப்பீட்டாளரையும் பயன்படுத்துங்கள். கோடெக் ஏற்கெனவே நீக்கிய தகவலை வலுவான மறைநிலை உருவாக்கியாலும் மீட்க முடியாது என்பதால், மறுகட்டமைப்பு இடைவெளியைத் தனியே அறிவியுங்கள். [ஒரே மதிப்பீட்டாளரின் கீழ் கட்டங்களை ஒப்பிடுக](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
10. இருகட்ட உரை உருவாக்கியில் தர இழப்பை எவ்வாறு கண்டறியலாம்? மாற்றப்படாத ஒரே குறிவிலக்கப்பட்ட-உரை மதிப்பீட்டாளரின் கீழ், மீள்கட்டமைப்பிலிருந்து உருவாக்கத்திற்கான இடைவெளியை அளவிடும்முன் மூலத்திலிருந்து மீள்கட்டமைப்பிற்கான இடைவெளியை அளவிடுக. இதனால் கோடெக் விதிக்கும் தர உச்சவரம்பை, மறைநிலை உருவாக்கம் கூடுதலாக ஏற்படுத்தும் தரச்சிதைவிலிருந்து பிரித்தறியலாம். [நான்கு சோதனைப்புள்ளிக் கண்டறிதல் முறையைப் பின்பற்றுக](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#workflow) .
11. மேம்பட்ட மறைநிலை வெளி அளவீடுகள் எப்போது குறிநீக்கப்பட்ட வெளியீட்டை மேம்படுத்தத் தவறக்கூடும்? ஆர்வத்திற்குரிய பின்நிலைப் பண்பைப் பின்தொடராமலேயே மறைநிலைப் பதிலளவீடு மேம்படலாம். பொருத்தப்பட்ட வெளியீடுகளைக் குறிவிலக்கி, அதே இறுதி அளவீடுகளால் மதிப்பிட்டு மாற்றுப்பயனைக் சோதிக்கவும்; இல்லையெனில் codebook வடிவியலோ பயன்பாடோ நோயறிச் சான்றாக மட்டுமே இருக்கும், உரைத்தர உயர்வாகாது. [பதிலி-மாற்ற நோயறிதலைப் பயன்படுத்துக](https://aogavrilov.com/ta/projects/codec-bottleneck-diagnosis/#decision-table) .

## வரம்பிட்ட இரண்டு சான்றுக் காட்சிகள்

இந்த எண்கள் எது அளவிடப்பட்டது என்பதை அடையாளப்படுத்துகின்றன; அவை உலகளாவிய மாதிரி உத்தரவாதங்கள் அல்ல.

### சுருக்க நோயறிதல்

TinyStories 64-to-16 அமைப்பொன்றில், இடைநிலை perplexity இதிலிருந்து உயர்ந்தது: **15.17** மூல உரைக்கு பின்வருவதிலிருந்து **27.36** மீள்கட்டமைப்பிற்குப் பிறகு. குறியீட்டு வெளி MDLM எட்டியது **26.55** எதிராக **38.42** அதே வெளிப்புற மதிப்பீட்டுக் கருவியின் கீழுள்ள டோக்கன்-வெளி அடிப்படைக்கோட்டுக்கு.

### ஆய்வுக்குட்படுத்தக்கூடிய திருத்தக் கட்டுப்பாடு

64-token Python செயல்கூறு அமைப்பொன்றில், நான்கு உயர்மட்டக் குறியீடுகளைப் பூட்டியது parse விகிதத்தை இதிலிருந்து உயர்த்தியது: **0.453** இதற்கு **0.591** , அதேவேளை பூட்டப்படாத நிலைகள் இவ்விகிதத்தில் மாறின **0.936** மேலும் நிபந்தனை மாதிரிகள் தொடர்ந்து இருந்தது **0.998** தனித்துவமானது.

## இந்த வரைபடம் வலியுறுத்தாதவை

வெளியிடப்பட்ட பரிசோதனைகள் துல்லியமான AST பேணல், பொருண்மைச் சமமான தன்மை, செயல்பாட்டுச் சரித்தன்மை, களஞ்சிய-அளவிலான பழுதுநீக்கம் அல்லது கோடெக் மற்றும் உருவாக்கி இடையூறுகளின் உலகளாவிய வரிசை ஆகியவற்றை நிறுவவில்லை. வழிகாட்டிகள் வரம்பிட்ட சான்றை மீள்பயன்படுத்தக்கூடிய நோயறிதல் நடைமுறைகளாக மாற்றுகின்றன; ஒவ்வொரு புதிய அமைப்புக்கும் அதற்கே உரிய குறிவிலக்கப்பட்ட வெளியீடு மற்றும் நடத்தை-மட்டச் சரிபார்ப்பு இன்னும் தேவை.
