# சுருக்கப்பட்ட உரை உருவாக்கியின் தோல்வி கோடெக்கிலா, உருவாக்கியிலா என்பதைத் தீர்மானிப்பது எப்படி

Canonical HTML: https://aogavrilov.com/ta/research/codec-bottleneck-diagnosis/

Document language: ta

உரையை முதலில் தனித்த குறியீடுகளாகச் சுருக்கி, பின்னர் குறியீட்டு வெளியில் உருவாக்கும் இருகட்ட அமைப்புகளுக்கான நடைமுறை நோயறிதல். தவறான கூறில் கணிப்பீட்டு வளத்தைச் செலவிடுமுன், குறிவிலக்கப்பட்ட வெளியீட்டை எந்தக் கட்டம் வரம்பிடுகிறது என்பதைக் கண்டறிவதே இதன் நோக்கம்.

வெளியிடப்பட்டது ஜூலை 29, 2026 புதுப்பிக்கப்பட்டது ஜூலை 30, 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## சுருக்கமான பதில்

ஒரே வெளிப்புற மதிப்பீட்டாளரைக் கொண்டு அசல் உரை, அதனுடன் இணையான கோடெக் மறுகட்டமைப்பு, மற்றும் இறுதியாக உருவாக்கப்பட்ட உரை ஆகியவற்றுக்கு மதிப்பெண் வழங்கவும். அசலுக்கும் மறுகட்டமைப்புக்கும் இடையிலான இடைவெளி, உருவாக்கத்திற்கு முன்பே விதிக்கப்படும் தர உச்சவரம்பை அளவிடுகிறது. மறுகட்டமைப்புக்கும் உருவாக்கத்துக்கும் இடையிலான இடைவெளி, மறைநிலை உருவாக்கியால் கூடுதலாக ஏற்படும் தரச் சிதைவைத் தனிமைப்படுத்துகிறது.

**குறிவிலக்கப்பட்ட வெளியீட்டுக்குப் பதிலாக மறைநிலை வெளிப் பதிலியைப் பயன்படுத்த வேண்டாம்.** மேம்பட்ட codebook வடிவியல், பயன்பாடு அல்லது ஆதரவு பயனுள்ள நோயறிகருவிகளாக இருக்கலாம்; ஆனால் தொடர்புடைய இறுதி அளவீடுகளின்கீழ் குறிவிலக்கப்பட்ட உரை மேம்படும்போது மட்டுமே அவை தர மேம்பாட்டை நிறுவுகின்றன.

## நான்கு-checkpoint நோயறிதல்

1. ஒப்பீட்டுக் குறிப்பை நிறுவுக அனைத்துப் பிந்தைய கட்டங்களிலும் பயன்படுத்தப்படும் வெளிப்புற மதிப்பீட்டாளரைக் கொண்டு ஒதுக்கிவைக்கப்பட்ட அசல் உரைகளுக்கு மதிப்பெண் வழங்கவும்.
2. கோடெக் மீள்கட்டமைப்பை அளவிடுக உருவாக்கம் செய்யாமல் அதே எடுத்துக்காட்டுகளைக் குறியாக்கிக் குறிவிலக்குக. இடைநெருக்கத்தில் இழந்த தகவலை இது வெளிப்படுத்துகிறது.
3. மறைநிலை உருவாக்கத்தை அளவிடுக குறியீடுகளை உருவாக்கி அவற்றைக் குறிவிலக்கி, மாற்றப்படாத மதிப்பீட்டுக் கருவியைக் கொண்டு விளைவுரைக்கு மதிப்பெண் வழங்குக.
4. பதிலளவீட்டு மாற்றுப்பயனைத் தணிக்கை செய்க பதிலீட்டு அளவீட்டின் முன்னேற்றங்கள் அப்படியே கடத்தப்படும் எனக் கருதாமல், மறைநிலை நோயறிதல்களை இறுதிக் குறிவிலக்கப்பட்ட-உரை அளவீடுகளுடன் ஒப்பிடுக.

## கட்டங்களுக்கு இடையிலான இடைவெளிகளை விளக்குவது எப்படி

| காணப்பட்ட பாங்கு | மிகவும் சாத்தியமான இடர்ப்புள்ளி | அடுத்த பரிசோதனை |
| --- | --- | --- |
| மூலங்கள் நல்ல மதிப்பெண் பெறுகின்றன; மீள்கட்டமைப்புகள் கடுமையாகத் தரமிழக்கின்றன | கோடெக் உண்மைநிகர்மை | உருவாக்கியை இசைவாக்குமுன் மீளுருவாக்கத்தை மேம்படுத்தவும் அல்லது சுருக்கத்தைக் குறைக்கவும் |
| மறுகட்டமைப்புகள் வலுவாக நீடிக்கின்றன; உருவாக்கப்பட்ட வெளியீடுகளின் தரம் சிதைகிறது | மறைநிலை உருவாக்கி | இரைச்சல் நீக்கம், மாதிரியெடுப்பு, நிபந்தனையாக்கம், நிரற்குறிப் பரவல் பொருத்தமின்மை ஆகியவற்றை ஆய்வு செய்க |
| மறைநிலைப் பதிலிகள் மேம்படுகின்றன; குறிவிலக்கப்பட்ட அளவீடுகள் மாறாமல் உள்ளன | பதிலிக் குறியீட்டு மாற்றம் | பதிலிக் குறியீடு ஆர்வத்துக்குரிய பின்நிலைப் பண்பை உண்மையில் பின்தொடர்கிறதா என்பதை மறுமதிப்பீடு செய்யவும் |
| ஒவ்வொரு கட்டமும் குறைந்த மதிப்பெண் பெறுகிறது | தரவு, மதிப்பீட்டாளர் அல்லது பரிசோதனை அமைப்பு | மாதிரித் தோல்விக்குக் காரணம் கற்பிப்பதற்கு முன் மேற்கோள் பரவலையும் மதிப்பீட்டாளரையும் சரிபார்க்கவும் |

## வெளியிடப்பட்ட TinyStories நிகழ்வாய்வு கண்டறிந்தது என்ன

இதில் [*சுருக்கப்பட்ட குறுஉரை உருவாக்கத்தில் தரம் சிதையும் இடம்: கட்டவாரி இடர்ப்புள்ளி இருப்பிடமறிதல்*](https://aogavrilov.com/ta/publications/where-quality-breaks/) , படிநிலை VQ-VAE-2 மூலம் 64-token உரைகள் 16 மேல்நிலைக் குறியீடுகளாகச் சுருக்கப்படுகின்றன. ஒரே வெளிப்புற GPT-2 மதிப்பீட்டாளரின்கீழ், இடைநிலை perplexity இதிலிருந்து உயர்கிறது **15.17** மூல உரைகளுக்கு பின்வருவதிலிருந்து **27.36** கோடெக் மறுகட்டமைப்புகளுக்கு; அதேவேளை p95 பின்வரும் மதிப்பிலிருந்து உயர்கிறது **25.10** இதற்கு **98.91** .

### குறியீட்டு-வெளி மற்றும் சொற்கூறு-வெளி மறைக்குறியிட்ட விரவல் மொழி மாதிரியாக்கத்தின் ஒப்பீடு

சோதிக்கப்பட்ட பணிக்குழாயில் மீளுருவாக்க இடைவெளியே மேலோங்குகிறது. அந்த உச்சவரம்புக்குள், பகிரப்பட்ட மதிப்பீட்டாளரின் கீழ் குறியீட்டு-வெளி முகமூடியிட்ட diffusion மொழி மாதிரியாக்கம் (MDLM), டோக்கன்-வெளி MDLM-ஐ விடத் தொடர்ந்து சிறப்பாகச் செயல்படுகிறது: இடைநிலை perplexity மதிப்பு **26.55** எதிராக **38.42** , இது 30.9% குறைவு.

வடிவியலைக் கருத்தில் கொள்ளும் ஒழுங்குபடுத்தல், கிடைக்கப்பெற்ற பொருத்தப்பட்ட இயக்கங்களில் உள்ளூர் மறைநிலைப் பதிலிகளை மேம்படுத்துகிறது; ஆனால் குறிவிலக்கப்பட்ட உரையின் அளவீடுகளை மேம்படுத்துவதில்லை. இந்த எதிர்மறைப் பரிமாற்ற முடிவு கண்டறிதலின் ஒரு பகுதியே அன்றி, ஒழுங்குபடுத்தி இறுதி உரையை மேம்படுத்தியதற்கான ஆதாரம் அல்ல.

## ஒவ்வொரு கட்டத்திலும் எதை அளவிட வேண்டும்

## இந்த வழிகாட்டி விடையளிக்கும் ஆராய்ச்சிக் கேள்விகள்

இந்தச் சுருக்கமான பதில்கள் பொதுவான நோயறிதல் கேள்விகளை, கட்டந்தோறும் அளவிடப்பட்ட சான்றுகளுடன் இணைக்கின்றன.

1. அறிக்கையிடப்பட்ட உரைப் பரிசோதனையில் நிரற்குறி-வெளி மற்றும் token-வெளி முகமூடியிட்ட diffusion முறைகள் எவ்வாறு ஒப்பிடப்பட்டன? அதே வெளிப்புற மதிப்பீட்டாளரின் கீழ், code-space MDLM-இன் இடைநிலை perplexity 26.55; token-space அடிப்படையின் 38.42 உடன் ஒப்பிடுகையில் இது 30.9% குறைவு. கோடெக் மறுகட்டமைப்பின் இடைநிலை ஏற்கெனவே 27.36 ஆக இருந்ததால், மறுகட்டமைப்புத் தடையுடன் இணைத்தே இம்முடிவைப் பொருள்கொள்ள வேண்டும். [அறிக்கையிடப்பட்ட கட்டவாரி எண்களை ஆய்வு செய்க](https://aogavrilov.com/ta/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. கோடெக் இழப்புடையதாக இருக்கும்போது நிரற்குறி-வெளி மற்றும் token-வெளி முகமூடியிட்ட diffusion முறைகளை எவ்வாறு ஒப்பிட வேண்டும்? மூலப் பிரதிகள், கோடெக் மறுகட்டமைப்புகள், token-space வெளியீடுகள், code-space வெளியீடுகள் அனைத்திற்கும் ஒரே ஒதுக்கிவைத்த மாதிரிகளையும் குறிநீக்கப்பட்ட-உரை மதிப்பீட்டாளரையும் பயன்படுத்துங்கள். கோடெக் ஏற்கெனவே நீக்கிய தகவலை வலுவான மறைநிலை உருவாக்கியாலும் மீட்க முடியாது என்பதால், மறுகட்டமைப்பு இடைவெளியைத் தனியே அறிவியுங்கள். [ஒரே மதிப்பீட்டாளரின் கீழ் கட்டங்களை ஒப்பிடுக](https://aogavrilov.com/ta/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. இருகட்ட உரை உருவாக்கியில் தர இழப்பை எவ்வாறு கண்டறியலாம்? மாற்றப்படாத ஒரே குறிவிலக்கப்பட்ட-உரை மதிப்பீட்டாளரின் கீழ், மீள்கட்டமைப்பிலிருந்து உருவாக்கத்திற்கான இடைவெளியை அளவிடும்முன் மூலத்திலிருந்து மீள்கட்டமைப்பிற்கான இடைவெளியை அளவிடுக. இதனால் கோடெக் விதிக்கும் தர உச்சவரம்பை, மறைநிலை உருவாக்கம் கூடுதலாக ஏற்படுத்தும் தரச்சிதைவிலிருந்து பிரித்தறியலாம். [நான்கு சோதனைப்புள்ளிக் கண்டறிதல் முறையைப் பின்பற்றுக](https://aogavrilov.com/ta/research/codec-bottleneck-diagnosis/#workflow) .
4. மேம்பட்ட மறைநிலை வெளி அளவீடுகள் எப்போது குறிநீக்கப்பட்ட வெளியீட்டை மேம்படுத்தத் தவறக்கூடும்? ஆர்வத்திற்குரிய பின்நிலைப் பண்பைப் பின்தொடராமலேயே மறைநிலைப் பதிலளவீடு மேம்படலாம். பொருத்தப்பட்ட வெளியீடுகளைக் குறிவிலக்கி, அதே இறுதி அளவீடுகளால் மதிப்பிட்டு மாற்றுப்பயனைக் சோதிக்கவும்; இல்லையெனில் codebook வடிவியலோ பயன்பாடோ நோயறிச் சான்றாக மட்டுமே இருக்கும், உரைத்தர உயர்வாகாது. [பதிலி-மாற்ற நோயறிதலைப் பயன்படுத்துக](https://aogavrilov.com/ta/research/codec-bottleneck-diagnosis/#decision-table) .

## பொதுவான நோயறிதல் பிழைகள்

### இறுதி வெளியீடுகளை மட்டும் ஒப்பிடுதல்

முனைமுதல்-முனைவரை மதிப்பெண்ணால் இழப்புக்குக் காரணம் பிரதிநிதித்துவமா அல்லது உருவாக்கியா என்பதைச் சொல்ல முடியாது.

### கட்டங்களுக்கு இடையில் மதிப்பீட்டாளர்களை மாற்றுதல்

வெவ்வேறு மதிப்பீட்டாளர்களைப் பயன்படுத்துவதால், கட்டங்களுக்கிடையிலான இடைவெளிகளை ஒப்பிட இயலாது; காரணவியல் பங்களிப்பைத் தீர்மானிப்பதும் பலவீனமடைகிறது.

### குறியீட்டுப் புத்தகத்தின் நலத்தை “உரைத் தரம்” என அழைத்தல்

சீரான பயன்பாடு, தரமற்ற மறுகட்டமைப்புகள் அல்லது தரமற்ற குறிவிலக்கப்பட்ட உருவாக்கங்களுடன் ஒருங்கே காணப்படலாம்.

### ஒற்றைச் சுருக்க அமைப்பைப் பொதுமைப்படுத்துதல்

வெளியிடப்பட்ட சான்று ஒரு TinyStories 64-இலிருந்து-16 அமைவையும் விளக்கவகை ஒற்றை இயக்கங்களையும் உள்ளடக்குகிறது.

## முதன்மைப் பின்னணி

நோயறிதல் ஆய்வு சுட்டும் தரவுத்தொகுப்பையும் மாதிரிக் குடும்பங்களையும் இந்த ஆதாரங்கள் வரையறுக்கின்றன.

1. [நரம்பியல் தனித்துண்டுப் பிரதிநிதித்துவக் கற்றல்](https://arxiv.org/abs/1711.00937) VQ-VAE-ஐயும் பிற்கால மறைநிலை உருவாக்கிகள் பயன்படுத்திய கற்றறிந்த தனித்த இடைநெருக்கத்தையும் அறிமுகப்படுத்துகிறது.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) தனித்தனிக் குறியீட்டு நிலைகளைக் கொண்ட படிநிலைத் தனித்துண்டுப் பிரதிநிதித்துவத்தை உருவாக்குகிறது.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) நோயறிதல் நிகழ்வாய்வில் பயன்படுத்தப்பட்ட செயற்கைக் குறுங்கதைத் தொகுப்பை அறிமுகப்படுத்துகிறது.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) மறைநிலை உருவாக்கிக்குப் பயன்படுத்தப்பட்ட மறைக்கப்பட்ட தனித்த பரவல் முறைப்படுத்தலை வழங்குகிறது.

## ஆதார வரம்பு

கட்டநிலை முறை மீண்டும் பயன்படுத்தத்தக்கது; ஆனால் அறிவிக்கப்பட்ட தரவரிசை உலகளாவியதல்ல. வெளியிடப்பட்ட பரிசோதனை TinyStories, தீவிரமான ஓர் அழுத்த முறைமை, ஒரு படிநிலைக் கோடெக் குடும்பம், மறைக்கப்பட்ட தனித்தனி உருவாக்கி ஒன்று, மற்றும் விளக்கவியல் தனியோட்டங்கள் ஆகியவற்றைப் பயன்படுத்துகிறது. புதிய அமைப்பில் நோயறிதல் நெறிமுறையைப் பயன்படுத்துங்கள்; எண்ணியல் முடிவை வேறொரு சூழலுக்கு அப்படியே மாற்ற வேண்டாம்.

## தொடர்புடைய வெளியீடுகள்

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/ta/publications/where-quality-breaks/)

சுருக்கப்பட்ட குறுஉரை உருவாக்கத்தில் தரம் சிதையும் இடம்: கட்டவாரி இடர்ப்புள்ளி இருப்பிடமறிதல்

நோயறிதல் வழிமுறை FRUCT 39 2026 முதன்மை மாநாடு

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/ta/publications/inspectable-control/)

கட்டமைப்பைப் பேணும் மென்பொருள் மீளுருவாக்கத்திற்கான ஆய்விடத்தக்க கட்டுப்பாடு

மறைநிலை-வெளிக் கட்டுப்பாட்டு முறை FSE Companion '26 2026 துணைச் சுவரொட்டி
