# குறியீட்டு வெளி–டோக்கன் வெளி முகமூடி விரவல்: எவ்வாறு ஒப்பிடுவது?

Canonical HTML: https://aogavrilov.com/ta/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: ta

ஆராய்ச்சிக் குறிப்பு

தனித்த கோடெக் தகவலிழப்புடையதாக இருக்கும்போது, குறியீட்டு வெளி மற்றும் டோக்கன் வெளி முகமூடி விரவல் மொழி மாதிரிகளை ஒரே கட்டங்களில் ஒப்பிடுவதற்கான நெறிமுறை.

வெளியிடப்பட்டது ஜூலை 30, 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

நேரடி விடை

## குறியீட்டு வெளி மற்றும் டோக்கன் வெளி முகமூடி விரவல் மொழி மாதிரியாக்கத்தை எவ்வாறு ஒப்பிட வேண்டும்?

மூல உரை, கோடெக் மறுகட்டமைப்புகள், டோக்கன் வெளி வெளியீடுகள், குறிவிலக்கப்பட்ட குறியீட்டு வெளி வெளியீடுகள் ஆகிய அனைத்தையும் ஒரே வெளிப்புற மதிப்பீட்டாளராலும் ஒரே முன்செயலாக்கத்தாலும் மதிப்பிடுக. கோடெக் மறுகட்டமைப்பு இடைவெளியைத் தனியே அறிக்கையிடுக: கோடெக் ஏற்கெனவே நீக்கிய தகவலைக் குறியீட்டு வெளி உருவாக்கத்தால் மீட்டெடுக்க முடியாது.

## இந்த வேறுபாடு ஏன் முக்கியம்

முறைக்கும் கூறப்படும் உத்தரவாதத்திற்கும் ஒரே கவனிக்கக்கூடிய எல்லை தேவை.

token வெளி மாதிரி உரை tokens-ஐ நேரடியாக உருவாக்குகிறது. குறியீட்டு வெளி மாதிரி முதலில் தனித்த மறைநிலைக் குறியீடுகளை உருவாக்கி, பின்னர் உரையை மீட்க decoder-ஐச் சார்கிறது. அவற்றின் இறுதி வெளியீடுகளை ஒப்பிடலாம்; ஆனால் குறியீட்டு வெளிப் பணிப்பாய்வில் கூடுதல் தோல்விப்புள்ளி உள்ளது: மறைநிலை உருவாக்கம் தொடங்கும்முன்பே மீள்கட்டமைப்பு இழப்பு தர உச்சவரம்பைக் குறைக்கலாம்.

எனவே நியாயமான ஒப்பீட்டிற்கு ஒரு கேள்வி அல்ல, இரண்டு கேள்விகள் தேவை. முதலில், எந்த உருவாக்கமும் இன்றிக் கோடெக் எவ்வளவு தரத்தைப் பாதுகாக்கிறது எனக் கேட்க வேண்டும். பின்னர், மாறாத ஒரே குறிவிலக்கப்பட்ட-உரை மதிப்பீட்டு நெறிமுறையின்கீழ் ஒவ்வொரு உருவாக்கியும் எவ்வளவு கூடுதல் இழப்பை ஏற்படுத்துகிறது எனக் கேட்க வேண்டும்.

## ஒரு நடைமுறைச் செயல்முறை

1. மூல அடிப்படைக்கோட்டை நிறுவுக ஒவ்வொரு பிந்தைய கட்டத்திலும் பயன்படுத்தப்படவுள்ள மதிப்பீட்டாளர் மற்றும் முன்செயலாக்கத்தைக் கொண்டு ஒதுக்கிவைக்கப்பட்ட மூல உரைகளுக்கு மதிப்பெண் வழங்கவும்.
2. உருவாக்கத்துக்கு முன் மீள்கட்டமைப்பை அளவிடுக புதிய குறியீடுகளை மாதிரியெடுக்காமல் அதே எடுத்துக்காட்டுகளைக் குறியாக்கிக் குறிவிலக்குக. கோடெக் விதிக்கும் செயல்திறன் உச்சவரம்பை இது தனிமைப்படுத்திக் காட்டுகிறது.
3. குறிவிலக்கத்திற்குப் பிறகு இரு உருவாக்க வெளிகளையும் மதிப்பிடுக டோக்கன்-வெளி மாதிரிகளை நேரடியாக மதிப்பிடுக; குறியீட்டு-வெளி மாதிரிகளை மதிப்பிடுவதற்கு முன் அவற்றை குறிவிலக்குக. மறைநிலைப் பதிலீட்டு அளவீட்டை குறிவிலக்கப்பட்ட உரை அளவீட்டுடன் ஒப்பிட வேண்டாம்.
4. பரவல்களையும் நிச்சயமின்மையையும் அறிக்கையிடவும் இடைநிலை மதிப்பு, வால் நடத்தை, மாதிரி எண்ணிக்கைகள், முன்செயலாக்கம், மீளியக்க நிச்சயமின்மை ஆகியவற்றைக் காட்டுக. ஒரே சராசரி கடுமையான மீளுருவாக்கத் தோல்விகளை மறைக்கக்கூடும்.

## தேவைப்படுத்த வேண்டிய ஆதாரம்

ஒரு கூற்றின் வலிமை, உருவாக்கம் அல்லது குறிவிலக்கத்திற்குப் பிறகு அளவிடப்பட்ட பண்பின் வலிமைக்கு மட்டுமே சமம்.

- ஒவ்வொரு சோதனைப்புள்ளியிலும் ஒரே வெளிப்புறக் குறிவிலக்கப்பட்ட-உரை மதிப்பீட்டாளரும் முன்செயலாக்கமும் பயன்படுத்தப்படுகின்றன.
- மூலம், மீளுருவாக்கம், டோக்கன்-வெளி, குறிவிலக்கப்பட்ட குறியீட்டு-வெளி ஆகியவற்றின் முடிவுகள் தனித்தனியாக அறிக்கையிடப்படுகின்றன.
- கோடெக் மீளுருவாக்க இடைவெளி மறைநிலை உருவாக்கிக்குக் காரணமாகக் கூறப்படவில்லை.
- எந்தச் சராசரி ஒப்பீட்டுடனும் இடைநிலையும் வால் நடத்தையும் இணைத்து வழங்கப்பட வேண்டும்.
- சிறிய வேறுபாடுகளைப் பொதுமைப்படுத்துவதற்கு முன் விதைகள் அல்லது நிச்சயமின்மை மதிப்பீடுகள் அறிக்கையிடப்படுகின்றன.

### இணைக்கப்பட்ட ஆய்வு அறிவிப்பது என்ன

- அறிக்கையிடப்பட்ட 64-to-16 TinyStories அமைப்பில், கோடெக் மீளுருவாக்கம் மட்டுமே இடைநிலை வெளிப்புற perplexity-ஐ 15.17 இலிருந்து 27.36 ஆக உயர்த்தியது.
- அதே மதிப்பீட்டாளரின் கீழ், code-space MDLM இடைநிலை perplexity 26.55-ஐ எட்டியது; token-space அடிப்படை 38.42-ஐ எட்டியது. அப்பரிசோதனையில் code-space உருவாக்கத்திற்கு இது 30.9% குறைவாகும்.
- வடிவியலைக் கருத்தில் கொள்ளும் ஒழுங்குபடுத்தல், கிடைக்கப்பெற்ற பொருத்தப்பட்ட இயக்கங்களில் உள்ளூர் மறைநிலைக் கண்டறிதல் அளவீடுகளை மேம்படுத்தியது; ஆனால் குறிவிலக்கப்பட்ட உரையின் அளவீடுகளை மேம்படுத்தவில்லை.

[வெளியீட்டுக் கண்ணோட்டத்தைப் படிக்கவும்](https://aogavrilov.com/ta/publications/where-quality-breaks/) [கட்டுரையின் முழு உரையில் தேடுக](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## ஆய்வெல்லை

- இந்த எண்கள் ஒரு TinyStories அழுத்த முறைமை, ஒரு படிநிலைக் கோடெக், அறிவிக்கப்பட்ட மதிப்பீட்டு அமைவு ஆகியவற்றை விவரிக்கின்றன; code-space மற்றும் token-space மாதிரிகளுக்கான உலகளாவிய வரிசையை அவை நிறுவவில்லை.
- குழப்பநிலை பயனுள்ள தகவலை அளிக்கிறது; ஆனால் பொருளியல் தரம், பன்முகத்தன்மை, உண்மைத்தன்மை அல்லது பயனுடைமை ஆகியவற்றின் முழுமையான அளவீடாகாது.
- கிடைக்கக்கூடிய ஒப்பீடுகளை, அவற்றின் குறிப்பிடப்பட்ட மாதிரி அளவுகளையும் நிச்சயமின்மை வரம்புகளையும் கருத்திற்கொண்டே புரிந்துகொள்ள வேண்டும்.

## முதன்மை மற்றும் தொடர்புடைய ஆதாரங்கள்

மூல முறைகள், அளவீடுகள், கூறப்பட்ட வரம்புகள் ஆகியவற்றிற்கு இணைக்கப்பட்ட ஆய்வுக்கட்டுரைகளைப் பயன்படுத்துங்கள்.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/ta/publications/where-quality-breaks/) முதன்மைக் கட்டுரையும் அறிக்கையிடப்பட்ட கட்டவாரி அளவீடுகளும்.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) மறைநிலை உருவாக்கி பயன்படுத்தும் மறைக்கப்பட்ட தனித்துண்டுப் பரவல் முறைப்படுத்தல்.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) கற்றறியப்பட்ட தனித்த பிரதிநிதித்துவத்திற்கான அடித்தள முறை.

பராமரிப்பவர் Alexey Gavrilov . இப்பக்கம் ஏற்கெனவே உள்ள சான்றுகளைச் சுருக்குகிறது; மேற்கோள் காட்டப்பட்ட ஆதாரங்களுக்கு அப்பால் எந்தச் சோதனை முடிவையும் சேர்க்கவில்லை.
