# కోడ్-స్థల, టోకెన్-స్థల మాస్క్‌డ్ డిఫ్యూజన్: వాటిని ఎలా పోల్చాలి

Canonical HTML: https://aogavrilov.com/te/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: te

పరిశోధనా గమనిక

విచ్ఛిన్న కోడెక్ నష్టకరమైనప్పుడు కోడ్-స్థల, టోకెన్-స్థల మాస్క్‌డ్ వ్యాపన భాషా నమూనాలకు దశ-సంగత పోలిక ప్రోటోకాల్.

ప్రచురితం జూలై 30, 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

సూటి సమాధానం

## కోడ్-స్థల, టోకెన్-స్థల ముసుగు-ఆధారిత వ్యాప్తి భాషా నమూనీకరణను ఎలా పోల్చాలి?

మూల పాఠ్యం, కోడెక్ పునర్నిర్మాణాలు, టోకెన్-స్థల అవుట్‌పుట్‌లు, డీకోడ్ చేసిన కోడ్-స్థల అవుట్‌పుట్‌లను ఒకే బాహ్య స్కోరర్ మరియు ప్రీప్రాసెసింగ్‌తో మూల్యాంకనం చేయండి. కోడెక్ పునర్నిర్మాణ అంతరాన్ని విడిగా నివేదించండి: కోడెక్ ఇప్పటికే తొలగించిన సమాచారాన్ని కోడ్-స్థల ఉత్పాదన తిరిగి పొందలేదు.

## ఈ భేదం ఎందుకు ముఖ్యం

పద్ధతికి, దాని గురించి చేసే హామీకి ఒకే పరిశీలించదగిన సరిహద్దు అవసరం.

టోకెన్-స్థల నమూనా పాఠ్య టోకెన్‌లను నేరుగా ఉత్పత్తి చేస్తుంది. కోడ్-స్థల నమూనా మొదట విచ్ఛిన్న గుప్త కోడ్‌లను ఉత్పత్తి చేసి, తరువాత పాఠ్యాన్ని తిరిగి పొందేందుకు డీకోడర్‌పై ఆధారపడుతుంది. వాటి తుది అవుట్‌పుట్‌లను పోల్చవచ్చు; అయితే కోడ్-స్థల పైప్‌లైన్‌లో అదనపు వైఫల్య బిందువు ఉంది: గుప్త ఉత్పాదన మొదలవకముందే పునర్నిర్మాణ నష్టం నాణ్యత గరిష్ఠ పరిమితిని తగ్గించగలదు.

అందువల్ల న్యాయమైన పోలికకు ఒక్కటి కాక రెండు ప్రశ్నలు అవసరం. మొదట, ఎలాంటి ఉత్పాదన లేకుండా కోడెక్ ఎంత నాణ్యతను పరిరక్షిస్తుందో అడగాలి. తరువాత, మార్పులేని ఒకే డీకోడ్-పాఠ్య మూల్యాంకన ప్రోటోకాల్ కింద ప్రతి ఉత్పాదకం ఎంత అదనపు నష్టాన్ని కలిగిస్తుందో అడగాలి.

## ఆచరణాత్మక ప్రక్రియ

1. మూల ఆధారరేఖను స్థాపించండి తదుపరి ప్రతి దశలో ఉపయోగించే మూల్యాంకనకర్త, ప్రీప్రాసెసింగ్‌తో విడిగా ఉంచిన సోర్స్ పాఠ్యాలకు స్కోరు కేటాయించండి.
2. ఉత్పత్తికి ముందు పునర్నిర్మాణాన్ని కొలవండి కొత్త కోడ్‌లను నమూనాగా తీసుకోకుండా అవే ఉదాహరణలను ఎన్‌కోడ్ చేసి డీకోడ్ చేయండి. ఇది కోడెక్ విధించిన గరిష్ఠ పరిమితిని విడిగా చూపుతుంది.
3. డీకోడింగ్ అనంతరం రెండు ఉత్పాదన స్థలాలనూ మూల్యాంకనం చేయండి టోకెన్-స్థల నమూనాలకు నేరుగా స్కోరు ఇవ్వండి; కోడ్-స్థల నమూనాలకు స్కోరు ఇచ్చే ముందు వాటిని డీకోడ్ చేయండి. గుప్త ప్రత్యామ్నాయ కొలమానాన్ని డీకోడ్-పాఠ్య కొలమానంతో పోల్చవద్దు.
4. పంపిణీలు మరియు అనిశ్చితిని నివేదించండి మధ్యమ విలువ, తోక ప్రవర్తన, నమూనా సంఖ్యలు, ముందస్తు ప్రాసెసింగ్, పునరావృత ప్రయోగాల అనిశ్చితిని చూపండి. ఒక్క సగటు తీవ్రమైన పునర్నిర్మాణ వైఫల్యాలను మరుగుపరచవచ్చు.

## తప్పనిసరిగా కావలసిన సాక్ష్యం

ఒక వాదన బలం, ఉత్పాదన లేదా డీకోడింగ్ తరువాత కొలిచిన లక్షణం బలాన్ని మించదు.

- ప్రతి తనిఖీ-స్థానంలో ఒకే బాహ్య డీకోడ్-పాఠ్య మూల్యాంకనకర్తను, ఒకే ముందస్తు ప్రాసెసింగ్‌ను ఉపయోగిస్తారు.
- మూల పాఠ్యం, పునర్నిర్మాణం, టోకెన్-స్థలం, డీకోడ్ చేసిన కోడ్-స్థలం—వీటి ఫలితాలను విడివిడిగా నివేదిస్తారు.
- కోడెక్ పునర్నిర్మాణ అంతరాన్ని గుప్త ఉత్పాదకానికి ఆపాదించరు.
- ప్రతి సగటు పోలికతో పాటు మధ్యమానం, టెయిల్ ప్రవర్తనను కూడా చూపాలి.
- చిన్న తేడాలను సాధారణీకరించే ముందు సీడ్‌లు లేదా అనిశ్చితి అంచనాలను నివేదిస్తారు.

### లింక్ చేసిన అధ్యయనం నివేదించేది

- నివేదించిన 64-నుంచి-16 TinyStories అమరికలో, కోడెక్ పునర్నిర్మాణం ఒక్కటే మధ్యమ బాహ్య పర్‌ప్లెక్సిటీని 15.17 నుంచి 27.36కు పెంచింది.
- అదే స్కోరర్ కింద కోడ్-స్థల MDLM మధ్యమ పర్‌ప్లెక్సిటీ 26.55కు చేరగా, టోకెన్-స్థల ప్రామాణిక ఆధారం 38.42కు చేరింది; ఆ ప్రయోగంలో కోడ్-స్థల ఉత్పాదనకు ఇది 30.9% తగ్గుదల.
- అందుబాటులో ఉన్న సరిపోల్చిన ప్రయోగాల్లో జ్యామితి-అవగాహన గల రెగ్యులరైజేషన్ స్థానిక గుప్త నిర్ధారణ సూచికలను మెరుగుపరిచింది; అయితే డీకోడ్ చేసిన పాఠ్య కొలమానాలను మెరుగుపరచలేదు.

[ప్రచురణ అవలోకనాన్ని చదవండి](https://aogavrilov.com/te/publications/where-quality-breaks/) [పరిశోధన పత్రం పూర్తి పాఠ్యంలో వెతకండి](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## పరిధి సరిహద్దు

- ఈ సంఖ్యలు ఒక TinyStories సంపీడన విధానం, ఒక శ్రేణీకృత కోడెక్, నివేదించిన మూల్యాంకన అమరికను వివరిస్తాయి; కోడ్-స్థల, టోకెన్-స్థల నమూనాలకు సార్వత్రిక క్రమాన్ని నిర్ధారించవు.
- పర్ప్లెక్సిటీ సమాచారప్రదమైనదే; అయితే అర్థ నాణ్యత, వైవిధ్యం, వాస్తవికత లేదా ఉపయోగకరతకు అది సంపూర్ణ ప్రమాణం కాదు.
- అందుబాటులోని పోలికలను, వాటికి పేర్కొన్న నమూనా పరిమాణాలు మరియు అనిశ్చితి పరిమితులతో కలిపి అర్థం చేసుకోవాలి.

## ప్రాథమిక, సమీప సంబంధిత మూలాలు

అసలు పద్ధతులు, కొలతలు, పేర్కొన్న పరిమితుల కోసం లింక్ చేసిన పత్రాలను చూడండి.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/te/publications/where-quality-breaks/) ప్రధాన పరిశోధనా పత్రం మరియు నివేదించిన దశలవారీ కొలతలు.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) గుప్త ఉత్పాదకం ఉపయోగించే మాస్క్ చేసిన వివిక్త విసరణ సూత్రీకరణ.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) నేర్చుకున్న వివిక్త ప్రాతినిధ్యాలకు పునాది వేసిన పద్ధతి.

నిర్వహణ: Alexey Gavrilov . ఈ పేజీ ఇప్పటికే ఉన్న ఆధారాలను సంక్షిప్తీకరిస్తుంది; ఉదహరించిన మూలాలకు మించి ఎలాంటి ప్రయోగ ఫలితాన్నీ జోడించదు.
