# Маскирана дифузија у простору кодова наспрам простора токена: како их упоредити

Canonical HTML: https://aogavrilov.com/sr/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: sr

ИСТРАЖИВАЧКА БЕЛЕШКА

Протокол поређења доследан фазама за маскиране дифузионе језичке моделе у простору кодова и простору токена када дискретни кодек уноси губитке.

Објављено 30. јул 2026. [Alexey Gavrilov](https://aogavrilov.com/about/)

НЕПОСРЕДАН ОДГОВОР

## Како треба поредити језичко моделовање маскираном дискретном дифузијом у простору кодова и у простору токена?

Оцените изворни текст, реконструкције кодеком, излазе из простора токена и декодиране излазе из простора кодова истим спољним оцењивачем и уз исту предобраду. Разлику насталу при реконструкцији кодеком прикажите засебно: генерисање у простору кодова не може повратити информације које је кодек већ уклонио.

## Зашто је та разлика важна

Метод и наведена гаранција морају имати исту уочљиву границу.

Модел у простору токена непосредно генерише текстуалне токене. Модел у простору кодова најпре генерише дискретне латентне кодове, а затим се ослања на декодер да обнови текст. Њихови завршни излази могу се поредити, али ток обраде у простору кодова има додатну тачку отказа: губитак реконструкције може снизити горњу границу квалитета пре него што почне генерисање латентних кодова.

За правично поређење зато су потребна два питања, а не једно. Најпре треба утврдити колики квалитет кодек очува без икаквог генерисања. Затим треба испитати колики додатни губитак сваки генератор уноси при истом, непромењеном протоколу оцењивања декодираног текста.

## Практичан поступак

1. Успоставите полазну вредност на изворном тексту Оценити издвојене изворне текстове евалуатором и поступком претходне обраде који ће се користити у свакој каснијој фази.
2. Реконструкцију мерити пре генерисања Кодирајте и декодирајте исте примере без узорковања нових кодова. Тако се издваја горња граница коју намеће кодек.
3. Оцените оба простора генерисања након декодирања Узорке из простора токена оцењујте непосредно, а узорке из простора кодова декодирајте пре оцењивања. Не поредите латентну посредну меру с метриком декодираног текста.
4. Приказати расподеле и неизвесност Прикажите медијану и понашање на реповима расподеле, број узорака, претходну обраду и неизвесност поновљених извршавања. Један просек може прикрити озбиљне неуспехе реконструкције.

## Неопходни докази

Тврдња је утемељена само онолико колико и својство измерено после генерисања или декодирања.

- На свакој контролној тачки користе се исти спољни оцењивач декодираног текста и иста претходна обрада.
- Резултати за извор, реконструкцију, простор токена и декодирани простор кодова приказују се одвојено.
- Јаз у реконструкцији кодеком не приписује се латентном генератору.
- Свако поређење средњих вредности треба допунити медијаном и понашањем у реповима расподеле.
- Пре уопштавања малих разлика наводе се семена или процене неизвесности.

### Шта повезана студија наводи

- У приказаној поставци TinyStories са компресијом 64-на-16, сама реконструкција кодеком повећала је медијану спољне перплексије са 15.17 на 27.36.
- Према истом оцењивачу, медијана перплексије MDLM-а у простору кодова износила је 26.55, док је за полазни модел у простору токена износила 38.42, што у том експерименту представља смањење од 30.9% за генерисање у простору кодова.
- Регуларизација која узима у обзир геометрију побољшала је локалне латентне дијагностичке мере у доступним упареним експериментима, али није побољшала метрике декодираног текста.

[Прочитајте преглед публикације](https://aogavrilov.com/sr/publications/where-quality-breaks/) [Претражите цео текст рада](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Граница обухвата

- Ови бројеви описују један режим компресије скупа TinyStories, један хијерархијски кодек и наведено евалуационо окружење; они не утврђују универзални поредак модела у простору кодова и модела у простору токена.
- Перплексија пружа корисне информације, али није потпуна мера семантичког квалитета, разноврсности, чињеничне тачности или употребљивости.
- Доступна поређења треба тумачити уз наведене величине узорака и ограничења у погледу неизвесности.

## Примарни и сродни извори

За изворне методе, мерења и наведена ограничења погледајте повезане радове.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/sr/publications/where-quality-breaks/) Главни рад и приказана мерења по фазама.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Формулација маскиране дискретне дифузије коју користи латентни генератор.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Темељни метод научених дискретних репрезентација.

Одржава Alexey Gavrilov . Ова страница сажима постојеће доказе и не додаје експерименталне резултате мимо наведених извора.
