# Маскована дифузія у просторі кодів і токенів: як їх порівнювати

Canonical HTML: https://aogavrilov.com/uk/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: uk

ДОСЛІДНИЦЬКА НОТАТКА

Узгоджений між етапами протокол порівняння мовних моделей маскованої дискретної дифузії у просторі кодів і просторі токенів за використання дискретного кодека з втратами.

Опубліковано 30 липня 2026 року [Alexey Gavrilov](https://aogavrilov.com/about/)

ПРЯМА ВІДПОВІДЬ

## Як слід порівнювати мовне моделювання методом маскованої дифузії у просторі кодів і просторі токенів?

Оцінюйте вихідний текст, реконструкції кодеком, результати у просторі токенів і декодовані результати з простору кодів за допомогою того самого зовнішнього засобу оцінювання й однакового попереднього оброблення. Окремо подавайте розрив реконструкції кодеком: генерація у просторі кодів не здатна відновити інформацію, яку кодек уже вилучив.

## Чому ця відмінність важлива

Метод і заявлена гарантія мають спиратися на ту саму спостережувану межу.

Модель у просторі токенів генерує текстові токени безпосередньо. Модель у просторі кодів спершу генерує дискретні латентні коди, а відновлення тексту покладає на декодер. Їхні кінцеві результати можна порівнювати, проте конвеєр у просторі кодів має додаткову точку відмови: втрати реконструкції можуть знизити гранично досяжну якість ще до початку генерації в латентному просторі.

Отже, для справедливого порівняння потрібні два запитання, а не одне. Спершу слід з’ясувати, яку частку якості зберігає кодек без генерації. Потім — яких додаткових втрат завдає кожен генератор за єдиного незмінного протоколу оцінювання декодованого тексту.

## Практична процедура

1. Визначте базовий рівень для вихідного тексту Оцініть відкладені вихідні тексти, застосовуючи засіб оцінювання та попереднє опрацювання, що використовуватимуться на кожному наступному етапі.
2. Оцінюйте реконструкцію до генерації Закодуйте й декодуйте ті самі приклади без вибірки нових кодів. Так можна ізолювати верхню межу якості, зумовлену кодеком.
3. Оцініть обидва простори генерації після декодування Оцінюйте зразки у просторі токенів безпосередньо, а зразки у просторі кодів перед оцінюванням декодуйте. Не порівнюйте проксі-показник латентного простору з метрикою декодованого тексту.
4. Наведіть розподіли та оцінки невизначеності Наводьте медіану й поведінку хвостів розподілу, кількість зразків, попередню обробку та невизначеність повторних запусків. Одне середнє значення може приховати серйозні збої реконструкції.

## Необхідні докази

Обґрунтованість твердження визначається тим, яку властивість виміряно після генерації або декодування.

- На кожній контрольній точці застосовано той самий зовнішній оцінювач декодованого тексту й ту саму попередню обробку.
- Результати для джерела, реконструкції, простору токенів і декодованого простору кодів наведено окремо.
- Розрив у якості реконструкції кодеком не приписують латентному генератору.
- Будь-яке порівняння середніх значень супроводжується медіаною та характеристиками хвостів розподілу.
- Перш ніж узагальнювати малі відмінності, наведено початкові значення або оцінки невизначеності.

### Про що повідомляє наведене дослідження

- В описаній конфігурації TinyStories зі стисненням 64 до 16 сама лише реконструкція кодеком підвищила медіанну зовнішню перплексію з 15.17 до 27.36.
- За оцінювання тим самим засобом медіанна перплексія MDLM у просторі кодів становила 26.55, тоді як для базової моделі у просторі токенів — 38.42; отже, в цьому експерименті генерація у просторі кодів знизила її на 30.9%.
- Регуляризація з урахуванням геометрії поліпшила локальні діагностичні показники латентного простору в наявних зіставних запусках, але не поліпшила метрик декодованого тексту.

[Читати огляд публікації](https://aogavrilov.com/uk/publications/where-quality-breaks/) [Пошук у повному тексті статті](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Межі охоплення

- Ці числа характеризують один режим стиснення TinyStories, один ієрархічний кодек і наведені умови оцінювання; вони не встановлюють універсального порядку моделей у просторі кодів і просторі токенів.
- Перплексія є інформативним, але не вичерпним показником семантичної якості, різноманітності, фактологічної точності чи корисності.
- Наявні порівняння слід тлумачити з урахуванням зазначених обсягів вибірок та обмежень щодо невизначеності.

## Основні та суміжні джерела

Звертайтеся до наведених статей за первинним описом методів, вимірювань і заявлених обмежень.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/uk/publications/where-quality-breaks/) Основна стаття та наведені в ній поетапні вимірювання.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Формулювання маскованої дискретної дифузії, застосоване в латентному генераторі.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Основоположний метод навчання дискретних представлень.

Супровід здійснює Alexey Gavrilov . На цій сторінці узагальнено наявні свідчення; жодних експериментальних результатів поза наведеними джерелами вона не додає.
