# Маскированная диффузия в пространстве кодов и токенов: как их сравнивать

Canonical HTML: https://aogavrilov.com/ru/research-notes/code-space-vs-token-space-masked-diffusion/

Document language: ru

ИССЛЕДОВАТЕЛЬСКАЯ ЗАМЕТКА

Согласованный по этапам протокол сравнения маскированных диффузионных языковых моделей в пространстве кодов и токенов при использовании дискретного кодека с потерями.

Опубликовано 30 июля 2026 г. [Алексей Гаврилов](https://aogavrilov.com/about/)

ПРЯМОЙ ОТВЕТ

## Как следует сравнивать маскированное диффузионное языковое моделирование в пространстве кодов и токенов?

Оценивайте исходный текст, реконструкции кодека, результаты в пространстве токенов и декодированные результаты в пространстве кодов одним внешним оценщиком и с одинаковой предобработкой. Разрыв реконструкции кодека нужно показывать отдельно: генератор кодов не может восстановить информацию, которую кодек уже удалил.

## Почему это различие важно

Метод и заявленная гарантия должны относиться к одной наблюдаемой границе.

Модель в пространстве токенов генерирует текстовые токены напрямую. Модель в пространстве кодов сначала генерирует дискретные латентные коды, а затем использует декодер для восстановления текста. Итоговые результаты можно сравнивать, но у кодового конвейера есть дополнительная точка отказа: потери реконструкции могут снизить потолок качества ещё до начала латентной генерации.

Поэтому корректное сравнение отвечает на два вопроса. Сначала нужно определить, сколько качества кодек сохраняет без генерации новых кодов. Затем — сколько дополнительных потерь вносит каждый генератор при неизменном протоколе оценки декодированного текста.

## Практическая процедура

1. Задать базовый уровень исходного текста Оцените отложенные исходные тексты тем же оценщиком и с той же предобработкой, которые будут использоваться на всех последующих этапах.
2. Измерить реконструкцию до генерации Закодируйте и декодируйте те же примеры без выборки новых кодов. Это изолирует потолок качества, заданный кодеком.
3. Сравнить оба пространства после декодирования Оценивайте результаты в пространстве токенов напрямую, а результаты в пространстве кодов — только после декодирования. Не сравнивайте латентную прокси-метрику с метрикой декодированного текста.
4. Показать распределения и неопределённость Сообщайте медиану, поведение хвостов, число примеров, предобработку и неопределённость повторных запусков. Одно среднее значение может скрыть тяжёлые ошибки реконструкции.

## Необходимые доказательства

Сила утверждения определяется свойством, действительно измеренным после генерации или декодирования.

- Во всех контрольных точках используется один внешний оценщик декодированного текста и одна предобработка.
- Результаты для исходного текста, реконструкции, пространства токенов и декодированного пространства кодов показаны отдельно.
- Разрыв реконструкции кодека не приписывается латентному генератору.
- Средние значения сопровождаются медианой и поведением хвостов.
- До обобщения небольших различий сообщаются случайные зерна или оценки неопределённости.

### Что сообщает связанное исследование

- В описанном режиме TinyStories со сжатием 64→16 одна только реконструкция кодека повысила медианную внешнюю перплексию с 15,17 до 27,36.
- При том же оценщике медианная перплексия MDLM в пространстве кодов составила 26,55, а базовой модели в пространстве токенов — 38,42; в этом эксперименте снижение для кодовой генерации составило 30,9%.
- В доступных сопоставимых запусках геометрически осведомлённая регуляризация улучшила локальные латентные диагностические показатели, но не улучшила метрики декодированного текста.

[Читать обзор статьи](https://aogavrilov.com/ru/publications/where-quality-breaks/) [Искать по полному тексту статьи](https://aogavrilov.com/publications/where-quality-breaks/full-text/)

## Границы применимости

- Эти числа относятся к одному режиму сжатия TinyStories, одному иерархическому кодеку и описанной схеме оценки; они не задают универсальный порядок моделей в пространстве кодов и токенов.
- Перплексия полезна, но не измеряет полностью семантическое качество, разнообразие, фактическую точность или практическую полезность.
- Сравнения нужно интерпретировать вместе с указанными размерами выборок и ограничениями неопределённости.

## Основные и смежные источники

Обращайтесь к связанным статьям за исходными методами, измерениями и заявленными ограничениями.

1. [Where Quality Breaks in Compressed Short-Text Generation](https://aogavrilov.com/ru/publications/where-quality-breaks/) Основная статья и её поэтапные измерения.
2. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Формулировка маскированной дискретной диффузии, используемая латентным генератором.
3. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Основополагающий метод обучаемых дискретных представлений.

Страницу поддерживает Алексей Гаврилов . Она обобщает существующие доказательства и не добавляет экспериментальных результатов сверх цитируемых источников.
