ИССЛЕДОВАТЕЛЬСКАЯ ЗАМЕТКА
Маскированная диффузия в пространстве кодов и токенов: как их сравнивать
Согласованный по этапам протокол сравнения маскированных диффузионных языковых моделей в пространстве кодов и токенов при использовании дискретного кодека с потерями.
ПРЯМОЙ ОТВЕТ
Как следует сравнивать маскированное диффузионное языковое моделирование в пространстве кодов и токенов?
Оценивайте исходный текст, реконструкции кодека, результаты в пространстве токенов и декодированные результаты в пространстве кодов одним внешним оценщиком и с одинаковой предобработкой. Разрыв реконструкции кодека нужно показывать отдельно: генератор кодов не может восстановить информацию, которую кодек уже удалил.
Почему это различие важно
Метод и заявленная гарантия должны относиться к одной наблюдаемой границе.
Модель в пространстве токенов генерирует текстовые токены напрямую. Модель в пространстве кодов сначала генерирует дискретные латентные коды, а затем использует декодер для восстановления текста. Итоговые результаты можно сравнивать, но у кодового конвейера есть дополнительная точка отказа: потери реконструкции могут снизить потолок качества ещё до начала латентной генерации.
Поэтому корректное сравнение отвечает на два вопроса. Сначала нужно определить, сколько качества кодек сохраняет без генерации новых кодов. Затем — сколько дополнительных потерь вносит каждый генератор при неизменном протоколе оценки декодированного текста.
Практическая процедура
Задать базовый уровень исходного текста
Оцените отложенные исходные тексты тем же оценщиком и с той же предобработкой, которые будут использоваться на всех последующих этапах.
Измерить реконструкцию до генерации
Закодируйте и декодируйте те же примеры без выборки новых кодов. Это изолирует потолок качества, заданный кодеком.
Сравнить оба пространства после декодирования
Оценивайте результаты в пространстве токенов напрямую, а результаты в пространстве кодов — только после декодирования. Не сравнивайте латентную прокси-метрику с метрикой декодированного текста.
Показать распределения и неопределённость
Сообщайте медиану, поведение хвостов, число примеров, предобработку и неопределённость повторных запусков. Одно среднее значение может скрыть тяжёлые ошибки реконструкции.
Необходимые доказательства
Сила утверждения определяется свойством, действительно измеренным после генерации или декодирования.
- Во всех контрольных точках используется один внешний оценщик декодированного текста и одна предобработка.
- Результаты для исходного текста, реконструкции, пространства токенов и декодированного пространства кодов показаны отдельно.
- Разрыв реконструкции кодека не приписывается латентному генератору.
- Средние значения сопровождаются медианой и поведением хвостов.
- До обобщения небольших различий сообщаются случайные зерна или оценки неопределённости.
Что сообщает связанное исследование
- В описанном режиме TinyStories со сжатием 64→16 одна только реконструкция кодека повысила медианную внешнюю перплексию с 15,17 до 27,36.
- При том же оценщике медианная перплексия MDLM в пространстве кодов составила 26,55, а базовой модели в пространстве токенов — 38,42; в этом эксперименте снижение для кодовой генерации составило 30,9%.
- В доступных сопоставимых запусках геометрически осведомлённая регуляризация улучшила локальные латентные диагностические показатели, но не улучшила метрики декодированного текста.
Границы применимости
- Эти числа относятся к одному режиму сжатия TinyStories, одному иерархическому кодеку и описанной схеме оценки; они не задают универсальный порядок моделей в пространстве кодов и токенов.
- Перплексия полезна, но не измеряет полностью семантическое качество, разнообразие, фактическую точность или практическую полезность.
- Сравнения нужно интерпретировать вместе с указанными размерами выборок и ограничениями неопределённости.
Основные и смежные источники
Обращайтесь к связанным статьям за исходными методами, измерениями и заявленными ограничениями.
- Where Quality Breaks in Compressed Short-Text Generation
Основная статья и её поэтапные измерения.
- Simple and Effective Masked Diffusion Language Models
Формулировка маскированной дискретной диффузии, используемая латентным генератором.
- Neural Discrete Representation Learning
Основополагающий метод обучаемых дискретных представлений.