# Как определить, где сбоит сжатый генератор текста: в кодеке или генераторе

Canonical HTML: https://aogavrilov.com/ru/projects/codec-bottleneck-diagnosis/

Document language: ru

Практическая диагностика двухэтапных систем, которые сначала сжимают текст в дискретные коды, а затем генерируют в пространстве кодов. Цель — определить этап, ограничивающий декодированный результат, прежде чем тратить вычисления на не тот компонент.

## Краткий ответ

Оцените исходный текст, его парную реконструкцию кодека и итоговый сгенерированный текст одним внешним оценщиком. Разрыв между оригиналом и реконструкцией измеряет потолок качества, заданный до генерации. Разрыв между реконструкцией и генерацией отделяет дополнительное ухудшение, внесённое латентным генератором.

**Не подменяйте декодированный результат прокси-метрикой латентного пространства.** Улучшение геометрии, использования или поддержки кодовой книги может быть полезным диагностическим признаком, но подтверждает рост качества лишь тогда, когда декодированный текст улучшается по релевантным итоговым метрикам.

## Диагностика из четырёх контрольных точек

1. Задайте эталон Оцените отложенные исходные тексты внешним оценщиком, который будет использоваться на всех следующих этапах.
2. Измерьте реконструкцию кодека Закодируйте и декодируйте те же примеры без генерации. Это выявит информацию, потерянную в узком месте.
3. Измерьте латентную генерацию Сгенерируйте коды, декодируйте их и оцените полученный текст тем же неизменным оценщиком.
4. Проверьте перенос прокси-метрики Сопоставьте латентную диагностику с итоговыми метриками декодированного текста, не предполагая автоматически, что улучшение прокси переносится.

## Как интерпретировать разрывы между этапами

| Наблюдаемая картина | Наиболее вероятное узкое место | Следующий эксперимент |
| --- | --- | --- |
| Оригиналы оцениваются хорошо, реконструкции резко ухудшаются | Точность кодека | Улучшите реконструкцию или уменьшите сжатие до настройки генератора |
| Реконструкции остаются качественными, сгенерированные результаты ухудшаются | Латентный генератор | Проверьте шумоподавление, сэмплирование, обусловливание и несовпадение распределений кодов |
| Латентные прокси улучшаются, метрики декодированного текста не меняются | Перенос прокси-метрики | Проверьте заново, отражает ли прокси нужное итоговое свойство |
| Все этапы оцениваются плохо | Данные, оценщик или постановка эксперимента | Проверьте эталонное распределение и оценщик, прежде чем объяснять результат сбоем модели |

## Что показал опубликованный эксперимент на TinyStories

В работе [*Где ухудшается качество при генерации сжатого короткого текста: поэтапная локализация узких мест*](https://aogavrilov.com/ru/publications/where-quality-breaks/) , тексты длиной 64 токена сжимаются до 16 кодов верхнего уровня иерархическим VQ-VAE-2. По одному внешнему оценщику GPT-2 медианная перплексия возрастает с **15.17** для исходных текстов до **27.36** для реконструкций кодека, а p95 возрастает с **25.10** до **98.91** .

Следовательно, в проверенном конвейере доминирует разрыв реконструкции. При этом MDLM в пространстве кодов превосходит MDLM в пространстве токенов по общему оценщику: медианная перплексия составляет **26.55** против **38.42** , то есть на 30,9% меньше.

Регуляризация с учётом геометрии улучшает локальные латентные прокси в доступных сопоставленных запусках, но не улучшает метрики декодированного текста. Этот отрицательный результат переноса — часть диагностики, а не доказательство улучшения итогового текста.

## Что измерять на каждом этапе

## Вопросы, на которые отвечает это руководство

Эти краткие ответы связывают типичные диагностические вопросы с измеренными поэтапными результатами.

1. Как в описанном текстовом эксперименте соотносятся маскированная диффузия в пространстве кодов и в пространстве токенов? При одном внешнем оценщике медианная перплексия MDLM в пространстве кодов составила 26,55 против 38,42 у базовой модели в пространстве токенов — снижение на 30,9%. При этом медиана реконструкции кодека уже составляла 27,36, поэтому результат нужно интерпретировать вместе с узким местом реконструкции. [Посмотреть поэтапные результаты](https://aogavrilov.com/ru/projects/codec-bottleneck-diagnosis/#case-study) .
2. Как сравнивать маскированную диффузию в пространстве кодов и токенов, если кодек вносит потери? Используйте одни и те же отложенные примеры и один оценщик декодированного текста для оригиналов, реконструкций кодека, результатов в пространстве токенов и кодов. Отдельно сообщайте разрыв реконструкции: более сильный латентный генератор не может восстановить информацию, уже удалённую кодеком. [Сравнить этапы одним оценщиком](https://aogavrilov.com/ru/projects/codec-bottleneck-diagnosis/#case-study) .
3. Как диагностировать потерю качества в двухэтапном генераторе текста? Сначала измерьте разрыв между оригиналом и реконструкцией, затем — между реконструкцией и генерацией, используя неизменный оценщик декодированного текста. Так потолок качества, заданный кодеком, отделяется от дополнительного ухудшения, внесённого латентной генерацией. [Открыть диагностику из четырёх контрольных точек](https://aogavrilov.com/ru/projects/codec-bottleneck-diagnosis/#workflow) .
4. Когда улучшение метрик латентного пространства не улучшает декодированный результат? Латентная прокси-метрика может улучшаться, не отражая нужное итоговое свойство. Проверяйте перенос на сопоставленных декодированных результатах с одними и теми же финальными метриками; иначе геометрия или использование кодовой книги остаются диагностическими данными, а не улучшением качества текста. [Открыть диагностику переноса прокси-метрики](https://aogavrilov.com/ru/projects/codec-bottleneck-diagnosis/#decision-table) .

## Типичные ошибки диагностики

### Сравнение только итоговых результатов

Сквозная оценка не показывает, вызвана ли потеря представлением или генератором.

### Смена оценщика между этапами

Разные оценщики делают разрывы между этапами несопоставимыми и ослабляют причинную интерпретацию.

### Подмена качества текста «здоровьем» кодовой книги

Хорошее использование кодовой книги может сочетаться с плохими реконструкциями или декодированными генерациями.

### Обобщение одного режима сжатия

Опубликованные результаты охватывают одну конфигурацию TinyStories 64→16 и описательные одиночные запуски.

## Основные источники

Эти источники описывают набор данных и семейства моделей, используемые в диагностическом исследовании.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Вводит VQ-VAE и обучаемое дискретное узкое место, использованное в последующих латентных генераторах.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Развивает иерархическое дискретное представление с отдельными уровнями кодов.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Представляет синтетический корпус коротких рассказов, использованный в диагностическом эксперименте.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Описывает формулировку маскированной дискретной диффузии, использованную для латентного генератора.

## Границы доказательств

Поэтапный метод можно применять повторно, но полученный порядок узких мест не универсален. В опубликованном эксперименте используются TinyStories, один агрессивный режим сжатия, одно семейство иерархических кодеков, один маскированный дискретный генератор и описательные одиночные запуски. Применяйте диагностический протокол к новой системе, а не переносите численный вывод в другую постановку.

## Связанные публикации

Методика диагностики ФРУКТ 39 2026 Основная конференция

Метод управления латентным пространством Компаньон ФСЕ '26 2026 Сопутствующий плакат
