# Wie sich feststellen lässt, ob ein komprimierter Textgenerator am Codec oder am Generator scheitert

Canonical HTML: https://aogavrilov.com/de/research/codec-bottleneck-diagnosis/

Document language: de

Eine praxisorientierte Diagnose für zweistufige Systeme, die Text zunächst in diskrete Codes komprimieren und anschließend im Coderaum generieren. Ziel ist es, vor dem Einsatz von Rechenressourcen für die falsche Komponente zu bestimmen, welche Stufe die decodierte Ausgabe begrenzt.

Veröffentlicht 29. Juli 2026 Aktualisiert 30. Juli 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## Die Kurzantwort

Den Originaltext, die zugehörige Codec-Rekonstruktion und den abschließend generierten Text mit demselben externen Evaluator bewerten. Die Differenz zwischen Original und Rekonstruktion misst die bereits vor der Generierung auferlegte Qualitätsobergrenze. Die Differenz zwischen Rekonstruktion und Generierung isoliert anschließend die zusätzliche Verschlechterung durch den latenten Generator.

**Ersetzen Sie die decodierte Ausgabe nicht durch ein Proxymaß des latenten Raums.** Eine bessere Codebuchgeometrie, -auslastung oder -abdeckung kann diagnostisch nützlich sein, belegt jedoch nur dann eine Qualitätsverbesserung, wenn sich der decodierte Text gemäß den relevanten abschließenden Metriken verbessert.

## Eine Diagnose anhand von vier Prüfpunkten

1. Referenz bestimmen Zurückgehaltene Originaltexte mit demselben externen Evaluator bewerten, der in allen späteren Stufen verwendet wird.
2. Codec-Rekonstruktion messen Codieren und decodieren Sie dieselben Beispiele ohne Generierung. Dadurch werden die am Engpass verlorenen Informationen sichtbar.
3. Latente Generierung messen Generieren Sie Codes, decodieren Sie diese und bewerten Sie den resultierenden Text mit dem unveränderten Evaluator.
4. Transfer des Proxys prüfen Latente Diagnosemaße mit den abschließenden Metriken des dekodierten Textes vergleichen, statt eine Übertragung der Verbesserungen bei Proxy-Maßen vorauszusetzen.

## Interpretation der Unterschiede zwischen den Stufen

| Beobachtetes Muster | Wahrscheinlichster Engpass | Nächstes Experiment |
| --- | --- | --- |
| Originale erzielen gute Werte; Rekonstruktionen verschlechtern sich deutlich | Codec-Wiedergabetreue | Zunächst die Rekonstruktion verbessern oder die Kompression verringern, bevor der Generator optimiert wird |
| Die Rekonstruktionen bleiben hochwertig, während sich die erzeugten Ausgaben verschlechtern | Latenter Generator | Entrauschung, Stichprobenziehung, Konditionierung und Abweichungen in der Codeverteilung untersuchen |
| Latente Proxy-Metriken verbessern sich, die Metriken der dekodierten Ausgabe bleiben unverändert | Proxy-Übertragung | Erneut prüfen, ob der Proxy die relevante nachgelagerte Eigenschaft tatsächlich abbildet |
| Jede Stufe erzielt schlechte Werte | Daten, Evaluator oder Versuchsaufbau | Referenzverteilung und Bewertungsmodell validieren, bevor ein Versagen dem Modell zugeschrieben wird |

## Was die veröffentlichte TinyStories-Fallstudie ergab

In [*Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization*](https://aogavrilov.com/de/publications/where-quality-breaks/) , Texte mit 64 Token werden durch einen hierarchischen VQ-VAE-2 auf 16 Codes der obersten Ebene komprimiert. Bei der Bewertung mit einem externen GPT-2-Modell steigt der Median der Perplexität von **15.17** für Originaltexte auf **27.36** für Codec-Rekonstruktionen, während p95 ansteigt von **25.10** zu **98.91** .

### Maskierte Diffusionssprachmodellierung im Coderaum und im Tokenraum im Vergleich

Die Rekonstruktionslücke dominiert die untersuchte Pipeline. Innerhalb dieser Obergrenze erzielt die maskierte Diffusionssprachmodellierung (MDLM) im Coderaum unter dem gemeinsamen Bewerter dennoch bessere Ergebnisse als MDLM im Tokenraum: Die mediane Perplexität beträgt **26.55** gegenüber **38.42** , was einer Verringerung um 30,9 % entspricht.

Die geometriebewusste Regularisierung verbessert in den verfügbaren abgestimmten Versuchsläufen lokale Proxymaße des latenten Raums, nicht jedoch die Metriken für decodierten Text. Dieses negative Transferergebnis ist Teil der Diagnose und kein Beleg dafür, dass der Regularisierer den endgültigen Text verbessert hat.

## Was auf jeder Stufe zu messen ist

## Forschungsfragen, die dieser Leitfaden beantwortet

Diese knappen Antworten verknüpfen häufige Diagnosefragen mit der stufenweise gemessenen Evidenz.

1. Wie schnitten die maskierten Diffusionsmodelle im Code- und Tokenraum im beschriebenen Textexperiment ab? Unter demselben externen Bewertungsmodell erzielte MDLM im Coderaum eine mediane Perplexität von 26.55 gegenüber 38.42 für die Basislinie im Tokenraum, was einer Reduktion um 30.9% entspricht. Der Median der Codec-Rekonstruktion lag bereits bei 27.36; das Ergebnis muss daher gemeinsam mit dem Rekonstruktionsengpass interpretiert werden. [Die ausgewiesenen Kennzahlen der einzelnen Stufen prüfen](https://aogavrilov.com/de/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. Wie lassen sich maskierte Diffusionsmodelle im Code- und Tokenraum bei einem verlustbehafteten Codec vergleichen? Verwenden Sie dieselben zurückgehaltenen Stichproben und dasselbe Bewertungsmodell für dekodierten Text bei Originalen, Codec-Rekonstruktionen sowie Ausgaben im Token- und Coderaum. Weisen Sie die Rekonstruktionsdifferenz gesondert aus, da auch ein stärkerer latenter Generator keine bereits vom Codec entfernten Informationen wiederherstellen kann. [Die Stufen mit demselben Bewertungsmodell vergleichen](https://aogavrilov.com/de/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. Wie lässt sich ein Qualitätsverlust in einem zweistufigen Textgenerator diagnostizieren? Mit ein und demselben unveränderten Evaluator für decodierten Text zunächst die Lücke zwischen Original und Rekonstruktion und anschließend jene zwischen Rekonstruktion und Generierung messen. Dadurch lässt sich die vom Codec gesetzte Qualitätsobergrenze von der zusätzlichen, durch latente Generierung verursachten Verschlechterung trennen. [Folgen Sie der Diagnose anhand von vier Prüfpunkten](https://aogavrilov.com/de/research/codec-bottleneck-diagnosis/#workflow) .
4. Wann führen bessere Metriken des latenten Raums nicht zu einer besseren dekodierten Ausgabe? Ein Proxy im latenten Raum kann sich verbessern, ohne die relevante nachgelagerte Eigenschaft abzubilden. Der Transfer ist zu prüfen, indem vergleichbare Ausgaben decodiert und mit denselben abschließenden Metriken bewertet werden; andernfalls bleiben Codebuchgeometrie oder -auslastung diagnostische Evidenz und stellen keinen Gewinn an Textqualität dar. [Proxy-Transfer-Diagnose verwenden](https://aogavrilov.com/de/research/codec-bottleneck-diagnosis/#decision-table) .

## Häufige Diagnosefehler

### Ausschließlicher Vergleich der Endausgaben

Eine End-to-End-Kennzahl lässt nicht erkennen, ob die Repräsentation oder der Generator den Verlust verursacht hat.

### Wechsel der Bewertungsmodelle zwischen den Stufen

Unterschiedliche Evaluatoren machen die Abweichungen zwischen den Stufen unvergleichbar und schwächen die kausale Zuordnung.

### Den Zustand des Codebuchs als „Textqualität“ zu bezeichnen

Eine angemessene Auslastung kann zugleich mit mangelhaften Rekonstruktionen oder mangelhaften decodierten Generierungen auftreten.

### Verallgemeinerung eines einzelnen Kompressionsregimes

Die veröffentlichte Evidenz umfasst eine TinyStories-Konfiguration mit Kompression von 64 auf 16 sowie deskriptive Einzelläufe.

## Primärer Hintergrund

Diese Quellen definieren den Datensatz und die Modellfamilien, auf die sich die diagnostische Studie bezieht.

1. [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) Führt VQ-VAE und den erlernten diskreten Engpass ein, den spätere latente Generatoren verwenden.
2. [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) Entwickelt eine hierarchische diskrete Repräsentation mit getrennten Codeebenen.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) Stellt den synthetischen Kurzgeschichtenkorpus vor, der in der diagnostischen Fallstudie verwendet wird.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) Beschreibt die Formulierung der maskierten diskreten Diffusion, die für den latenten Generator verwendet wird.

## Evidenzgrenze

Die stufenweise Methode ist wiederverwendbar, die berichtete Rangfolge gilt jedoch nicht universell. Das veröffentlichte Experiment verwendet TinyStories, ein aggressives Kompressionsregime, eine hierarchische Codec-Familie, einen maskierten diskreten Generator und deskriptive Einzelläufe. Wenden Sie das Diagnoseprotokoll auf ein neues System an; übertragen Sie die numerische Schlussfolgerung nicht auf einen anderen Kontext.

## Verwandte Publikationen

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/de/publications/where-quality-breaks/)

Wo Qualität bei komprimierter Kurztextgenerierung einbricht: stufenweise Lokalisierung von Engpässen

Diagnostische Methodik FRUCT 39 2026 Hauptkonferenz

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/de/publications/inspectable-control/)

Überprüfbare Steuerung für die strukturerhaltende Regenerierung von Software

Steuerungsverfahren für den latenten Raum FSE Companion '26 2026 Begleitposter
