# Inspectable Control for Structure-Preserving Software Regeneration

Canonical HTML: https://aogavrilov.com/cs/publications/inspectable-control/

Document language: cs

Přezkoumatelné řízení regenerace softwaru se zachováním struktury

Kontrolovatelná částečná regenerace kódu s využitím hierarchických diskrétních latentních reprezentací.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Mikhail Mozikov](https://orcid.org/0000-0003-0594-867X) 2 [Ilya Makarov](https://orcid.org/0000-0002-3308-8825) 2 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russian Federation](https://en.itmo.ru/)
2. [AXXX, Moskva, Ruská federace](https://axxx.tech/)

[Přečíst celý článek v HTML](https://aogavrilov.com/publications/inspectable-control/full-text/) Prohledávatelný text se vzorci, tabulkami, obrázky a bibliografickými odkazy.

Autorský rukopis připravený k tisku s konečným seznamem autorů a DOI. CC BY 4.0 author manuscript; the ACM DOI page remains the version of record. [Podmínky zveřejnění a opětovného použití](https://creativecommons.org/licenses/by/4.0/) .

## Článek ve 30 sekundách

**Výzkumná otázka** Jak může generativní model upravit vybrané části programu a přitom zachovat zvolené prvky jeho hrubé struktury?

### Problém

Úpravy kódu s podporou AI často vyžadují jedinou vymezenou změnu, zatímco zvolená struktura programu má zůstat zachována. Regenerování celého programu může narušit nesouvisející oblasti a omezení na úrovni tokenů neposkytují řídicí rozhraní pro hrubou strukturu.

### Přístup

Studie kóduje 64tokenové funkce v jazyce Python pomocí hierarchického VQ-VAE, uzamyká vybrané hrubé diskrétní kódy a ve zbývajících latentních pozicích používá maskované diskrétní generování k lokalizované regeneraci kódu.

### Hlavní výsledek

Uzamčení čtyř kódů nejvyšší úrovně zvyšuje podíl syntakticky analyzovatelných výstupů z 0.453 na 0.591; míra změn v odemčených pozicích přitom zůstává na 0.936 a jedinečnost podmíněných vzorků na 0.998.

### Proč je to důležité

Výsledky ukazují měřitelný kompromis mezi stabilitou a volností při řiditelných úpravách kódu a částečné regeneraci programu. Představují předběžné důkazy o přezkoumatelné řídicí vrstvě v latentním prostoru, nikoli důkaz sémantické ekvivalence či funkční správnosti.

## Abstrakt

Pracovní postupy softwarového inženýrství, jako jsou opravy s omezeními, postupné zpřesňování a úpravy se zachováním struktury, vyžadují kontrolu nad tím, co se mění a co zůstává pevné. Generování na úrovni tokenů je pro tyto operace slabým řídicím rozhraním, protože omezuje povrchovou podobu lokálního textu, nikoli hrubé strukturní invarianty, které se softwarové inženýrství často snaží zachovat. Hierarchické diskrétní latentní reprezentace zkoumáme jako přezkoumatelnou mezireprezentaci softwarových artefaktů: hierarchický VQ-VAE komprimuje 64tokenovou funkci v jazyce Python do hrubých a jemných diskrétních kódů a maskované diskrétní generování při částečných omezeních regeneruje pouze vybrané pozice. Na 2 000 předzpracovaných funkcích v jazyce Python zvýšilo uzamčení čtyř kódů nejvyšší úrovně podíl syntakticky analyzovatelných výstupů z 0.453 na 0.591, přičemž zůstala zachována značná míra změn v odemčených pozicích (volnost úprav 0.936) a téměř maximální jedinečnost vzorků (rozmanitost 0.998). Při zafixovaném hrubém kontextu je zpřesňování na nižší úrovni slabší, zůstává však monotónní, což podporuje interpretaci hierarchie od hrubé k jemné úrovni. Výsledky tak poskytují předběžné důkazy o praktickém řídicím rozhraní nad úrovní tokenů, které umožňuje vymezenou regeneraci softwarových artefaktů se zachováním struktury.

Publikováno na Sborník 34th ACM International Conference on the Foundations of Software Engineering

Typ přínosu Metoda řízení v latentním prostoru

5. července 2026 s. 1406–1407 Doprovodný poster

DOI [https://doi.org/10.1145/3803437.3807386](https://doi.org/10.1145/3803437.3807386)

## Obsah Na této stránce

## Klíčové výsledky

| Nastavení | Úspěšnost syntaktické analýzy | Kostra | Podpis | Změna v odemčené části |
| --- | --- | --- | --- | --- |
| Vstup (zkráceno) | 0.994 | 0.994 | 0.994 | — |
| Rekonstrukce kodeku | 0.857 | 0.848 | 0.493 | 0 |
| Nepodmíněné generování | 0.453 | 0.08 | 0 | 0.995 |
| Podmíněné, prefix k=4 | 0.591 | 0.295 | 0.061 | 0.936 |
| Podmíněné, úsek signatury | 0.6 | 0.302 | 0.063 | neuvedeno |

**Klíčový výsledek.** Uzamčení hrubých latentních reprezentací zvyšuje syntaktickou stabilitu, aniž by potlačilo změny v editovatelné oblasti; výsledek dokládá kontrolu struktury, nikoli zaručenou funkční ekvivalenci.

Stáhnout výsledky: [CSV](https://aogavrilov.com/publications/inspectable-control/results.csv) [JSON](https://aogavrilov.com/publications/inspectable-control/results.json) [Markdown](https://aogavrilov.com/publications/inspectable-control/results.md) Externí zrcadlová kopie: [Karta datové sady na Hugging Face](https://huggingface.co/datasets/aogavrilov/inspectable-control-results)

## PDF a citace

**Jak citovat tento článek** Doporučeným formátem je BibTeX. Všechny níže uvedené varianty pocházejí z téhož záznamu o publikaci.

```
@inproceedings{Gavrilov2026InspectableControl,
  title      = {Inspectable Control for Structure-Preserving Software Regeneration},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Mozikov, Mikhail and Makarov, Ilya and Muravyov, Sergey},
  booktitle  = {Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering},
  publisher  = {ACM},
  year       = {2026},
  pages      = {1406--1407},
  doi        = {10.1145/3803437.3807386},
  url        = {https://doi.org/10.1145/3803437.3807386},
  isbn       = {979-8-4007-2636-1},
}
```

Citační soubory: [Text citace podle APA](https://aogavrilov.com/publications/inspectable-control/citation-apa.txt) [Text ve formátu IEEE](https://aogavrilov.com/publications/inspectable-control/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/inspectable-control/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/inspectable-control/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/inspectable-control/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/inspectable-control/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/inspectable-control/openaire.xml) [MODS XML](https://aogavrilov.com/publications/inspectable-control/mods.xml) [Metadata XML ve formátu JATS 1.4](https://aogavrilov.com/publications/inspectable-control/metadata.jats.xml) [Plný text ve formátu JATS 1.4 XML](https://aogavrilov.com/publications/inspectable-control/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/inspectable-control/metadata.ttl) [Sada odkazů (JSON)](https://aogavrilov.com/publications/inspectable-control/linkset.json) [Sada odkazů (HTTP)](https://aogavrilov.com/publications/inspectable-control/linkset) [RO-Crate](https://aogavrilov.com/publications/inspectable-control/ro-crate-metadata.json)

DOI: [https://doi.org/10.1145/3803437.3807386](https://doi.org/10.1145/3803437.3807386)

Úplný průvodce

## Úplný výzkumný průvodce

## Metoda

## 

Metoda komprimuje krátkou funkci v Pythonu do dvou úrovní diskrétních kódů, zmrazí vybrané hrubé pozice a před zpětným dekódováním do kódu znovu vygeneruje zbývající pozice.

1. Zakódování Komprimujte 64tokenovou funkci v jazyce Python pomocí hierarchického VQ-VAE do 16 kódů vyšší úrovně a 32 kódů nižší úrovně.
2. Uzamčení Zvolte pozice hrubých kódů, které reprezentují strukturu určenou k zachování, například prefix pokrývající úsek signatury funkce.
3. Regenerace Provést maskované diskrétní generování pouze nad odemčenými pozicemi a dokončenou hierarchii dekódovat zpět do zdrojového kódu.
4. Zkontrolovat Před přijetím regenerovaného výstupu změřte úspěšnost syntaktické analýzy, strukturální zástupné ukazatele, změny v odemčených pozicích a jedinečnost vzorků.

![Vybrané hrubé kódy programu zůstávají pevné, zatímco maskované jemné diskrétní kódy se regenerují a dekódují do upravené funkce v jazyce Python.](https://aogavrilov.com/publications/inspectable-control/hierarchical-discrete-latent-code-editing.svg)

**Úpravy hierarchických diskrétních latentních kódů zachovávají vybranou hrubou strukturu programu a regenerují jemné kódy v upravitelné oblasti.* Zdroj: [Vysvětlující schéma vytvořené autorem na základě publikované metody a výsledků.](https://doi.org/10.1145/3803437.3807386) . Podmínky opětovného užití: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Doporučená citace: Gavrilov et al. (2026), Inspectable Control for Structure-Preserving Software Regeneration. [Stáhnout SVG](https://aogavrilov.com/publications/inspectable-control/hierarchical-discrete-latent-code-editing.svg) .*

### Hlavní myšlenka

Kontrola se uplatňuje na naučenou reprezentaci nad úrovní tokenů: hrubé latentní pozice vymezují konkrétní místa, na nichž lze strukturu zafixovat, zatímco okolní implementační detaily zůstávají editovatelné.

### Rozdíl oproti příbuzným přístupům

Omezení na úrovni zadání či tokenů působí na povrchovou podobu textu. Navržené rozhraní zpřístupňuje hrubé i jemné diskrétní řídicí body a měří výsledný kompromis mezi stabilitou a volností.

### Co je nové

Práce zavádí a hodnotí přezkoumatelnou hierarchickou řídicí vrstvu v latentním prostoru pro ohraničenou regeneraci softwarových artefaktů.

## Otázky, na které článek pomáhá odpovědět

## 

Otevřete otázku a zobrazte stručnou odpověď opřenou o článek. Podrobné hranice důkazní platnosti jsou uvedeny v části Omezení.

1. Jak může umělá inteligence upravovat kód, aniž by vše přepisovala? Článek zkoumá částečné regenerování kódu nad úrovní tokenů. Hierarchický VQ-VAE mapuje krátkou funkci v Pythonu na hrubé a jemné diskrétní kódy; vybrané hrubé pozice se uzamknou a maskované diskrétní generování před dekódováním mění pouze zbývající latentní pozice. Namísto regenerování celé funkce tak vzniká explicitní hranice zachování.
2. Které metody při generování kódu zachovávají strukturu programu? Tato práce testuje hierarchické diskrétní řízení v latentním prostoru. Hrubé latentní pozice lze zafixovat, zatímco odemčené pozice se regenerují; následně se měří podíl úspěšného syntaktického rozboru a zástupné ukazatele struktury. Doklady se týkají pravděpodobnostní strukturální stability krátkých funkcí v jazyce Python; neprokazují přesné zachování AST, sémantickou ekvivalenci ani funkční správnost.
3. Mohou hierarchické diskrétní latentní reprezentace umožnit lokalizovanou kontrolu nad kódem? V popsaném experimentu s 2,000 funkcemi zvýšilo uzamčení čtyř kódů nejvyšší úrovně podíl syntakticky analyzovatelných výstupů z 0.453 na 0.591. Současně se změnilo 0.936 odemčených pozic a podíl jedinečných podmíněných vzorků dosáhl 0.998. Tyto výsledky představují předběžný doklad, že hrubá omezení v latentním prostoru mohou zachovat část struktury, aniž by odstranila volnost lokálních úprav či rozmanitost vzorků.
4. Jak lze při generování kódu vyvážit stabilitu struktury a rozmanitost? Článek hodnotí stabilitu a volnost společně, namísto optimalizace pouhé platnosti. Uzamčení hrubých kódů zvyšuje syntaktickou platnost, zatímco míra změn v odemčených pozicích zůstává vysoká a podmíněné vzorky téměř zcela jedinečné. Výsledek dokládá měřitelný kompromis mezi stabilitou a volností v testované konfiguraci, nikoli univerzální optimum.
5. Jak tato práce souvisí s úpravami kódu podporovanými velkými jazykovými modely? Testovaným modelem je hierarchický VQ-VAE s maskovaným diskrétním generováním, nikoli velký jazykový model. Problém řízení je přesto relevantní pro editaci podporovanou LLM, protože zbytečné změny mimo požadovanou oblast představují praktický problém. Článek přináší doplňkový mechanismus v latentním prostoru a rámec hodnocení, nikoli benchmark editace pomocí LLM.

## Porovnání s příbuznými přístupy

## 

| Schopnost | Řízení na úrovni tokenů | Hierarchická kontrola latentní reprezentace |
| --- | --- | --- |
| Zafixujte hrubou strukturu | Omezené | Nativní uzamykání hrubých kódů |
| Částečná regenerace | Křehká povrchová omezení | Maskované převzorkování vybraných kódů |
| Kontrolní body umožňující inspekci | Žádná explicitní mezivrstva | Hrubé a jemné diskrétní pozice |
| Důkazy v této práci | Nehodnoceno jako úplná referenční metoda | Diagnostika syntaktické stability a volnosti úprav |

Tabulka popisuje rozhraní a empirické doklady naměřené ve studii; netvrdí funkční správnost ani univerzální převahu.

## Relevance a rozsah

## 

Článek je nejrelevantnější pro práce vyžadující explicitní kontrolu nad tím, co smí transformace kódu s podporou AI změnit a které části programu mají zůstat stabilní.

1. Kontrolovatelné generování kódu se zachováním struktury
2. Lokalizované opravy programů a ohraničená refaktorizace
3. Hierarchické diskrétní reprezentace zdrojového kódu
4. Maskované diskrétní generování zdrojového kódu
5. Řízení softwarových artefaktů prostřednictvím latentních reprezentací

## Omezení

## 

- Studie se omezuje na krátké funkce v jazyce Python zkrácené na 64 tokenů.
- Hodnocení používá dekódování pomocí argmax a syntaktické či strukturní zástupné metriky namísto testů funkční ekvivalence.
- Přesné zachování signatur zůstává nespolehlivé.
- Řízení na nižší úrovni je slabší než řízení na nejvyšší úrovni.
- Latentní pozice dosud nejsou propojeny se sémantickými oblastmi, jako jsou úseky AST, signatury nebo struktura toku řízení.
- Výsledky nedokládají správnost při praktických opravách, refaktorizaci ani změnách na úrovni repozitáře.

## Literatura citovaná v článku

## 

Tyto položky odpovídají číslovanému oddílu References v PDF článku.

1. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
2. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
3. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
4. Shraddha Barke, Michael B. James, Nadia Polikarpova. 2023 . [Grounded Copilot: How Programmers Interact with Code-Generating Models](https://doi.org/10.1145/3586030) . Proceedings of the ACM on Programming Languages .
5. Fengji Zhang, Bei Chen, Yue Zhang, Jacky Keung, Jin Liu, Daoguang Zan, Yi Mao, Jian-Guang Lou, Weizhu Chen. 2023 . [RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation](https://doi.org/10.18653/v1/2023.emnlp-main.151) . Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing .

## Zdroje a reprodukovatelnost

## 

### Prohlášení o datech

## Verze

## 

1. **Publikovaná verze** [ACM FSE Companion, 2026](https://doi.org/10.1145/3803437.3807386)
2. **Autorský rukopis** [Textově přístupný finální rukopis s konečným seznamem autorů a DOI](https://aogavrilov.com/publications/inspectable-control/paper.pdf)
3. **Externí zrcadlová kopie plného textu** [Autorský rukopis pod licencí CC BY 4.0 na Hugging Face](https://huggingface.co/datasets/aogavrilov/inspectable-control-results/resolve/main/paper.pdf)
4. **Otevřít záznam v repozitáři** [Záznam Zenodo indexovaný službou OpenAIRE](https://zenodo.org/records/21605395)
5. **Otevřít plný text v repozitáři** [Autorský rukopis na Zenodo pod licencí CC BY 4.0; textově shodný s místním rukopisem](https://zenodo.org/records/21605395/files/fse2026-posters-final11%20%284%29.pdf?download=1)
6. **Materiály autora** [Poster a prezentace](https://aogavrilov.com/publications/inspectable-control/media/)
7. **Bibliografický záznam** [DBLP](https://dblp.org/rec/conf/sigsoft/GavrilovGMMM26)
8. **Otevřít odborný záznam** [OpenAlex](https://openalex.org/W7169573479)
9. **Záznam v citačním grafu** [Semantic Scholar](https://www.semanticscholar.org/paper/93c3de037596ce177d9d882d214ccad5c5405b00)
10. **Plný text zpřístupněný autorem** [ResearchGate](https://www.researchgate.net/publication/410435483_Inspectable_Control_for_Structure-Preserving_Software_Regeneration)
11. **Shrnutí srozumitelným jazykem** [Ocenění](https://www.growkudos.com/publications/10.1145%252F3803437.3807386/reader)

Publikované DOI je primárním bibliografickým identifikátorem. Tato stránka zůstává napříč verzemi jedinou kanonickou adresou URL projektu.

## Související publikace

- [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/cs/publications/where-quality-breaks/)

Přečíst [Kontrolovatelná editace kódu](https://aogavrilov.com/cs/projects/discrete-latent-generation/) průvodce výzkumem. [O autorovi](https://aogavrilov.com/about/) .

### Cílené výzkumné poznámky

Odpovědi přizpůsobené konkrétnímu záměru, s vymezením důkazní opory a odkazy zpět na tento článek.

- [Lokalizované změny kódu pomocí generativních modelů](https://aogavrilov.com/cs/research-notes/localized-code-modification-generative-models/)
- [Omezené generování kódu pro softwarové inženýrství](https://aogavrilov.com/cs/research-notes/constrained-code-generation-software-engineering/)
- [Refaktorizace s podporou AI: metody a důkazy](https://aogavrilov.com/cs/research-notes/ai-assisted-refactoring-evidence/)
- [Předvídatelné generování kódu vyžaduje kontrakt zachování](https://aogavrilov.com/cs/research-notes/predictable-code-generation-preservation-contract/)
