# Inspectable Control for Structure-Preserving Software Regeneration

Canonical HTML: https://aogavrilov.com/sk/publications/inspectable-control/

Document language: sk

Preskúmateľné riadenie opätovného generovania softvéru so zachovaním štruktúry

Kontrolovateľné čiastočné opätovné generovanie kódu pomocou hierarchických diskrétnych latentných reprezentácií.

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Mikhail Mozikov](https://orcid.org/0000-0003-0594-867X) 2 [Ilya Makarov](https://orcid.org/0000-0002-3308-8825) 2 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Petrohrad, Ruská federácia](https://en.itmo.ru/)
2. [AXXX, Moskva, Ruská federácia](https://axxx.tech/)

[Prečítať celý článok vo formáte HTML](https://aogavrilov.com/publications/inspectable-control/full-text/) Prehľadávateľný text so vzorcami, tabuľkami, obrázkami a bibliografickými odkazmi.

Autorský rukopis pripravený na tlač s konečným zoznamom autorov a DOI. CC BY 4.0 author manuscript; the ACM DOI page remains the version of record. [Podmienky zverejnenia a opätovného použitia](https://creativecommons.org/licenses/by/4.0/) .

## Článok za 30 sekúnd

**Výskumná otázka** Ako môže generatívny model upraviť vybrané časti programu a pritom zachovať zvolené prvky jeho hrubej štruktúry?

### Problém

Pri úprave kódu s podporou AI často treba vykonať jedinú ohraničenú zmenu a pritom zachovať vybrané prvky štruktúry programu. Opätovné vygenerovanie celého programu môže zasiahnuť aj nesúvisiace oblasti a obmedzenia na úrovni tokenov neposkytujú rozhranie na riadenie hrubej štruktúry.

### Prístup

Štúdia kóduje 64-tokenové funkcie v jazyku Python pomocou hierarchického VQ-VAE, uzamyká vybrané hrubé diskrétne kódy a na lokálne opätovné generovanie kódu vo zvyšných latentných pozíciách používa maskované diskrétne generovanie.

### Hlavný výsledok

Uzamknutie štyroch kódov najvyššej úrovne zvyšuje mieru úspešnej syntaktickej analýzy z 0.453 na 0.591, pričom miera zmien odomknutých pozícií naďalej dosahuje 0.936 a podiel jedinečných podmienených vzoriek zostáva na úrovni 0.998.

### Prečo je to dôležité

Výsledky ukazujú merateľný kompromis medzi stabilitou a voľnosťou pri riadenej úprave kódu a čiastočnom opätovnom generovaní programu. Poskytujú prvotné dôkazy o preskúmateľnej vrstve riadenia v latentnom priestore, nie dôkaz sémantickej ekvivalencie ani funkčnej správnosti.

## Abstrakt

Postupy softvérového inžinierstva, ako sú opravy s obmedzeniami, etapové zdokonaľovanie a úpravy so zachovaním štruktúry, vyžadujú riadenie toho, čo sa smie zmeniť a čo má zostať nemenné. Generovanie na úrovni tokenov je pri týchto operáciách slabým riadiacim rozhraním, pretože obmedzuje lokálnu povrchovú podobu kódu, nie hrubé štruktúrne invarianty, ktoré sa softvérové inžinierstvo často usiluje zachovať. Hierarchické diskrétne latentné reprezentácie skúmame ako preskúmateľnú medzireprezentáciu softvérových artefaktov: hierarchický VQ-VAE komprimuje 64-tokenovú funkciu v jazyku Python na hrubé a jemné diskrétne kódy a maskované diskrétne generovanie pri čiastočných obmedzeniach opätovne generuje iba vybrané pozície. Na 2,000 predspracovaných funkciách v jazyku Python zvýšilo uzamknutie štyroch kódov najvyššej úrovne mieru úspešnej syntaktickej analýzy z 0.453 na 0.591, pričom sa zachovala výrazná miera zmien v odomknutých pozíciách (voľnosť úprav, 0.936) aj takmer maximálna jedinečnosť vzoriek (rozmanitosť, 0.998). Pri pevnom hrubom kontexte je zdokonaľovanie na nižšej úrovni slabšie, zostáva však monotónne, čo podporuje interpretáciu hierarchie od hrubej k jemnej úrovni. Tieto výsledky celkovo predstavujú prvotné dôkazy o praktickej vrstve riadenia, ktorá nad úrovňou tokenov umožňuje ohraničené opätovné generovanie softvérových artefaktov so zachovaním štruktúry.

Miesto publikovania Zborník 34. medzinárodnej konferencie ACM o základoch softvérového inžinierstva

Typ prínosu Metóda riadenia v latentnom priestore

5. júla 2026 s. 1406–1407 Sprievodný poster

DOI [https://doi.org/10.1145/3803437.3807386](https://doi.org/10.1145/3803437.3807386)

## Obsah Na tejto stránke

## Kľúčové výsledky

| Nastavenie | Úspešnosť syntaktickej analýzy | Kostra | Signatúra | Odomknutá zmena |
| --- | --- | --- | --- | --- |
| Vstup (skrátený) | 0.994 | 0.994 | 0.994 | — |
| Rekonštrukcia kodeku | 0.857 | 0.848 | 0.493 | 0 |
| Nepodmienené generovanie | 0.453 | 0.08 | 0 | 0.995 |
| Podmienené, prefix k=4 | 0.591 | 0.295 | 0.061 | 0.936 |
| Podmienené, rozsah signatúry | 0.6 | 0.302 | 0.063 | neuvedené |

**Kľúčový výsledok.** Uzamknutie hrubých latentných reprezentácií zvyšuje syntaktickú stabilitu bez potlačenia zmien v upravovateľnej oblasti; výsledok dokladá riadenie štruktúry, nie zaručenú funkčnú ekvivalenciu.

Stiahnuť výsledky: [CSV](https://aogavrilov.com/publications/inspectable-control/results.csv) [JSON](https://aogavrilov.com/publications/inspectable-control/results.json) [Markdown](https://aogavrilov.com/publications/inspectable-control/results.md) Externé zrkadlo: [Karta dátového súboru Hugging Face](https://huggingface.co/datasets/aogavrilov/inspectable-control-results)

## PDF a citácia

**Citovať túto prácu** Odporúčaným formátom je BibTeX. Všetky nižšie uvedené varianty sa generujú z rovnakého publikačného záznamu.

```
@inproceedings{Gavrilov2026InspectableControl,
  title      = {Inspectable Control for Structure-Preserving Software Regeneration},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Mozikov, Mikhail and Makarov, Ilya and Muravyov, Sergey},
  booktitle  = {Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering},
  publisher  = {ACM},
  year       = {2026},
  pages      = {1406--1407},
  doi        = {10.1145/3803437.3807386},
  url        = {https://doi.org/10.1145/3803437.3807386},
  isbn       = {979-8-4007-2636-1},
}
```

Citačné súbory: [Text podľa APA](https://aogavrilov.com/publications/inspectable-control/citation-apa.txt) [Text podľa normy IEEE](https://aogavrilov.com/publications/inspectable-control/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/inspectable-control/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/inspectable-control/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/inspectable-control/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/inspectable-control/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/inspectable-control/openaire.xml) [MODS XML](https://aogavrilov.com/publications/inspectable-control/mods.xml) [Metadáta XML podľa JATS 1.4](https://aogavrilov.com/publications/inspectable-control/metadata.jats.xml) [Plný text vo formáte JATS 1.4 XML](https://aogavrilov.com/publications/inspectable-control/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/inspectable-control/metadata.ttl) [Súbor odkazov (JSON)](https://aogavrilov.com/publications/inspectable-control/linkset.json) [Súbor odkazov (HTTP)](https://aogavrilov.com/publications/inspectable-control/linkset) [RO-Crate](https://aogavrilov.com/publications/inspectable-control/ro-crate-metadata.json)

DOI: [https://doi.org/10.1145/3803437.3807386](https://doi.org/10.1145/3803437.3807386)

Úplná príručka

## Úplná výskumná príručka

## Metóda

## 

Metóda komprimuje krátku funkciu jazyka Python do dvoch úrovní diskrétnych kódov, zafixuje vybrané hrubé pozície a pred spätným dekódovaním na kód opätovne vygeneruje zostávajúce pozície.

1. Zakódovať Pomocou hierarchického VQ-VAE skomprimujte funkciu v jazyku Python so 64 tokenmi do 16 kódov vyššej úrovne a 32 kódov nižšej úrovne.
2. Uzamknúť Vyberte hrubé pozície kódov reprezentujúce štruktúru, ktorú treba zachovať, napríklad prefix pokrývajúci rozsah signatúry funkcie.
3. Opätovne generovať Vykonať maskované diskrétne generovanie iba nad odomknutými pozíciami a dokončenú hierarchiu dekódovať späť do zdrojového kódu.
4. Skontrolovať Pred prijatím regenerovaného výstupu zmerajte úspešnosť syntaktickej analýzy, zástupné ukazovatele štruktúry, zmenu v odomknutých pozíciách a jedinečnosť vzoriek.

![Vybrané hrubé kódy programu zostávajú nemenné, kým sa maskované jemné diskrétne kódy opätovne vygenerujú a dekódujú do upravenej funkcie v jazyku Python.](https://aogavrilov.com/publications/inspectable-control/hierarchical-discrete-latent-code-editing.svg)

**Úprava hierarchických diskrétnych latentných kódov zachováva vybrané prvky hrubej štruktúry programu a zároveň opätovne generuje jemné kódy v upravovateľnej oblasti.* Zdroj: [Vysvetľujúci diagram vytvorený autorom na základe publikovanej metódy a výsledkov.](https://doi.org/10.1145/3803437.3807386) . Podmienky opätovného použitia: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . Odporúčaná citácia: Gavrilov et al. (2026), Inspectable Control for Structure-Preserving Software Regeneration. [Stiahnuť SVG](https://aogavrilov.com/publications/inspectable-control/hierarchical-discrete-latent-code-editing.svg) .*

### Kľúčová myšlienka

Kontrola sa uplatňuje na naučenú reprezentáciu nad úrovňou tokenov: hrubé latentné pozície určujú explicitné miesta, na ktorých možno štruktúru zmraziť, zatiaľ čo blízke implementačné detaily zostávajú upravovateľné.

### Odlišnosť od príbuzných prístupov

Obmedzenia na úrovni inštrukcie alebo tokenov pôsobia na povrchovú podobu textu. Navrhované rozhranie sprístupňuje hrubé aj jemné diskrétne kontrolné body a meria výsledný kompromis medzi stabilitou a voľnosťou.

### Čo je nové

Práca predstavuje a hodnotí kontrolovateľnú vrstvu hierarchického riadenia v latentnom priestore na ohraničenú regeneráciu softvérových artefaktov.

## Otázky, na ktoré tento článok pomáha odpovedať

## 

Otvorte otázku a získajte stručnú odpoveď podloženú článkom. Podrobné hranice dôkazov sú uvedené v časti Obmedzenia.

1. Ako môže AI upravovať kód bez toho, aby všetko prepísala? Článok skúma čiastočné opätovné generovanie kódu nad úrovňou tokenov. Hierarchický VQ-VAE mapuje krátku funkciu jazyka Python na hrubé a jemné diskrétne kódy; vybrané hrubé pozície sa uzamknú a maskované diskrétne generovanie pred dekódovaním zmení iba zostávajúce latentné pozície. Tým sa namiesto opätovného generovania celej funkcie vytvára explicitná hranica zachovania.
2. Ktoré metódy zachovávajú štruktúru programu počas generovania kódu? Táto práca testuje hierarchické diskrétne riadenie v latentnom priestore. Hrubé latentné pozície možno zafixovať, zatiaľ čo odomknuté pozície sa regenerujú; následne sa meria podiel úspešného syntaktického rozboru a zástupné ukazovatele štruktúry. Dôkazy sa týkajú pravdepodobnostnej štruktúrnej stability krátkych funkcií jazyka Python; nepreukazujú presné zachovanie AST, sémantickú ekvivalenciu ani funkčnú správnosť.
3. Môžu hierarchické diskrétne latentné reprezentácie umožniť lokalizovanú kontrolu nad kódom? V opísanom experimente s 2 000 funkciami zvýšilo uzamknutie štyroch kódov najvyššej úrovne mieru úspešnej syntaktickej analýzy z 0.453 na 0.591. Zároveň sa zmenilo 0.936 odomknutých pozícií a podiel jedinečných podmienených vzoriek dosiahol 0.998. Tieto výsledky predstavujú predbežný dôkaz, že hrubé latentné obmedzenia môžu zachovať časť štruktúry bez odstránenia voľnosti lokálnych úprav či rozmanitosti vzoriek.
4. Ako možno pri generovaní kódu vyvážiť stabilitu štruktúry a rozmanitosť? Článok hodnotí stabilitu a voľnosť spoločne namiesto optimalizácie samotnej platnosti. Uzamknutie hrubých kódov zvyšuje syntaktickú platnosť, zatiaľ čo miera zmien v neuzamknutých pozíciách zostáva vysoká a podmienené vzorky zostávajú takmer úplne jedinečné. Výsledok preukazuje merateľný kompromis medzi stabilitou a voľnosťou v testovanej konfigurácii, nie univerzálne optimum.
5. Ako táto práca súvisí s úpravou kódu podporovanou veľkými jazykovými modelmi? Testovaným modelom je hierarchický VQ-VAE s maskovanou diskrétnou difúziou, nie veľký jazykový model. Problém riadenia je napriek tomu relevantný pre úpravy podporované LLM, pretože zbytočné zmeny mimo požadovanej oblasti predstavujú praktický problém. Článok prináša doplnkový mechanizmus v latentnom priestore a rámec hodnotenia, nie referenčný test úprav pomocou LLM.

## Porovnanie s príbuznými prístupmi

## 

| Schopnosť | Riadenie na úrovni tokenov | Hierarchická kontrola latentného priestoru |
| --- | --- | --- |
| Zafixujte hrubú štruktúru | Obmedzené | Natívne uzamknutie hrubých kódov |
| Čiastočná regenerácia | Krehké povrchové obmedzenia | Maskované prevzorkovanie vybraných kódov |
| Kontrolné body umožňujúce kontrolu zásahov | Bez explicitnej medzivrstvy | Hrubé a jemné diskrétne pozície |
| Dôkazy v tejto práci | Nehodnotené ako úplná referenčná metóda | Diagnostika syntaktickej stability a voľnosti úprav |

Tabuľka opisuje rozhrania a dôkazy namerané v štúdii; netvrdí funkčnú správnosť ani univerzálnu prevahu.

## Relevantnosť a rozsah

## 

Článok je najrelevantnejší pre práce vyžadujúce explicitnú kontrolu nad tým, čo môže transformácia kódu podporovaná umelou inteligenciou zmeniť a ktoré časti programu majú zostať stabilné.

1. Kontrolovateľné generovanie kódu so zachovaním štruktúry
2. Lokalizovaná oprava programov a ohraničená refaktorizácia
3. Hierarchické diskrétne reprezentácie zdrojového kódu
4. Maskované diskrétne generovanie zdrojového kódu
5. Latentné riadenie softvérových artefaktov

## Obmedzenia

## 

- Štúdia sa obmedzuje na krátke funkcie jazyka Python skrátené na 64 tokenov.
- Hodnotenie používa dekódovanie argmax a syntaktické či štruktúrne zástupné ukazovatele namiesto testov funkčnej ekvivalencie.
- Presné zachovanie signatúry zostáva nedostatočné.
- Riadenie na nižšej úrovni je slabšie než riadenie na najvyššej úrovni.
- Latentné pozície zatiaľ nie sú zosúladené so sémantickými oblasťami, ako sú úseky AST, signatúry alebo štruktúra toku riadenia.
- Výsledky nepreukazujú správnosť pri praktických opravách, refaktorizácii ani zmenách na úrovni repozitára.

## Literatúra citovaná v článku

## 

Tieto položky zodpovedajú číslovanému zoznamu literatúry v dokumente PDF.

1. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
2. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
3. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
4. Shraddha Barke, Michael B. James, Nadia Polikarpova. 2023 . [Grounded Copilot: How Programmers Interact with Code-Generating Models](https://doi.org/10.1145/3586030) . Proceedings of the ACM on Programming Languages .
5. Fengji Zhang, Bei Chen, Yue Zhang, Jacky Keung, Jin Liu, Daoguang Zan, Yi Mao, Jian-Guang Lou, Weizhu Chen. 2023 . [RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation](https://doi.org/10.18653/v1/2023.emnlp-main.151) . Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing .

## Zdroje a reprodukovateľnosť

## 

### Vyhlásenie o údajoch

## Verzie

## 

1. **Publikovaná verzia** [ACM FSE Companion, 2026](https://doi.org/10.1145/3803437.3807386)
2. **Autorský rukopis** [Textovo prístupný finálny rukopis s konečným zoznamom autorov a DOI](https://aogavrilov.com/publications/inspectable-control/paper.pdf)
3. **Externé zrkadlo plného textu** [Autorský rukopis s licenciou CC BY 4.0 na Hugging Face](https://huggingface.co/datasets/aogavrilov/inspectable-control-results/resolve/main/paper.pdf)
4. **Otvoriť záznam v repozitári** [Záznam Zenodo indexovaný službou OpenAIRE](https://zenodo.org/records/21605395)
5. **Otvoriť plný text v repozitári** [Autorský rukopis na Zenodo s licenciou CC BY 4.0; textovo zhodný s lokálnym rukopisom](https://zenodo.org/records/21605395/files/fse2026-posters-final11%20%284%29.pdf?download=1)
6. **Autorské materiály** [Poster a prezentácia](https://aogavrilov.com/publications/inspectable-control/media/)
7. **Bibliografický záznam** [DBLP](https://dblp.org/rec/conf/sigsoft/GavrilovGMMM26)
8. **Otvoriť odborný záznam** [OpenAlex](https://openalex.org/W7169573479)
9. **Záznam citačného grafu** [Semantic Scholar](https://www.semanticscholar.org/paper/93c3de037596ce177d9d882d214ccad5c5405b00)
10. **Plný text sprístupnený autorom** [ResearchGate](https://www.researchgate.net/publication/410435483_Inspectable_Control_for_Structure-Preserving_Software_Regeneration)
11. **Zhrnutie zrozumiteľným jazykom** [Uznanie](https://www.growkudos.com/publications/10.1145%252F3803437.3807386/reader)

Publikované DOI je primárnym bibliografickým identifikátorom. Táto stránka zostáva jedinou kanonickou adresou URL projektu naprieč verziami.

## Súvisiaca publikácia

- [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/sk/publications/where-quality-breaks/)

Prečítať [Kontrolovateľná úprava kódu](https://aogavrilov.com/sk/projects/discrete-latent-generation/) výskumného sprievodcu. [O autorovi](https://aogavrilov.com/about/) .

### Cielené výskumné poznámky

Odpovede prispôsobené zámeru s jasne vymedzenou dôkaznou oporou a odkazmi na tento článok.

- [Lokálna úprava kódu pomocou generatívnych modelov](https://aogavrilov.com/sk/research-notes/localized-code-modification-generative-models/)
- [Generovanie kódu s obmedzeniami pre softvérové inžinierstvo](https://aogavrilov.com/sk/research-notes/constrained-code-generation-software-engineering/)
- [Refaktorizácia s podporou AI: metódy a dôkazy](https://aogavrilov.com/sk/research-notes/ai-assisted-refactoring-evidence/)
- [Predvídateľné generovanie kódu si vyžaduje špecifikáciu zachovania](https://aogavrilov.com/sk/research-notes/predictable-code-generation-preservation-contract/)
