Inspectable Control for Structure-Preserving Software Regeneration
کنترل بازرسیپذیر برای بازتولید نرمافزار با حفظ ساختار
بازتولید جزئی و کنترلپذیر کُد با استفاده از بازنماییهای نهفتهٔ گسستهٔ سلسلهمراتبی.
متن کامل مقاله را در قالب HTML بخوانیدمتن قابل جستوجو همراه با فرمولها، جدولها، شکلها و منابع.
نسخهٔ نهایی آمادهٔ چاپ نویسنده با فهرست نهایی نویسندگان و DOI. CC BY 4.0 author manuscript; the ACM DOI page remains the version of record. شرایط انتشار و استفادهٔ مجدد.
مقاله در ۳۰ ثانیه
پرسش پژوهشیک مدل مولد چگونه میتواند با حفظ عناصر برگزیدهٔ ساختار درشتدانهٔ برنامه، بخشهای منتخب آن را اصلاح کند؟
مسئله
اصلاح کُد به کمک هوش مصنوعی اغلب به یک تغییر کرانمند نیاز دارد، درحالیکه ساختارهای منتخب برنامه ثابت میمانند. بازتولید کل برنامه میتواند نواحی نامرتبط را مختل کند و قیود سطح توکن، سطح کنترلی درشتدانه در اختیار نمیگذارند.
رویکرد
این مطالعه توابع 64توکنی Python را با یک VQ-VAE سلسلهمراتبی رمزگذاری میکند، کُدهای گسستهٔ درشتدانهٔ منتخب را قفل میکند و برای بازتولید موضعی کُد در جایگاههای نهفتهٔ باقیمانده، از تولید گسستهٔ نقابدار بهره میگیرد.
نتیجهٔ اصلی
قفلکردن چهار کد سطحبالا نرخ تجزیه را از 0.453 به 0.591 افزایش میدهد، درحالیکه موقعیتهای قفلنشده همچنان با نرخ 0.936 تغییر میکنند و یکتایی نمونههای شرطی در 0.998 باقی میماند.
چرا اهمیت دارد
نتایج برای ویرایش کنترلپذیر کُد و بازتولید جزئی برنامه، توازن سنجشپذیری میان پایداری و آزادی نشان میدهند. آنها شواهد اولیهای برای یک لایهٔ کنترل نهفتهٔ بازرسیپذیر فراهم میکنند، نه اثباتی برای همارزی معنایی یا درستی کارکردی.
چکیده
گردشکارهای مهندسی نرمافزار، مانند ترمیم مقید، پالایش مرحلهای و اصلاحِ حافظ ساختار، مستلزم کنترل بر آن چیزیاند که تغییر میکند و آنچه ثابت میماند. تولید در سطح توکن برای این عملیات سطح کنترل ضعیفی است، زیرا بهجای ناورداهای ساختاری درشتدانهای که مهندسی نرمافزار غالباً در پی حفظ آنهاست، متن ظاهری محلی را مقید میکند. ما نهفتههای گسستهٔ سلسلهمراتبی را بهمنزلهٔ بازنمایی میانی بازرسیپذیر برای مصنوعات نرمافزاری بررسی میکنیم: یک VQ-VAE سلسلهمراتبی، تابع Python با 64 توکن را به کُدهای گسستهٔ درشتدانه و ریزدانه فشرده میکند و تولید گسستهٔ نقابدار، تحت قیود جزئی، فقط جایگاههای منتخب را بازتولید میکند. در 2,000 تابع Python پیشپردازششده، قفلکردن چهار کُد سطح بالا نرخ تجزیه را از 0.453 به 0.591 افزایش میدهد، درحالیکه تغییر چشمگیر در جایگاههای قفلنشده (آزادی ویرایش، 0.936) و یکتایی نزدیک به بیشینهٔ نمونهها (تنوع، 0.998) حفظ میشود. با ثابتبودن بافت درشتدانه، پالایش سطح پایینتر ضعیفتر است، اما همچنان یکنواخت باقی میماند و برداشتی درشتبهریز از سلسلهمراتب را تأیید میکند. در مجموع، این نتایج شواهد اولیهای برای یک لایهٔ کنترل عملی فراهم میآورند که از بازتولید محدود و حافظ ساختارِ مصنوعات نرمافزاری در سطحی بالاتر از توکن پشتیبانی میکند.
محل انتشار مجموعهمقالات سیوچهارمین کنفرانس بینالمللی ACM دربارهٔ مبانی مهندسی نرمافزار
نوع دستاورد روش کنترل در فضای نهفته
صص. 1406–1407پوستر همراه
نتایج کلیدی
| تنظیمات | نرخ تجزیه | اسکلت | امضا | تغییر در بخش قفلنشده |
|---|---|---|---|---|
| ورودی (کوتاهشده) | 0.994 | 0.994 | 0.994 | — |
| بازسازی کُدک | 0.857 | 0.848 | 0.493 | 0 |
| تولید بدون شرط | 0.453 | 0.08 | 0 | 0.995 |
| شرطی، پیشوند k=4 | 0.591 | 0.295 | 0.061 | 0.936 |
| شرطی، گسترهٔ امضا | 0.6 | 0.302 | 0.063 | گزارش نشده است |
نتیجهٔ کلیدی. قفلکردن متغیرهای نهفتهٔ درشتدانه، پایداری نحوی را بهبود میدهد بیآنکه تغییر در ناحیهٔ ویرایشپذیر را فروبپاشاند؛ این نتیجه کنترل ساختاری را نشان میدهد، نه همارزی کارکردیِ تضمینشده را.
- مجموعهداده
- ۲٬۰۰۰ تابع Python پیشپردازششده از یک زیرمجموعهٔ CodeParrot Clean
- اندازهٔ نمونه
- ۲٬۰۰۰ تابع Python پیشپردازششده؛ یکتایی نمونههای شرطی ۰٫۹۹۸ است.
- سنجهها
- نرخ تجزیه؛ سنجههای جانشین حفظ اسکلت و امضا؛ نرخ تغییر موقعیتهای قفلنشده؛ یکتایی و آنتروپی نمونه
- عدمقطعیت
- این مطالعهٔ دوصفحهای، برآوردهای نقطهای را بدون فاصلهٔ اطمینان یا تحلیل آماری چندبذری گزارش میکند.
- شرایط
- توابع ۶۴ توکنی، رمزگشایی argmax، ۱۶ کُد سطحبالا و ۳۲ کُد سطحپایین؛ قفل کامل، بازسازی کُدک را دقیقاً بازیابی میکند.
دریافت نتایج:CSVJSONمارکداونآینهٔ بیرونی:کارت مجموعهدادهٔ Hugging Face
PDF و استناد
به این مقاله استناد کنید BibTeX قالب پیشنهادی است. همهٔ گونههای زیر از یک رکورد انتشار واحد تولید شدهاند.
@inproceedings{Gavrilov2026InspectableControl,
title = {Inspectable Control for Structure-Preserving Software Regeneration},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Mozikov, Mikhail and Makarov, Ilya and Muravyov, Sergey},
booktitle = {Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering},
publisher = {ACM},
year = {2026},
pages = {1406--1407},
doi = {10.1145/3803437.3807386},
url = {https://doi.org/10.1145/3803437.3807386},
isbn = {979-8-4007-2636-1},
}
Gavrilov, A., Gazzaev, A.-B., Mozikov, M., Makarov, I., and Muravyov, S. (2026). Inspectable Control for Structure-Preserving Software Regeneration. In Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering (pp. 1406–1407). ACM. https://doi.org/10.1145/3803437.3807386A. Gavrilov, A.-B. Gazzaev, M. Mozikov, I. Makarov, and S. Muravyov, “Inspectable Control for Structure-Preserving Software Regeneration,” in Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering, 2026, pp. 1406–1407, doi: 10.1145/3803437.3807386.TY - CPAPER
TI - Inspectable Control for Structure-Preserving Software Regeneration
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Mozikov, Mikhail
AU - Makarov, Ilya
AU - Muravyov, Sergey
PY - 2026
DA - 2026-07-05
T2 - Proceedings of the 34th ACM International Conference on the Foundations of Software Engineering
SP - 1406
EP - 1407
PB - ACM
DO - 10.1145/3803437.3807386
UR - https://doi.org/10.1145/3803437.3807386
SN - 979-8-4007-2636-1
ER -
فایلهای استناد:متن APAمتن IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLفرادادهٔ XML با قالب JATS 1.4متن کامل JATS 1.4 XMLRDF Turtleمجموعهپیوند (JSON)مجموعهپیوند (HTTP)RO-Crate
راهنمای کامل
راهنمای کامل پژوهش
روش
این روش یک تابع کوتاه Python را در دو سطح کُد گسسته فشرده میکند، جایگاههای درشتدانهٔ منتخب را ثابت نگه میدارد و پیش از رمزگشایی مجدد به کُد، جایگاههای باقیمانده را بازتولید میکند.
رمزگذاری
یک تابع 64-توکنی Python را با یک VQ-VAE سلسلهمراتبی به 16 کُد سطحبالا و 32 کُد سطحپایین فشرده کنید.
قفلکردن
موقعیتهای درشتدانهٔ کُد را برگزینید که ساختارِ لازم برای حفظشدن را بازنمایی میکنند؛ مانند پیشوندی که گسترهٔ امضای تابع را میپوشاند.
بازتولید
تولید گسستهٔ نقابدار را فقط بر موقعیتهای قفلنشده اجرا کنید و سلسلهمراتب تکمیلشده را دوباره به کد مبدأ رمزگشایی کنید.
بازرسی
پیش از پذیرش بازتولید، نرخ تجزیه، سنجههای جانشین ساختاری، تغییر در موقعیتهای قفلنشده و یکتایی نمونه را اندازهگیری کنید.
ایدهٔ کلیدی
کنترل بر بازنماییِ آموختهشدهای در سطحی بالاتر از توکنها اعمال میشود: موقعیتهای درشتدانهٔ نهفته، جایگاههای صریحی را تعیین میکنند که میتوان ساختار را در آنها ثابت نگه داشت، درحالیکه جزئیات پیادهسازیِ مجاور همچنان ویرایشپذیر میمانند.
تفاوت با رویکردهای نزدیک
قیود در سطح پرامپت یا توکن بر متن ظاهری اعمال میشوند. رابط پیشنهادی، نقاط کنترل گسستهٔ درشتدانه و ریزدانه را در دسترس میگذارد و موازنهٔ حاصل میان پایداری و آزادی را اندازهگیری میکند.
نوآوری چیست
این کار، لایهای بازرسیپذیر برای کنترل سلسلهمراتبی نهفته معرفی و ارزیابی میکند که برای بازتولید کرانمند مصنوعات نرمافزاری طراحی شده است.
پرسشهایی که این مقاله به پاسخدادن به آنها کمک میکند
برای دریافت پاسخی کوتاه و مستند به مقاله، یکی از پرسشها را باز کنید. مرزهای تفصیلی شواهد در بخش محدودیتها آمدهاند.
هوش مصنوعی چگونه میتواند کد را بیآنکه همهچیز را از نو بنویسد ویرایش کند؟
مقاله بازتولید جزئی کُد در سطحی بالاتر از توکن را بررسی میکند. یک VQ-VAE سلسلهمراتبی، تابع کوتاه Python را به کُدهای گسستهٔ درشتدانه و ریزدانه نگاشت میکند؛ جایگاههای درشتدانهٔ منتخب قفل میشوند و تولید گسستهٔ نقابدار پیش از رمزگشایی فقط جایگاههای نهفتهٔ باقیمانده را تغییر میدهد. بدینترتیب، بهجای بازتولید کل تابع، مرز حفظ صریحی فراهم میشود.
کدام روشها هنگام تولید کُد ساختار برنامه را حفظ میکنند؟
این کار، کنترل گسستهٔ سلسلهمراتبی در فضای نهفته را میآزماید. میتوان موقعیتهای نهفتهٔ درشت را ثابت نگه داشت و موقعیتهای قفلنشده را بازتولید کرد؛ سپس نرخ تجزیه و شاخصهای جانشین ساختاری اندازهگیری میشوند. شواهد به پایداری ساختاری احتمالاتی در توابع کوتاه Python مربوط است و حفظ دقیق AST، همارزی معنایی یا درستی کارکردی را اثبات نمیکند.
آیا متغیرهای نهفتهٔ گسستهٔ سلسلهمراتبی میتوانند کنترل موضعی بر کُد فراهم کنند؟
در آزمایش گزارششده روی 2,000 تابع، قفلکردن چهار کد سطحبالا نرخ تجزیه را از 0.453 به 0.591 افزایش داد. همزمان، 0.936 از موقعیتهای قفلنشده تغییر کردند و یکتایی نمونههای شرطی 0.998 بود. این نتایج شواهدی مقدماتیاند که نشان میدهند قیود درشتدانهٔ نهفته میتوانند بخشی از ساختار را حفظ کنند، بیآنکه آزادی ویرایش موضعی یا تنوع نمونهها را از میان ببرند.
تولید کد چگونه میتواند میان پایداری ساختاری و تنوع توازن برقرار کند؟
مقاله، پایداری و آزادی را با هم ارزیابی میکند، نه اینکه فقط اعتبار را بهینه سازد. قفلکردن کُدهای درشتدانه اعتبار نحوی را افزایش میدهد، درحالیکه میزان تغییر در جایگاههای قفلنشده بالا میماند و نمونههای شرطی تقریباً همگی یکتا باقی میمانند. این نتیجه در پیکربندی آزمودهشده، توازن سنجشپذیری میان پایداری و آزادی را نشان میدهد، نه یک بهینهٔ جهانشمول را.
این پژوهش چه ارتباطی با ویرایش کد به کمک LLM دارد؟
مدل آزمودهشده یک VQ-VAE سلسلهمراتبی با تولید گسستهٔ نقابدار است، نه یک مدل زبانی بزرگ. بااینحال، مسئلهٔ کنترل به ویرایش با کمک LLM نیز مربوط است، زیرا تغییرات غیرضروری بیرون از ناحیهٔ درخواستی دغدغهای عملیاند. سهم مقاله، سازوکاری مکمل در فضای نهفته و چارچوبی برای ارزیابی است، نه یک بنچمارک ویرایش LLM.
مقایسه با رویکردهای نزدیک
| قابلیت | کنترل در سطح توکن | کنترل نهفتهٔ سلسلهمراتبی |
|---|---|---|
| ثابت نگهداشتن ساختار درشتدانه | محدود | قفلگذاری بومی کُدهای درشتدانه |
| بازتولید جزئی | قیود سطحی شکننده | بازنمونهگیری نقابدار کُدهای انتخابشده |
| نقاط کنترل بازرسیپذیر | بدون لایهٔ میانی صریح | موقعیتهای گسستهٔ درشتدانه و ریزدانه |
| شواهد ارائهشده در این مقاله | بهعنوان خط مبنای کامل ارزیابی نشده است | شاخصهای تشخیصی پایداری نحوی و آزادی ویرایش |
جدول، رابطها و شواهد اندازهگیریشدهٔ مطالعه را توصیف میکند؛ ادعایی دربارهٔ درستی کارکردی یا برتری همگانی ندارد.
ارتباط و دامنه
این مقاله بیش از همه برای کارهایی مرتبط است که به کنترل صریح بر بخشهای مجاز به تغییر در تبدیل کُد با کمک هوش مصنوعی و بخشهایی از برنامه که باید پایدار بمانند نیاز دارند.
تولید کُدِ کنترلپذیر و حافظ ساختار
تعمیر موضعی برنامه و بازآرایی کرانمند
بازنماییهای گسستهٔ سلسلهمراتبی برای کد منبع
تولید گسستهٔ نقابدار برای کد منبع
کنترل نهفته برای مصنوعات نرمافزاری
محدودیتها
- این مطالعه به توابع کوتاه Python که تا 64 توکن برش خوردهاند محدود است.
- ارزیابی بهجای آزمونهای همارزی کارکردی، از رمزگشایی argmax و سنجههای جانشین نحوی یا ساختاری استفاده میکند.
- حفظ دقیق امضا همچنان ضعیف است.
- کنترل سطح پایین از کنترل سطح بالا ضعیفتر است.
- موقعیتهای نهفته هنوز با نواحی معنایی، مانند بازههای AST، امضاها یا ساختار جریان کنترل، همتراز نشدهاند.
- نتایج، درستیِ ترمیم عملی، بازآرایی یا تغییرات در سطح مخزن را اثبات نمیکنند.
منابع مورد استناد مقاله
این مدخلها با بخش شمارهگذاریشدهٔ References در فایل PDF مقاله متناظرند.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Shraddha Barke, Michael B. James, Nadia Polikarpova. . Grounded Copilot: How Programmers Interact with Code-Generating Models. Proceedings of the ACM on Programming Languages.
- Fengji Zhang, Bei Chen, Yue Zhang, Jacky Keung, Jin Liu, Daoguang Zan, Yi Mao, Jian-Guang Lou, Weizhu Chen. . RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing.
منابع و بازتولیدپذیری
- ناشر
- ACM
- منابع انتشار
- نسخهٔ عمومی مقاله، جدولهای نتایج، شکل توضیحی و فایلهای استناد در اینجا در دسترساند. کُد پیادهسازی و نقاط وارسی بهصورت عمومی منتشر نشدهاند.
بیانیهٔ داده
- منبع
- زیرمجموعهای پیشپردازششده از CodeParrot Clean شامل ۲٬۰۰۰ تابع Python.
- مجوز
- این وبگاه هیچیک از فایلهای مجموعهداده را بازتوزیع نمیکند؛ استفادهٔ مجدد همچنان تابع مجوزهای مجموعهدادهٔ بالادستی CodeParrot و کد منبع است.
- پیشپردازش
- توابع Python پیش از رمزگذاری سلسلهمراتبی، توکنبندی میشوند و با برش یا پُرگذاری به 64 توکن میرسند.
- تفکیک
- پوستر یک مجموعهٔ ارزیابی شامل 2,000 تابع را گزارش میکند؛ مقالهٔ عمومی فاقد فهرست ثابتِ تفکیک آموزش/اعتبارسنجی است.
- قالب
- توابع کد مبدأ Python، دنبالههای توکن به سبک GPT، دنبالههای کد سطحبالا با طول 16 و دنبالههای سطحپایین با طول 32.
- نسخه / جمعِ مقابلهای
- مقالهٔ دوصفحهای، سرجمع مقابلهای مجموعهداده و شناسهٔ تغییرناپذیر اسنپشات را گزارش نمیکند.
- گردآوری
- هیچ اسکریپت عمومی گردآوری همراه صفحهٔ مقاله منتشر نشده است.
- محدودیتهای استفاده
- این نمونه نمایندهٔ نرمافزار در مقیاس مخزن، چندین زبان برنامهنویسی یا وظایف ترمیمِ راستیآزماییشده از نظر رفتاری نیست.
نسخهها
- نسخهٔ منتشرشدهACM FSE Companion, 2026
- دستنوشتهٔ نویسندهنسخهٔ نهایی آمادهٔ انتشار با متن دسترسپذیر، فهرست نهایی نویسندگان و DOI
- آینهٔ بیرونی متن کاملنسخهٔ دستنویس نویسنده با مجوز CC BY 4.0 در Hugging Face
- بازکردن رکورد مخزنرکورد Zenodo نمایهشده در OpenAIRE
- بازکردن متن کامل در مخزننسخهٔ نویسنده در Zenodo با مجوز CC BY 4.0؛ از نظر متن معادل نسخهٔ محلی
- منابع نویسندهپوستر و مجموعهاسلاید
- رکورد کتابشناختیDBLP
- بازکردن رکورد علمیOpenAlex
- رکورد گراف استنادSemantic Scholar
- متن کاملِ بهاشتراکگذاشتهشده از سوی نویسندهResearchGate
- خلاصه به زبان سادهKudos
DOI منتشرشده شناسهٔ اصلی کتابشناختی است. این صفحه در همهٔ نسخهها تنها URL مرجع پروژه باقی میماند.