# پروژه‌های پژوهشی

Canonical HTML: https://aogavrilov.com/fa/projects/

Document language: fa

از شکست قابل مشاهده آغاز کنید؛ سپس روش، شواهد و مرز دامنهٔ متناسب با آن را دنبال کنید.

## بر پایهٔ خرابیِ مشاهده‌شده انتخاب کنید

یک نشانهٔ یکسان می‌تواند از بازنمایی، تولید، کنترل یا راستی‌آزمایی ناشی شود.

| مسئلهٔ مشاهده‌شده | نخستین بررسی تشخیصی | شواهد لازم | روش |
| --- | --- | --- | --- |
| خروجی رمزگشایی‌شده ضعیف است، اما مرحلهٔ دچار خرابی مشخص نیست | متن مبدأ، بازسازی متناظر و خروجی تولیدشده را با یک ارزیاب بیرونی یکسان امتیازدهی کنید. | توزیع‌های مقایسه‌پذیر و رفتار دُم در هر مرحله. | [تشخیص مرحله‌ای گلوگاه](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#workflow) |
| یک معیار فضای نهفته بهبود می‌یابد، اما کیفیت نهایی نه | بیازمایید که آیا بهبود شاخص جانشین پس از رمزگشایی نیز منتقل می‌شود. | سنجه‌های زوجی خروجی رمزگشایی‌شده، نه صرفاً تشخیص‌های فضای نهفته. | [بررسی انتقال جانشین](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#decision-table) |
| ویرایشگر کُد ناحیه‌ای فراتر از محدودهٔ درخواستی را بازنویسی می‌کند | مرز حفظ را به‌صراحت بیان کنید و تفاوت بیرون از ناحیه را اندازه بگیرید. | موضعی‌بودن و موفقیت در وظیفه به‌طور هم‌زمان سنجیده می‌شوند. | [ارزیابی ویرایش موضعی](https://aogavrilov.com/fa/projects/discrete-latent-generation/#measurement) |
| بازآرایی باید رفتار را حفظ کند، نه صرفاً نحو را | پیشنهاد را از اجرا و راستی‌آزمایی جدا کنید. | کامپایل، آزمون‌ها، بررسی‌های ایستا و تشخیص بازآرایی. | [نقشهٔ تصمیمِ سطح کنترل](https://aogavrilov.com/fa/projects/discrete-latent-generation/#control-surface) |

مسیر فعال

## تولید نهفتهٔ گسسته

بازنمایی‌های گسسته برای بازتولید گزینشی کد، همراه با انتخاب‌های شواهد‌محور میان تولید مقید، بازآرایی با کمک هوش مصنوعی و ویرایش پیش‌بینی‌پذیر کد.

راهنمای ارزیابی

## تشخیص گلوگاه کُدک

روشی مرحله‌به‌مرحله برای تشخیص اینکه کیفیت رمزگشایی‌شده به‌وسیلهٔ بازسازی، تولید نهفته یا شاخص جانشینی محدود شده است که به متن نهایی انتقال نمی‌یابد.

## پاسخ‌های متمرکز

یادداشت‌های مستقل شواهد برای جست‌وجوهای گسترده‌تری که با عنوان مقاله آغاز نمی‌شوند. هر یادداشت به انتشار مرتبط و متن کامل آن پیوند می‌دهد.

1. [پخش نقاب‌دار در فضای کُد در برابر فضای توکن: چگونه مقایسه کنیم؟](https://aogavrilov.com/fa/research-notes/code-space-vs-token-space-masked-diffusion/) پروتکلی برای مقایسهٔ سازگار میان مراحلِ مدل‌های زبانی پخش نقاب‌دار در فضای کُد و فضای توکن، در شرایطی که کُدک گسسته اتلافی است.
2. [تغییر موضعی کد با مدل‌های مولد](https://aogavrilov.com/fa/research-notes/localized-code-modification-generative-models/) چگونه ضمن حفظ آزادی کافی برای اعمال تغییر درخواستی کد به‌وسیلهٔ مدل مولد، از بازنویسی غیرضروری کل تابع جلوگیری کنیم.
3. [تولید مقید کُد برای مهندسی نرم‌افزار](https://aogavrilov.com/fa/research-notes/constrained-code-generation-software-engineering/) تمایزی عملی میان قیود دستور زبان، قیود نوع، مرزهای حفاظت و بررسی‌های پذیرش در سطح رفتار برای کُد تولیدشده.
4. [بازآرایی به کمک هوش مصنوعی: روش‌ها و شواهد](https://aogavrilov.com/fa/research-notes/ai-assisted-refactoring-evidence/) چگونه روش‌های جدید بازآرایی به کمک هوش مصنوعی را ارزیابی کنیم، بی‌آنکه یک وصلهٔ تولیدشدهٔ باورپذیر را با حفظِ راستی‌آزمایی‌شدهٔ رفتار اشتباه بگیریم.
5. [تولید پیش‌بینی‌پذیر کُد به قرارداد حفظ نیاز دارد](https://aogavrilov.com/fa/research-notes/predictable-code-generation-preservation-contract/) چرا نمونه‌گیری قطعی کافی نیست و ویژگی‌های محافظت‌شدهٔ مشاهده‌پذیر و وارسی‌های پذیرش چگونه رفتار تولید کُد را آزمون‌پذیر می‌کنند.

## پرسش‌های پژوهشی که این وبگاه می‌تواند پاسخ دهد

برای دریافت پاسخی کوتاه، یکی از پرسش‌های عملی را باز کنید؛ سپس برای آگاهی از روش‌ها، اندازه‌گیری‌ها و محدودیت‌ها، پیوند شواهد را دنبال کنید. این موارد مسیرهایی برای ورود به پژوهش‌اند، نه تضمین‌هایی جهان‌شمول.

1. یک مدل مولد چگونه می‌تواند بدون بازنویسی کل تابع، کد را اصلاح کند؟ مرز ویرایش‌پذیر را پیش از تولید تعریف کنید، کُد منبع بیرون از آن را حفظ یا بازاستفاده کنید، فقط تغییرات نامزد را تولید کنید و خروجی‌هایی را که در انجام وظیفه ناموفق‌اند یا نواحی حفاظت‌شده را تغییر می‌دهند، رد کنید. قفل‌کردن متغیرهای نهفتهٔ سلسله‌مراتبی یک سطح کنترل آزمایشی است، اما یکسان‌ماندن گستره‌های کُد منبع را تضمین نمی‌کند. [سطوح کنترلِ ویرایش موضعی را مقایسه کنید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#control-surface) .
2. چه شواهدی نشان می‌دهد ویرایش کُد موضعی است، نه اینکه صرفاً از نظر نحوی معتبر باشد؟ اختلاف بیرون از ناحیهٔ درخواستی را همراه با موفقیت وظیفه، تغییر ناحیهٔ ویرایش‌پذیر، ناورداهای ساختاری، آزمون‌ها یا بررسی‌های ایستا و تغییرپذیری میان اجراهای مکرر اندازه‌گیری کنید. نرخ تجزیه به‌تنهایی فقط خوش‌ساختی نحوی را اثبات می‌کند. [سیاههٔ وارسی شواهد موضعی‌بودن را مرور کنید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#measurement) .
3. میان موضعی‌بودن ویرایش کد و تنوع تولید چگونه باید توازن برقرار کرد؟ پایداری ناحیهٔ حفاظت‌شده را در کنار آزادی در ناحیهٔ ویرایش‌پذیر و یکتایی نامزدها گزارش کنید. کپی‌کردن ورودی می‌تواند پایداری را بیشینه کند، بی‌آنکه وظیفه پیشرفتی داشته باشد؛ بازنویسی نامحدود نیز می‌تواند تغییر را بیشینه کند، اما موضعی‌بودن را از میان ببرد. [شواهد محدودِ پایداری–آزادی را ببینید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#evidence) .
4. ویرایش موضعی کد، تولید مقید و تعمیر برنامه چه تفاوتی با یکدیگر دارند؟ ویرایش موضعی بر آنچه باید بدون تغییر بماند تأکید دارد؛ تولید مقید یک ویژگی صوری خروجی، مانند عضویت در دستور زبان، را اعمال می‌کند؛ و تعمیر برنامه مستلزم آن است که تغییر، مشخصات یک نقص یا وظیفه را برآورده سازد. نحو به‌تنهایی هم‌ارزی معنایی، درستی کارکردی، موفقیت در وظیفه یا موضعی‌بودن را اثبات نمی‌کند. [سه هدف را مقایسه کنید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#comparison) .
5. چگونه می‌توان بخش‌های منتخب یک تابع Python را دوباره تولید کرد، درحالی‌که سایر بخش‌ها پایدار می‌مانند؟ پیش از تولید، نواحی حفاظت‌شده و ویرایش‌پذیر را تعریف کنید؛ فقط بازنمایی ویرایش‌پذیر را تغییر دهید، آن را رمزگشایی کنید و نامزدهایی را رد کنید که کُد حفاظت‌شده را تغییر می‌دهند یا در نحو، آزمون‌ها، بررسی‌های ایستا یا ناورداهای ویژهٔ وظیفه ناموفق‌اند. آزمایش گزارش‌شده با متغیرهای نهفتهٔ سلسله‌مراتبی، پایداری احتمالاتی را روی توابع 64-توکنی می‌سنجد؛ این آزمایش ثابت‌ماندن گستره‌ها یا رفتار را تضمین نمی‌کند. [گردش‌کار بازتولید گزینشی را بررسی کنید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#workflow) .
6. کدام راهبرد کنترل برای بازآراییِ حافظ رفتار به کمک هوش مصنوعی مناسب است؟ از مدل برای شناسایی یا پیشنهاد یک تبدیل استفاده کنید؛ سپس، هرجا ممکن است، آن را با موتور بازآرایی قابل‌اعتماد اجرا کنید و کامپایل، آزمون‌ها، وارسی‌های ایستا و تحقق بازآرایی موردنظر را بسنجید. وصلهٔ تولیدشده‌ای که صرفاً پذیرفتنی به نظر می‌رسد، شاهد کافی نیست. [بازکردن ردیف تصمیم بازآرایی](https://aogavrilov.com/fa/projects/discrete-latent-generation/#control-surface) .
7. چه چیزی تولید کُد را پیش‌بینی‌پذیر می‌کند، نه صرفاً کنترل‌پذیر؟ پیش از انتخاب مولد، قرارداد حفظِ مشاهده‌پذیر و بررسی‌های پذیرش را بیان کنید. پیش‌بینی‌پذیری به آنچه پس از رمزگشایی و راستی‌آزمایی پایدار می‌ماند وابسته است، نه صرفاً به ثابت‌بودن یک پرامپت، نقاب، دستور زبان یا کُد نهفته. [قرارداد حفظ را تعریف کنید](https://aogavrilov.com/fa/projects/discrete-latent-generation/#core-idea) .
8. در آزمایش متنی گزارش‌شده، پخش نقاب‌دار در فضای کُد و فضای توکن چه تفاوتی در عملکرد داشتند؟ با همان امتیازدهندهٔ بیرونی، میانهٔ سرگشتگی MDLM در فضای کُد 26.55 بود، در برابر 38.42 برای خط پایهٔ فضای توکن؛ یعنی کاهشی معادل 30.9%. میانهٔ بازسازی کُدک از پیش 27.36 بود؛ بنابراین نتیجه باید همراه با گلوگاه بازسازی تفسیر شود. [اعداد گزارش‌شده برای هر مرحله را بررسی کنید](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
9. وقتی کُدک اتلافی است، پخش نقاب‌دار در فضای کُد و فضای توکن را چگونه باید مقایسه کرد؟ برای نمونه‌های اصلی، بازسازی‌های کُدک و خروجی‌های فضای توکن و فضای کُد، از همان نمونه‌های کنارگذاشته‌شده و همان امتیازدهندهٔ متن رمزگشایی‌شده استفاده کنید. شکاف بازسازی را جداگانه گزارش دهید، زیرا مولد نهفتهٔ قوی‌تر نمی‌تواند اطلاعاتی را بازیابی کند که کُدک پیش‌تر حذف کرده است. [مراحل را با یک ارزیاب واحد مقایسه کنید](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
10. افت کیفیت در یک مولد متن دومرحله‌ای چگونه قابل تشخیص است؟ با یک ارزیاب ثابتِ متن رمزگشایی‌شده، ابتدا شکاف میان متن اصلی و بازسازی و سپس شکاف میان بازسازی و تولید را اندازه‌گیری کنید. بدین‌ترتیب، سقف کیفیت تحمیل‌شده از سوی کُدِک از افت اضافی ناشی از تولید نهفته تفکیک می‌شود. [رویهٔ تشخیصی چهارمرحله‌ای را دنبال کنید](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#workflow) .
11. چه زمانی بهبود سنجه‌های فضای نهفته به بهبود خروجی رمزگشایی‌شده منجر نمی‌شود؟ ممکن است یک شاخص جانشین در فضای نهفته بهبود یابد، بی‌آنکه ویژگی پایین‌دستی موردنظر را دنبال کند. انتقال را با رمزگشایی خروجی‌های همتاشده و ارزیابی آن‌ها با معیارهای نهایی یکسان بیازمایید؛ در غیر این صورت، هندسه یا میزان استفاده از کتاب کُد صرفاً شاهدی تشخیصی است، نه بهبود کیفیت متن. [از تشخیص انتقال شاخص جانشین استفاده کنید](https://aogavrilov.com/fa/projects/codec-bottleneck-diagnosis/#decision-table) .

## دو نمای اجمالی از شواهد کران‌مند

این اعداد آنچه را اندازه‌گیری شده مشخص می‌کنند؛ تضمین‌هایی همگانی دربارهٔ مدل نیستند.

### تشخیص فشرده‌سازی

در یک پیکربندی 64-به-16 از TinyStories، میانهٔ سرگشتگی از **15.17** برای متن مبدأ به **27.36** پس از بازسازی. MDLM فضای کُد به این مقدار رسید: **26.55** در برابر **38.42** برای خط مبنای فضای توکن، تحت همان امتیازدهندهٔ بیرونی.

### کنترل بازرسی‌پذیر ویرایش

در یک پیکربندیِ تابع Python با 64 توکن، قفل‌کردن چهار کُد سطح‌بالا نرخ تجزیه را از **0.453** به **0.591** ، درحالی‌که جایگاه‌های قفل‌نشده با نرخ **0.936** و یکتایی نمونه‌های شرطی برابر بود با **0.998** یکتا.

## این نقشه چه ادعایی ندارد

آزمایش‌های منتشرشده حفظ دقیق AST، هم‌ارزی معنایی، درستی کارکردی، ترمیم در مقیاس مخزن یا ترتیب جهان‌شمولی برای گلوگاه‌های کُدک و مولد اثبات نمی‌کنند. راهنماها شواهد محدود را به رویه‌های تشخیصی بازاستفاده‌پذیر تبدیل می‌کنند؛ بااین‌حال، هر سامانهٔ جدید همچنان به اعتبارسنجی اختصاصی خروجی رمزگشایی‌شده و سطح رفتار نیاز دارد.
