# چگونه تشخیص دهیم شکست یک مولد متن فشرده از کُدک ناشی می‌شود یا از مولد

Canonical HTML: https://aogavrilov.com/fa/research/codec-bottleneck-diagnosis/

Document language: fa

روشی عملی برای تشخیص در سامانه‌های دومرحله‌ای که ابتدا متن را به کُدهای گسسته فشرده و سپس در فضای کُد تولید می‌کنند. هدف آن است که پیش از صرف توان محاسباتی برای مؤلفهٔ نادرست، مرحله‌ای که خروجی رمزگشایی‌شده را محدود می‌کند شناسایی شود.

منتشرشده 29 ژوئیهٔ 2026 به‌روزشده 30 ژوئیهٔ 2026 [Alexey Gavrilov](https://aogavrilov.com/about/)

## پاسخ کوتاه

متن اصلی، بازسازی کُدِک متناظر آن و متن نهاییِ تولیدشده را با یک ارزیاب بیرونی یکسان امتیازدهی کنید. شکاف میان متن اصلی و بازسازی، سقف کیفیتِ تحمیل‌شده پیش از تولید را اندازه می‌گیرد. سپس شکاف میان بازسازی و تولید، افت اضافیِ ناشی از مولد نهفته را مجزا می‌کند.

**یک سنجهٔ جانشینِ فضای نهفته را جایگزین خروجی رمزگشایی‌شده نکنید.** هندسه، میزان استفاده یا پوشش بهترِ کتاب کُد می‌تواند برای تشخیص سودمند باشد؛ اما تنها زمانی بهبود کیفیت را اثبات می‌کند که متن رمزگشایی‌شده بر پایهٔ معیارهای نهایی مرتبط بهتر شود.

## فرایند تشخیصی چهارمرحله‌ای

1. تعیین مرجع متن‌های اصلیِ کنارگذاشته‌شده را با ارزیاب بیرونیِ مورد استفاده در همهٔ مراحل بعدی امتیازدهی کنید.
2. اندازه‌گیری بازسازی کُدِک همان نمونه‌ها را بدون تولید، رمزگذاری و رمزگشایی کنید. این کار اطلاعات ازدست‌رفته در گلوگاه را آشکار می‌کند.
3. اندازه‌گیری تولید نهفته کدها را تولید و رمزگشایی کنید و متن حاصل را با ارزیاب تغییریافته‌نشده امتیاز دهید.
4. ممیزی انتقال شاخص جانشین به‌جای فرض‌کردن انتقال بهبودهای سنجه‌های جانشین، تشخیص‌های فضای نهفته را با سنجه‌های نهاییِ متن رمزگشایی‌شده مقایسه کنید.

## نحوهٔ تفسیر شکاف‌های میان مراحل

| الگوی مشاهده‌شده | محتمل‌ترین گلوگاه | آزمایش بعدی |
| --- | --- | --- |
| متن‌های اصلی امتیاز خوبی می‌گیرند؛ کیفیت بازسازی‌ها به‌شدت افت می‌کند | وفاداری کُدک | پیش از تنظیم مولد، بازسازی را بهبود دهید یا میزان فشرده‌سازی را کاهش دهید |
| بازسازی‌ها همچنان قوی‌اند؛ خروجی‌های تولیدشده افت می‌کنند | مولد نهفته | نویززدایی، نمونه‌گیری، شرطی‌سازی و ناهمخوانی توزیع کد را بررسی کنید |
| شاخص‌های جانشین نهفته بهبود می‌یابند؛ سنجه‌های رمزگشایی‌شده ثابت می‌مانند | انتقال جانشین | دوباره ارزیابی کنید که آیا سنجهٔ جانشین، ویژگی پایین‌دستیِ مورد نظر را دنبال می‌کند یا نه |
| همهٔ مراحل امتیاز ضعیفی می‌گیرند | داده، ارزیاب یا آرایش آزمایشی | پیش از نسبت‌دادن شکست به مدل، توزیع مرجع و امتیازدهنده را اعتبارسنجی کنید |

## مطالعهٔ موردی منتشرشدهٔ TinyStories چه یافت

در [*Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization*](https://aogavrilov.com/fa/publications/where-quality-breaks/) ، متن‌های ۶۴ توکنی با یک VQ-VAE-2 سلسله‌مراتبی به ۱۶ کُد سطح‌بالا فشرده می‌شوند. با یک امتیازدهندهٔ بیرونی GPT-2، میانهٔ سرگشتگی از **15.17** برای متن‌های اصلی به **27.36** برای بازسازی‌های کُدک می‌رسد؛ در همین حال، p95 از **25.10** به **98.91** .

### مدل‌سازی زبان با پخش نقاب‌دار در فضای کُد در برابر فضای توکن

شکاف بازسازی، عامل غالب در خط لولهٔ آزموده‌شده است. با وجود این سقف، مدل‌سازی زبان با پخش نقاب‌دار در فضای کُد (MDLM) همچنان با امتیازدهندهٔ مشترک بهتر از MDLM فضای توکن عمل می‌کند: میانهٔ سرگشتگی برابر است با **26.55** در برابر **38.42** ، یعنی کاهشی ۳۰٫۹ درصدی.

منظم‌سازی آگاه از هندسه، سنجه‌های جانشین موضعیِ نهفته را در اجراهای همتاسازی‌شدهٔ موجود بهبود می‌دهد، اما معیارهای متن رمزگشایی‌شده را بهتر نمی‌کند. این نتیجهٔ انتقال منفی بخشی از تشخیص است، نه شاهدی بر اینکه منظم‌ساز متن نهایی را بهبود داده است.

## در هر مرحله چه چیزی باید اندازه‌گیری شود

## پرسش‌های پژوهشی که این راهنما پاسخ می‌دهد

این پاسخ‌های موجز، پرسش‌های تشخیصی رایج را به شواهد اندازه‌گیری‌شده در هر مرحله پیوند می‌دهند.

1. در آزمایش متنی گزارش‌شده، پخش نقاب‌دار در فضای کُد و فضای توکن چه تفاوتی در عملکرد داشتند؟ با همان امتیازدهندهٔ بیرونی، میانهٔ سرگشتگی MDLM در فضای کُد 26.55 بود، در برابر 38.42 برای خط پایهٔ فضای توکن؛ یعنی کاهشی معادل 30.9%. میانهٔ بازسازی کُدک از پیش 27.36 بود؛ بنابراین نتیجه باید همراه با گلوگاه بازسازی تفسیر شود. [اعداد گزارش‌شده برای هر مرحله را بررسی کنید](https://aogavrilov.com/fa/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
2. وقتی کُدک اتلافی است، پخش نقاب‌دار در فضای کُد و فضای توکن را چگونه باید مقایسه کرد؟ برای نمونه‌های اصلی، بازسازی‌های کُدک و خروجی‌های فضای توکن و فضای کُد، از همان نمونه‌های کنارگذاشته‌شده و همان امتیازدهندهٔ متن رمزگشایی‌شده استفاده کنید. شکاف بازسازی را جداگانه گزارش دهید، زیرا مولد نهفتهٔ قوی‌تر نمی‌تواند اطلاعاتی را بازیابی کند که کُدک پیش‌تر حذف کرده است. [مراحل را با یک ارزیاب واحد مقایسه کنید](https://aogavrilov.com/fa/research/codec-bottleneck-diagnosis/#code-space-vs-token-space) .
3. افت کیفیت در یک مولد متن دومرحله‌ای چگونه قابل تشخیص است؟ با یک ارزیاب ثابتِ متن رمزگشایی‌شده، ابتدا شکاف میان متن اصلی و بازسازی و سپس شکاف میان بازسازی و تولید را اندازه‌گیری کنید. بدین‌ترتیب، سقف کیفیت تحمیل‌شده از سوی کُدِک از افت اضافی ناشی از تولید نهفته تفکیک می‌شود. [رویهٔ تشخیصی چهارمرحله‌ای را دنبال کنید](https://aogavrilov.com/fa/research/codec-bottleneck-diagnosis/#workflow) .
4. چه زمانی بهبود سنجه‌های فضای نهفته به بهبود خروجی رمزگشایی‌شده منجر نمی‌شود؟ ممکن است یک شاخص جانشین در فضای نهفته بهبود یابد، بی‌آنکه ویژگی پایین‌دستی موردنظر را دنبال کند. انتقال را با رمزگشایی خروجی‌های همتاشده و ارزیابی آن‌ها با معیارهای نهایی یکسان بیازمایید؛ در غیر این صورت، هندسه یا میزان استفاده از کتاب کُد صرفاً شاهدی تشخیصی است، نه بهبود کیفیت متن. [از تشخیص انتقال شاخص جانشین استفاده کنید](https://aogavrilov.com/fa/research/codec-bottleneck-diagnosis/#decision-table) .

## خطاهای رایج در تشخیص

### مقایسهٔ صرفِ خروجی‌های نهایی

یک امتیاز سرتاسری نمی‌تواند مشخص کند که افت ناشی از بازنمایی بوده است یا مولد.

### تغییر ارزیاب‌ها میان مراحل

ارزیاب‌های متفاوت، شکاف‌های میان مراحل را قیاس‌ناپذیر می‌کنند و انتساب علّی را تضعیف می‌کنند.

### «کیفیت متن» نامیدنِ سلامت کتاب‌کُد

بهره‌برداری مناسب ممکن است هم‌زمان با بازسازی‌های ضعیف یا تولیدهای رمزگشایی‌شدهٔ ضعیف رخ دهد.

### تعمیم‌دادن یک رژیم فشرده‌سازی

شواهد منتشرشده یک پیکربندی 64 به 16 از TinyStories و اجراهای منفرد توصیفی را پوشش می‌دهند.

## پیشینهٔ اصلی

این منابع، مجموعه‌داده و خانواده‌های مدلی را تعریف می‌کنند که مطالعهٔ تشخیصی به آن‌ها ارجاع داده است.

1. [یادگیری بازنمایی گسستهٔ عصبی](https://arxiv.org/abs/1711.00937) VQ-VAE و گلوگاه گسستهٔ آموخته‌شده‌ای را معرفی می‌کند که مولدهای نهفتهٔ بعدی از آن بهره می‌برند.
2. [تولید تصاویر متنوع و باوفاداری بالا با VQ-VAE-2](https://arxiv.org/abs/1906.00446) بازنمایی گسستهٔ سلسله‌مراتبی با سطوح کُدِ مجزا توسعه می‌دهد.
3. [TinyStories: How Small Can Language Models Be and Still Speak Coherent English?](https://arxiv.org/abs/2305.07759) پیکرهٔ مصنوعی داستان‌های کوتاه را که در مطالعهٔ موردی تشخیصی به‌کار رفته است معرفی می‌کند.
4. [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) صورت‌بندی پخش گسستهٔ نقاب‌دارِ به‌کاررفته برای مولد نهفته را ارائه می‌کند.

## مرز شواهد

روش مرحله‌ای بازاستفاده‌پذیر است، اما رتبه‌بندی گزارش‌شده عمومیت ندارد. آزمایش منتشرشده از TinyStories، یک رژیم فشرده‌سازی تهاجمی، یک خانوادهٔ کُدک سلسله‌مراتبی، یک مولد گسستهٔ نقاب‌دار و اجراهای منفرد توصیفی استفاده می‌کند. پروتکل تشخیصی را بر سامانهٔ جدید اعمال کنید و نتیجهٔ عددی را به محیطی متفاوت تعمیم ندهید.

## انتشارات مرتبط

### [Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization](https://aogavrilov.com/fa/publications/where-quality-breaks/)

نقطهٔ فروپاشی کیفیت در تولید متن کوتاهِ فشرده: مکان‌یابی مرحله‌ای گلوگاه

روش‌شناسی تشخیصی FRUCT 39 2026 کنفرانس اصلی

### [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/fa/publications/inspectable-control/)

کنترل بازرسی‌پذیر برای بازتولید نرم‌افزار با حفظ ساختار

روش کنترل در فضای نهفته FSE Companion '26 2026 پوستر همراه
