# Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

Canonical HTML: https://aogavrilov.com/bn/publications/where-quality-breaks/

Document language: bn

সংকুচিত স্বল্প-পাঠ উৎপাদনে যেখানে গুণমান ভেঙে পড়ে: ধাপভিত্তিক bottleneck স্থানীয়করণ

সংকুচিত স্বল্প-পাঠ উৎপাদনের ধাপভিত্তিক রোগনির্ণয়, যা কোডেক পুনর্গঠনজনিত ক্ষতিকে সুপ্ত উৎপাদনজনিত ক্ষতি থেকে পৃথক করে।

[Alexey Gavrilov](https://orcid.org/0009-0006-3147-5430) 1 [Alan-Barsag Gazzaev](https://orcid.org/0009-0000-0334-312X) 1 [Sergey Muravyov](https://orcid.org/0000-0002-4251-1744) 1

1. [ITMO University, Saint Petersburg, Russia](https://en.itmo.ru/)

[HTML-এ পূর্ণ গবেষণাপত্রটি পড়ুন](https://aogavrilov.com/publications/where-quality-breaks/full-text/) সূত্র, সারণি, চিত্র ও তথ্যসূত্রসহ অনুসন্ধানযোগ্য পাঠ্য।

চূড়ান্ত গৃহীত পাণ্ডুলিপি (লেখক-প্রকাশিত DOI-সহ সংস্করণ)। © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. [প্রকাশ ও পুনর্ব্যবহারের শর্তাবলি](https://journals.ieeeauthorcenter.ieee.org/become-an-ieee-journal-author/publishing-ethics/guidelines-and-policies/post-publication-policies/) .

## ৩০ সেকেন্ডে প্রবন্ধ

**গবেষণা প্রশ্ন** সংকুচিত টেক্সট-উৎপাদন পাইপলাইনে মানের অবনতির জন্য কোডেক ও প্রচ্ছন্ন উৎপাদককে পৃথকভাবে কীভাবে দায়ী করা যায়?

### সমস্যা

সংকুচিত স্বল্প-টেক্সট উৎপাদনে নিম্নমানের ডিকোড করা টেক্সট কোডেকে তথ্য হারানো অথবা দুর্বল প্রচ্ছন্ন পরিসরভিত্তিক উৎপাদন থেকে আসতে পারে। প্রান্ত-থেকে-প্রান্ত স্কোর এই ব্যর্থতার ধরনগুলোকে অস্পষ্ট করে এবং অপ্টিমাইজেশনের প্রচেষ্টাকে ভুল উপাদানের দিকে চালিত করতে পারে।

### পদ্ধতি

ধাপভিত্তিক প্রোটোকলটি একটি বহিরাগত GPT-2 মূল্যায়ক দিয়ে মূল নমুনা, জোড়াবদ্ধ কোডেক পুনর্গঠন, টোকেন-পরিসরের MDLM আউটপুট এবং কোড-পরিসরের ডিফিউশন আউটপুটের স্কোর নির্ধারণ করে। কোডবুক ও জ্যামিতিক পরিমাপ ডিকোড করা পাঠের মানের বিকল্প নয়, রোগনির্ণয়মূলক সূচক হিসেবেই থাকে।

### প্রধান ফলাফল

কোডেক পুনর্গঠনে বহিঃস্থ পারপ্লেক্সিটির মধ্যমা 15.17 থেকে 27.36 এবং p95 25.10 থেকে 98.91-এ ওঠে। তবু টোকেন-পরিসর MDLM-এর তুলনায় কোড-পরিসর MDLM মধ্যমা পারপ্লেক্সিটি 30.9% কমায়।

### কেন এটি গুরুত্বপূর্ণ

ফলটি কোডেক বটলনেক নির্ণয়কে কার্যকর কাজের ক্রমে রূপ দেয়: প্রথমে কোডেকের উন্নতিকে অগ্রাধিকার দিন, এরপর টোকেন-পরিসর ও কোড-পরিসরের উৎপাদন তুলনা করুন, এবং ডিকোড-করা পাঠ্যও উন্নত হলেই কেবল সুপ্ত প্রক্সির উন্নতিকে বিশ্বাস করুন।

## সারসংক্ষেপ

সংকুচিত সংক্ষিপ্ত-পাঠ্য উৎপাদক দুটি ভিন্ন স্থানে ব্যর্থ হতে পারে: উৎপাদন শুরুর আগেই কোডেক তথ্য হারাতে পারে, অথবা সুপ্ত উৎপাদক দুর্বল কোড তৈরি করতে পারে। এই ব্যর্থতার ধরনগুলো আলাদা না করলে গবেষকেরা ভুল উপাদানের উন্নয়নে গণনাশক্তি ব্যয় করতে পারেন। আমরা স্তরবিন্যস্ত VQ-VAE-2 কোডেক ও মাস্কযুক্ত বিচ্ছিন্ন ডিফিউশন উৎপাদক (MDLM) দিয়ে নির্মিত একটি নিয়ন্ত্রিত 64-থেকে-16 TinyStories কেস স্টাডিতে সমস্যাটি বিশ্লেষণ করি। একই বহিঃস্থ GPT-2 স্কোরারের অধীনে কোডেক পুনর্গঠনের বিশ্বস্ততা, সুপ্ত উৎপাদনের গুণমান ও সহায়ক সুপ্ত নির্ণায়ক সূচক আলাদা করতে আমরা ধাপভিত্তিক বৈধতা যাচাইয়ের প্রোটোকল ব্যবহার করি; পাশাপাশি জ্যামিতি-গবেষণার জন্য পরিপূরক অর্থগত মেট্রিকও প্রতিবেদন করি। পরীক্ষিত বিন্যাসে শুধু কোডেক পুনর্গঠনই বহিঃস্থ পারপ্লেক্সিটির মধ্যমা 15.17 থেকে 27.36 (+80.4%) এবং p95 25.10 থেকে 98.91 (+294.1%)-এ বাড়ায়; অর্থাৎ প্রধান গুণমান-ক্ষতি সুপ্ত উৎপাদন শুরুর আগেই দেখা দেয়। একই স্কোরারে কোড-পরিসর MDLM টোকেন-পরিসর ডিফিউশনের চেয়ে উল্লেখযোগ্যভাবে শক্তিশালী থাকে এবং যথাক্রমে গড়, মধ্যমা ও p95 কমায় 32.9%, 30.9% ও 36.6%। জ্যামিতি-সচেতন নিয়মিতকরণ স্থানীয় সুপ্ত প্রক্সির উন্নতি ঘটালেও উপলভ্য চালনাগুলোতে ডিকোড-করা-পাঠ্যের মেট্রিক উন্নত করে না। অবদানটি অ্যালগরিদমগত নয়, বরং পদ্ধতিগত: গবেষণাপত্রটি একটি নির্দিষ্ট পাইপলাইনের জন্য পুনর্ব্যবহারযোগ্য ধাপভিত্তিক নির্ণয় উপস্থাপন করে এবং দেখায় যে এই বিন্যাসে সুপ্ত ডিনয়েজিং নয়, কোডেক বিশ্বস্ততাই ব্যবহারিক গুণমানের ঊর্ধ্বসীমা নির্ধারণ করে।

প্রকাশনার স্থান 2026 39th Conference of Open Innovations Association (FRUCT)

অবদানের ধরন নির্ণয়-পদ্ধতি

28 এপ্রিল, 2026 সংখ্যা 1 পৃষ্ঠা 69–76 প্রধান সম্মেলন

DOI [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

## বিষয়বস্তু এই পৃষ্ঠায়

## প্রধান ফলাফল

| মূল্যায়ন বিন্দু | n | গড় PPL | মধ্যক PPL | p95 PPL |
| --- | --- | --- | --- | --- |
| মূল পাঠসমূহ | 256 | 16.24 | 15.17 | 25.1 |
| কোডেক পুনর্গঠনসমূহ | 256 | 37.26 | 27.36 | 98.91 |
| AR baseline | 251 | 30.98 | 23.27 | 56.11 |
| টোকেন-পরিসর MDLM | 256 | 44.74 | 38.42 | 93.6 |
| কোড-পরিসর MDLM | 256 | 30.01 | 26.55 | 59.36 |

**প্রধান ফলাফল।** পর্যবেক্ষিত গুণমানহানির অধিকাংশই উৎপাদনের আগে ঘটে; তবু টোকেন-স্থান ডিফিউশনের তুলনায় কোড-স্থান ডিফিউশন মধ্যক perplexity 30.9% কমায়।

ফলাফল ডাউনলোড করুন: [CSV](https://aogavrilov.com/publications/where-quality-breaks/results.csv) [JSON](https://aogavrilov.com/publications/where-quality-breaks/results.json) [মার্কডাউন](https://aogavrilov.com/publications/where-quality-breaks/results.md) বাহ্যিক মিরর: [Hugging Face ডেটাসেট কার্ড](https://huggingface.co/datasets/aogavrilov/where-quality-breaks-results)

## PDF ও উদ্ধৃতিতথ্য

**এই গবেষণাপত্রটি উদ্ধৃত করুন** BibTeX হলো প্রস্তাবিত বিন্যাস। নিচের প্রতিটি রূপ একই প্রকাশনা-নথি থেকে তৈরি।

```
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
```

উদ্ধৃতি-ফাইল: [APA পাঠ](https://aogavrilov.com/publications/where-quality-breaks/citation-apa.txt) [IEEE টেক্সট](https://aogavrilov.com/publications/where-quality-breaks/citation-ieee.txt) [RIS](https://aogavrilov.com/publications/where-quality-breaks/citation.ris) [CSL-JSON](https://aogavrilov.com/publications/where-quality-breaks/citation.json) [Schema.org JSON-LD](https://aogavrilov.com/publications/where-quality-breaks/metadata.jsonld) [OAI-DC XML](https://aogavrilov.com/publications/where-quality-breaks/oai-dc.xml) [OpenAIRE v4 XML](https://aogavrilov.com/publications/where-quality-breaks/openaire.xml) [MODS XML](https://aogavrilov.com/publications/where-quality-breaks/mods.xml) [JATS 1.4 মেটাডেটা XML](https://aogavrilov.com/publications/where-quality-breaks/metadata.jats.xml) [পূর্ণপাঠ JATS 1.4 XML](https://aogavrilov.com/publications/where-quality-breaks/full-text/article.jats.xml) [RDF Turtle](https://aogavrilov.com/publications/where-quality-breaks/metadata.ttl) [লিংক সেট (JSON)](https://aogavrilov.com/publications/where-quality-breaks/linkset.json) [লিংক সেট (HTTP)](https://aogavrilov.com/publications/where-quality-breaks/linkset) [RO-Crate](https://aogavrilov.com/publications/where-quality-breaks/ro-crate-metadata.json)

DOI: [https://doi.org/10.23919/FRUCT70069.2026.11506553](https://doi.org/10.23919/FRUCT70069.2026.11506553)

পূর্ণাঙ্গ নির্দেশিকা

## পূর্ণাঙ্গ গবেষণা নির্দেশিকা

## পদ্ধতি

## 

প্রবন্ধটি মূল্যায়নের তিনটি ধাপে একই স্কোরার ব্যবহার করে, যাতে প্রতিটি অতিরিক্ত রূপান্তরকে পরিমাপযোগ্য মানের ব্যবধানের সঙ্গে যুক্ত করা যায়।

1. পুনর্গঠন করুন প্রতিটি 64-token TinyStories নমুনাকে 16টি শীর্ষ-স্তরের কোডে এনকোড করে সঙ্গে সঙ্গে ডিকোড করুন, যাতে কোডেক পুনর্গঠন ক্ষতি মাপা যায়।
2. উৎপাদন করুন MDLM দিয়ে পাঠ-টোকেন অথবা বিচ্ছিন্ন সুপ্ত কোড উৎপাদন করুন; এরপর একই প্রশিক্ষিত কোডেকের মাধ্যমে কোড-পরিসরের নমুনাগুলো ডিকোড করুন।
3. তুলনা করুন একই বহিরাগত GPT-2 প্রোটোকল দিয়ে মূল, পুনর্গঠিত ও উৎপাদিত পাঠ্যের স্কোর নির্ণয় করুন; এতে মধ্যক ও বণ্টনের প্রান্তীয় পরিসংখ্যানও অন্তর্ভুক্ত রাখুন।

![কোডেক ক্ষতিকে উৎপাদন ক্ষতি থেকে পৃথক করতে মূল পাঠ্য, কোডেক পুনর্গঠন, কোড-পরিসরের MDLM এবং ডিকোড-করা পাঠ্যের তুলনাকারী পর্যায়ক্রমিক সংকুচিত-পাঠ্য উৎপাদন পাইপলাইন।](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg)

**একই ডিকোড-করা পাঠ্য মূল্যায়ন প্রোটোকলের অধীনে ধাপভিত্তিক বটলনেক অবস্থান-নির্ণয় কোডেক পুনর্গঠনজনিত ক্ষতিকে সুপ্ত-উৎপাদনজনিত ক্ষতি থেকে পৃথক করে।* উৎস: [প্রকাশিত পদ্ধতি ও ফলাফলের ভিত্তিতে লেখকের তৈরি ব্যাখ্যামূলক চিত্র।](https://doi.org/10.23919/FRUCT70069.2026.11506553) . পুনর্ব্যবহারের শর্ত: [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) . প্রস্তাবিত সূত্রোল্লেখ: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. [SVG ডাউনলোড করুন](https://aogavrilov.com/publications/where-quality-breaks/staged-codec-bottleneck-localization.svg) .*

### মূল ধারণা

কোডেক ইতিমধ্যে যে তথ্য বর্জন করেছে, পরবর্তী উৎপাদক তা পুনরুদ্ধার করতে পারে না। তাই সুপ্ত-উৎপাদনের ফল ব্যাখ্যা করার আগে পুনর্গঠন ধাপটি নিরীক্ষা করতে হবে।

### নিকটবর্তী পদ্ধতি থেকে পার্থক্য

প্রচলিত প্রান্ত-থেকে-প্রান্ত তুলনায় একটি চূড়ান্ত উৎপাদন স্কোর জানানো হয়। এই প্রোটোকল জোড়াভিত্তিক পুনর্গঠন চেকপয়েন্ট যুক্ত করে এবং সুপ্ত পরিসরের স্বাস্থ্য-মেট্রিককে ডিকোড-করা পাঠ্যের প্রমাণ থেকে পৃথক করে।

### নতুন কী

অবদানটি নতুন কোনো ডিনয়েজিং অ্যালগরিদম নয়; বরং একটি নির্দিষ্ট সংকুচিত-পাঠ্য পাইপলাইনের জন্য পুনর্ব্যবহারযোগ্য পর্যায়ক্রমিক নিদান-পদ্ধতি।

## যেসব প্রশ্নের উত্তর পেতে এই গবেষণাপত্র সহায়ক

## 

গবেষণাপত্রভিত্তিক সংক্ষিপ্ত উত্তরের জন্য একটি প্রশ্ন খুলুন। প্রমাণের বিস্তারিত সীমা ‘সীমাবদ্ধতা’ অংশে দেওয়া আছে।

1. সংকুচিত স্বল্প-পাঠ উৎপাদনে কোথায় মানের অবনতি ঘটে? পরীক্ষিত TinyStories 64-to-16 পাইপলাইনে প্রধান অবনতি দেখা যায় কোডেক পুনর্গঠনের পর্যায়ে, প্রচ্ছন্ন উৎপাদন শুরু হওয়ার আগেই। বাহ্যিক GPT-2 পারপ্লেক্সিটির মধ্যমা মূল টেক্সটের 15.17 থেকে পুনর্গঠনের পরে 27.36-এ ওঠে; অন্যদিকে p95 বৃদ্ধি পায় 25.10 থেকে 98.91-এ। এটি একটি নির্দিষ্ট কনফিগারেশনের ফল, সর্বজনীন কোডেক ক্রমমান নয়।
2. কোডেক পুনর্গঠনজনিত ক্ষতিকে প্রচ্ছন্ন-উৎপাদন ক্ষতি থেকে কীভাবে পৃথক করা যায়? ধাপভিত্তিক প্রোটোকলটি একই বহিরাগত স্কোরার দিয়ে মূল নমুনা, জোড়াবদ্ধ কোডেক পুনর্গঠন এবং চূড়ান্ত উৎপাদিত পাঠ মূল্যায়ন করে। মূল নমুনা থেকে পুনর্গঠনের ব্যবধান কোডেকের অবদান অনুমান করে, আর পুনর্গঠন ও উৎপাদিত আউটপুটের তুলনা অতিরিক্ত উৎপাদন-পর্যায়ের ক্ষতির অবস্থান নির্ণয়ে সহায়তা করে। ডিকোড করা পাঠের প্রমাণ থেকে সুপ্ত উপস্থাপনার সুস্থতা-সূচক আলাদাভাবে প্রতিবেদন করা হয়।
3. বিচ্ছিন্ন প্রচ্ছন্ন উপস্থাপনাভিত্তিক টেক্সট উৎপাদন কীভাবে মূল্যায়ন করা উচিত? প্রবন্ধটি জেনারেটর তুলনার আগে পুনর্গঠনের বিশ্বস্ততা যাচাই, প্রতিটি ধাপে একই ডিকোড-করা পাঠ্য স্কোরার প্রয়োগ এবং কেন্দ্রীয় ও প্রান্তীয় পরিসংখ্যান প্রকাশের পরামর্শ দেয়। পাশাপাশি কোডবুক ব্যবহার, জ্যামিতি ও অন্যান্য সুপ্ত প্রক্সিকে ডিকোড-করা পাঠ্যের মানের বিকল্প নয়, বরং নিদান হিসেবে বিবেচনা করে।
4. কোড-পরিসরের ডিফিউশন কি টোকেন-পরিসরের ডিফিউশনকে ছাড়িয়ে যায়? অভিন্ন স্কোরার ও পরীক্ষিত বিন্যাসে টোকেন-পরিসর MDLM-এর তুলনায় কোড-পরিসর MDLM গড়, মধ্যমা ও p95 পারপ্লেক্সিটি যথাক্রমে 32.9%, 30.9% ও 36.6% কমায়। তুলনাটি বর্ণনামূলক ও কনফিগারেশন-নির্দিষ্ট; এটি বিভিন্ন ডেটাসেট, সংকোচন অনুপাত, কোডেক বা ডিফিউশন স্থাপত্যে কোনো সর্বজনীন ক্রম প্রতিষ্ঠা করে না।
5. উন্নত সুপ্ত-জ্যামিতি মেট্রিক কি আরও ভালো উৎপাদিত পাঠের নিশ্চয়তা দেয়? না। উপলভ্য জোড়-মেলানো রানগুলোতে জ্যামিতি-সচেতন নিয়মিতকরণ স্থানীয় সুপ্ত-স্থান প্রতিরূপ সূচক উন্নত করলেও ডিকোড-করা-পাঠের মূল্যায়ন সূচক উন্নত করেনি। ফলটি প্রতিটি প্রতিরূপ সূচকের উন্নতি চূড়ান্ত ডিকোড-করা আউটপুটে যাচাই করা এবং স্থানান্তর না-ঘটাকে উৎপাদন উন্নতির প্রমাণ না ভেবে একটি উপযোগী নেতিবাচক ফল হিসেবে বিবেচনা করার পক্ষে সমর্থন দেয়।

## নিকটবর্তী পদ্ধতিগুলোর সঙ্গে তুলনা

## 

| পদ্ধতি | উপস্থাপন | নিয়ন্ত্রণ / নির্ণয় | কী সংরক্ষিত বা পরিমাপ করা হয় |
| --- | --- | --- | --- |
| টোকেন-পরিসর ডিফিউশন | পাঠ্য টোকেন | টোকেন-পরিসরে উৎপাদনের গুণমান | সরাসরি উৎপাদনের সাবলীলতা ও স্কোরারের আচরণ |
| সংকুচিত সুপ্ত উৎপাদন | কোডেকের মাধ্যমে বিচ্ছিন্ন সুপ্ত কোড | চূড়ান্ত প্রান্ত-থেকে-প্রান্ত উৎপাদনের গুণমান | কোডেক ও সুপ্ত-উৎপাদকের সম্মিলিত আচরণ |
| পর্যায়ক্রমিক বটলনেক অবস্থান-নির্ণয় | পাঠ্য, কোডেক পুনর্গঠন এবং বিচ্ছিন্ন সুপ্ত চলক | কোডেক ক্ষতিকে উৎপাদন ক্ষতি থেকে পৃথক করুন | একই স্কোরারে যেখানে মানের অবনতি ঘটে |

তুলনাটি মূল্যায়নের পরিসর ও প্রমাণের পার্থক্য নির্দেশ করে; এটি পদ্ধতিগুলোর কোনো সর্বজনীন ক্রমতালিকা নয়।

## প্রাসঙ্গিকতা ও পরিধি

## 

কোনো উৎপাদনমূলক পাইপলাইনে শেখানো কোডেক ও সুপ্ত-পরিসর উৎপাদক উভয়ই থাকলেও আউটপুটের মানহ্রাসের উৎস অস্পষ্ট হলে ধাপভিত্তিক প্রোটোকলটি কার্যকর।

1. সংকুচিত ও বিচ্ছিন্ন-সুপ্ত পাঠ্য উৎপাদন
2. উৎপাদনমূলক পাইপলাইনে কোডেক পুনর্গঠনের বিশ্বস্ততা
3. কোড স্থানে মাস্কযুক্ত ডিফিউশন ভাষা মডেলিং
4. bottleneck স্থানীয়করণ ও ধাপ-সামঞ্জস্যপূর্ণ মূল্যায়ন
5. decoded পাঠের বিপরীতে সুপ্ত স্থানের proxy উন্নতি নিরীক্ষণ

## সীমাবদ্ধতা

## 

- অভিজ্ঞতামূলক গবেষণাটিতে কেবল TinyStories ব্যবহৃত হয়েছে।
- মূল বিশ্লেষণটি একটি আক্রমণাত্মক 64-থেকে-16 সংকোচন বিন্যাস নিয়ে করা হয়েছে।
- মূল্যায়িত ব্যবস্থাটি একটি স্তরবিন্যস্ত VQ-VAE-2 কোডেক পরিবারকে একটি MDLM জেনারেটরের সঙ্গে যুক্ত করে।
- তুলনাগুলো একক চালনার ভিত্তিতে করা এবং বহু-সিড পরিসংখ্যানগত প্রাক্কলনের বদলে বর্ণনামূলক।
- বাহ্যিক GPT-2 perplexity একটি অভিন্ন রোগনির্ণায়ক সূচক, সর্বজনীন অর্থগত-গুণমান মেট্রিক নয়।
- উপসংহারগুলো সব ডেটাসেট, কোডেক স্থাপত্য বা সংকোচন অনুপাতে সরাসরি প্রয়োগ করা উচিত নয়।

## গবেষণাপত্রে উদ্ধৃত তথ্যসূত্র

## 

এন্ট্রিগুলো গবেষণাপত্রের PDF-এ নম্বরযুক্ত তথ্যসূত্র অংশের সঙ্গে সঙ্গতিপূর্ণ।

1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. 2024 . [Simple and Effective Masked Diffusion Language Models](https://arxiv.org/abs/2406.07524) . Advances in Neural Information Processing Systems .
2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. 2017 . [Neural Discrete Representation Learning](https://arxiv.org/abs/1711.00937) . Advances in Neural Information Processing Systems .
3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. 2019 . [Generating Diverse High-Fidelity Images with VQ-VAE-2](https://arxiv.org/abs/1906.00446) . Advances in Neural Information Processing Systems .
4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. 2021 . [Structured Denoising Diffusion Models in Discrete State-Spaces](https://arxiv.org/abs/2107.03006) . Advances in Neural Information Processing Systems .
5. Aaron Lou, Chenlin Meng, Stefano Ermon. 2024 . [Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution](https://arxiv.org/abs/2310.16834) . Proceedings of the 41st International Conference on Machine Learning .
6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. 2023 . [SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control](https://doi.org/10.18653/v1/2023.acl-long.647) . Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics .
7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. 2022 . [Diffusion-LM Improves Controllable Text Generation](https://arxiv.org/abs/2205.14217) . Advances in Neural Information Processing Systems .
8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. 2022 . [MaskGIT: Masked Generative Image Transformer](https://openaccess.thecvf.com/content/CVPR2022/html/Chang_MaskGIT_Masked_Generative_Image_Transformer_CVPR_2022_paper.html) . Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition .
9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. 2019 . [Mask-Predict: Parallel Decoding of Conditional Masked Language Models](https://doi.org/10.18653/v1/D19-1633) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. 2021 . [Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions](https://arxiv.org/abs/2102.05379) . Advances in Neural Information Processing Systems .
11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. 2019 . [Language Models are Unsupervised Multitask Learners](https://cdn.openai.com/better-language-models/language-models.pdf) . OpenAI Technical Report .
12. Nils Reimers, Iryna Gurevych. 2019 . [Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks](https://doi.org/10.18653/v1/D19-1410) . Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing .
13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. 2020 . [BERTScore: Evaluating Text Generation with BERT](https://arxiv.org/abs/1904.09675) . International Conference on Learning Representations .
14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. 2021 . [MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers](https://arxiv.org/abs/2102.01454) . Advances in Neural Information Processing Systems .
15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. 2023 . [Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena](https://arxiv.org/abs/2306.05685) . Advances in Neural Information Processing Systems, Datasets and Benchmarks Track .

## উপকরণ ও পুনরুৎপাদনযোগ্যতা

## 

### ডেটা-বিবৃতি

## সংস্করণসমূহ

## 

1. **প্রকাশিত সংস্করণ** [IEEE / FRUCT, 2026](https://doi.org/10.23919/FRUCT70069.2026.11506553)
2. **arXiv রেকর্ড** [প্রাক্‌মুদ্রণ রেকর্ড খুলুন, arXiv:2607.24176](https://arxiv.org/abs/2607.24176)
3. **AI গবেষণা সূচি** [প্রথম লেখকের যাচাইকৃত পরিচয় ও সংযুক্ত ফলাফল-সারাংশসহ Hugging Face Paper Page](https://huggingface.co/papers/2607.24176)
4. **লেখকের manuscript** [পাঠ্য-অভিগম্য স্থানীয় PDF](https://aogavrilov.com/publications/where-quality-breaks/paper.pdf)
5. **সম্মেলন বক্তৃতা** [FRUCT 39 উপস্থাপনা](https://www.youtube.com/watch?v=JExX7cxa63s)
6. **সম্মেলন কার্যবিবরণীর সূচি** [FRUCT 39-এর আনুষ্ঠানিক খণ্ড](https://fruct.org/publications/volume-39/fruct39)
7. **সম্মেলন কার্যবিবরণীর PDF** [FRUCT-এর উন্মুক্ত পূর্ণপাঠ](https://www.fruct.org/files/publications/volume-39/fruct39/Gav.pdf)
8. **গবেষণামূলক রেকর্ড খুলুন** [OpenAlex](https://openalex.org/W7160914887)
9. **উদ্ধৃতি-গ্রাফ রেকর্ড** [Semantic Scholar](https://www.semanticscholar.org/paper/11b5a0e8f75f0dfd141659e9a82ac58982a65ce1)
10. **লেখকের শেয়ার করা পূর্ণপাঠ** [ResearchGate](https://www.researchgate.net/publication/404794122_Where_Quality_Breaks_in_Compressed_Short-Text_Generation_Staged_Bottleneck_Localization)

প্রকাশিত DOI-ই প্রধান গ্রন্থপঞ্জিগত শনাক্তকারী। সংস্করণভেদে এই পৃষ্ঠাই প্রকল্পের একমাত্র প্রামাণ্য URL হিসেবে বহাল থাকে।

## সংশ্লিষ্ট প্রকাশনা

- [Inspectable Control for Structure-Preserving Software Regeneration](https://aogavrilov.com/bn/publications/inspectable-control/)

পড়ুন: [কোডেক সংকীর্ণপথ নির্ণয়](https://aogavrilov.com/bn/projects/codec-bottleneck-diagnosis/) গবেষণা-নির্দেশিকা। [লেখক পরিচিতি](https://aogavrilov.com/about/) .

### লক্ষ্যনির্দিষ্ট গবেষণা নোট

প্রমাণের সীমারেখা ও এই গবেষণাপত্রে প্রত্যাবর্তী সংযোগসহ অভিপ্রায়-নির্দিষ্ট উত্তর।

- [কোড-পরিসর বনাম টোকেন-পরিসর মাস্কযুক্ত ডিফিউশন: তুলনা করবেন কীভাবে](https://aogavrilov.com/bn/research-notes/code-space-vs-token-space-masked-diffusion/)
