Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

संपीडित लघु-मजकूर निर्मितीत गुणवत्ता कुठे ढासळते: टप्प्याटप्प्याने अडथळ्याचे स्थाननिर्धारण

कोडेक पुनर्रचना हानी आणि सुप्त-निर्मिती हानी वेगळी करणारे संपीडित लघु-मजकूर निर्मितीचे टप्प्याटप्प्याने निदान.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

संपूर्ण शोधलेख HTML मध्ये वाचासूत्रे, तक्ते, आकृत्या आणि संदर्भांसह शोधता येण्याजोगा मजकूर.

अंतिम स्वीकृत हस्तलिखित (लेखकाने प्रसिद्ध केलेली DOI-सहित आवृत्ती). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. प्रकाशन आणि पुनर्वापराच्या अटी.

शोधनिबंध 30 सेकंदांत

संशोधन प्रश्नसंपीडित मजकूर-निर्मिती प्रक्रियाप्रवाहातील गुणवत्तेची हानी कोडेक आणि सुप्त जनित्र यांच्यात स्वतंत्रपणे कशी विभागता येईल?

समस्या

संपीडित लघु-मजकूर निर्मितीत निकृष्ट विसंकेतित मजकूर कोडेकमध्ये हरवलेल्या माहितीमुळे किंवा दुर्बल सुप्त-अवकाश निर्मितीमुळे मिळू शकतो. आद्यंत गुणांकनांत हे दोन अपयशप्रकार वेगळे दिसत नाहीत आणि त्यामुळे इष्टतमीकरणाचे प्रयत्न चुकीच्या घटकाकडे वळू शकतात.

दृष्टिकोन

टप्पानिहाय प्रोटोकॉलमध्ये मूळ मजकूर, त्याच्याशी जोडलेल्या कोडेक पुनर्रचना, टोकन-अवकाशातील MDLM निष्पत्ती आणि कोड-अवकाशातील प्रसरण निष्पत्ती यांना एकाच बाह्य GPT-2 मूल्यमापकाने गुण दिले जातात. कोडबुक आणि भूमितीची मापने ही निदान-साधनेच मानली जातात; विसंकेतित मजकुराच्या गुणवत्तेचे पर्याय नव्हेत.

मुख्य निष्कर्ष

कोडेक पुनर्रचनेमुळे बाह्य perplexity चा मध्यक 15.17 वरून 27.36 पर्यंत आणि p95 25.10 वरून 98.91 पर्यंत वाढतो. तरीही टोकन-अवकाश MDLM च्या तुलनेत कोड-अवकाश MDLM मध्यक perplexity 30.9% ने कमी करतो.

हे महत्त्वाचे का आहे

हा निष्कर्ष कोडेकमधील अडथळ्याच्या निदानाला कृतीयोग्य कार्यक्रम देतो: प्रथम कोडेक सुधारण्याला प्राधान्य द्या, त्यानंतर टोकन-अवकाश आणि कोड-अवकाश निर्मितीची तुलना करा; विसंकेतित मजकूरही सुधारतो तेव्हाच सुप्त प्रतिनिधी मापनांतील सुधारणा विश्वासार्ह माना.

सारांश

संपीडित लघु-मजकूर जनित्रे दोन वेगवेगळ्या टप्प्यांवर अपयशी ठरू शकतात: निर्मिती सुरू होण्यापूर्वी कोडेक माहिती गाळू शकतो किंवा सुप्त जनित्र निकृष्ट कोड निर्माण करू शकते. हे अपयशप्रकार वेगळे न केल्यास संशोधक चुकीचा घटक सुधारण्यासाठी संगणकीय संसाधने खर्च करू शकतात. श्रेणीबद्ध VQ-VAE-2 कोडेक आणि मुखवटित विविक्त प्रसरण जनित्र (MDLM) यांपासून तयार केलेल्या नियंत्रित 64-to-16 TinyStories प्रकरण-अभ्यासात आम्ही या समस्येचा अभ्यास करतो. एकाच सामायिक बाह्य GPT-2 गुणनिर्धारकाखाली कोडेक पुनर्रचनेची निष्ठा, सुप्त निर्मितीची गुणवत्ता आणि पूरक सुप्त निदान-मापने वेगळी करणारा टप्पानिहाय प्रमाणीकरण प्रोटोकॉल आम्ही वापरतो; भूमिती-अभ्यासासाठी पूरक अर्थविषयक मापनेही नोंदवतो. तपासलेल्या मांडणीत केवळ कोडेक पुनर्रचनेमुळे बाह्य perplexity चा मध्यक 15.17 वरून 27.36 (+80.4%) आणि p95 25.10 वरून 98.91 (+294.1%) पर्यंत वाढतो; यावरून प्रमुख गुणवत्ताहानी सुप्त निर्मिती सुरू होण्यापूर्वीच होते असे दिसते. त्याच गुणनिर्धारकाखाली कोड-अवकाश MDLM टोकन-अवकाश प्रसरणापेक्षा लक्षणीयरीत्या सक्षम राहतो आणि सरासरी, मध्यक व p95 अनुक्रमे 32.9%, 30.9% व 36.6% ने कमी करतो. भूमिती-जागरूक नियमितीकरण स्थानिक सुप्त प्रतिनिधी मापने सुधारते; मात्र उपलब्ध धावांमध्ये विसंकेतित-मजकूर मापने सुधारत नाही. हे योगदान अल्गोरिदमिक नसून पद्धतिशास्त्रीय आहे: शोधलेख एका ठोस प्रक्रियाप्रवाहासाठी पुनर्वापरयोग्य टप्पानिहाय निदान सादर करतो आणि या मांडणीत सुप्त चलांचे denoising नव्हे, तर कोडेकची निष्ठा व्यावहारिक गुणवत्तेची कमाल मर्यादा ठरवते, असे दाखवतो.

येथे प्रकाशित 2026 39th Conference of Open Innovations Association (FRUCT)

योगदानाचा प्रकार निदान पद्धतिशास्त्र

अंक 1पृ. 69–76मुख्य परिषद

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

हा शोधनिबंध सामायिक करासामायिक करा

मुख्य निष्कर्ष

संपीडित लघु-मजकूर निर्मितीत गुणवत्ता कुठे ढासळते: टप्प्याटप्प्याने अडथळा-स्थाननिश्चिती—प्रमुख निष्कर्ष
मूल्यमापन बिंदूnसरासरी PPLमध्यक PPLp95 PPL
मूळ मजकूर25616.2415.1725.1
कोडेक पुनर्रचना25637.2627.3698.91
AR आधाररेषा25130.9823.2756.11
टोकन-अवकाश MDLM25644.7438.4293.6
कोड-अवकाश MDLM25630.0126.5559.36

मुख्य निष्कर्ष. निरीक्षित गुणवत्ताहानीचा बहुतांश भाग निर्मितीपूर्वीच उद्भवतो; तरीही टोकन-अवकाश प्रसरणाच्या तुलनेत कोड-अवकाश प्रसरण मध्यक perplexity 30.9% ने कमी करते.

डेटासंच
TinyStories
नमुना आकार
256 जोडलेले पुनर्रचना नमुने; प्रत्येक पद्धतीसाठी 251–256 निर्मित नमुने; चार जुळणारी भूमिती विन्यास.
मापन निकष
बाह्य GPT-2 perplexity: सरासरी, मध्यक, p95 आणि कमाल; संकेतपुस्तिका वापर व आधार-संचाचा आकार; भूमिती प्रयोगांसाठी SBERT, BERTScore, MAUVE आणि LLM-परीक्षकाचा सारांश
अनिश्चितता
नोंदवलेल्या तुलना वर्णनात्मक एकल धावांच्या आहेत; विश्वास अंतराल आणि बहु-बीज महत्त्व-अंदाज संगणित केलेले नाहीत.
अटी
64 लांबीचे GPT-2 टोकन अनुक्रम श्रेणीबद्ध VQ-VAE-2 वापरून 16 उच्च-स्तरीय संकेतांपर्यंत संक्षेपित केले आहेत; सर्व निर्मिती प्रकार सामायिक बाह्य गुणांकनकर्ता वापरतात.

PDF आणि संदर्भ-उद्धरण

या शोधपत्राचा संदर्भ द्या BibTeX हे शिफारस केलेले स्वरूप आहे. खालील प्रत्येक प्रकार त्याच प्रकाशन-नोंदीपासून निर्माण केला आहे.

PDF उघडा
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
.bib डाउनलोड करा

संदर्भ-उद्धरण फायली:APA मजकूरIEEE मजकूरRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 मेटाडेटा XMLसंपूर्ण-मजकूर JATS 1.4 XMLRDF Turtleदुवा संच (JSON)दुवा संच (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

संपूर्ण मार्गदर्शिका

संपूर्ण संशोधन मार्गदर्शिका

पद्धत

प्रत्येक अतिरिक्त रूपांतरण मोजता येण्याजोग्या गुणवत्ता-तफावतीशी जोडता यावे म्हणून शोधनिबंध मूल्यमापनाच्या तीनही टप्प्यांत एकच गुणांकक वापरतो.

  1. पुनर्रचना करा

    कोडेक पुनर्रचना हानी मोजण्यासाठी प्रत्येक 64-टोकन TinyStories नमुन्याचे 16 उच्च-स्तरीय संकेतांत संकेतन करून तत्काळ विसंकेतन करा.

  2. निर्मिती करा

    MDLM वापरून मजकूर-टोकन किंवा विविक्त सुप्त संकेत निर्माण करा आणि त्यानंतर त्याच प्रशिक्षित कोडेकद्वारे संकेत-अवकाश नमुन्यांचे विसंकेतन करा.

  3. तुलना करा

    मध्यक आणि वितरणाच्या शेपटीची सांख्यिकी यांसह एकाच बाह्य GPT-2 प्रोटोकॉलने मूळ मजकूर, पुनर्रचना आणि निर्मित मजकूर यांचे गुणांकन करा.

कोडेक हानी आणि निर्मिती हानी वेगळी करण्यासाठी मूळ मजकूर, कोडेक पुनर्रचना, कोड-अवकाश MDLM आणि विकोडित मजकूर यांची तुलना करणारी टप्पानिहाय संक्षिप्त-मजकूर निर्मिती वाहिनी.
टप्पानिहाय अडथळा-स्थाननिर्धारण एका सामायिक विसंकेतित-मजकूर मूल्यमापन प्रोटोकॉलअंतर्गत कोडेक पुनर्रचना हानी आणि सुप्त-निर्मिती हानी वेगळी करते.स्रोत: प्रकाशित पद्धत आणि निष्कर्षांवर आधारित, लेखकाने तयार केलेली स्पष्टीकरणात्मक आकृती..पुनर्वापराच्या अटी: CC BY 4.0.सुचवलेले श्रेय: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. SVG डाउनलोड करा.

मुख्य कल्पना

कोडेकने आधीच टाकून दिलेली माहिती पुढील टप्प्यातील जनक पुनर्प्राप्त करू शकत नाही. म्हणून सुप्त-निर्मितीच्या निष्कर्षांचा अर्थ लावण्यापूर्वी पुनर्रचना टप्प्याचे लेखापरीक्षण करणे आवश्यक आहे.

समीपवर्ती पद्धतींपासूनचा फरक

प्रमाणित टोकापासून-टोकापर्यंतच्या तुलनांमध्ये एक अंतिम निर्मिती गुण नोंदवला जातो. हा प्रोटोकॉल जोडित पुनर्रचना तपासणी-बिंदू समाविष्ट करतो आणि सुप्त अवकाशातील स्वास्थ्य मापनांना विकोडित मजकुरावरील पुराव्यापासून वेगळे करतो.

नवे काय आहे

हे योगदान नवीन विरवणी अल्गोरिदम नसून, एका ठोस संक्षिप्त-मजकूर वाहिनीसाठी पुनर्वापरयोग्य टप्पानिहाय निदान पद्धतिशास्त्र आहे.

हा शोधलेख ज्या प्रश्नांची उत्तरे शोधण्यास मदत करतो

शोधनिबंधावर आधारित संक्षिप्त उत्तरासाठी प्रश्न उघडा. पुराव्याच्या सविस्तर सीमा ‘मर्यादा’ विभागात दिल्या आहेत.

  1. संपीडित लघु-मजकूर निर्मितीत गुणवत्ता कुठे ढासळते?

    तपासलेल्या TinyStories 64-to-16 प्रक्रियाप्रवाहात प्रमुख गुणवत्ताहानी सुप्त निर्मिती सुरू होण्यापूर्वी, कोडेक पुनर्रचनेच्या टप्प्यावर दिसते. बाह्य GPT-2 perplexity चा मध्यक मूळ मजकुरासाठी 15.17 वरून पुनर्रचनेनंतर 27.36 पर्यंत वाढतो, तर p95 25.10 वरून 98.91 पर्यंत वाढतो. हा निष्कर्ष एका मांडणीपुरता आहे; कोडेकची सार्वत्रिक क्रमवारी नव्हे.

  2. कोडेक हानी आणि सुप्त-निर्मिती हानी वेगवेगळी कशी मोजता येईल?

    टप्प्याटप्प्याची कार्यपद्धती मूळ मजकूर, त्याच्याशी जोडलेल्या कोडेक पुनर्रचना आणि अंतिम निर्मित मजकूर यांचे एका सामायिक बाह्य गुणदात्याने मूल्यमापन करते. मूळ मजकूर व पुनर्रचना यांतील अंतर कोडेकच्या योगदानाचा अंदाज देते, तर पुनर्रचना व निर्मित निष्पत्ती यांची तुलना निर्मितीच्या टप्प्यातील अतिरिक्त हानीचे स्थान निश्चित करण्यास मदत करते. सुप्त प्रतिनिधित्वाच्या स्वास्थ्याची मापके विकोडित मजकुराच्या पुराव्यापासून स्वतंत्रपणे नोंदवली आहेत.

  3. विविक्त-सुप्त मजकूर-निर्मितीचे मूल्यमापन कसे करावे?

    जनित्रांची तुलना करण्यापूर्वी पुनर्रचनेची निष्ठा तपासावी, प्रत्येक टप्प्यावर तोच विसंकेतित-मजकूर गुणनिर्धारक वापरावा आणि मध्यवर्ती तसेच वितरणाच्या शेपटीतील सांख्यिकी नोंदवावी, अशी शोधलेखाची शिफारस आहे. कोडबुकचा वापर, भूमिती आणि इतर सुप्त प्रतिनिधी मापने ही विसंकेतित मजकुराच्या गुणवत्तेचे पर्याय नसून निदान-मापने मानली आहेत.

  4. कोड-अवकाश प्रसरण टोकन-अवकाश प्रसरणापेक्षा सरस ठरते का?

    सामायिक गुणदाता आणि तपासलेल्या मांडणीत, टोकन-अवकाश MDLM च्या तुलनेत कोड-अवकाश MDLM सरासरी, मध्यक आणि p95 संदिग्धता अनुक्रमे 32.9%, 30.9% आणि 36.6% ने कमी करते. ही तुलना वर्णनात्मक आणि संरचना-विशिष्ट आहे; विविध डेटासंच, संपीडन गुणोत्तरे, कोडेक किंवा विसरण स्थापत्यांमध्ये ती सार्वत्रिक क्रमवारी सिद्ध करत नाही.

  5. सुप्त भूमितीची अधिक चांगली मापने अधिक चांगल्या निर्मित मजकुराची हमी देतात का?

    नाही. उपलब्ध जुळवलेल्या धावांमध्ये भूमिती-जागरूक नियमितीकरणाने स्थानिक सुप्त-अवकाशातील प्रतिनिधी मापने सुधारली; मात्र विसंकेतित-मजकूर मापने सुधारली नाहीत. त्यामुळे प्रत्येक प्रतिनिधी मापनातील सुधारणा अंतिम विसंकेतित निष्पत्तीवर तपासणे आणि तिचे संक्रमण न होणे हा निर्मिती सुधारल्याचा पुरावा न मानता उपयुक्त नकारात्मक निष्कर्ष मानणे आवश्यक ठरते.

समीपवर्ती पद्धतींशी तुलना

संपीडित लघु-मजकूर निर्मितीत गुणवत्ता कुठे ढासळते: टप्प्याटप्प्याने अडथळा-स्थाननिश्चिती—संबंधित दृष्टिकोनांशी तथ्याधारित तुलना
दृष्टिकोननिरूपणनियंत्रण / निदानकाय जपले किंवा मोजले जाते
टोकन-अवकाश विसरणमजकूर टोकनटोकन-अवकाशातील निर्मिती-गुणवत्ताथेट निर्मितीची प्रवाहीता आणि गुणांकनकर्त्याचे वर्तन
संपीडित सुप्त निर्मितीकोडेकद्वारे विविक्त सुप्त संकेतअंतिम टोकापासून टोकापर्यंतची निर्मिती-गुणवत्ताकोडेक आणि सुप्त-जनित्र यांचे संयुक्त वर्तन
टप्पानिहाय अडथळा स्थाननिश्चितीमजकूर, कोडेक पुनर्रचना आणि विविक्त सुप्त चलकोडेक हानी आणि निर्मिती हानी वेगवेगळी मोजाएका सामायिक गुणदात्याखाली गुणवत्ता कुठे खालावते

ही तुलना मूल्यमापनाची व्याप्ती आणि पुरावा यांत भेद करते; ती पद्धतींचे सार्वत्रिक क्रमांकन नाही.

प्रस्तुतता आणि व्याप्ती

निर्मिती प्रक्रियाप्रवाहात शिकवलेला कोडेक आणि सुप्त-अवकाश जनित्र हे दोन्ही असताना, पण निष्पत्तीचा दर्जा नेमका कुठे खालावतो हे अस्पष्ट असताना, ही टप्प्याटप्प्याची कार्यपद्धती उपयुक्त ठरते.

  1. संपीडित आणि विविक्त-सुप्त मजकूर-निर्मिती

  2. निर्मिती पाइपलाइनमधील कोडेक पुनर्रचनेची निष्ठा

  3. कोड अवकाशातील मुखवटित विसरण भाषा-प्रतिमानन

  4. अडथळ्याचे स्थाननिर्धारण आणि टप्पा-सुसंगत मूल्यमापन

  5. विसंकेतित मजकुराच्या संदर्भात सुप्त-अवकाश प्रतिनिधी मापनांतील सुधारणांचे लेखापरीक्षण

मर्यादा आणि पुराव्याच्या सीमा पाहा

मर्यादा

  • अनुभवाधारित अभ्यासात केवळ TinyStories वापरले आहे.
  • मुख्य विश्लेषण एका आक्रमक 64-to-16 संक्षेप व्यवस्थेपुरते आहे.
  • मूल्यमापन केलेली प्रणाली एका श्रेणीबद्ध VQ-VAE-2 कोडेक कुटुंबाला एका MDLM जनकाशी जोडते.
  • तुलना एकेरी धावांवर आधारित असून, बहु-बीज सांख्यिकीय अंदाजांऐवजी वर्णनात्मक स्वरूपाच्या आहेत.
  • बाह्य GPT-2 perplexity हे सामायिक निदान-साधन आहे; ते अर्थविषयक गुणवत्तेचे सार्वत्रिक मेट्रिक नाही.
  • हे निष्कर्ष सर्व डेटासंच, कोडेक संरचना किंवा संक्षेप गुणोत्तरांवर थेट लागू करू नयेत.

शोधलेखात उद्धृत केलेले संदर्भ

या नोंदी शोधनिबंधाच्या PDF मधील क्रमांकित संदर्भ विभागाशी अनुरूप आहेत.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

संसाधने आणि पुनरुत्पादकता

प्रकाशक
IEEE
प्रकाशन संसाधने
सार्वजनिक हस्तलिखित, निष्कर्ष तक्ते, स्पष्टीकरणात्मक आकृती आणि उद्धरण फाइल्स येथे उपलब्ध आहेत. अंमलबजावणी कोड आणि तपासणी-बिंदू सार्वजनिकरीत्या प्रसिद्ध केलेले नाहीत.

डेटा निवेदन

स्रोत
शोधनिबंधात वर्णन केल्याप्रमाणे TinyStories.
परवाना
TinyStories चा वापर डेटासंचाच्या स्वतःच्या अटींच्या अधीन राहतो; या संकेतस्थळावरून डेटासंचातील कोणत्याही फाइलचे पुनर्वितरण केले जात नाही.
पूर्वप्रक्रिया
GPT-2 टोकनीकरण, निश्चित 64-टोकन निविष्ट्या आणि 64 वरून 32 व नंतर 16 स्थानांपर्यंत श्रेणीबद्ध कालिक संक्षेपण.
विभाजन
प्रकाशनात 256 जोडित पुनर्रचना नमुने आणि प्रत्येक पद्धतीसाठी 251–256 निर्मित नमुने नोंदवले आहेत; पुनर्वापरयोग्य प्रशिक्षण/सत्यापन विभाजन विवरण प्रकाशित केलेले नाही.
स्वरूप
लघु-मजकूर नमुने, GPT-2 टोकन अनुक्रम, विविक्त कोड अनुक्रम, निर्मिती नोंदी आणि सारांश तक्ते.
आवृत्ती / तपासबेरीज
शोधलेखात डेटासंचाचा checksum किंवा अपरिवर्तनीय TinyStories snapshot ओळखचिन्ह नोंदवलेले नाही.
डेटा-प्राप्ती
प्रकाशन-पृष्ठासोबत डेटा मिळवण्यासाठीची सार्वजनिक स्क्रिप्ट प्रसिद्ध केलेली नाही.
वापराच्या मर्यादा
हा पुरावा लघु कृत्रिम कथांपुरता आहे आणि निर्बंधमुक्त नैसर्गिक-भाषा निर्मितीसाठी मानदंड मानू नये.

आवृत्त्या

  1. प्रकाशित आवृत्तीIEEE / FRUCT, 2026
  2. लेखकाचे हस्तलिखितमजकूर-सुलभ स्थानिक PDF
  3. परिषद व्याख्यानFRUCT 39 सादरीकरण
  4. परिषद कार्यवृत्त अनुक्रमणिकाअधिकृत FRUCT 39 खंड
  5. परिषद कार्यवृत्त PDFFRUCT मुक्त संपूर्ण मजकूर
  6. शैक्षणिक अभिलेख उघडाOpenAlex
  7. संदर्भ-उद्धरण आलेख नोंदSemantic Scholar
  8. लेखकाने सामायिक केलेला संपूर्ण मजकूरResearchGate

प्रकाशित DOI हा प्राथमिक ग्रंथसूची ओळखचिन्ह आहे. सर्व आवृत्त्यांसाठी हे पृष्ठ एकमेव प्रमाणित प्रकल्प URL राहते.