Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

சுருக்கப்பட்ட குறுஉரை உருவாக்கத்தில் தரம் சிதையும் இடம்: கட்டவாரி இடர்ப்புள்ளி இருப்பிடமறிதல்

கோடெக் மறுகட்டமைப்பு இழப்பையும் மறைநிலை உருவாக்க இழப்பையும் பிரித்தறியும், சுருக்கப்பட்ட குறுஉரை உருவாக்கத்திற்கான கட்டவாரி நோயறிதல்.

Alexey Gavrilov1Alan-Barsag Gazzaev1Sergey Muravyov1

  1. ITMO University, Saint Petersburg, Russia

முழுக் கட்டுரையையும் HTML வடிவில் படிக்கவும்சூத்திரங்கள், அட்டவணைகள், படங்கள், மேற்கோள்கள் ஆகியவற்றுடன் தேடக்கூடிய உரை.

இறுதியாக ஏற்கப்பட்ட கையெழுத்துப் பிரதி (DOI உடன் ஆசிரியர் வெளியிட்ட பதிப்பு). © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. பதிவிடல் மற்றும் மறுபயன்பாட்டு விதிமுறைகள்.

30 வினாடிகளில் ஆய்வுக்கட்டுரை

ஆராய்ச்சிக் கேள்விசுருக்கப்பட்ட உரை-உருவாக்கச் செயல்தொடரில் ஏற்படும் தர இழப்பை கோடெக்கிற்கும் மறைநிலை உருவாக்கிக்கும் தனித்தனியாக எவ்வாறு காரணப்படுத்தலாம்?

சிக்கல்

சுருக்கப்பட்ட குறுஉரை உருவாக்கத்தில், தரமற்ற குறிவிலக்கப்பட்ட உரைக்கு கோடெக் இழந்த தகவலோ பலவீனமான மறைநிலை வெளி உருவாக்கமோ காரணமாக இருக்கலாம். முனைமுதல் முனைவரையிலான மதிப்பெண்கள் இத்தோல்வி முறைகளின் வேறுபாட்டை மறைத்து, உகப்பாக்க முயற்சியைத் தவறான கூறை நோக்கிச் செலுத்தக்கூடும்.

அணுகுமுறை

கட்டவாரி நெறிமுறை, மூல உரைகள், அவற்றுடன் இணையான கோடெக் மறுகட்டமைப்புகள், டோக்கன் வெளி MDLM வெளியீடுகள், குறியீட்டு வெளி விரவல் வெளியீடுகள் ஆகிய அனைத்தையும் ஒரே வெளிப்புற GPT-2 மதிப்பீட்டாளரால் மதிப்பிடுகிறது. குறியீட்டுத் தொகுதி மற்றும் வடிவியல் அளவீடுகள், குறிவிலக்கப்பட்ட உரையின் தரத்திற்கான மாற்றீடுகளாக அல்லாமல் நோயறிதல் அளவீடுகளாகவே கருதப்படுகின்றன.

முதன்மை முடிவு

கோடெக் மறுகட்டமைப்பால் வெளிப்புறக் குழப்பநிலையின் இடைநிலை 15.17 இலிருந்து 27.36 ஆகவும், p95 25.10 இலிருந்து 98.91 ஆகவும் உயர்கிறது. இருந்தபோதிலும், டோக்கன் வெளி MDLM-உடன் ஒப்பிடும்போது குறியீட்டு வெளி MDLM இடைநிலைக் குழப்பநிலையை 30.9% குறைக்கிறது.

இது ஏன் முக்கியம்

இம்முடிவு கோடெக் இடர்ப்புள்ளி நோயறிதலைச் செயல்படுத்தக்கூடிய பணிவரிசையாக மாற்றுகிறது: முதலில் கோடெக் மேம்பாடுகளுக்கு முன்னுரிமை அளிக்கவும்; பின்னர் டோக்கன் வெளி மற்றும் குறியீட்டு வெளி உருவாக்கத்தை ஒப்பிடவும்; குறிவிலக்கப்பட்ட உரையும் மேம்படும்போது மட்டுமே மறைநிலைப் பதிலளவீட்டின் முன்னேற்றங்களை நம்பவும்.

சுருக்கம்

சுருக்கப்பட்ட குறுஉரை உருவாக்கிகள் இரண்டு இடங்களில் தோல்வியடையலாம்: உருவாக்கம் தொடங்குமுன் கோடெக் தகவலை இழக்கலாம்; அல்லது மறைநிலை உருவாக்கி தரமற்ற குறியீடுகளை உருவாக்கலாம். இத்தோல்வி முறைகளைப் பிரித்தறியாவிட்டால், ஆய்வாளர்கள் தவறான கூறை மேம்படுத்தக் கணிப்பீட்டு வளத்தைச் செலவிடக்கூடும். படிநிலை VQ-VAE-2 கோடெக் மற்றும் முகமூடியிட்ட தனித்த விரவல் உருவாக்கி (MDLM) கொண்டு கட்டமைக்கப்பட்ட, கட்டுப்படுத்தப்பட்ட 64-இலிருந்து-16 TinyStories வழக்காய்வில் இச்சிக்கலை ஆராய்கிறோம். வடிவியல் ஆய்வுக்கான துணைப் பொருண்மை அளவீடுகளையும் அறிக்கையிடும் அதேவேளை, ஒரே பகிரப்பட்ட வெளிப்புற GPT-2 மதிப்பீட்டாளரின் கீழ் கோடெக் மறுகட்டமைப்பு உண்மைநிகர்மை, மறைநிலை உருவாக்கத் தரம், துணை மறைநிலை நோயறிதல்கள் ஆகியவற்றைப் பிரிக்கும் கட்டவாரிச் சரிபார்ப்பு நெறிமுறையைப் பயன்படுத்துகிறோம். சோதிக்கப்பட்ட அமைப்பில், கோடெக் மறுகட்டமைப்பு மட்டுமே வெளிப்புறக் குழப்பநிலையின் இடைநிலையை 15.17 இலிருந்து 27.36 ஆக (+80.4%), p95-ஐ 25.10 இலிருந்து 98.91 ஆக (+294.1%) உயர்த்துகிறது; முதன்மையான தர இழப்பு மறைநிலை உருவாக்கம் தொடங்குமுன்பே ஏற்படுவதை இது காட்டுகிறது. அதே மதிப்பீட்டாளரின் கீழ், குறியீட்டு வெளி MDLM, டோக்கன் வெளி விரவலைவிடக் கணிசமாக வலுவாக இருந்து, சராசரி, இடைநிலை, p95 ஆகியவற்றை முறையே 32.9%, 30.9%, 36.6% குறைக்கிறது. வடிவியல் உணர்வுள்ள ஒழுங்குபடுத்தல் உள்ளூர் மறைநிலைப் பதிலளவீடுகளை மேம்படுத்துகிறது; ஆனால் கிடைத்த இயக்கங்களில் குறிவிலக்கப்பட்ட உரை அளவீடுகளை மேம்படுத்தவில்லை. இப்பங்களிப்பு படிமுறை சார்ந்ததல்ல, வழிமுறை சார்ந்தது: ஒரு குறிப்பிட்ட செயல்தொடருக்கான மீள்பயன்படுத்தத்தக்க கட்டவாரி நோயறிதலைக் கட்டுரை வழங்குகிறது; மேலும், இவ்வமைப்பில் மறைநிலை இரைச்சல் நீக்கத்தைவிட கோடெக் உண்மைநிகர்மையே நடைமுறைத் தர உச்சவரம்பை நிர்ணயிப்பதைக் காட்டுகிறது.

வெளியிடப்பட்ட இடம் 2026 39th Conference of Open Innovations Association (FRUCT)

பங்களிப்பு வகை நோயறிதல் வழிமுறை

இதழ் 1பக். 69–76முதன்மை மாநாடு

DOI https://doi.org/10.23919/FRUCT70069.2026.11506553

இந்தக் கட்டுரையைப் பகிர்கபகிர்க

முக்கிய முடிவுகள்

அழுத்தப்பட்ட குற்றுரை உருவாக்கத்தில் தரம் சிதையும் இடம்: கட்டநிலைத் தடையிட உள்ளடக்கத்தின் முக்கிய முடிவுகள்
மதிப்பீட்டுப் புள்ளிnசராசரி PPLஇடைநிலை PPLp95 PPL
மூல உரைகள்25616.2415.1725.1
கோடெக் மறுகட்டமைப்புகள்25637.2627.3698.91
AR அடிப்படைநிலை25130.9823.2756.11
Token-space MDLM25644.7438.4293.6
குறியீட்டு-வெளி MDLM25630.0126.5559.36

முக்கிய முடிவு. காணப்பட்ட தர இழப்பின் பெரும்பகுதி உருவாக்கத்திற்கு முன்பே ஏற்படுகிறது; இருந்தபோதிலும், டோக்கன் வெளி விரவலுடன் ஒப்பிடும்போது குறியீட்டு வெளி விரவல் இடைநிலைக் குழப்பநிலையை 30.9% குறைக்கிறது.

தரவுத்தொகுப்பு
TinyStories
மாதிரி அளவு
256 இணை மீள்கட்டமைப்பு மாதிரிகள்; ஒவ்வொரு முறைக்கும் 251–256 உருவாக்கப்பட்ட மாதிரிகள்; பொருத்தப்பட்ட நான்கு வடிவியல் அமைப்புகள்.
அளவீடுகள்
வெளிப்புற GPT-2 perplexity: சராசரி, இடைநிலை, p95 மற்றும் பெருமம்; codebook பயன்பாடும் ஆதரவுத் தொகுதியின் அளவும்; வடிவியல் இயக்கங்களுக்கான SBERT, BERTScore, MAUVE மற்றும் LLM-judge சுருக்கம்
நிச்சயமின்மை
அறிக்கையிடப்பட்ட ஒப்பீடுகள் விளக்கவகை ஒற்றை இயக்கங்கள்; நம்பக இடைவெளிகளும் பல-விதை முக்கியத்துவ மதிப்பீடுகளும் கணக்கிடப்படவில்லை.
நிபந்தனைகள்
64 நீளமுள்ள GPT-2 டோக்கன் தொடர்கள், படிநிலை VQ-VAE-2 கொண்டு 16 மேல்நிலைக் குறியீடுகளாகச் சுருக்கப்படுகின்றன; அனைத்து உருவாக்க முறைகளும் பொதுவான வெளிப்புற மதிப்பீட்டுக் கருவியைப் பயன்படுத்துகின்றன.

PDF மற்றும் மேற்கோள்

இந்த ஆய்வுக் கட்டுரையை மேற்கோளிடுக BibTeX பரிந்துரைக்கப்படும் வடிவம். கீழே உள்ள ஒவ்வொரு வடிவமும் அதே வெளியீட்டுப் பதிவிலிருந்து உருவாக்கப்படுகிறது.

PDF-ஐத் திறக்கவும்
@inproceedings{Gavrilov2026WhereQuality,
  title      = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
  author     = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
  booktitle  = {2026 39th Conference of Open Innovations Association (FRUCT)},
  publisher  = {IEEE},
  year       = {2026},
  pages      = {69--76},
  doi        = {10.23919/FRUCT70069.2026.11506553},
  url        = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
  isbn       = {978-952-65246-5-8},
}
.bib கோப்பைப் பதிவிறக்குக

மேற்கோள் கோப்புகள்:APA உரைIEEE உரைRISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLJATS 1.4 மீத்தரவு XMLமுழு-உரை JATS 1.4 XMLRDF Turtleஇணைப்புத் தொகுப்பு (JSON)இணைப்புத் தொகுப்பு (HTTP)RO-Crate

DOI:https://doi.org/10.23919/FRUCT70069.2026.11506553

முழுமையான வழிகாட்டி

முழுமையான ஆய்வு வழிகாட்டி

முறை

ஒவ்வொரு கூடுதல் மாற்றத்தையும் அளவிடக்கூடிய தர இடைவெளியுடன் தொடர்புபடுத்தும் வகையில், மூன்று மதிப்பீட்டுக் கட்டங்களிலும் ஒரே மதிப்பீட்டாளரைக் கட்டுரை பயன்படுத்துகிறது.

  1. மறுகட்டமைக்கவும்

    ஒவ்வொரு 64-டோக்கன் TinyStories மாதிரியையும் 16 மேல்நிலைக் குறியீடுகளாகக் குறியாக்கி, கோடெக் மறுகட்டமைப்பு இழப்பை அளவிட உடனடியாகக் குறிவிலக்குக.

  2. உருவாக்குக

    MDLM கொண்டு உரை டோக்கன்கள் அல்லது தனித்த மறைநிலைக் குறியீடுகளில் ஒன்றை உருவாக்கி, பின்னர் அதே பயிற்றுவிக்கப்பட்ட கோடெக் வழியாகக் குறியீட்டு-வெளி மாதிரிகளைக் குறிவிலக்குக.

  3. ஒப்பிடுக

    இடைநிலை மற்றும் வால் புள்ளிவிவரங்கள் உட்பட, ஒரே வெளிப்புற GPT-2 நெறிமுறையைக் கொண்டு அசல்கள், மறுகட்டமைப்புகள், மற்றும் உருவாக்கப்பட்ட உரைகளுக்கு மதிப்பெண் வழங்கவும்.

கோடெக் இழப்பை உருவாக்க இழப்பிலிருந்து பிரித்தறிய, மூல உரை, கோடெக் மறுகட்டமைப்பு, குறியீட்டு வெளி MDLM, குறிவிலக்கப்பட்ட உரை ஆகியவற்றை ஒப்பிடும் கட்டவாரிச் சுருக்கப்பட்ட உரை உருவாக்கச் செயல்தொடர்.
பகிரப்பட்ட ஒரே குறிவிலக்கப்பட்ட உரை மதிப்பீட்டு நெறிமுறையின் கீழ், கட்டவாரி இடர்ப்புள்ளி இருப்பிடமறிதல் கோடெக் மறுகட்டமைப்பு இழப்பை மறைநிலை உருவாக்க இழப்பிலிருந்து பிரித்தறிகிறது.மூலம்: வெளியிடப்பட்ட முறை மற்றும் முடிவுகளின் அடிப்படையில் ஆசிரியர் உருவாக்கிய விளக்கப்படம்..மறுபயன்பாட்டு விதிமுறைகள்: CC BY 4.0.பரிந்துரைக்கப்பட்ட குறிப்பிடல்: Gavrilov, Gazzaev, and Muravyov (2026), Where Quality Breaks in Compressed Short-Text Generation. SVG-ஐப் பதிவிறக்குக.

மையக் கருத்து

கோடெக் ஏற்கெனவே கைவிட்ட தகவலைப் பின்நிலை உருவாக்கியால் மீட்க முடியாது. எனவே மறைநிலை உருவாக்க முடிவுகளைப் பொருள்கொள்வதற்கு முன் மீள்கட்டமைப்புப் படிநிலை தணிக்கை செய்யப்பட வேண்டும்.

தொடர்புடைய அணுகுமுறைகளிலிருந்து வேறுபாடு

வழக்கமான முழுமுனை ஒப்பீடுகள் ஒரே இறுதி உருவாக்க மதிப்பெண்ணை அறிக்கையிடுகின்றன. இந்நெறிமுறை இணையான மீளுருவாக்கச் சோதனைப்புள்ளியைச் சேர்த்து, மறைநிலை வெளியிலுள்ள நல அளவீடுகளைக் குறிவிலக்கப்பட்ட உரைச் சான்றிலிருந்து பிரிக்கிறது.

புதியது என்ன

இப்பங்களிப்பு புதிய இரைச்சல்நீக்க வழிமுறையன்று; ஒரு குறிப்பிட்ட சுருக்க-உரைப் பணிக்குழாய்க்கான மீள்பயன்படுத்தக்கூடிய படிநிலை நோயறிதல் முறையியலாகும்.

இந்தக் கட்டுரை விடையளிக்க உதவும் கேள்விகள்

ஆய்வுக்கட்டுரையை ஆதாரமாகக் கொண்ட சுருக்கமான விடைக்கு ஒரு கேள்வியைத் திறக்கவும். விரிவான சான்று எல்லைகள் ‘வரம்புகள்’ பகுதியில் பட்டியலிடப்பட்டுள்ளன.

  1. அழுத்தப்பட்ட குற்றுரை உருவாக்கத்தில் தரம் எங்கே சிதைகிறது?

    சோதிக்கப்பட்ட TinyStories 64-to-16 செயல்தொடரில், மறைநிலை உருவாக்கம் தொடங்குவதற்கு முன்பே கோடெக் மீளுருவாக்கக் கட்டத்தில் முதன்மையான தரச்சிதைவு தோன்றுகிறது. இடைநிலை வெளிப்புற GPT-2 perplexity மூல உரைக்கான 15.17 இலிருந்து மீளுருவாக்கத்துக்குப் பின் 27.36 ஆகவும், p95 25.10 இலிருந்து 98.91 ஆகவும் உயர்கிறது. இது உலகளாவிய கோடெக் தரவரிசை அல்ல; ஓர் அமைவடிவுக்கான முடிவு மட்டுமே.

  2. கோடெக் இழப்பையும் மறைநிலை உருவாக்க இழப்பையும் எவ்வாறு தனித்தனியாகப் பிரித்தறியலாம்?

    கட்டநிலை நெறிமுறை, மூலப் பிரதிகள், அவற்றுடன் இணைக்கப்பட்ட கோடெக் மறுகட்டமைப்புகள், இறுதியாக உருவாக்கப்பட்ட உரை ஆகியவற்றை ஒரே பகிரப்பட்ட வெளிப்புற மதிப்பீட்டாளரால் மதிப்பிடுகிறது. மூலத்திலிருந்து மறுகட்டமைப்புக்கான இடைவெளி கோடெக்கின் பங்களிப்பை மதிப்பிடுகிறது; மறுகட்டமைப்பையும் உருவாக்கப்பட்ட வெளியீட்டையும் ஒப்பிடுவது கூடுதலான உருவாக்கக் கட்ட இழப்பை உள்ளடக்க உதவுகிறது. மறைநிலை ஆரோக்கிய அளவீடுகள், குறிநீக்கப்பட்ட உரைச் சான்றிலிருந்து தனியே அறிவிக்கப்படுகின்றன.

  3. தனித்த மறைநிலை உரை உருவாக்கத்தை எவ்வாறு மதிப்பிட வேண்டும்?

    உருவாக்கிகளை ஒப்பிடுவதற்கு முன் மீளுருவாக்கத் துல்லியத்தைச் சரிபார்க்கவும், ஒவ்வொரு கட்டத்திலும் ஒரே குறிவிலக்கப்பட்ட-உரை மதிப்பீட்டாளரைப் பயன்படுத்தவும், மைய மற்றும் வால் புள்ளிவிவரங்களை அறிக்கையிடவும் கட்டுரை பரிந்துரைக்கிறது. மேலும், குறியீட்டுப் புத்தகப் பயன்பாடு, வடிவியல் மற்றும் பிற மறைநிலைப் பதிலீட்டு அளவீடுகளைக் குறிவிலக்கப்பட்ட உரையின் தரத்திற்கான மாற்றீடுகளாக அல்லாமல் நோயறிதல்களாகக் கருதுகிறது.

  4. குறியீட்டு-வெளிப் பரவல், டோக்கன்-வெளிப் பரவலைவிடச் சிறப்பாகச் செயல்படுகிறதா?

    பகிரப்பட்ட மதிப்பீட்டாளரும் சோதிக்கப்பட்ட அமைவும் பயன்படுத்தப்பட்டபோது, token-space MDLM உடன் ஒப்பிடுகையில் code-space MDLM சராசரி, இடைநிலை மற்றும் p95 perplexity-ஐ முறையே 32.9%, 30.9%, 36.6% குறைக்கிறது. இவ்வொப்பீடு விளக்கவியலானதும் அமைவுக்கே உரியதும் ஆகும்; தரவுத்தொகுப்புகள், அழுத்த விகிதங்கள், கோடெக்குகள் அல்லது diffusion கட்டமைப்புகள் அனைத்திற்குமான உலகளாவிய தரவரிசையை இது நிறுவவில்லை.

  5. மேம்பட்ட மறைநிலை வடிவியல் அளவீடுகள், மேம்பட்ட உருவாக்கப்பட்ட உரைக்கு உத்தரவாதமளிக்கின்றனவா?

    இல்லை. கிடைக்கப்பெற்ற பொருத்தப்பட்ட இயக்கங்களில், வடிவியலறிந்த ஒழுங்குபடுத்தல் உள்ளூர் மறைநிலை-வெளிப் பதிலீட்டு அளவீடுகளை மேம்படுத்தியது; ஆனால் குறிவிலக்கப்பட்ட-உரை அளவீடுகளை மேம்படுத்தவில்லை. ஒவ்வொரு பதிலீட்டு அளவீட்டு முன்னேற்றத்தையும் இறுதிக் குறிவிலக்கப்பட்ட வெளியீட்டில் தணிக்கை செய்ய வேண்டும் என்பதையும், பரிமாற்றம் நிகழாமையை உருவாக்க மேம்பாட்டுக்கான சான்றாக அல்லாமல் பயனுள்ள எதிர்மறை முடிவாகக் கருத வேண்டும் என்பதையும் இம்முடிவு ஆதரிக்கிறது.

தொடர்புடைய அணுகுமுறைகளுடனான ஒப்பீடு

அழுத்தப்பட்ட குற்றுரை உருவாக்கத்தில் தரம் சிதையும் இடம்: கட்டநிலைத் தடையிட உள்ளடக்கம் — தொடர்புடைய அணுகுமுறைகளுடனான உண்மைசார் ஒப்பீடு
அணுகுமுறைபிரதிநிதித்துவம்கட்டுப்பாடு / நோயறிதல்எது பாதுகாக்கப்படுகிறது அல்லது அளவிடப்படுகிறது
Token-space diffusionஉரை டோக்கன்கள்டோக்கன் வெளியில் உருவாக்கத் தரம்நேரடி உருவாக்கத்தின் மொழியோட்டமும் மதிப்பீட்டுக் கருவியின் நடத்தையும்
சுருக்கப்பட்ட மறைநிலை உருவாக்கம்கோடெக் வழியான தனித்த மறைநிலைக் குறியீடுகள்இறுதி முனை-முதல்-முனை உருவாக்கத் தரம்கோடெக்கும் மறைநிலை உருவாக்கியும் இணைந்த நடத்தை
படிநிலையான இடையூறு இருப்பிடமறிதல்உரை, கோடெக் மீளுருவாக்கங்கள், தனித்த மறைநிலைகள்கோடெக் இழப்பையும் உருவாக்க இழப்பையும் தனித்தனியாகப் பிரித்தறிகஒரே பகிரப்பட்ட மதிப்பீட்டாளரின் கீழ் தரம் சிதையும் இடம்

இவ்வொப்பீடு மதிப்பீட்டு வரம்பையும் சான்றையும் வேறுபடுத்துகிறது; இது அணுகுமுறைகளின் உலகளாவிய தரவரிசை அல்ல.

பொருத்தமும் ஆய்வெல்லையும்

உருவாக்கச் செயல்தொடரில் கற்றறிந்த கோடெக்கும் மறைநிலை வெளி உருவாக்கியும் இருந்து, வெளியீட்டுத் தரச் சிதைவின் மூலம் தெளிவாக இல்லாதபோது கட்டநிலை நெறிமுறை பயனுள்ளதாகும்.

  1. சுருக்கப்பட்ட மற்றும் தனித்துண்டு-மறைநிலை உரை உருவாக்கம்

  2. உருவாக்கச் செயலோட்டங்களில் கோடெக் மறுகட்டமைப்பு உண்மைநிகர்மை

  3. குறியீட்டு வெளியில் மறைக்கப்பட்ட பரவல் மொழி மாதிரியாக்கம்

  4. இடர்ப்புள்ளி இருப்பிடங்காணலும் படிநிலை-இசைவான மதிப்பீடும்

  5. குறிவிலக்கப்பட்ட உரைக்கு எதிராக மறைநிலை வெளிப் பதிலளவீட்டு மேம்பாடுகளைத் தணிக்கை செய்தல்

வரம்புகளையும் சான்றின் எல்லைகளையும் காண்க

வரம்புகள்

  • அனுபவவழி ஆய்வு TinyStories-ஐ மட்டுமே பயன்படுத்துகிறது.
  • முதன்மைப் பகுப்பாய்வு தீவிரமான ஒரே 64-இலிருந்து-16 சுருக்க அமைவை மட்டுமே உள்ளடக்குகிறது.
  • மதிப்பிடப்பட்ட அமைப்பு ஒரு படிநிலை VQ-VAE-2 கோடெக் குடும்பத்தையும் ஓர் MDLM உருவாக்கியையும் இணைக்கிறது.
  • ஒப்பீடுகள் ஒற்றை இயக்கங்களை அடிப்படையாகக் கொண்ட விளக்கத் தன்மையுடையவை; அவை பல-விதை புள்ளியியல் மதிப்பீடுகள் அல்ல.
  • வெளிப்புற GPT-2 குழப்பநிலை என்பது பகிரப்பட்ட நோயறிதல் அளவீடு மட்டுமே; உலகளாவிய பொருண்மைத் தர அளவீடு அல்ல.
  • தீர்மானங்களை எல்லாத் தரவுத்தொகுப்புகள், கோடெக் கட்டமைப்புகள் அல்லது சுருக்க விகிதங்களுக்கும் நேரடியாகப் பொருத்தக்கூடாது.

கட்டுரையில் மேற்கோளிடப்பட்ட உசாத்துணைகள்

இந்தப் பதிவுகள் ஆய்வுக்கட்டுரையின் PDF-இல் எண்களிடப்பட்ட References பகுதிக்கு ஒத்திருக்கின்றன.

  1. Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
  2. Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
  3. Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
  4. Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
  5. Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
  6. Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
  7. Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
  8. Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  9. Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  10. Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
  11. Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
  12. Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
  13. Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
  14. Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
  15. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

வளங்களும் மறுஉருவாக்கத்தன்மையும்

பதிப்பாளர்
IEEE
வெளியீட்டு வளங்கள்
பொதுக் கையெழுத்துப்படி, முடிவு அட்டவணைகள், விளக்கப்படம், மேற்கோள் கோப்புகள் ஆகியவை இங்குக் கிடைக்கின்றன. செயலாக்கக் குறியீடும் சோதனைப்புள்ளிகளும் பொதுவாக வெளியிடப்படவில்லை.

தரவுக் கூற்று

மூலம்
ஆய்வுக்கட்டுரையில் விவரிக்கப்பட்ட TinyStories.
உரிமம்
TinyStories பயன்பாடு அந்தத் தரவுத்தொகுப்பின் சொந்த விதிமுறைகளுக்கு உட்பட்டது; இத்தளம் எந்தத் தரவுத்தொகுப்புக் கோப்புகளையும் மறுவிநியோகம் செய்வதில்லை.
முன்செயலாக்கம்
GPT-2 டோக்கனாக்கம், நிலையான 64-டோக்கன் உள்ளீடுகள், மேலும் 64-இலிருந்து 32 வழியாக 16 நிலைகளுக்கான படிநிலைக் காலச் சுருக்கம்.
பிரிப்பு
வெளியீடு 256 இணை மீளுருவாக்க மாதிரிகளையும், ஒவ்வொரு முறைக்கும் 251–256 உருவாக்கப்பட்ட மாதிரிகளையும் அறிக்கையிடுகிறது; மீள்பயன்படுத்தக்கூடிய பயிற்சி/சரிபார்ப்புப் பிரிப்பு அறிக்கையை வெளியிடவில்லை.
வடிவம்
குறுஉரை மாதிரிகள், GPT-2 டோக்கன் தொடர்கள், தனித்த குறியீட்டுத் தொடர்கள், உருவாக்கப் பதிவுகள், சுருக்க அட்டவணைகள்.
பதிப்பு / checksum
கட்டுரையில் தரவுத்தொகுப்பு checksum அல்லது மாற்றவியலா TinyStories snapshot identifier தெரிவிக்கப்படவில்லை.
பெறுகை
வெளியீட்டுப் பக்கத்துடன் பொதுப் பெறுகை script வெளியிடப்படவில்லை.
பயன்பாட்டு வரம்புகள்
இச்சான்று குறுகிய செயற்கைக் கதைகளை மட்டுமே உள்ளடக்குகிறது; கட்டுப்பாடற்ற இயல்மொழி உருவாக்கத்திற்கான அளவுகோலாக இதைக் கருதக்கூடாது.

பதிப்புகள்

  1. வெளியிடப்பட்ட பதிப்புIEEE / FRUCT, 2026
  2. ஆசிரியர் கையெழுத்துப்படிஉரையாக அணுகக்கூடிய உள்ளூர் PDF
  3. மாநாட்டு உரைFRUCT 39 விளக்கவுரை
  4. மாநாட்டு ஆய்வுத்தொகுப்புக் குறியீடுஅதிகாரப்பூர்வ FRUCT 39 தொகுதி
  5. மாநாட்டு ஆய்வுத்தொகுப்பு PDFFRUCT திறந்த முழு உரை
  6. ஆய்வியல் பதிவைத் திறக்கவும்OpenAlex
  7. மேற்கோள் வரைபடப் பதிவுSemantic Scholar
  8. ஆசிரியர் பகிர்ந்த முழு உரைResearchGate

வெளியிடப்பட்ட DOI முதன்மை நூற்பதிவு அடையாளமாகும். பதிப்புகள் அனைத்திலும் இந்தப் பக்கமே ஒரே அதிகாரப்பூர்வத் திட்ட URL ஆக நீடிக்கிறது.