Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
จุดที่คุณภาพลดลงในการสร้างข้อความสั้นแบบบีบอัด: การระบุคอขวดเป็นลำดับขั้น
การวินิจฉัยเป็นลำดับขั้นของการสร้างข้อความสั้นแบบบีบอัด ซึ่งแยกการสูญเสียจากการสร้างคืนด้วยตัวแปลงสัญญาณออกจากการสูญเสียจากการสร้างในปริภูมิแฝง
อ่านบทความฉบับเต็มในรูปแบบ HTMLเนื้อหาที่ค้นหาได้ พร้อมสูตร ตาราง รูป และเอกสารอ้างอิง
ต้นฉบับฉบับสมบูรณ์ที่ได้รับการตอบรับ (ฉบับที่ผู้เขียนเผยแพร่พร้อม DOI) © 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting or republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works. เงื่อนไขการเผยแพร่และการนำไปใช้ซ้ำ.
ทำความเข้าใจบทความใน 30 วินาที
คำถามวิจัยจะจำแนกได้อย่างไรว่าการสูญเสียคุณภาพในไปป์ไลน์การสร้างข้อความแบบบีบอัดเกิดจากโคเดกหรือตัวสร้างในปริภูมิแฝง
ปัญหา
ในการสร้างข้อความสั้นแบบบีบอัด ข้อความที่ถอดรหัสแล้วมีคุณภาพต่ำอาจเกิดจากข้อมูลที่โคเดกทำสูญหาย หรือจากการสร้างในปริภูมิแฝงที่ยังไม่ดีพอ คะแนนแบบต้นทางถึงปลายทางทำให้รูปแบบความล้มเหลวเหล่านี้แยกจากกันได้ยาก และอาจทำให้มุ่งปรับประสิทธิภาพผิดองค์ประกอบ
แนวทาง
โพรโทคอลแบบแบ่งขั้นใช้ตัวประเมิน GPT-2 ภายนอกตัวเดียวกันให้คะแนนข้อความต้นฉบับ ผลการสร้างคืนด้วยโคเดกที่จับคู่กัน ผลลัพธ์ MDLM ในปริภูมิโทเค็น และผลลัพธ์การแพร่ในปริภูมิรหัส ส่วนตัววัดสมุดรหัสและเรขาคณิตใช้เพื่อการวินิจฉัยเท่านั้น มิใช่ตัวแทนคุณภาพของข้อความหลังถอดรหัส
ผลลัพธ์หลัก
การสร้างคืนด้วยโคเดกทำให้ค่ามัธยฐานเพอร์เพล็กซิตีจากตัวประเมินภายนอกเพิ่มจาก 15.17 เป็น 27.36 และ p95 เพิ่มจาก 25.10 เป็น 98.91 อย่างไรก็ดี MDLM ในปริภูมิรหัสยังลดค่ามัธยฐานเพอร์เพล็กซิตีได้ 30.9% เมื่อเทียบกับ MDLM ในปริภูมิโทเค็น
เหตุผลที่เรื่องนี้สำคัญ
ผลลัพธ์นี้ทำให้การวินิจฉัยคอขวดของโคเดกนำไปจัดลำดับงานได้จริง กล่าวคือ ควรปรับปรุงโคเดกก่อน แล้วจึงเปรียบเทียบการสร้างในปริภูมิโทเค็นกับปริภูมิรหัส และควรเชื่อว่าตัวชี้วัดตัวแทนในปริภูมิแฝงที่ดีขึ้นสะท้อนคุณภาพจริงก็ต่อเมื่อข้อความหลังถอดรหัสดีขึ้นด้วย
บทคัดย่อ
ระบบสร้างข้อความสั้นแบบบีบอัดอาจล้มเหลวได้สองขั้น กล่าวคือ โคเดกอาจทิ้งข้อมูลไปก่อนเริ่มการสร้าง หรือตัวสร้างในปริภูมิแฝงอาจผลิตรหัสที่ด้อยคุณภาพ หากไม่แยกสาเหตุทั้งสอง นักวิจัยอาจใช้ทรัพยากรประมวลผลไปกับการปรับปรุงองค์ประกอบที่ไม่ใช่ต้นเหตุ เราศึกษาปัญหานี้ด้วยกรณีศึกษาแบบควบคุมบน TinyStories ที่บีบอัดจาก 64 เป็น 16 โดยใช้โคเดก VQ-VAE-2 แบบลำดับชั้นและตัวสร้างด้วยการแพร่แบบไม่ต่อเนื่องชนิดมาสก์ (MDLM) โพรโทคอลตรวจสอบเป็นลำดับขั้นของเราแยกความเที่ยงตรงของการสร้างคืนด้วยโคเดก คุณภาพการสร้างในปริภูมิแฝง และตัววินิจฉัยเสริมในปริภูมิแฝงออกจากกัน โดยใช้ตัวให้คะแนน GPT-2 ภายนอกตัวเดียวกัน พร้อมรายงานเมตริกเชิงความหมายเพิ่มเติมสำหรับการศึกษาเรขาคณิต ในการตั้งค่าที่ทดสอบ การสร้างคืนด้วยโคเดกเพียงอย่างเดียวทำให้ค่ามัธยฐานเพอร์เพล็กซิตีภายนอกเพิ่มจาก 15.17 เป็น 27.36 (+80.4%) และ p95 เพิ่มจาก 25.10 เป็น 98.91 (+294.1%) แสดงว่าคุณภาพส่วนใหญ่สูญเสียไปก่อนเริ่มการสร้างในปริภูมิแฝง เมื่อใช้ตัวให้คะแนนเดียวกัน MDLM ในปริภูมิรหัสยังให้ผลดีกว่าการแพร่ในปริภูมิโทเค็นอย่างชัดเจน โดยลดค่าเฉลี่ย ค่ามัธยฐาน และ p95 ลง 32.9%, 30.9% และ 36.6% ตามลำดับ การทำเรกิวลาไรเซชันโดยคำนึงถึงเรขาคณิตช่วยให้ตัวชี้วัดตัวแทนเฉพาะที่ในปริภูมิแฝงดีขึ้น แต่ไม่ทำให้เมตริกของข้อความหลังถอดรหัสดีขึ้นในการทดลองที่มีอยู่ คุณูปการของงานนี้จึงอยู่ที่ระเบียบวิธี มิใช่อัลกอริทึม บทความนำเสนอการวินิจฉัยเป็นลำดับขั้นที่นำไปใช้ซ้ำได้กับไปป์ไลน์หนึ่งที่กำหนดชัดเจน และแสดงว่าในการตั้งค่านี้ ความเที่ยงตรงของโคเดกเป็นปัจจัยกำหนดเพดานคุณภาพในทางปฏิบัติ มิใช่การขจัดสัญญาณรบกวนในปริภูมิแฝง
เผยแพร่ ณ การประชุม 2026 39th Conference of Open Innovations Association (FRUCT)
ประเภทคุณูปการ ระเบียบวิธีการวินิจฉัย
ฉบับที่ 1หน้า 69–76การประชุมวิชาการหลัก
ผลลัพธ์สำคัญ
| จุดประเมิน | n | ค่าเฉลี่ย PPL | ค่ามัธยฐาน PPL | PPL เปอร์เซ็นไทล์ที่ 95 |
|---|---|---|---|---|
| ข้อความต้นฉบับ | 256 | 16.24 | 15.17 | 25.1 |
| ผลการสร้างคืนของโคเดก | 256 | 37.26 | 27.36 | 98.91 |
| เส้นฐาน AR | 251 | 30.98 | 23.27 | 56.11 |
| MDLM ในปริภูมิโทเค็น | 256 | 44.74 | 38.42 | 93.6 |
| MDLM ในปริภูมิรหัส | 256 | 30.01 | 26.55 | 59.36 |
ผลลัพธ์สำคัญ การสูญเสียคุณภาพที่สังเกตได้ส่วนใหญ่เกิดขึ้นก่อนขั้นการสร้าง อย่างไรก็ดี การแพร่ในปริภูมิโค้ดยังคงลดค่ามัธยฐานของความฉงนได้ 30.9% เมื่อเทียบกับการแพร่ในปริภูมิโทเคน
- ชุดข้อมูล
- TinyStories
- ขนาดตัวอย่าง
- ตัวอย่างการสร้างคืนแบบจับคู่ 256 ตัวอย่าง; ตัวอย่างที่สร้างขึ้น 251–256 ตัวอย่างต่อโหมด; การตั้งค่าเรขาคณิตที่จับคู่กันสี่แบบ
- ตัวชี้วัด
- ค่า perplexity จาก GPT-2 ภายนอก: ค่าเฉลี่ย มัธยฐาน p95 และค่าสูงสุด; การใช้งาน codebook และขนาดเซตสนับสนุน; SBERT, BERTScore, MAUVE และบทสรุปจากผู้ตัดสิน LLM สำหรับการทดลองด้านเรขาคณิต
- ความไม่แน่นอน
- การเปรียบเทียบที่รายงานเป็นการรันเดี่ยวเชิงพรรณนา โดยไม่ได้คำนวณช่วงความเชื่อมั่นหรือค่าประมาณนัยสำคัญจากหลายซีด
- เงื่อนไข
- ลำดับโทเคน GPT-2 ความยาว 64 ถูกบีบอัดเป็นรหัสระดับบน 16 รหัสด้วย VQ-VAE-2 แบบลำดับชั้น โดยทุกโหมดการสร้างใช้ตัวให้คะแนนภายนอกร่วมกัน
ดาวน์โหลดผลลัพธ์:CSVJSONMarkdownแหล่งสำเนาภายนอก:การ์ดชุดข้อมูล Hugging Face
PDF และการอ้างอิง
อ้างอิงบทความนี้ BibTeX เป็นรูปแบบที่แนะนำ รูปแบบย่อยทั้งหมดด้านล่างสร้างจากระเบียนผลงานตีพิมพ์เดียวกัน
@inproceedings{Gavrilov2026WhereQuality,
title = {Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization},
author = {Gavrilov, Alexey and Gazzaev, Alan-Barsag and Muravyov, Sergey},
booktitle = {2026 39th Conference of Open Innovations Association (FRUCT)},
publisher = {IEEE},
year = {2026},
pages = {69--76},
doi = {10.23919/FRUCT70069.2026.11506553},
url = {https://doi.org/10.23919/FRUCT70069.2026.11506553},
isbn = {978-952-65246-5-8},
}
Gavrilov, A., Gazzaev, A.-B., and Muravyov, S. (2026). Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization. In 2026 39th Conference of Open Innovations Association (FRUCT) (pp. 69–76). IEEE. https://doi.org/10.23919/FRUCT70069.2026.11506553A. Gavrilov, A.-B. Gazzaev, and S. Muravyov, “Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization,” in 2026 39th Conference of Open Innovations Association (FRUCT), 2026, pp. 69–76, doi: 10.23919/FRUCT70069.2026.11506553.TY - CPAPER
TI - Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
AU - Gavrilov, Alexey
AU - Gazzaev, Alan-Barsag
AU - Muravyov, Sergey
PY - 2026
DA - 2026-04-28
T2 - 2026 39th Conference of Open Innovations Association (FRUCT)
SP - 69
EP - 76
PB - IEEE
DO - 10.23919/FRUCT70069.2026.11506553
UR - https://doi.org/10.23919/FRUCT70069.2026.11506553
SN - 978-952-65246-5-8
SN - 2305-7254
ER -
ไฟล์รายการอ้างอิง:ข้อความรูปแบบ APAข้อความรูปแบบ IEEERISCSL-JSONSchema.org JSON-LDOAI-DC XMLOpenAIRE v4 XMLMODS XMLXML ข้อมูลอภิพันธุ์ JATS 1.4เนื้อหาฉบับเต็มรูปแบบ JATS 1.4 XMLRDF Turtleชุดลิงก์ (JSON)ชุดลิงก์ (HTTP)RO-Crate
คู่มือฉบับเต็ม
คู่มือวิจัยฉบับเต็ม
วิธีการ
บทความใช้ตัวประเมินตัวเดียวกันตลอดสามขั้นตอนการประเมิน เพื่อให้เชื่อมโยงการแปลงแต่ละขั้นที่เพิ่มเข้ามากับช่องว่างคุณภาพที่วัดได้
สร้างคืน
เข้ารหัสตัวอย่าง TinyStories ขนาด 64 โทเคนแต่ละตัวอย่างเป็นรหัสระดับบน 16 รหัส แล้วถอดรหัสทันทีเพื่อวัดการสูญเสียจากการสร้างคืนของโคเดก
สร้าง
ใช้ MDLM สร้างโทเคนข้อความหรือรหัสแฝงแบบไม่ต่อเนื่อง จากนั้นถอดรหัสตัวอย่างในปริภูมิรหัสผ่านโคเดกที่ฝึกแล้วตัวเดียวกัน
เปรียบเทียบ
ประเมินคะแนนข้อความต้นฉบับ ผลการสร้างคืน และข้อความที่สร้างขึ้นด้วยโพรโทคอล GPT-2 ภายนอกเดียวกัน โดยรวมสถิติค่ามัธยฐานและบริเวณหาง
แนวคิดสำคัญ
ตัวสร้างในขั้นปลายไม่อาจกู้คืนข้อมูลที่โคเดกทิ้งไปแล้ว จึงต้องตรวจสอบขั้นการสร้างคืนก่อนตีความผลการสร้างในปริภูมิแฝง
ความแตกต่างจากแนวทางที่ใกล้เคียง
การเปรียบเทียบแบบต้นทางถึงปลายทางมาตรฐานรายงานคะแนนการสร้างสุดท้ายเพียงค่าเดียว โพรโทคอลนี้เพิ่มจุดตรวจสอบการสร้างคืนแบบจับคู่ และแยกเมตริกสภาวะของปริภูมิแฝงออกจากหลักฐานบนข้อความที่ถอดรหัสแล้ว
ส่วนใหม่ของงาน
ผลงานหลักคือระเบียบวิธีวินิจฉัยเป็นลำดับขั้นที่นำกลับมาใช้ได้ สำหรับไปป์ไลน์ข้อความบีบอัดที่เป็นรูปธรรมหนึ่งระบบ มิใช่อัลกอริทึมขจัดสัญญาณรบกวนแบบใหม่
คำถามที่บทความนี้ช่วยตอบ
เปิดคำถามเพื่ออ่านคำตอบโดยสังเขปที่อิงจากบทความ ขอบเขตของหลักฐานโดยละเอียดระบุไว้ในหัวข้อข้อจำกัด
คุณภาพสูญเสียไป ณ ขั้นใดในการสร้างข้อความสั้นแบบบีบอัด
ในไปป์ไลน์ TinyStories แบบ 64 ต่อ 16 ที่ทดสอบ การเสื่อมคุณภาพส่วนใหญ่เกิดขึ้นในขั้นการสร้างคืนของโคเดก ก่อนเริ่มการสร้างในปริภูมิแฝง ค่ามัธยฐานของเพอร์เพล็กซิตีภายนอกที่วัดด้วย GPT-2 เพิ่มจาก 15.17 สำหรับข้อความต้นฉบับเป็น 27.36 หลังการสร้างคืน ขณะที่ p95 เพิ่มจาก 25.10 เป็น 98.91 ผลนี้ใช้กับการกำหนดค่าหนึ่งเท่านั้น มิใช่การจัดอันดับโคเดกที่ใช้ได้เป็นการทั่วไป
จะแยกการสูญเสียจากโคเดกออกจากการสูญเสียจากการสร้างในปริภูมิแฝงได้อย่างไร
โพรโทคอลแบบแบ่งขั้นประเมินข้อความต้นฉบับ ผลการสร้างคืนด้วยโคเดกที่จับคู่กัน และข้อความที่สร้างในขั้นสุดท้ายด้วยตัวให้คะแนนภายนอกตัวเดียวกัน ช่องว่างระหว่างต้นฉบับกับผลการสร้างคืนใช้ประมาณส่วนที่เกิดจากโคเดก ส่วนการเปรียบเทียบผลการสร้างคืนกับผลลัพธ์ที่สร้างช่วยระบุตำแหน่งของความสูญเสียจากการสร้างที่เพิ่มขึ้นในขั้นการสร้าง ทั้งนี้รายงานตัวชี้วัดสุขภาวะของปริภูมิแฝงแยกจากหลักฐานของข้อความที่ถอดรหัส
ควรประเมินการสร้างข้อความผ่านตัวแปรแฝงแบบไม่ต่อเนื่องอย่างไร
บทความเสนอให้ตรวจสอบความเที่ยงตรงของการสร้างคืนก่อนเปรียบเทียบตัวสร้าง ใช้ตัวให้คะแนนข้อความหลังถอดรหัสตัวเดียวกันในทุกขั้น และรายงานทั้งสถิติค่ากลางและสถิติบริเวณหาง นอกจากนี้ การใช้สมุดรหัส เรขาคณิต และตัวชี้วัดตัวแทนอื่นในปริภูมิแฝงควรใช้เพื่อการวินิจฉัย มิใช่ใช้แทนคุณภาพของข้อความหลังถอดรหัส
ดิฟฟิวชันในปริภูมิรหัสมีประสิทธิภาพเหนือกว่าดิฟฟิวชันในปริภูมิโทเคนหรือไม่
ภายใต้ตัวให้คะแนนร่วมและการตั้งค่าที่ทดสอบ MDLM ในปริภูมิโค้ดลดค่าเฉลี่ย ค่ามัธยฐาน และ p95 ของ perplexity ลง 32.9%, 30.9% และ 36.6% ตามลำดับ เมื่อเทียบกับ MDLM ในปริภูมิโทเค็น การเปรียบเทียบนี้เป็นเชิงพรรณนาและจำเพาะต่อการกำหนดค่า จึงมิได้ยืนยันลำดับความเหนือกว่าที่เป็นสากลข้ามชุดข้อมูล อัตราส่วนการบีบอัด โคเดก หรือสถาปัตยกรรมการแพร่
ตัวชี้วัดเรขาคณิตของปริภูมิแฝงที่ดีขึ้นรับประกันว่าข้อความที่สร้างจะดีขึ้นหรือไม่
ไม่ ในการรันแบบจับคู่ที่มีอยู่ การทำให้เป็นระเบียบโดยคำนึงถึงเรขาคณิตช่วยปรับปรุงองค์ประกอบชี้วัดแทนเฉพาะที่ในปริภูมิแฝง แต่ไม่ได้ทำให้ตัวชี้วัดของข้อความที่ถอดรหัสดีขึ้น ผลดังกล่าวสนับสนุนให้ตรวจสอบการปรับปรุงขององค์ประกอบชี้วัดแทนทุกครั้งที่ผลลัพธ์ถอดรหัสสุดท้าย และให้ถือว่าการไม่ถ่ายโอนเป็นผลลัพธ์เชิงลบที่มีประโยชน์ มิใช่หลักฐานว่าการสร้างดีขึ้น
การเปรียบเทียบกับแนวทางที่ใกล้เคียง
| แนวทาง | การแทนข้อมูล | การควบคุม / การวินิจฉัย | สิ่งที่คงไว้หรือวัดผล |
|---|---|---|---|
| การแพร่ในปริภูมิโทเค็น | โทเคนข้อความ | คุณภาพการสร้างในปริภูมิโทเคน | ความคล่องแคล่วและพฤติกรรมของตัวให้คะแนนในการสร้างโดยตรง |
| การสร้างตัวแปรแฝงแบบบีบอัด | รหัสแฝงแบบไม่ต่อเนื่องผ่านโคเดก | คุณภาพการสร้างแบบครบวงจรขั้นสุดท้าย | พฤติกรรมร่วมของโคเดกและตัวสร้างตัวแปรแฝง |
| การระบุตำแหน่งคอขวดเป็นลำดับขั้น | ข้อความ ผลการสร้างคืนด้วยโคเดก และตัวแปรแฝงไม่ต่อเนื่อง | แยกการสูญเสียจากโคเดกออกจากการสูญเสียจากการสร้าง | ตำแหน่งที่คุณภาพเสื่อมลงภายใต้ตัวให้คะแนนร่วมตัวเดียว |
การเปรียบเทียบนี้จำแนกขอบเขตการประเมินและหลักฐาน มิใช่การจัดอันดับแนวทางต่าง ๆ ที่ใช้ได้เป็นสากล
ความเกี่ยวข้องและขอบเขต
โพรโทคอลแบบแบ่งขั้นมีประโยชน์เมื่อสายงานการสร้างประกอบด้วยทั้งโคเดกที่เรียนรู้และตัวสร้างในปริภูมิแฝง แต่ยังไม่ชัดเจนว่าคุณภาพผลลัพธ์เสื่อมลงจากส่วนใด
การสร้างข้อความแบบบีบอัดและใช้ตัวแปรแฝงไม่ต่อเนื่อง
ความเที่ยงตรงของการสร้างคืนของโคเดกในไปป์ไลน์เชิงกำเนิด
การสร้างแบบจำลองภาษาด้วยการแพร่ชนิดปกปิดในปริภูมิโค้ด
การระบุตำแหน่งคอขวดและการประเมินที่สอดคล้องกันในแต่ละขั้น
การตรวจสอบการปรับปรุงตัวชี้วัดตัวแทนในปริภูมิแฝงเทียบกับข้อความที่ถอดรหัสแล้ว
ข้อจำกัด
- การศึกษาเชิงประจักษ์ใช้เฉพาะ TinyStories
- การวิเคราะห์หลักครอบคลุมระบอบการบีบอัดอย่างเข้มข้นจาก 64 เป็น 16 เพียงรูปแบบเดียว
- ระบบที่ประเมินประกอบด้วยโคเดกแบบลำดับชั้นตระกูล VQ-VAE-2 หนึ่งตระกูลและตัวสร้าง MDLM หนึ่งตัว
- การเปรียบเทียบอาศัยการรันเพียงครั้งเดียวและมีลักษณะเชิงพรรณนา มิใช่ค่าประมาณทางสถิติจากหลาย seed
- ค่า perplexity จาก GPT-2 ภายนอกเป็นเครื่องมือวินิจฉัยร่วม มิใช่ตัวชี้วัดคุณภาพเชิงความหมายที่ใช้ได้เป็นสากล
- ไม่ควรถ่ายโอนข้อสรุปเหล่านี้โดยตรงไปยังชุดข้อมูล สถาปัตยกรรมโคเดก หรืออัตราส่วนการบีบอัดทุกแบบ
เอกสารอ้างอิงที่บทความนี้อ้างถึง
รายการเหล่านี้ตรงกับส่วนเอกสารอ้างอิงที่มีหมายเลขในไฟล์ PDF ของบทความ
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T Chiu, Alexander Rush, Volodymyr Kuleshov. . Simple and Effective Masked Diffusion Language Models. Advances in Neural Information Processing Systems.
- Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu. . Neural Discrete Representation Learning. Advances in Neural Information Processing Systems.
- Ali Razavi, Aaron van den Oord, Oriol Vinyals. . Generating Diverse High-Fidelity Images with VQ-VAE-2. Advances in Neural Information Processing Systems.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, Rianne van den Berg. . Structured Denoising Diffusion Models in Discrete State-Spaces. Advances in Neural Information Processing Systems.
- Aaron Lou, Chenlin Meng, Stefano Ermon. . Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. Proceedings of the 41st International Conference on Machine Learning.
- Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov. . SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics.
- Xiang Lisa Li, John Thickstun, Ishaan Gulrajani, Percy Liang, Tatsunori B. Hashimoto. . Diffusion-LM Improves Controllable Text Generation. Advances in Neural Information Processing Systems.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman. . MaskGIT: Masked Generative Image Transformer. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Marjan Ghazvininejad, Omer Levy, Yinhan Liu, Luke Zettlemoyer. . Mask-Predict: Parallel Decoding of Conditional Masked Language Models. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Emiel Hoogeboom, Didrik Nielsen, Priyank Jaini, Patrick Forré, Max Welling. . Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. Advances in Neural Information Processing Systems.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever. . Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.
- Nils Reimers, Iryna Gurevych. . Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing.
- Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, Yoav Artzi. . BERTScore: Evaluating Text Generation with BERT. International Conference on Learning Representations.
- Krishna Pillutla, Swabha Swayamdipta, Rowan Zellers, John Thickstun, Sean Welleck, Yejin Choi, Zaid Harchaoui. . MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. Advances in Neural Information Processing Systems.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica. . Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.
ทรัพยากรและความสามารถในการทำซ้ำ
- สำนักพิมพ์
- IEEE
- PDF ข้อความในเครื่อง
- ต้นฉบับฉบับสมบูรณ์ที่ได้รับการตอบรับ (ฉบับที่ผู้เขียนเผยแพร่พร้อม DOI)
- ทรัพยากรของสิ่งพิมพ์
- ต้นฉบับสาธารณะ ตารางผลลัพธ์ รูปประกอบคำอธิบาย และไฟล์การอ้างอิงมีให้เข้าถึงที่นี่ ส่วนโค้ดที่ใช้พัฒนาและเช็กพอยต์ไม่ได้เผยแพร่ต่อสาธารณะ
คำชี้แจงข้อมูล
- แหล่งที่มา
- TinyStories ตามที่อธิบายไว้ในบทความ
- สัญญาอนุญาต
- การใช้ TinyStories ยังคงอยู่ภายใต้ข้อกำหนดของชุดข้อมูลเอง เว็บไซต์นี้มิได้เผยแพร่ไฟล์ชุดข้อมูลซ้ำ
- การประมวลผลเบื้องต้น
- การตัดโทเคนด้วย GPT-2 อินพุตคงที่ขนาด 64 โทเคน และการบีบอัดเชิงเวลาแบบลำดับชั้นจาก 64 เป็น 32 และ 16 ตำแหน่ง
- แบ่ง
- สิ่งพิมพ์รายงานตัวอย่างการสร้างคืนแบบจับคู่ 256 ตัวอย่าง และตัวอย่างที่สร้างขึ้น 251–256 ตัวอย่างต่อโหมด แต่ไม่ได้เผยแพร่บัญชีรายการการแบ่งชุดฝึก/ตรวจสอบความถูกต้องที่นำกลับมาใช้ได้
- รูปแบบ
- ตัวอย่างข้อความสั้น ลำดับโทเคน GPT-2 ลำดับโค้ดไม่ต่อเนื่อง บันทึกการสร้าง และตารางสรุป
- รุ่น / ผลรวมตรวจสอบ
- บทความไม่ได้รายงานผลรวมตรวจสอบของชุดข้อมูลหรือตัวระบุสแนปช็อต TinyStories ที่เปลี่ยนแปลงไม่ได้
- การจัดหาข้อมูล
- ไม่มีการเผยแพร่สคริปต์สำหรับจัดหาข้อมูลต่อสาธารณะพร้อมกับหน้าผลงานตีพิมพ์
- ข้อจำกัดการใช้งาน
- หลักฐานครอบคลุมเรื่องสังเคราะห์ขนาดสั้น และไม่ควรถือเป็นเบนช์มาร์กสำหรับการสร้างภาษาธรรมชาติแบบไม่จำกัด
รุ่น
- ฉบับเผยแพร่IEEE / FRUCT, 2026
- ระเบียน arXivเปิดระเบียนฉบับก่อนตีพิมพ์ arXiv:2607.24176
- ต้นฉบับของผู้เขียนPDF ภายในระบบที่เข้าถึงเนื้อหาได้
- การบรรยายในที่ประชุมวิชาการงานนำเสนอ FRUCT 39
- ดัชนีรายงานการประชุมวิชาการเล่ม FRUCT 39 อย่างเป็นทางการ
- PDF รายงานการประชุมวิชาการเนื้อหาฉบับเต็มแบบเปิดของ FRUCT
- เปิดระเบียนวิชาการOpenAlex
- ระเบียนกราฟการอ้างอิงSemantic Scholar
- ฉบับเต็มที่ผู้เขียนเผยแพร่ResearchGate
DOI ที่เผยแพร่เป็นตัวระบุทางบรรณานุกรมหลัก หน้านี้ยังคงเป็น URL มาตรฐานเพียงแห่งเดียวของโครงการในทุกเวอร์ชัน