Mga proyektong pananaliksik

Magsimula sa kabiguang naoobserbahan, saka sundan ang metodo, ebidensiya, at hangganan ng saklaw na naaangkop dito.

Ibahagi ang mapa ng pananaliksik na itoIbahagi

Pumili batay sa kabiguang naoobserbahan

Maaaring magmula ang parehong sintomas sa representasyon, pagbuo, kontrol, o pagpapatunay.

Naobserbahang suliraninUnang diagnosticEbidensiyang dapat kailanganinPamamaraan
Mahina ang na-decode na output, ngunit hindi alam kung aling yugto ang nabibigoBigyan ng score ang source, ang katambal nitong rekonstruksiyon, at ang nabuong output gamit ang iisang panlabas na evaluator.Magkakahambing na mga distribusyon at gawi ng tail sa bawat yugto.Yugtu-yugtong diyagnosis ng bottleneck
Bumubuti ang isang metric sa espasyong latent, ngunit hindi ang pinal na kalidadSubukin kung naipapasa ang pagbuti ng proxy pagkatapos ng decoding.Magkapares na sukatan ng decoded output, hindi latent diagnostics lamang.Pagsusuri sa paglilipat ng proxy
Mas malawak kaysa sa hiniling na rehiyon ang muling isinusulat ng isang code editorMaghayag ng tahasang hangganan ng pagpapanatili at sukatin ang diff sa labas ng rehiyon.Magkasamang sinusukat ang lokalidad at tagumpay sa gawain.Pagsusuri ng lokalisadong pag-edit
Dapat panatilihin ng refactoring ang pag-uugali, hindi lamang ang sintaksIhiwalay ang panukala sa pagpapatupad at pagpapatunay.Compilation, mga test, static check, at pagtukoy sa refactoring.Mapa ng pagpapasiya para sa control surface

Aktibong direksiyon

Pagbuo sa discrete latent na representasyon

Mga discrete na representasyon para sa piling muling pagbuo ng code, kasama ang mga pagpiling ginagabayan ng ebidensiya sa constrained generation, refactoring na tinutulungan ng AI, at mahuhulaang pag-edit ng code.

Siyasatin ang proyekto

Gabay sa ebalwasyon

Pagtukoy sa bottleneck ng codec

Pamamaraang sumusuri sa bawat yugto upang malaman kung ang kalidad ng na-decode na output ay nililimitahan ng rekonstruksiyon, latent generation, o proxy na ang pagbuti ay hindi lumilitaw sa pinal na teksto.

Buksan ang gabay sa diagnosis

Mga nakatuong sagot

Mga nagsasariling tala ng ebidensiya para sa mas malawak na paghahanap na hindi nagsisimula sa pamagat ng papel. Bawat isa ay nag-uugnay pabalik sa kaugnay na publikasyon at buong teksto.

  1. Code-space at token-space masked diffusion: kung paano paghahambingin ang mga ito

    Protocol ng paghahambing na pare-pareho sa bawat yugto para sa mga code-space at token-space masked diffusion language model kapag lossy ang discrete codec.

  2. Lokalisadong pagbabago ng code gamit ang mga generative model

    Kung paano maiiwasan ang di-kailangang muling pagsulat sa buong function habang binibigyan ang generative model ng sapat na kalayaang gawin ang hinihinging pagbabago sa code.

  3. Constrained code generation sa software engineering

    Praktikal na paglilinaw sa pagkakaiba ng mga grammar constraint, type constraint, hangganan ng pagpapanatili, at behavior-level acceptance check para sa nabuong code.

  4. Refactoring na tinutulungan ng AI: mga pamamaraan at ebidensiya

    Kung paano susuriin ang mga bagong pamamaraan ng refactoring na tinutulungan ng AI nang hindi ipinagkakamali ang kapani-paniwalang nabuong patch sa napatunayang pagpapanatili ng gawi.

  5. Kailangan ng mahuhulaang pagbuo ng code ang isang kasunduan sa pagpapanatili

    Kung bakit hindi sapat ang deterministikong sampling, at kung paano ginagawang masusubok ng mga naoobserbahang protektadong katangian at acceptance check ang gawi ng pagbuo ng code.

Tingnan ang lahat ng nakatuong tala sa pananaliksik

Mga tanong sa pananaliksik na masasagot ng site na ito

Magbukas ng praktikal na tanong para sa maikling sagot, pagkatapos ay sundan ang link ng ebidensiya para sa mga pamamaraan, pagsukat, at limitasyon. Mga daan ang mga ito tungo sa pananaliksik, hindi mga pangkalahatang garantiya.

  1. Paano mababago ng isang generative model ang code nang hindi muling isinusulat ang buong function?

    Itakda bago ang pagbuo ang hangganan ng nae-edit na bahagi, panatilihin o muling gamitin ang source sa labas nito, bumuo lamang ng mga kandidatong pagbabago, at tanggihan ang mga output na nabibigo sa gawain o bumabago sa mga protektadong rehiyon. Isang eksperimental na control surface ang pag-lock sa herarkikal na latent, ngunit hindi nito ginagarantiya ang magkakaparehong span ng source. Ihambing ang mga control surface para sa lokalisadong pag-edit.

  2. Anong ebidensiya ang nagpapakitang lokal ang isang edit sa code sa halip na sintaktikong balido lamang?

    Sukatin ang diff sa labas ng hiniling na rehiyon kasabay ng tagumpay sa gawain, pagbabago sa nae-edit na rehiyon, mga structural invariant, mga test o static check, at baryabilidad sa mga paulit-ulit na run. Ang parse rate lamang ay nagpapatunay lamang ng wastong pagkakabuo ng sintaks. Suriin ang checklist ng ebidensiya sa lokalidad.

  3. Paano dapat balansehin ang lokalidad ng pag-edit ng code at ang dibersidad ng pagbuo?

    Iulat ang katatagan ng protektadong rehiyon kasabay ng kalayaan sa nae-edit na rehiyon at pagiging natatangi ng mga kandidato. Maaaring palakihin nang husto ng pagkopya sa input ang katatagan nang walang anumang pagsulong sa gawain; maaaring palakihin nang husto ng walang-limitasyong muling pagsulat ang pagbabago habang sinisira ang lokalidad. Tingnan ang saklaw na ebidensiya sa katatagan at kalayaan.

  4. Ano ang pagkakaiba ng lokalisadong pag-edit ng code, kontroladong pagbuo, at pagkukumpuni ng programa?

    Binibigyang-diin ng lokalisadong pag-edit kung ano ang kailangang manatiling hindi nagbabago; ipinapatupad ng kontroladong pagbuo ang isang pormal na katangian ng output, gaya ng pagiging kabilang sa isang grammar; at hinihingi ng pagkukumpuni ng programa na matugunan ng pagbabago ang detalye ng depekto o gawain. Hindi sapat ang syntax lamang upang patunayan ang semantikong equivalence, functional correctness, tagumpay sa gawain, o lokalidad. Ihambing ang tatlong layunin.

  5. Paano muling mabubuo ang mga piling bahagi ng isang Python function habang nananatiling matatag ang iba pang bahagi?

    Itakda bago ang pagbuo ang mga protektado at nae-edit na rehiyon, baguhin lamang ang nae-edit na representasyon, mag-decode, at tanggihan ang mga kandidatong bumabago sa protektadong code o bumabagsak sa syntax, mga test, static check, o invariant na partikular sa gawain. Sinusukat ng iniulat na eksperimento sa herarkikal na latent ang probabilidadistikong katatagan sa mga 64-token na function; hindi nito ginagarantiya ang di-nagbagong mga span o gawi. Suriin ang daloy ng piling muling pagbuo.

  6. Aling estratehiya ng kontrol ang angkop sa refactoring na tinutulungan ng AI at nagpapanatili ng gawi?

    Gamitin ang modelo upang tukuyin o imungkahi ang isang transpormasyon, saka isagawa ito gamit ang mapagkakatiwalaang refactoring engine kung posible at beripikahin ang compilation, mga test, static check, at nilalayong refactoring. Hindi sapat na ebidensiya ang isang kapani-paniwalang nabuong patch. Buksan ang hanay ng pasiya sa refactoring.

  7. Ano ang dahilan kung bakit mahuhulaan, at hindi lamang nakokontrol, ang pagbuo ng code?

    Magtakda ng naoobserbahang kontrata sa pagpapanatili at mga pagsusuri sa pagtanggap bago pumili ng generator. Nakasalalay ang predictability sa nananatiling matatag pagkatapos ng decoding at pagpapatunay, hindi lamang sa kung ipinirmi ang prompt, mask, grammar, o latent code. Itakda ang kontrata ng pagpapanatili.

  8. Paano naghambing ang masked diffusion sa espasyo ng code at sa espasyo ng token sa iniulat na eksperimento sa teksto?

    Sa ilalim ng parehong panlabas na scorer, nagkaroon ang MDLM sa espasyo ng code ng median na perplexity na 26.55 kumpara sa 38.42 ng baseline sa espasyo ng token, isang pagbawas na 30.9%. Nasa 27.36 na ang median ng rekonstruksiyon ng codec, kaya dapat bigyang-kahulugan ang resulta kasabay ng bottleneck sa rekonstruksiyon. Suriin ang mga iniulat na bilang sa bawat yugto.

  9. Paano dapat ihambing ang masked diffusion sa espasyo ng code at sa espasyo ng token kapag lossy ang codec?

    Gamitin ang parehong held-out sample at scorer ng na-decode na teksto para sa mga orihinal, rekonstruksiyon ng codec, output sa espasyo ng token, at output sa espasyo ng code. Iulat nang hiwalay ang agwat sa rekonstruksiyon sapagkat hindi mababawi ng mas mahusay na latent generator ang impormasyong inalis na ng codec. Ihambing ang mga yugto gamit ang iisang scorer.

  10. Paano matutukoy ang sanhi ng pagbaba ng kalidad sa isang dalawang-yugtong tagabuo ng teksto?

    Sukatin muna ang agwat mula orihinal tungo sa rekonstruksiyon bago ang agwat mula rekonstruksiyon tungo sa pagbuo, gamit ang iisang di-binagong evaluator ng decoded text. Sa ganitong paraan, naihihiwalay ang pinakamataas na kalidad na ipinapataw ng codec sa karagdagang paglala na dulot ng latent na pagbuo. Sundin ang diagnostic na may apat na checkpoint.

  11. Kailan maaaring hindi mapahusay ng mas mahusay na mga sukatan sa espasyo ng latent ang na-decode na output?

    Maaaring bumuti ang latent proxy nang hindi nasusubaybayan ang downstream na katangiang mahalaga. Subukin ang transfer sa pamamagitan ng pag-decode ng magkatugmang output at pagsusuri sa mga ito gamit ang parehong pinal na metric; kung hindi, nananatiling diagnostikong ebidensiya lamang ang geometry o utilization ng codebook, hindi pagtaas ng kalidad ng teksto. Gamitin ang diagnostic sa paglilipat ng proxy.

Dalawang may-hangganang snapshot ng ebidensiya

Tinutukoy ng mga bilang na ito kung ano ang sinukat; hindi sila mga pangkalahatang garantiya ng modelo.

Pagsusuri sa compression

Sa isang 64-to-16 na setting ng TinyStories, tumaas ang median perplexity mula 15.17 para sa source text tungo sa 27.36 pagkatapos ng rekonstruksiyon. Umabot ang code-space MDLM sa 26.55 kumpara sa 38.42 para sa baseline sa espasyo ng token sa ilalim ng parehong panlabas na tagapuntos.

Suriin ang ebidensiya sa papel

Nasusuring kontrol sa pag-edit

Sa isang setting ng Python function na may 64 token, ang pag-lock sa apat na top-level code ay nagtaas sa parse rate mula 0.453 tungo sa 0.591, samantalang nagbago ang mga hindi naka-lock na posisyon sa 0.936 at nanatili ang mga conditional sample na 0.998 natatangi.

Suriin ang ebidensiya sa papel

Ano ang hindi inaangkin ng mapang ito

Hindi itinatatag ng mga inilathalang eksperimento ang eksaktong pagpapanatili ng AST, semantic equivalence, functional correctness, repair sa saklaw ng repository, o pangkalahatang pagkakasunod ng mga bottleneck ng codec at generator. Ginagawang muling magagamit na pamamaraang diyagnostiko ng mga gabay ang saklaw na ebidensiya; kailangan pa rin ng bawat bagong sistema ang sarili nitong validation sa na-decode na output at antas ng asal.