研究项目与方法指南

从可以观察到的失败开始,再进入与它匹配的方法、证据和适用范围。

根据观察到的问题选择方法

同一个表面症状可能来自表示、生成、控制或验证阶段。

观察到的问题第一项诊断必须要求的证据方法
解码输出质量差,但不知道哪个阶段失败使用同一个外部评估器,对源文本、配对重建和生成输出评分。每个阶段可比较的分布和尾部行为。分阶段瓶颈诊断
潜空间指标改善,但最终质量没有改善测试代理指标的改善在解码后是否仍然成立。配对的解码输出指标,而不只是潜空间诊断。代理指标传递检查
代码编辑器改写了目标区域之外的内容明确保持边界,并测量目标区域之外的 diff。同时测量局部性和任务成功。局部编辑评估
重构必须保持行为,而不只是保持语法把变换提议、执行和验证分开。编译、测试、静态检查和重构检测。控制面决策图

分阶段诊断指南

压缩文本生成中的编解码器瓶颈

用同一个外部评估器区分重建损失、潜变量生成损失,以及没有传递到最终文本的代理指标改进。

阅读中文诊断指南

代码编辑方法指南

不完整重写的局部代码编辑

比较程序修复、局部编辑、语法约束和分层离散潜变量,并区分语法、结构、语义与功能保证。

阅读中文代码编辑指南

两组有明确边界的实验证据

这些数字说明已经测量了什么,不是对所有模型都成立的保证。

压缩流程诊断

在一个 TinyStories 64-to-16 设置中,中位困惑度从源文本的 15.17上升到重建文本的 27.36。在同一个外部评分器下, 码空间 MDLM 为 26.55,token 空间基线为 38.42

查看论文证据

可检查的编辑控制

在一个 64-token Python 函数设置中,锁定四个顶层潜码后,解析率从0.453 提高到 0.591;未锁定位置的变化率为0.936,条件样本唯一率为 0.998

查看论文证据

这张方法图没有声称什么

已发表实验没有证明精确保持 AST、语义等价、功能正确、仓库级修复, 也没有证明编解码器与生成器瓶颈存在普遍排序。这里把有边界的证据整理为可复用诊断流程; 每个新系统仍需接受自己的解码输出和行为级验证。