現在取り組んでいる方向性
離散潜在生成
選択的なコード再生成のための離散表現と、制約付き生成、AI支援リファクタリング、予測可能なコード編集を証拠に基づいて選択する方法。
プロジェクトを見る観測可能な失敗を起点とし、それに適合する手法、エビデンス、および適用範囲の境界をたどる。
同じ症状でも、表現、生成、制御、または検証のいずれに起因するかは異なりうる。
| 観測された問題 | 最初の診断 | 必須とすべき証拠 | 手法 |
|---|---|---|---|
| 復号出力の品質は低いが、失敗した段階は不明である | ソース、対応する再構成、生成出力を同一の外部評価器で評価する。 | 各段階で比較可能な分布と裾の挙動。 | 段階的ボトルネック診断 |
| 潜在空間の指標は改善しても、最終品質は改善しない | 代理指標の改善が復号後にも反映されるか検証する。 | 潜在表現の診断だけでなく、対応のある復号出力指標。 | 代理指標の転移確認 |
| コードエディタが指定範囲を超えて書き換える | 保持境界を明示し、その外側の領域における差分を測定する。 | 局所性と課題達成度を併せて測定する。 | 局所編集の評価 |
| リファクタリングでは、構文だけでなく振る舞いを保持しなければならない | 提案を実行および検証から分離する。 | コンパイル、テスト、静的検査、リファクタリングの検出。 | 制御面の意思決定マップ |
現在取り組んでいる方向性
選択的なコード再生成のための離散表現と、制約付き生成、AI支援リファクタリング、予測可能なコード編集を証拠に基づいて選択する方法。
プロジェクトを見る評価ガイド
復号品質の制約要因が再構成、潜在生成、最終テキストに転移しない代理指標のいずれかを段階別に判定する手法。
診断ガイドを開く論文タイトルを起点としない広範な検索のための独立したエビデンスノート。各ノートから関連する出版物と全文へたどることができる。
離散コーデックが非可逆な場合に、コード空間とトークン空間のマスク付き拡散言語モデルを段階整合的に比較するプロトコル。
生成モデルが要求されたコード変更を行うのに十分な自由度を確保しつつ、不要な関数全体の書き換えを防ぐ方法。
生成コードに対する文法制約、型制約、保持境界、振る舞いレベルの受け入れ検査を実務的に区別する。
もっともらしい生成パッチと、検証済みの振る舞いの保存を混同せずに、近年のAI支援リファクタリング手法を評価する方法。
決定論的サンプリングだけでは不十分な理由と、観測可能な保護対象の性質および受入検査によってコード生成の振る舞いを検証可能にする方法。
実践的な問いを開くと簡潔な回答が得られ、エビデンスへのリンクから手法、測定、限界を確認できる。これらは研究への入口であり、普遍的な保証ではない。
生成前に編集可能境界を定義し、その外側のソースを保存または再利用して、変更候補だけを生成する。タスクに失敗する出力や保護領域を変更する出力は棄却する。階層的潜在表現の固定は実験的な制御面の一つだが、ソース範囲の同一性は保証しない。 局所編集の制御面を比較する.
指定領域外の差分を、タスクの成否、編集可能領域の変化、構造的不変条件、テストまたは静的検査、および反復実行時の変動と併せて測定する。構文解析率だけで確認できるのは、構文上の適格性にすぎない。 局所性に関するエビデンスのチェックリストを確認する.
保護領域の安定性を、編集可能領域の自由度および候補の一意性と併せて報告する。入力の複製は安定性を最大化できる一方で、タスクをまったく進展させない可能性がある。制約のない書き換えは変更量を最大化できる一方で、局所性を損なう可能性がある。 限定的な安定性–自由度のエビデンスを見る.
局所的編集では変更してはならない対象を重視し、制約付き生成では文法への所属など出力の形式的性質を強制する。一方、プログラム修復では、変更が欠陥仕様または課題仕様を満たす必要がある。構文だけでは、意味的等価性、機能的正しさ、課題の達成、局所性のいずれも証明できない。 三つの目的を比較する.
生成前に保護領域と編集可能領域を定義し、編集可能な表現のみを変更して復号する。保護対象コードを変更した候補、または構文、テスト、静的検査、タスク固有の不変条件を満たさない候補は棄却する。報告した階層的潜在表現の実験は64トークンの関数における確率的安定性を測るものであり、範囲や挙動が不変であることは保証しない。 選択的再生成のワークフローを検査する.
モデルで変換を特定または提案し、可能であれば信頼できるリファクタリングエンジンで実行したうえで、コンパイル、テスト、静的検査、および意図したリファクタリングを検証する。もっともらしい生成パッチだけでは十分な証拠にならない。 リファクタリングの判断行を開く.
生成器を選択する前に、観測可能な保持契約と受入検査を定める。予測可能性を左右するのは、プロンプト、マスク、文法、潜在コードを固定したか否かだけではなく、復号と検証を経た後も何が安定しているかである。 保存契約を定義する.
同一の外部評価器の下で、コード空間MDLMのパープレキシティ中央値は26.55、トークン空間ベースラインは38.42であり、30.9%低下した。ただし、コーデック再構成の中央値がすでに27.36であったため、この結果は再構成ボトルネックと併せて解釈する必要がある。 報告された段階別の数値を検査する.
原文、コーデック再構成、トークン空間出力、コード空間出力には、同一の保留サンプルと復号テキスト評価器を用いる。より強力な潜在生成器でもコーデックがすでに除去した情報は復元できないため、再構成の差は別途報告する。 単一の評価器で各段階を比較する.
同一の復号テキスト評価器を変更せずに用い、再構成から生成までの隔たりに先立って、原文から再構成までの隔たりを測定する。これにより、コーデックが課す品質上限と、潜在生成によって生じる追加の劣化を切り分けられる。 4つのチェックポイントによる診断に従う.
潜在代理指標は、対象とする後段の性質を反映しないまま改善することがある。条件を揃えた出力を復号し、同じ最終指標で評価して転移を検証する必要がある。そうしなければ、コードブックの幾何構造や利用率は診断上のエビデンスにとどまり、テキスト品質の向上を示すものではない。 代理指標の転移診断を用いる.
これらの数値は測定対象を示すものであり、モデルに普遍的な保証を与えるものではない。
TinyStoriesを64から16へ圧縮するある設定では、パープレキシティの中央値が次の値から上昇した: 15.17 (ソーステキスト)から次の値へ: 27.36 となった。再構成後、コード空間 MDLM は次の値に達した 26.55 対 38.42 (同一の外部評価器を用いたトークン空間ベースライン)。
論文の根拠資料を読む64トークンのPython関数を用いたある設定では、上位コード4個の固定により、構文解析成功率が次の値から向上した: 0.453 から 0.591である一方、非固定位置の変更率は 0.936 であり、条件付きサンプルは 0.998 一意である。
論文の根拠資料を読む公開された実験は、ASTの厳密な保持、意味的等価性、機能的正しさ、リポジトリ規模の修復、またはコーデックと生成器のボトルネックに関する普遍的な順序を確立するものではない。本ガイドは限定的なエビデンスを再利用可能な診断手順へ落とし込むが、新しいシステムごとに、復号出力と振る舞いの水準で独自に検証する必要がある。