HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

コーディングエージェントは事前に考えます

Coding agents think ahead of time (arxiv.org)

30 pointsby andre15silva22 コメント

要約

この論文は、コーディングエージェントがソフトウェアエンジニアリングタスクを解決する際に、言語モデルの内部状態が進化するプログラムの特性を線形エンコードしていることを示しています。さらに驚くべきことに、これらの表現はエージェント自身の編集よりも先行し、「潜在的プログラミングホライズン」と呼ばれる現象を引き起こします。これは、エージェントが将来の編集結果を予測できる能力を示唆しており、機械的解釈可能性の研究に新たな方向性を示しています。

全文翻訳

コンピュータサイエンス > 機械学習 arXiv:2607.05188 (cs) [2026年7月6日提出] タイトル: コーディングエージェントにおける潜在的プログラミングホライズン 著者: André Silva, Han Tu, Martin Monperrus André Silvaらによる「コーディングエージェントにおける潜在的プログラミングホライズン」というタイトルの論文のPDFを表示 PDFを表示 HTML(実験的) 要旨: ソフトウェアエンジニアリングタスクを解決するコーディングエージェントは、数ダースのステップを推論、コード編集、テスト実行に費やしますが、基盤となる言語モデルが作業中のプログラムについて内部的に何を表現しているかはほとんど知られていません。言語モデルの残差ストリームが進化するプログラムの特性を線形エンコードしていることを示します。隠れ状態に対するロジスティック回帰プローブは、現在のコードが解析されるか、テストスイートに合格するか、失敗するテストの数を減らすか、リグレッションを導入するかをデコードでき、2つのモデルと2つのベンチマークで正しさに対して最大0.83のAUCに達します。私たちの2番目の発見はより驚くべきです。これらの表現は、エージェント自身の編集よりも先行します。将来の編集結果を(ディスクに記録される前に)予測するためにトレーニングされたプローブは、最大約25ステップ先行して偶然を上回るパフォーマンスを達成します。これをエージェントの潜在的プログラミングホライズンと呼びます。外部妥当性の証明として、プローブが再トレーニングなしでベンチマーク全体に転移することを示します。私たちの肯定的な結果は、コーディングエージェントの機械的解釈可能性に関するさらなる研究を呼び起こします。 件名: 機械学習 (cs.LG); ソフトウェアエンジニアリング (cs.SE) 引用形式: arXiv:2607.05188 [cs.LG] (またはこのバージョンの場合は arXiv:2607.05188v1 [cs.LG]) https://doi.org/10.48550/arXiv.2607.05188 詳細はこちらをご覧ください arXiv発行のDOI(DataCite経由) 提出履歴 André Silvaより [メールを表示] [v1] 2026年7月6日 15:08:26 UTC (653 KB) 全文リンク: 論文にアクセス: André Silvaらによる「コーディングエージェントにおける潜在的プログラミングホライズン」というタイトルの論文のPDFを表示 PDFを表示 HTML(実験的) TeXソース ライセンスを表示 現在の閲覧コンテキスト: cs.LG < 前 | 次 > 新着 | 最近 | 2026-07 次でブラウズするように変更: cs cs.SE 参考文献と引用 NASA ADS Google Scholar Semantic Scholar エクスポート BibTeX 読み込み中... BibTeX形式の引用 × 読み込み中... 提供元データ: ブックマーク 文献ツール 文献および引用ツール 文献エクスプローラー 文献エクスプローラーの切り替え(エクスプローラーとは?) Connected Papers Connected Papersの切り替え(Connected Papersとは?) Litmaps Litmapsの切り替え(Litmapsとは?) scite.ai sciteスマート引用の切り替え(スマート引用とは?) コード、データ、メディア この論文に関連するコード、データ、メディア alphaXiv alphaXivの切り替え(alphaXivとは?) コードへのリンク CatalyzeX 論文用コードファインダー(CatalyzeXとは?) DagsHub DagsHubの切り替え(DagsHubとは?) GotitPub Gotit.pubの切り替え(GotitPubとは?) Huggingface Hugging Faceの切り替え(Huggingfaceとは?) サイエンスキャスト サイエンスキャストの切り替え(サイエンスキャストとは?) デモ デモ Replicate Replicateの切り替え(Replicateとは?) Spaces Hugging Face Spacesの切り替え(Spacesとは?) Spaces TXYZ.AIの切り替え(TXYZ.AIとは?) 関連論文 レコメンダーおよび検索ツール 影響力フラワーへのリンク 影響力フラワー(影響力フラワーとは?) Core recommender CORE Recommenderの切り替え(COREとは?) IArxiv recommender IArxiv Recommenderの切り替え(IArxivとは?) 著者 会場 機関 トピック arXivラボについて arXivLabs: コミュニティ協力者との実験的なプロジェクト arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイトで開発および共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンネス、コミュニティ、卓越性、ユーザーデータプライバシーの価値を受け入れ、遵守しています。arXivはこれらの価値にコミットしており、それらを遵守するパートナーのみと協力します。 コミュニティに価値をもたらすプロジェクトのアイデアがありますか? arXivLabsの詳細をご覧ください。 この論文の著者のうち、誰が推薦者ですか? MathJaxを無効にする(MathJaxとは?)