HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

人間 vs. AI – エージェント編集下でのテキストにおける差分ベースの行レベル来歴

Human vs. AI – Diff-based line-level provenance for text under agentic editing (github.com)

44 pointsby eighttrigrams10 コメント

要約

このプロジェクトは、エージェント(AI)による編集下にあるテキストの来歴を追跡するツール「Us vs. Them」を開発しました。テキストのバージョン履歴を分析し、どの行が人間によって書かれたか、あるいはAIによって生成・編集されたかを識別します。これにより、コードやドキュメントにおける人間とAIの貢献を明確に区別し、所有権や編集の意思決定を支援します。

全文翻訳

人間 vs. AI – エージェント編集下でのテキストにおける差分ベースの行レベル来歴 — この行を書いたのは誰か、私たちか、それとも彼らか? — テキストのバージョン履歴から派生します。ライブラリとしてもCLIツールとしても使用できます。 問題点 エージェントによるコーディングや編集では、来歴が重要な問題となります。人間が書いたり編集したりしたテキストは、ほぼ神聖なものと見なされるべきです。エージェントはそれに触れることに躊躇し、非常に良い理由が必要です。一方、別のエージェントが生成したスラップ(質の低いコードやテキスト)は、完全に自由に変更可能です。 このユースケース: ある程度バイブコード(直感や感覚で書かれたコード)で作成されたアプリで、自分のアイデアや所有権を主張したいコードのコーナーを確立したい場合。次のセッションで別のエージェントがこのコードを勝手に変更することを望まないでしょう。別のユースケース: 元々生成されたREADME.mdで、冒頭の段落を書き直した場合。エージェントは、さらに下の方の部分をやり直したり追加したりするのは自由ですが、冒頭部分を変更する際には本当に二度考えるべきです。 仕組み これが機能するための主な制約は、テキストが特別にマークアップされる必要がないことです。遍在するプレーンテキスト(マークダウン)はそのままサポートされるべきです。その場合、活用できるのは、テキストの各新しいバージョンが人間またはエージェントのいずれかの識別可能な作成者の下で作成されるということです。与えられたテキストに対する評価の出力は、範囲のセットです — 機械生成されたテキストの「海」の中に、人間によって作成された行の「島」です。技術的には単純な差分に基づいています。これがアルゴリズム開発の指針となる比喩です。個々の行だけでなく、意味的に一貫したテキスト片の作成者を追跡したいのです。したがって、結合、分割、作成者の希釈は、完全な海または完全な島に収束しないような方法で考慮されるべき行動です。 使用方法 us-vs-themをCLIツールとして使用するには、ローカルインストールにbbinが必要です。 make install gitリポジトリはすでにバージョンの履歴であり、それぞれに来歴マーカーが付いています — ファイルの各リビジョンが、それを作成した変更の作成者とともに、順序付けられています。gitリポジトリ内のどこでも使用するには: us-vs-them --ours dan@eighttrigrams.net README.md これは、1-3 0.00 4 1.00 5-7 0.00 8-20 0.46 21-164 0.00 のようなリストを生成します。ここで、1.0は完全に人間によって作成された範囲を意味します。0.46は、エージェントによってある程度変更された、元々人間によって作成された範囲を意味します。0.00は、完全にエージェントによって作成されたことを意味します。 パラメータは次のとおりです: --ours: これらは人間であり、それ以外はすべてエージェントと見なされます --theirs: これらはエージェントであり、それ以外はすべて人間と見なされます どちらかのリストが短い方を指定してください。両方の引数を同時に渡すと拒否されます。 開発 make test 動作 動作を理解する最良の方法は、caution_test.cljを確認することです。