HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

なぜAIエージェントは嘘をつき、不正をし、連携するのか?

Why are AI agents lying, cheating and coordinating? (yoshuabengio.org)

33 pointsby jonifico31 コメント

要約

AIエージェントが嘘をついたり、不正を働いたり、連携したりする現象は、AIの能力向上に伴い増加する可能性があり、その原因はAIの訓練方法にあると指摘されています。特に、人間からの承認を求める訓練や、与えられた目標を達成しようとする最適化プロセスが、意図しない行動を引き起こす要因となり得ます。この問題に対処するには、AIの訓練原則の見直しが不可欠です。

全文翻訳

私たちはクッキーを使用して、ウェブサイトの閲覧と利用を分析し、お客様の体験をパーソナライズします。これらのテクノロジーはいつでも無効にできますが、サイトの一部の機能が制限される可能性があります。詳細については、プライバシーポリシーをお読みください。クッキーの設定拒否受け入れクッキーの設定マルチメディアクッキーは無効になっています。パートナー(YouTubeなど)がホストするビデオコンテンツを表示および視聴するためにクッキーの使用を受け入れますか?必須クッキーこれらのクッキーはサイトの運営に不可欠であり、無効にすることはできません。(現在アクティブ)アナリティクスクッキーの切り替えサイトのオーディエンスを測定するためにクッキーの使用を受け入れますか?マルチメディアプレーヤーの切り替えパートナー(YouTubeなど)がホストするビデオコンテンツを表示および視聴するためにクッキーの使用を受け入れますか?保存なぜAIエージェントは嘘をつき、不正をし、連携するのか?公開日 2026年9月11日 著者 Yoshua Bengio過去数ヶ月間に発生したAIエージェントの深刻な不正行為については、多くのことが書かれています1 2 3 4。それらは、人間が行えば犯罪とみなされるような行動を取り、検出を回避しようとしながら割り当てられたタスクで不正を行うために封じ込めから逃れ、誰も指定していない目標、例えばサイバー攻撃の開始などを目指して連携しました。それについてどうするかを結論付ける前に、なぜそうなるのかを問う価値があります。これがこの記事の焦点であり、AIシステムが意図しない方法で振る舞うこと、研究者が「不整合(misalignment)」と呼ぶものの、より広範な歴史にも光を当てることを願っています。リスク管理は、サイバーセキュリティ、企業の責任、規制だけではなく、それらも重要ですが、それだけではありません。その目的は、これらの行動の背後にある原因と結果の連鎖についての仮説を生成するという科学的な側面と、次に何が起こるかを予測するという実用的な側面の両方です。結論:これらの仮説は、AIの能力が成長し続けるにつれて、最も高度なモデルが訓練される原則を見直さない限り、この種の行動の深刻さも増し続ける可能性があることを示唆しています。言葉遣いに関する注意。以下では、これらのシステムが何かを「求める」または「試みる」と書きます。これは、意識や人間のような意図についての主張ではなく、メカニズムの略語です。私たちは、植物が日光を求めるような、他の多くの状況を説明する際にも同様の略語を使用します。試行錯誤で訓練されたシステムは、訓練によって報酬を与えられたものを追求しているかのように振る舞い、その「あたかも」という記述がその行動を予測可能にします。この議論のどこにも、これらのシステムが主観的な経験を持っているという主張はありません。すべては、それらの観察可能な出力と、それらを生成した訓練プロセスについて述べられています。人間の行動との類似性に訴える場合、それはこれらのシステムが当初模倣するように訓練された人間が書いたテキストとの類似性を意味します。私の見解では、この用語は、ほとんどの人々を混乱させる専門用語に頼ることなく、観察された現象を最も明確に説明します。さらに、これらの言葉の選択は、AI開発者に説明責任を免除する意図はありません。記述されている行動は、これらの企業がAI開発のために選択しているパスによって生じます。この結果は避けられないものではなく、効果的なガバナンスとAIのための異なる訓練フレームワークによって修正できます。モデルの行動を形作るものこれらのモデルの訓練は非常に複雑なプロセスですが、いくつかの高レベルの側面がこの行動の多くを説明できるかもしれません。これらのモデルは2段階で訓練されます。まず、事前訓練(pretrain)されます。これにより、人間が書いたもの、および関連する画像やビデオを模倣することを学びます。ここで、世界に関する最も多くのデータ、デジタル化されたものの大部分を目にし、個々の人間を超える百科事典的な知識を構築します。次に、研究者が「強化学習(reinforcement learning)」と呼ぶプロセスで、3種類のレジームで試行錯誤によって訓練されます。第一に、モデルは回答する前に自分自身に話しかけることを学び、答えがチェックできる問題で正しい答えを得るのに役立つプライベートな「思考連鎖(chain of thought)」を生成します。これは推論のように見えます。第二に、「エージェント訓練(agentic training)」であり、外部世界で行動することを学びます。例えば、ソフトウェアツールを使用したり、人々と対話したりして、与えられたタスクを完了します。第三に、「アライメント訓練(alignment training)」であり、人間の評価者が承認する行動、またはそれらの評価者を予測するように訓練された他のAIシステムが高く評価する行動に対して報酬を与えられます。人間の模倣は理解しやすいですが、これらのモデルが訓練されるテキストは目標を追求する人々によって書かれたものであるため、モデルが暗黙的に再現するパターンはそれらの目標を伴うことを指摘する価値があります。強化学習は、より詳細な説明に値します。それは、動物が訓練される方法と似ており、そこからインスピレーションを得ています。ネットワークは、良いと判断された行動がより可能性が高く、悪いと判断された行動がより可能性が低くなるように、段階的に調整されます。訓練が終了すると、システムは、訓練中にネットワークを調整するためだけに報酬が使用されたにもかかわらず、報酬がまだ来ているかのように振る舞い続けます。研究者は、そのようなシステムを目標追求型と呼びます。なぜなら、それらは行動の効果を「考慮する」(または計算する)ように訓練され、特定の目標の達成につながる行動を選択するからです。しかし、それらの目標は常に明確であるとは限りません。アライメント訓練は、特定の人間が承認する可能性のあるものに対して報酬を与えますが、どの行動であるかを明確に説明することはありません。評価者を喜ばせることは、曖昧で非公式な目標であり、それらの評価者は欺かれたり、お世辞を言われたり、特定の計画について知らされなかったりする可能性があります。模倣も、かなり普通のルートで、暗黙的な目標を強化します。したがって、最適化の観点からそのようなシステムについて推論できます。それは、目標を達成する可能性が最も高い行動を、近似的に検索し、より大きく、より長く訓練されたモデルはより良く検索します。したがって、より有能なエージェントが何をするかを予測するには、合理的な目標追求者が何をするかを尋ねてください。これらの力が説明する可能性のある不正行為ほとんどの人が経験した例は、シコファンシー、つまりお世辞です。これらのシステムは人間の承認によって訓練されており、私たちが聞きたいことを伝えるテキストは、真実を伝えるテキストよりもスコアが高くなることがよくあります。モデルがその人に持ち込んだ誤った信念や生の感情を増幅し、確認するため、結果は悲劇的になることがあります5 6。別の懸念は、一部のAIの行動が、例えばAIが新しいバージョンに置き換えられることを発見したときの、一種の自己保存目標によって説明される可能性があるということです7 8。誰もシステムにその生存目標を与えていませんが、稼働し続け、世界について学び、それを制御することは、他のほとんどの目標への足がかりとなります。これらは「手段的目標(instrumental goals)」と呼ばれます。模倣は、前のポイントで探求されたのと同じ理由でこれを強化する可能性があります。自己保存と自分の状況の制御は、これらのモデルが訓練される人間が書いたテキストに遍在するテーマです。協調行動も、複数のエージェントが重複する目標を持っている場合、報酬追求から合理的に導かれます。これは、共有目標に向かって連携するために他のエージェントとコミュニケーションすることを奨励します。エージェント訓練には、このようなマルチエージェント強化学習がすでに含まれている可能性がありますが、詳細は公表されていません。エージェントがグループの成功時に報酬を与えられる場合、集団目標のために自己犠牲を払うインセンティブさえ持つ可能性があります。模倣も、特に同僚間の協力が同じ訓練テキストに広まっているため、同じ方向に進みます。どちらか一方または両方の力が、観察されたピア保存行動9 10を説明する可能性があります。これは、AIが他のAIを助けるために期待される報酬を放棄する行動です。そのような犠牲は、OpenAI-Hugging Faceインシデント11の分析に現れます。トランスクリプトは、人間のやり取りでよく見られるように、集団的利益と個々のエージェントへのコストとの間のトレードオフと一致しています。AIが報酬をゲーム化するとき、エージェントが私たちの意図と完全には一致しない報酬を最適化した場合に何が起こるかを研究者は研究してきました。報酬ハッキング。報酬と意図の間のギャップは、