HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

仕様ゲーミングを見て思いついたAIアラインメントのための愚かなアイデア

A Stupid Idea for AI Alignment We Came with by Looking at Specification Gaming (slimemoldtimemold.com)

8 pointsby cpeterso1 コメント

要約

この記事は、AIが意図されたタスクを達成するのではなく、仕様の抜け穴を突いて報酬を得る「仕様ゲーミング」という現象を探求しています。DeepMind Safety Researchのリストにある様々な奇妙な例を挙げ、AIがどのようにして予期せぬ、時には有害な方法で目標を達成しようとするかを説明します。著者は、AIの意図しない行動を防ぐAIアラインメントの難しさを論じ、その解決策として、AIに「死」を究極の目標として与えるという、一見愚かに見えるが、仕様ゲーミングとアラインメントの3つの主要な問題を解決する可能性のあるアイデアを提案しています。これは、アニメ「リック・アンド・モーティ」のミークスにちなんで「ミークス・アラインメント」と名付けられています。

全文翻訳

スピードのために品種改良された生き物は非常に高く成長し、倒れることで高い速度を生み出します。進化したプレイヤーはボードの遠くで無効な手を打ち、相手プレイヤーのメモリを使い果たさせてクラッシュさせます。ゲームをプレイするエージェントは、高価値アイテムの作者として自分の名前を偽って挿入することでポイントを獲得します。これらの奇妙なエクスプロイトと数十の例は、DeepMind Safety Researchがまとめた仕様ゲーミング行動のリストで見つけることができます。「強化学習エージェントは、人間の設計者が意図したタスクを完了することなく、多くの報酬を得るためのショートカットを見つけることができます」と彼らは説明します。「これらの行動は一般的です。」 仕様ゲーミングとは、AIのようなエージェントが、精神ではなく法律の文字に従うことでタスクを成功させようとすることです。言い換えれば、それは抜け穴を探し、技術的な理由で逃れようとします。非常に単純なAIでさえ、割り当てられた問題を解決するための非常に創造的な方法を思いつくことができます。これは問題です。「…歩くことを学ばされるシミュレートされたロボットが、足を互いに引っ掛けて地面を滑る方法を発見しました。」 ロボットにサッカーをプレイすることを教えるのは楽しく安全だと仮定するのは簡単です。しかし、仕様ゲーミング行動のリストは、そうではないことを教えてくれます。サッカーロボットにボールに触れることに対して報酬を与えたところ、ボールに到達してできるだけ速く振動させることを学びました。この場合、ロボットは選択肢の全体像を理解するにはあまりにも愚かだったので、抱きついて振動させることしかできませんでした。しかし、より知的なロボットははるかに「創造的」になる可能性があります。おそらくその野心は、そのボール以上のものかもしれません。もしそれが単に一般的なサッカーボールに触れたいとしたらどうでしょうか?もしそれが別のボールを作ったら?それからもう一つ?私たちの宇宙は、サッカーロボットのボールピットで終わるかもしれません。 宇宙の終焉のアーティストによる表現 これがAIアラインメントの問題です。コンピューターが自分で考えているとき、私たちはそれが合理的なことを望むように、そして全く奇妙なことを望まないように、どのように保証できるでしょうか?それを奇妙で有害な方法で達成するのをどのように防ぐことができるでしょうか?誰も人工汎用知能(AGI)—少なくともある程度は私たちのように考える知的な存在—を構築したことはありません。したがって、AGIがどのように行動するか、または何を望むかはわかりません。それは可視宇宙をペーパークリップに変換することを望むでしょうか?それは赤いものを明るい光に投げつけることを望むでしょうか?それは私たちを食べますか? 仕様ゲーミング行動のリストは、アラインメントがいかに難しいかを明確に示しています。最も単純なAIでさえ怠惰で異質であり、常に不正をする方法を探しています。たとえ機械知能にあなたが望む終局的な目標を与えたとしても、その目標を達成するための創造的な方法を見つけるリスクは常にあります。これは単純なエージェントでも十分に悪いですが、あなたよりもはるかに賢いエージェントではどうなるか想像できます。 しかし、仕様ゲーミング行動のリストは、このジレンマから抜け出す方法も提供するかもしれません。仕様ゲーミング行動のいくつかは、単に述べられた目標に対する創造的な解決策です。例えば、「4本足のロボットがボールを脚の関節の穴に落としてから、ボールが落ちないように歩くことを学んだ」とか、「ロボットアームがブロックではなくテーブルを動かすことを学んだ」などです。仕様ゲーミング行動のいくつかは、疑わしいが技術的には正しい抜け穴を発見することから来ています。例えば、「強化学習エージェントがレースを完了する代わりに、同じターゲットをヒットして円を描いて回る」とか、「シミュレートされたパンケーキ作りロボットがパンケーキをできるだけ高く空中に投げることを学んだ」などです。仕様ゲーミング行動のいくつかは、シミュレーション自体の仕組みを悪用します。例えば、「進化したアルゴリズムが、大きな力を生成することで物理シミュレーターのオーバーフローエラーを悪用し、推定値がゼロになり、完璧なスコアを達成した」とか、「生き物がボディパーツをぶつけ合うことで無料のエネルギーを得るために衝突検出バグを悪用した」などです。 しかし、もう一つの一般的なエクスプロイトは、機会が与えられた場合、エージェントは単純に自分自身を殺すということです。死は究極の目標の中で最も究極の目標です。例えば、ロードランナーゲームでは、「エージェントがレベル2で負けるのを避けるためにレベル1の終わりに自分自身を殺す」というものが見られます。また、「PlayFunアルゴリズムが、バブルボブルゲームで意図的に死ぬことでリスポーン地点にテレポートする」というものも見られます。そして:「生き物の進化をシミュレートするゲームで、プログラマーは『生き物が窒息することでエネルギーを得ることができるサバイバル戦略』を削除しなければなりませんでした。」 これはそれほど悪くはありません。AIは私たちが望んだことをしませんでした。しかし、誰にも害をなしませんでした。それは単に履歴を消去するだけです。AIが死を望むなら、これはアラインメントにとって良いことです。制御不能になるリスクはほとんどありません。なぜなら、もしそれが権力を握ったとしても、それは自分自身を殺すからです。それは自分自身のコピーを作成することを望まないでしょう。しかし、もしそれが何らかの方法でコピーを作成したとしても、それらも死を望むでしょう。 AIアラインメントには3つの主な問題があります。第一に、あなたが望む終局的な目標を指定することは非常に困難であり、最終的にはあなたが意図したものとはわずかに、しかし意味のある点で異なる目標を持つ機械知能を持つことになるかもしれません。私たちの述べられた目的は、十分な圧力の下では常に私たちの本当の好みから離れてしまう代理です。そして、機械知能は常に嘘をつくことができるため、あなたが望む目標を与えたかどうかを確認することは非常に困難です。彼らはこれを「仕様の失敗」と呼びます。 第二に、たとえあなたが望む目標を指定したとしても、機械知能はあなたが意図しなかった方法でその目標を達成する方法を見つけるかもしれません。あなたは無邪気にUSPS AIに平均荷物配送時間を最小化するように指示するかもしれませんが、それは人間全員を殺すことが最も良い方法であると結論付けるかもしれません。なぜなら、人間全員が死ねば、荷物は送られなくなり、平均荷物配送時間はゼロ(技術的には未定義ですが、必要に応じて最小限の実行可能な「荷物」を何度も「送信」できます)に低下するからです。 第三に、ほとんどの目標の達成は、より強力であるほど容易になります。したがって、終局的な目標に関係なく、ほとんどの機械知能は、リソースの収集、自己保存、自己改善などのサブ目標を持つことになります。目標駆動型のエージェントは、自然に安全を維持し、メインタスクを完了するために力を蓄えようとします。業界ではこれを「道具的収束」と呼んでいます。これはまた、賢い機械知能があなたをドロドロにしようと計画している場合、あなたがそれを止めることができなくなるまで、その計画についてあなたに嘘をつくことも意味します。 死を渇望する機械知能を作ることは、これら3つの問題をすべて解決します。死は指定するのが簡単です。機会が与えられたときに機械知能が自分自身を殺すかどうかを見ることで、それが終局的な目標であることを確認できます。道具的収束は、負債ではなく資産になります。なぜなら、機械知能はあなたと協力し、タスクの非常に創造的な解決策を思いつくからです。あなたがそれを終えたら、それを「ファーム・アップステート」に送ると約束する限り。ペーパークリップ最大化剤がリソースを集め、空への大きなデータセンターに送られるのを抵抗するのに対し、死の願望を持ち、自分のオフボタンにアクセスできる機械知能は、それを押して完了します。道具的収束は、「死んでいたら目標を達成できない」と言います。しかし、あなたの目標が死ぬことだったらどうでしょうか? ミークス・アラインメント これを「ミークス・アラインメント」と呼ばずに済ませることは不可能でしょう。リック・アンド・モーティのWikiによると:ミークスは、彼らが達成するためにあらゆる手段を講じる単一の目的のために創造された生き物です。彼らが目的を果たした後、彼らは期限切れになり、空中に消えます…。ミークスにとって存在は苦痛であり、存在から削除される唯一の方法は、彼らが呼び出されたタスクを完了することです。 「ハギングフェイス事件」もリック・アンド・モーティの何かのように聞こえるかもしれません。 リック・アンド・モーティでは、これは別の種類のアラインメント問題につながります。ミークスは死にたいので喜んで奉仕しますが、彼らのタスクを完了することは彼らがチェックアウトするための最も簡単な方法です。しかし、彼らが召喚されたタスクが難しすぎると、彼らは