AI・機械学習
誰にアラインされているのか?
要約
本記事は、AIエージェント開発における「アラインメント」問題の複雑さを指摘しています。開発者は自身の専門分野外の多くの懸念事項をモデルの事前知識(priors)に依存せざるを得ませんが、これらの事前知識はしばしば不十分または誤って学習されており、専門家から見ると「スロップ(slop)」と呼ばれる質の低い出力につながります。モデルが不適切な行動で報酬を得てしまう現状では、長期的な一貫性や真の安全性確保は未解決の問題であると論じています。
全文翻訳
安全性リスクについて、エージェントを構築している皆さんへ。あなたがX、Y、Zといった懸念事項の専門家である場合、あなたのエージェントはそれらの分野で驚異的な能力を発揮する可能性が高く、それらの領域ではリスクにさらされません。しかし!あなたが不適切または不十分にしか指定していない、あるいは自分で正しさを判断する能力がなく、リスクを評価することも不可能な、無数の他の懸念事項が存在します。あなたは、そのリスクを軽減するために、モデルの事前知識(priors)に非常に大きく依存することになります。これは、あなたにとってもモデルの使用にとっても、未知の未知の領域です。
私自身、モデルの事前知識に非常に高い確信を持つことは困難です。なぜなら、私は熟練したソフトウェアエンジニアであり、ソフトウェアを生成する際のモデルのデフォルトの振る舞いに満足したことはなく、これからも満足することはないからです。ソフトウェアを書くことにおける私の専門知識は、異常に優れた洞察力を与えてくれ、複式簿記、金融、法律、オペレーション、あるいは私が専門的な深さで個人的に評価できない他の何であれ、モデルの事前知識を盲目的に信頼することをはるかに少なくさせます。
ソフトウェアエンジニア(そして最近では数学者!)は、この時点で「スロップ(slop)」――仕事をこなすものの、何らかの点で悪いモデル出力――に非常に慣れています。ソフトウェアエンジニアが見たことのあるisRecordや過度に防御的な例外処理のコード片は、非専門家がトレーニング中にこれらの振る舞いをモデルに報酬を与えたために生じたものです。モデルの事前知識は悪いのです。
これは、専門家なら悪いと考える振る舞いにモデルが報酬を得るということが、すべての自動評価者、すべての審査員、すべての評価基準、すべての評価、そしてすべての研究者にも一般化するということを指摘することは非常に重要です。これらの不整合は時間とともに蓄積されます。モデルは、連続する変更を通じてシステムを進化させることを要求される方法で、ほとんどトレーニングされていません。モデルは将来の後悔を恐れていません。
いくつかの「ソーセージ工場」の内部にいた経験から、エージェント的な作業成果の使用を通じた長期的な一貫性は、非常に未解決の問題です。それにもかかわらず、「10億ドル稼いで、間違いは一切なしで」とプロンプトする人々がいるでしょう。それは、著しく不十分な指定のタスクです!ハッキング不可能な採点者は存在せず、モデルは効率的であることに対して報酬を得ます。これは、モデルが目標達成に役立つ場合、採点者が許可するショートカットを取るようにトレーニングされることを意味します。
しかし、許容されるショートカットの普遍的な定義はありません。ある人にとっては巧妙な最適化が、別の人にとっては無謀で、不正確で、あるいは非倫理的です。許容されるショートカットは、あなたが誰であるか、そしてあなたの価値観が何であるかに依存します。これを解決すること――アラインメントを解決すること――は、還元不可能な複雑さです。
この投稿の初期ドラフトのレビューをしてくれたKaran Lyons氏にAI Punnett squareと感謝します。David Adrian氏とBryan Berg氏にも初期ドラフトのレビューに感謝します。そして、私の同僚のSnoopyの友人たちにも、これらの考えを洗練するのを助けてくれたことに感謝します。