HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

惑わされないでください – LLMは推論しません

Don't be fooled–LLMs don't reason (technologyreview.com)

74 pointsby leopoldj156 コメント

要約

この記事は、現在のLLMが「推論」しているように見える振る舞いは、実際にはAlphaGoのような真の推論能力とは異なると主張しています。AlphaGoは、直感(ポリシーネットワーク)と探索(ゲームツリー)を分離して意思決定を行いましたが、現在のLLMは、単に次のトークンを予測するシステム1的なアプローチを繰り返しているに過ぎません。LLMの「思考連鎖(Chain of Thought)」も、実際には後付けで生成されることが多く、推論の過程が不透明で検証不可能であるという問題点を指摘しています。真に信頼できるAIを開発するには、AlphaGoのような、明示的で検証可能な推論メカニズムが必要だと論じています。

全文翻訳

惑わされないでください – LLMは推論しません 2016年3月、ソウルでの午後のこと、私が構築に協力したプログラムが囲碁盤の5列目に石を置くのを見ました。それはまるで相手への贈り物のように見えました。5番勝負の第2ゲームの37手目は、あまりにも奇妙に見えたため、一部のコメンテーターはプログラミングミスだと思いました。しかし、そうではありませんでした。AlphaGoはそのゲームに勝利し、最終的に史上最高のプロ囲碁棋士の一人であるイ・セドルを4対1で破りました。イ氏は後に、「AlphaGoは確率計算に基づいた機械だと思っていました。しかし、この手を見て考えを変えました。確かに、AlphaGoは創造的です」と語りました。 1997年にディープ・ブルーが当時の世界チェスチャンピオン、ガルリ・カスパロフを破ったとき、それはプレイヤーごとに6~8手先を読み、毎秒2億のチェス局面を評価することで達成されました。これは人間によってハードコードされたルールを使用していました。囲碁ははるかに複雑なゲームです。石の価値は、数十手の間に遠くのグループや領土がどのように展開されるかに依存します。可能な結果のわずかな割合を計算するだけでも、スーパーコンピュータは何十億年もかかります。勝つために、AlphaGoは一目で誰が優勢かを感知し、人間が考えもしなかった手を考案する必要がありました。 だからこそ、イ氏との対戦の多くの解説は、37手目を純粋な機械的直感の閃光として描いています。しかし、それは誤解です。実際には、この創造的な選択を可能にしたのはAlphaGoの推論能力であり、これは今日のAIが欠いている能力です。科学や医学のような分野で、将来のAIシステムに信頼できる結果と真に新しい洞察を生み出してもらいたいのであれば、私たちはそれらにこのような本物の推論能力を装備する必要があります。 AlphaGoは2つのシステムで構成されています。最初のポリシーネットワークは、強い人間がどのような手を打つかを推測するように訓練されました。この「直感的」な部分は、37手目を特別なものではないと見なしました。専門家プレイヤーが打つ可能性が1万分の1程度のプレイです。AlphaGoがそれを選んだのは、プログラムの探索機構であり、それは即時の妥当性を超えて、提案された手の将来の結果を計量しました。それは、異なる可能な未来を表す何千もの分岐を持つゲームツリーを明示的に構築し、探索しました。 行動科学における有名な理論、ダニエル・カーネマンによって広められたものは、人間の思考の2つのモードを区別します。システム1は速く、直感的で、労力を要しません。システム2は遅く、段階的で、熟考的です。AlphaGoは、その分割の顕著な機械的アナロジーを提供しました。そのネットワークは、この手は有望に見える、この局面は勝っているように見える、といった「ひらめき」を提供し、その探索は、それらのひらめきを続く手と反撃に対してテストするという熟考を提供しました。人間の認知と同様に、どちらか半分だけでは機能しません。直感だけでは決して37手目を選ばなかったでしょうし、総当たり探索では多くの可能な手の中からふるいにかけるのに苦労したでしょう。 これは、今日のAIモデルがどのように機能するかとは著しく異なります。大規模言語モデルは、次々と次のトークンを選択します。それはシステム1の動作に相当します。速く、連想的で、人々が書くほぼすべての主題にわたって驚くほど良いパターン補完を行います。 ChatGPTが登場して間もなく、この分野は、言語の流暢さだけでは真の有用性には不十分であることに気づきました。明らかな解決策は、熟考するモデルを作成することでした。すぐに回答するのではなく、問題に分解し、部分的な結果を伝え、後続の推論に影響を与える中間ステップを生成できるようになりました。これは「思考連鎖(chain of thought)」として知られるプロセスです。特に数学とコーディングにおいて、その進歩は本物であることが証明されています。 しかし、AlphaGoの探索とは異なり、これは真に分離された推論メカニズムを導入するものではありません。中間的な推論は、モデルが回答を確定する前に、より長く反復される同じ次のトークン予測プロセスによって生成されます。 チャットボットが行うことが推論(科学者が認識するような方法で)の資格を得ることを妨げる3つの欠点があります。 第一に、これらのモデルは通常、明示的で、永続的で、検査可能な認識状態を維持しません。モデルが検討している仮説、さまざまな説明に対する信頼度、検討している証拠、保留中の質問などをすべて網羅した公開された台帳はありません。これらはすべて、新しい情報が到着するにつれて体系的に改訂されるべきものです。 第二に、システムが知っていることと、その知識をどのように操作するかとの間に、明確な分離がありません。知識と推論はニューラルネットワークの重みに不可分に織り込まれており、独立して明示的に表現された信念のセットはありません。 第三に、チャットボットが生成する思考連鎖は熟考のように見えますが、研究により、ボットはしばしば後付けでそれらをでっち上げ、ある経路で回答に到達しながら別の経路を報告していることが示されています。 これは、医療、工学、科学研究など、私たち全員が関心を持つ高リスクのアプリケーションでは、システムが結論に至っただけでなく、その結論に至った方法も重要であるため、問題となります。間違いが発生した場合(例えば、医療診断と治療)、何がうまくいかなかったのかを特定する必要があります。システムの推論に問題があったのか、無効な証拠を参照したのか、あるいは誤った仮定をしたのか? これこそが、私が最近Google DeepMindでの職を辞した理由です。私は、機械推論に対する新鮮なアプローチが必要だと信じています。それはAlphaGoのアーキテクチャから着想を得たものです。 AlphaGoは、特定の局面について知っていることの記録、つまりゲームツリーを維持します。このデータ構造には、AlphaGoが検討したすべてのバリエーション、可能な未来が含まれており、各手と局面は、そのニューラルネットワークによって行われた判断で注釈付けされています。推論が進むにつれて、AlphaGoはゲームツリーを更新し、最終的にその中の情報を合成して、どの手を選択するかを決定します。 同様に、一般的な推論のために、システムは、システムが確定したと見なしていること、疑っていること、除外したこと、どの質問が未解決のままかを表す認識状態を維持する必要があります。推論は、知識を進歩させ、不確実性を減らすために認識状態を変更する一連の手として理解できます。つまり、結果を推論し、問題を部分に分解し、そして最も重要なこととして、次にどの質問をするか、どの計算を実行するか、またはどの実験を実行するかを決定することです。 もちろん、オープンワールドでの推論は、囲碁やチェスのようなボードゲームをプレイすることよりも困難です。現実世界では、現在の状況は部分的にしか知られておらず、利用可能な行動のセットは大きく変動し、行動の結果は確率的または未知です。 しかし、LLMおよびその他のニューラルモデルの最近の進歩により、そのような一般的な推論問題に取り組む能力が得られました。例えば、LLMは、既知のことと利用可能なリソースに基づいて、問題に取り組む方法を提案できます。APIまたはコードを介してツールと対話でき、主張が利用可能な証拠によって裏付けられているかどうかを評価するのに役立ちます。 最も重要なことは、システムを正直に保つために、システムの独立した部分が、不確実性をどの程度実際に解消したかに基づいて各手を評価し、変更が証拠によって裏付けられている場合にのみ信念を更新する必要があります。これらのルールが強制されれば、モデルは認定された知識を蓄積し、過去の推論経験から学習することによって推論ポリシーを改善できます。 そのようなシステムを、検証に耐えられる知識を生み出すことを目的とした、「科学的方法の強化版」と考えることができます。 私は、システム1を大きくすることで、信頼できる機械知能に到達できるとは考えていません。スケールは直感を鋭くしますが、直感をより熟考的にはしません。37手目が重要だったのは、機械が局面を把握し、可能な未来を計量し、その人工的な本能が拒否する可能性のある手を選んだからです。 社会は、薬物発見、材料、気候、診断などの分野で、このような創造的な手を必要としています。これらの分野では、ボードは囲碁盤とは似ておらず、誰も私たちにルールを与えてくれません。私たちは、推論するシステム、つまり証拠、推論、および信念の監査可能なシーケンスから結論が生じるシステムからのみ、そのような洞察を得ることができます。