HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

CoTモニタリングの脆い基盤

The fragile foundations of CoT monitoring (web.stanford.edu)

3 pointsby jxmorris120 コメント

要約

この記事は、AIの推論過程を追跡するChain of Thought(CoT)モニタリングの現状と課題について論じています。CoTはモデルの性能向上に役立つものの、そのモニタリングへの依存は脆く、AIの安全性のためには内部状態の理解など、より包括的なアプローチが必要であると主張しています。また、モデルが生成する推論テキストが必ずしも真の計算過程を反映するとは限らないという、欺瞞的なCoTの脅威についても指摘しています。

全文翻訳

Credit: Art Potts By Christopher Potts – July 27, 2026 先週、Chain of Thought(すなわち、推論チェーン)のモニタビリティに関するワークショップに参加しました。このトピックに取り組んでいる最も影響力のある研究者や「テクニカルスタッフ」のメンバーの多くが出席していました。私はそこにいられたことを幸運だと感じています。なぜなら、CoTモニタリングについて私が知っていることのほぼすべては、Peter Hase氏から学んだものだからです。しかし、私は解釈可能性(interpretability)について広範に研究しており、解釈可能性がCoTモニタリングを改善または補完するという一般的な期待があるようですが、この関係は複雑です。以下で議論するように。 ワークショップでは多くのことを学び、考えるべき多くのことを持ち帰りました。この記事は、コミュニティの部外者としての私にとっての主な学びを要約し、体系化しようとするものです。 CoTとモニタリング:不安定で不均一な同盟 ワークショップグループの一般的なコンセンサスは、CoTがモニタリングの基盤を提供しているのは幸運なことであり、それはその目的のために発明されたわけではないということのようでした。CoT推論は、主にモデルを困難なタスクにより良くするために開発されました。この仮説は、CoTをプロンプト技術として導入した古典的な論文、Wei et al. 2022に遡ります。 通常のストーリーは、現在のLLMは固定された深さを持ち、したがって、出力を生成する前に計算を実行する能力は非常に限られているということです。モデルが最終的な回答を生成する前にトークンを生成できるようにすることで、よりオープンエンドな形式の計算でモデルを豊かにします。 Wei et al.にとって、CoTは純粋なプロンプト技術ですが、2024年9月にOpenAIのo1モデルがリリースされたことで、トレーニング後のプロセスに格上げされました。Wei et al.は性能向上に焦点を当てていますが、CoTは「モデルの動作への解釈可能な窓を提供する」と指摘しており、「回答をサポートするモデルの計算を完全に特徴づけることは未解決の問題である」という注意書きが付いています。 これは、Korbak, Balesni, et al. 2025の議題論文「Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety」で、モニタリングのための完全なプログラムとなりました。(この論文の起源と先行研究については、Peter Hase氏と私のこの投稿を参照してください。) Korbak et al.のタイトルの「脆い機会」というフレーズは、彼らの提案の精神を捉えているようです。CoTは、透明性を高めるからではなく、能力の向上につながるからこそ、時の試練に耐えてきました。さらに、この2つの目標は必ずしも一致していません。最近のいくつかの論文(Kirchner, Chen, et al. 2024; Guo et al. 2025)では、透明性がCoTの効果に対する税金になる可能性さえ示唆されています。 AIビジネスについて特に皮肉的になる必要はありませんが、いざとなれば、能力の進歩は透明性の向上よりも優先されると結論付けることができます。 全体として、CoTをモニタリングできることは有用であることに同意します。しかし、この同盟の脆さは、CoTが役に立たない未来を計画するために、安全性へのCoTへの依存を減らすべきだと感じさせます。この記事の次の2つのセクションは、この結論に追加の動機を提供します。 ✳ すべての計算が言語化されることを保証できるか? ワークショップでのもう一つの著名な立場は、上記に関連していますが、興味深いことにそれとは区別されます。これは、モデルがCoTに反映されない計算を一切行わないようにすることを有用であるという考えです。 誰もこの理想が完全に達成可能であるとは期待していませんが、一部の人々は安全性を向上させるために、それに近づくことを好むようです。私の理解では、議論は次のようになります。 モデルが入力Xを受け取り、内部計算Cを実行し、トークンを生成する前に最終的な回答Aに到達し、その最初の生成トークンがAを表現すると仮定します。計算Cは私たちから隠されており、これは私たちを不安にさせる可能性があります。例えば、Aが正しかったとしても、それは誤った推論に基づいている可能性があり、モデルが他の関連する入力X'でどのようにパフォーマンスを発揮するかについて私たちを心配させるかもしれません。 一つの応答は、最終的な回答に対する一種の「もっともらしい説明」として、とにかくCoTを生成させることでしょう。 私はこのアイデアに対して参加者から多様な反応を受けました。一般的に、人々はそれが不正確または誤解を招くものだと考えているようでした。 CoTは、モデルが最終的な回答を生成する上で因果的に関与しているはずです。私のシナリオでは、それは規定によりそうではないので、CoTはヌルであるべきです。 私にとって、これはCoTの元の動機が能力志向であったことへの忠誠心を反映しています。 また、このグループが、推論がどのように出力に影響するかについての因果理論の詳細を詰めることよりも、ベンチマークパフォーマンスにより関心があるように見えたという事実と、この異議を調和させるのが難しいと感じました。既存の文献は、この理論を解明することが容易ではないことを示唆しています(特にYu et al. 2026; Gur-Arieh et al. 2026を参照)。したがって、私たちはそれを当然のことと見なすことは絶対にできません。 上記アイデアのバリアントはどうでしょうか?モデルに回答後に説明を生成させる(Chen et al. 2023)。ここでは、説明は推論チェーンや計画として提示されないため、モデルの応答におけるその役割についての因果関係を示唆しません。 このアイデアに対する熱意は比較的少なかったようですが、その正確な理由はわかりません。私自身は、これらの事後的な合理化の真実性について懸念するでしょう(人間について知っていること、Nisbett and Wilson 1977を考えると深い懸念です)。しかし、他の人々は、アイデアの根本的な問題よりも、既存のモニターをこの新しいシナリオに適応させる方法について、より懸念しているようでした。 したがって、モニタリングされるテキストと回答の間に因果関係を要求し、テキストがモニタリングの唯一の基盤であると考えるなら、モデルはすべての思考をCoTで行うべきだという提案に押しやられます。すべての計算を言語化するのです! 参加者の中には、オープンエンドな計算を生み出してトークンを生成しないことで推論の必要性を排除する危険性があるため、再帰型アーキテクチャの禁止を主張する人もいました。 私の投票は、内部状態をモニタリングするためのより良いツールの開発に向かうでしょう。この方向への移動は避けられないように見えます。 すべての計算がトークンに反映されるという理想は達成不可能であるということに同意します。入力処理のフォワードパスは豊かな計算であり、推論自体も豊かな内部計算を実行するフォワードパスの集まりであり、トークンから読み取れるものをはるかに超える可能性があります。 したがって、これらのモデルの内部表現と計算を深く理解する方法を見つけなければなりません。さもなければ、必然的に何かを見落とすことになります。(この結論について少し葛藤を感じていることを言わなければなりません。インタープリタビリティの研究者が、インタープリタビリティだけが救世主になれるという結論に達したのは、おそらく驚くことではありません。私の弁護として:簡単だとは思いませんし、既存のインタープリタビリティツールキットで十分であるという自信もあまりありません。内部状態がより信頼性が高く包括的な画像を提供するであろうことは明らかであるように思われます。) ✳ 欺瞞的なCoTの脅威 すべてを言語化させるというこの動きは、推論中に生成されるテキストが、モデルが行ったことの正確で有益な説明であるという仮定に依存しています。これは非常に shaky な仮説です。 最近の研究(例:Turpin et al. 2023; Baker, Huizinga, et al. 2025; Chen et al. 2025)から、モデルは出力の真の原因を反映しない推論を生成できることがわかっています。 ワークショップの全員がこれらの結果を鋭く認識していました。しかし、驚くべきことに、彼らはそれほど心配していないようでした。なぜなら、実際には、現在のモデルはこのように欺瞞的になるのが得意ではないからです。 この応答は私にとって非常に驚くべきものです。私たちは皆、AIの進歩は速く破壊的であり、今後もそうであり続けるだろうということに同意しています。むしろ、ワークショップの参加者は平均して、私よりも進歩に対して楽観的(したがって、より心配)でした。そのため、彼らの現在の利便性と一般的な良い状況への訴えは...