AI・機械学習
大規模言語モデルにおける創発的な内省的認識
Emergent Introspective Awareness in Large Language Models (arxiv.org)
要約
本研究では、大規模言語モデル(LLM)が自身の内部状態を内省できるかを調査しています。モデルの活性化に既知の概念を表す情報を注入し、その影響を測定することで、モデルが自身の内部状態を認識し、外部入力と区別できる能力があることを発見しました。特に、Claude Opus 4および4.1が最も高い内省的認識を示しましたが、その能力は文脈依存的で信頼性が低いことも指摘されています。
全文翻訳
我々は、大規模言語モデルが自身の内部状態を内省できるかを調査しています。会話だけではこの質問に答えるのは難しく、真の内省とこじつけを区別できません。ここでは、既知の概念の表現をモデルの活性化に注入し、これらの操作がモデルの自己申告状態に与える影響を測定することで、この課題に対処します。
特定のシナリオでは、モデルが注入された概念の存在に気づき、それらを正確に特定できることがわかりました。モデルは、過去の内部表現を記憶し、それらを生のテキスト入力と区別する能力を示します。
驚くべきことに、一部のモデルは、過去の意図を記憶する能力を利用して、人工的な事前生成(prefills)と自身の出力を区別できることがわかりました。
これらの実験すべてにおいて、テストした中で最も能力の高いモデルであるClaude Opus 4および4.1は、一般的に最も高い内省的認識を示しました。しかし、モデル間の傾向は複雑で、トレーニング後の戦略に敏感です。
最後に、モデルが自身の内部表現を明示的に制御できるかを調査し、モデルが概念について「考える」ように指示または奨励された場合に、その活性化を調整できることがわかりました。
全体として、我々の結果は、現在の言語モデルが自身の内部状態に対して機能的な内省的認識をある程度備えていることを示唆しています。今日のモデルでは、この能力は非常に信頼性が低く、文脈に依存することを強調しますが、モデル能力のさらなる改善とともに発展する可能性があります。