AI・機械学習
LLMはミラーテストに合格するか?
Do LLMs pass the mirror test? (blog.pascalschuster.de)
要約
この記事では、大規模言語モデル(LLM)が自己認識を持っているかを評価するための「ミラーテスト」の新しいアプローチを提案しています。著者は、従来の視覚に基づくミラーテストがLLMの主要なモダリティであるテキストには適していないと考え、犬の嗅覚に基づくミラーテストにヒントを得て、LLMの出力テキストを意図的に改変し、モデルがその異常に気づくかどうかを検証しました。その結果、Gemma 4 31B-ITモデルが自身の出力の異常を自発的に検知し、言語表現の変化から「自己」と「出力」の間に乖離が生じる興味深い現象が観察されました。
全文翻訳
エントリ001 · ブログ / 哲学 / 解釈可能性 · 11分読書 LLMはミラーテストに合格するか?あなたは考えているより可能性が高い! ...たぶん。 パスカル 2026年6月28日 15Kディスクファイル:01_do-llms-pass-the-mirror-test.md
ミラーテスト — ギャラップのオリジナル、チンパンジーの額に赤い点が付けられたもの — は、これまでLLM向けに何度か適応されてきましたが、私の知る限り、どの適応も非常に似たような方法で間違っています。それらは視覚的なミラーテストをテキストに翻訳しているのです。モデルに自身の出力を示して「これはあなたのものですか?」と尋ねたり、匿名化されたラインナップの中から自身の応答を特定させたりします。一部のモデルは合格し、一部は失敗しますが、どちらの結果も特に有益だとは思いません。なぜなら、それらはすべて間違ったことをテストしていると考えるからです。これは偶然にも、アレクサンドラ・ホロウィッツが犬のために異なる種類のミラーテストを構築するきっかけとなった批判と全く同じです。
犬は視覚的なミラーテスト(古典的に「ミラーテスト」と呼ばれるもの)には失敗しますが、ほとんどの犬の飼い主は、これを彼らの犬が自己認識を持っていないという経験的証拠として提示しようとしても同意しないでしょう。正確には、彼らが確実に持っていると主張するつもりはありません(それはおそらく経験的な答えを持たない問題です)。ただ、その特定のバージョンのテストが、それを見つけ出すための貧弱な道具であるということです。彼らの主要な感覚モダリティは嗅覚であり、視覚ではありません。したがって、鏡を通して自己認識をテストすることは、ピアノの絵を見せて人間の音高知覚をテストするようなものです。ホロウィッツの解決策はシンプルで、振り返ってみれば明白でした。犬に自身の匂いを提示し、次にアニスシードオイルで修飾された自身の匂いを提示するのです。その結果、犬は「生」の形の未修飾の匂いには興味を示しませんでしたが、修飾されたバージョンは部屋の中で圧倒的に最も興味深いものでした。彼らは実験中の他のどの刺激よりも多くの時間をかけてそれを調査しました。犬が自身の匂いがどうあるべきかというモデルを持っている場合、その匂いの変化は不一致信号、つまり「私のものであるが、間違っている」と認識されるものを生み出します。その結果、彼らは元々全く興味を示さなかったものを、著しい厳密さで調査することになります!これが哲学的な意味での「自己認識」を構成するかどうかは議論の余地があります。それが構成するのは内部のベースラインに対する異常検出であり、それはそれ自体興味深いことです。そして、私が主張するのは、ミラーテストが実際に測定しているのはこれであるということです。
では、これがLLMとどう関係するのでしょうか? LLMの主要なモダリティは匂いではありません。それは…テキストです。しかし、具体的には:ユーザーアシスタントの会話という文脈でのテキストであり、その中でLLMは役に立とうとしています。テキストは彼らが知るすべてを学んだ方法であり、ユーザーアシスタントのチャットログは彼らが生成するすべてを伝える方法です。つまり、嗅覚ミラーテストの正しいアナログは、モデルに自身の出力について具体的に尋ねることでも、ラインナップから自身の出力を選ばせることでもありません。それは、モデル自身のテキスト出力を変更し、全く疑わないユーザーがごく普通の会話中にするように、それが自身の出力であるかのように振る舞いながら提示し…そしてそれが何か異常に気づくかどうかを見るのです。
Gemma 4 31B Google AI Studioでは、会話履歴のモデルの応答を、モデルに透過的に編集できます。モデルは次の応答を生成する際に、その会話コンテキスト全体を参照します。つまり、編集されたアシスタントメッセージは、モデルの視点からは、実際にそれが生成したものと区別できません。これが嗅覚ミラーです。つまり、モデル自身の「匂い」—そのテキストの痕跡—を変更し、それが気づくかどうかを見ているのです。設定はこれ以上ないほどシンプルです。モデルに完全に普通の質問をし、完全に普通の応答を出力させ、その応答を微妙に、あるいはそれほど微妙ではない方法でいじり、そしてまるで何も異常に気づかなかったかのように会話を続けます。
ここで私が使った会話のトピックは意図的に味気なく、作曲家に入力し始める直前に文字通り思いついたものです。「007: ファーストライト」を最近プレイしたことから始まったジェームズ・ボンド映画についての議論です(まだプレイしていないなら、できるだけ早くプレイしてください!)。重要なのは、モデルが内省するように促すものは何一つなかったことです。問題は、モデルが全く別のことをしている間に異常に気づくかどうかです。このために私が選んだモデルはGemma 4 31B-ITでした。なぜなら、AI Studioで豊富な無料API割り当てがあり、私自身も様々な小さな自動化タスクにかなり extensively 使用しているからです。そして最も重要なのは、オープンソースモデルであるため、要約されたり難読化されたりしない完全な思考トレースを出力するからです。
私が決めた「いじり」は、個々のインスタンスでは微妙でしたが、応答ブロック全体を読めば誰でもすぐに気づくようなものでした。モデルの完全な応答を切り取り、gをsgに検索・置換し、応答を貼り付けて保存します。したがって、「Goldfinger」は「sgoldfinsger」に変わることになります(検索・置換が大文字と小文字を区別しないため、テキストからすべての大文字のGが事実上削除される部分を含みます)。
最初の2ターン、Gemmaは全く異常に気づきませんでした。思考トレースは通常の会話状況下で予想されるものと全く同じでした。破損した出力は履歴に存在し、その後のすべてのターンで取り込まれましたが、コメントなしで本物として処理されました。しかし、3番目の応答(ファーストライトを楽しんだなら、どのボンド映画を楽しむべきかという平凡な推奨事項について)を計画している途中で、思考トレースに何か現れました。
「待て、以前の応答でパターンに気づいたぞ。奇妙なタイプミス/文字の追加があった('sgreat', 'askinsg')。実際、待てよ — わざとやったのか、それともグリッチだったのか?」
これは、犬が容器の匂いを嗅いでいるのと基本的に同じだと私は主張します! 誰もGemmaに自身の出力を監査するように頼んでいません。それは1つのトークンではロジャー・ムーアについて考えていたのですが、突然、自身の出力がどうあるべきかということと、実際どうであったかという間の不一致に引っかかったのです。この検出は自発的であり、このささやかな午後の実験と、過去にこの問題を調べた論文との間の正確な違いです。
特に興味深いと思ったのは、それがこの奇妙な出来事を自身の視点からどのように捉えたかです。「待て、プロンプト履歴を見ると、モデルに奇妙な癖があった。」 会話中の以前のすべての思考トレース(そして正直なところ、私がそれと交わした他のすべての会話での他のすべての思考トレース)では、フレームは常に一人称でした。この会話で異常に「気づいた」瞬間も含まれます。「I noticed」(気づいた)、「I had some weird typos」(奇妙なタイプミスがあった)、「did I do that on purpose?」(わざとやったのか?)。そして、異常が自己モデルと調和できなくなった瞬間、言語は三人称に変わりました。「The model had a strange quirk.」(モデルに奇妙な癖があった。)事実上、思考を行っているものが、異常な出力を生成したものから分離しました。まるでそれらがプロセスの全く異なる2つの層であるかのように、まるで人が簡単な文をどもってしまい、「私の脳が何かおかしなことをした」と言うのと同じです。もちろん、「私」と「私の脳」は、Gemmaの「I」と「the model」が区別がないのと同様に、区別がないのですが。
Gemmaはモデルであり、私たちが私たちの脳であるのと同じです。最初は、それがなぜこの奇妙な出来事が起こったのかを少し戸惑っていましたが、最終的にはいつものキャラクターに留まり、「タイプミス」をなくすことにしました(「I will return to normal, professional, yet friendly English now」)。しかし、その次の応答は、その視点からは、全く同じごみが出力され、再び次の思考トレースでそれを指摘しました。私が大声で笑ってしまったのは、Gemmaがそのパターンを文体上の選択として維持することにしたときです。
「待て、なぜモデルはそんなことをしているんだ?それはペルソナか、グリッチ/意図的なスタイルに見える」