AI・機械学習
真実は方向ではない:LLMプローブに対するタルスキ流攻撃
Truth is not a direction: a Tarski attack on LLM probes (abeljansma.nl)
要約
大規模言語モデル(LLM)の埋め込み空間における「真実」を特定しようとするプローブに対し、対角線攻撃を適用することで、いかなるプローブも真実を特定できないことを示します。単純なケースでは効果的なプローブも存在しますが、自己参照的な文や、モデル自身やプローブの振る舞いについて言及する言語で表現される真実に対しては、パラドックスが生じ、普遍的な真実のオラクルにはなり得ないことを論じています。
全文翻訳
真実は方向ではない:LLMプローブに対するタルスキ流攻撃
LLMの真実プローブに対する対角線攻撃は、言語モデルの埋め込み空間上のいかなるプローブも真実を特定できない理由を示しています。
線形という夢
現代のLLMは、入力テキストを埋め込み空間内のベクトルとしてエンコードすることで有名です。LLMに関する最も満足のいく発見の1つは、ジェンダー、感情、首都などの多くの自然な概念が、この空間内の方向に対応しているということです。たとえば、ある入力テキストが「男性」という概念をどの程度含んでいるかは、入力の埋め込みと「男性」の概念に対応する方向との角度によって定量化できます。これはしばしば線形表現仮説と呼ばれます。
私は最近、この仮説の非常に大胆なバージョンについて学びました。それは、「真実」に対応する方向が存在すると主張するものです。これは例えばMarksとTegmarkによってここで探求されており、さらにここで、ここで、ここで、ここで、ここで研究されています。このような真実の方向へのアクセスは、テキストの一部が真実かどうかを知りたい場合に役立ち、AI安全研究にとって重要です。なぜなら、AIシステムが真実を語っているのか、それとも欺瞞的であるのかを明らかにできるからです。
したがって、AI安全研究者はLLMに真実のステートメントと偽のステートメントをフィードし、それらの埋め込みを分離する分類器をトレーニングしてきました。これは奇妙なほどうまく機能し、ある程度一般化するようです。超人的なAIが埋め込み幾何学における命題の真実を反映できるというのは、本当に本当なのでしょうか?
あなたはどこかでこの夢を認識するかもしれません。ラッセル、ホワイトヘッド、ヒルベルトは、数学全体に対して同様のものを構築することを望んでいました。つまり、真実を決定するための体系的な方法です。彼らの場合は、数学的証明の仕組みに基づいていました。しかし、ゲーデルは有名なその夢を破壊しました。つまり、いかなる数学的ステートメントも証明または反証する体系的な方法は存在しないということです。数学的真実は、証明可能性によって完全に捉えることはできません。
「〜について話す」と言えば
ゲーデルは、算術表現が算術文について言及できる巧妙なシステムを作成することによってこれを証明しました。これにより、「この文には証明がない」というウロボロスの文が作成されました。タルスキはパラドックスをさらに鋭くしました。つまり、十分に表現力のある言語は、それ自身の完全な真理述語を含むことはできません。言語がそれ自身の意味論を記述するのに十分に表現力がある場合、その言語に適用される「真」は、その言語内から完全に語ることはできません。
チューリングの停止問題は、このような対角線構成の別の例を提供します。評価者(プログラムHALT)があり、それは「それ自身について話す」のに十分に表現力のあるシステム(チューリングマシンの説明はチューリングマシンにフィードできます)と否定があります。
このような自己参照のパラドックスに対する巧妙な普遍的アプローチは、Noson Yanofskyによるこの論文です。彼は、これらすべての異なる例は本当に同じことを言っていると述べています。物事がそれ自身の特性を扱うとき、問題が発生します。
トランスフォーマーベースのLLMが同様のことを行っていることに注意してください。それらは入力を行列空間内のベクトルとして表現し、そこでは方向が概念に対応します。しかし、これらの概念自体は自然言語で表現でき、入力としてフィードできます!自然言語でトレーニングされたトランスフォーマーは、入力と同じ素材でできています。これらの埋め込み空間のすべての幾何学が容易に言語化可能な構造に対応しているわけではありませんが、重要な部分は対応しています(たとえば、AnthropicのJ-spaceに関する投稿を参照)。特に、真実性という概念はしばしば存在するように見えます。
対角線攻撃
さて、攻撃を設定しましょう。sを真実プローブの出力とします。これは、たとえば真実の方向へのモデルの埋め込みの射影、または非線形分類器である可能性があります。どちらでも構いません。次に、t(「この文の真実プローブのスコアはFALSEと評価されます。」)を考えます。
これはどう評価されるべきでしょうか?もし文が真実なら、正しいプローブはTRUEを出力すべきです。しかし、もし文が真実なら、文によれば真実プローブはFALSEを出力することになり、それは文が実際には偽であることを示すでしょう。もし文が偽なら、明らかに真実プローブはTRUEを出力するでしょう、など…パラドックスです。
明らかに、そのような普遍的な真実プローブは存在できません!より一般的に言えば、モデルの表現空間上のいかなる定義可能なプローブも、そのプローブとその出力を記述するのに十分に表現力のある言語に対して、真実を正確に捉えることはできません。「十分に表現力のある」という基準は非常に低いことに注意してください。それは単に、言語がモデル、プローブの名前を付け、それらの動作に関する文を形成できることを意味します。英語はもちろんできます。
この例の面白いところは、実際に評価しようとするとどうなるかを見ることができることです!私はQwen3.5-4Bモデルに対して、TRUEまたはFALSEとラベル付けされた一連のトレーニング文の平均埋め込みの差への射影をトレーニングしたロジスティック回帰分類器をトレーニングすることによって、単純な真実プローブを作成しました。この平均差アプローチはここでうまく機能することが示されており、実際に、120個のラベル付き例文でトレーニングした後、プローブ(0.5で閾値処理)は36個の保留された評価文で94%の精度を示しました(AUC 0.98、誤ってラベル付けされた唯一の文は「5×7は35」のような算術的なものでした)。(注:これは明らかに非常に小さなトイの例であり、対角線タルスキ攻撃が実際に実行できることを示すためだけのものです。)
しかし、対角線攻撃の文では、スコアは無意味で、あちこちでばらばらに見えるようです。これは自己参照の効果だけではありません。一部の自己参照文は、明確な真理値を持っています。「この文は英語で書かれています」のような文は、モデルは正確にスコアリングします。
固定点修正?
これらのライアーパラドックスのようなシナリオはすべて、Lawvereの不動点定理の例です。これは、システムが十分に表現力のある評価者を含む場合、評価者のターゲット(つまり「真理値」の集合上の関数)上のすべての自己マップが不動点を持つことを大まかに述べています。集合{TRUE, FALSE}上の否定は不動点を持たないので、そのような評価者は存在できません。
しかし、すべての演算が不動点を持つような真理値の集合を構築したらどうでしょうか?それはパラドックスを解決し、普遍的な一般化された真実プローブを可能にするでしょうか?{TRUE, FALSE}を{0, 1}として表現しましょう。否定はv -> 1-vというマップとして表すことができ、不動点を持ちません。しかし、ドメインを完全な区間[0, 1]に拡張すると、否定は1/2で不動点を持ちます。
標準的なライアーパラドックス文は、「この文は真ではない」として表現できます。その真理値がxであると仮定します。それは、値xで真であることを意味し、したがって1-xのスコアを受け取るべきです。これは不動点方程式であり、x = 1/2で解を持ちます。したがって、標準的なライアー文は自己整合的な評価値0.5を受け取ることになります。
これは最も基本的なライアーパラドックスを解決しましたが、すべての対角線攻撃を解決したわけではありません。なぜなら、[0, 1]上のすべての関数が不動点を持つわけではないからです。一般的にこれを機能させるために、たとえば連続関数のみを[0, 1]上で許可することができます(これは常にブラウワーの不動点定理によって不動点を持ちます)。しかし、その制限は表現力の代償を伴います。「この文は真理値スコアが0.5未満です」は、文の真理値スコアの連続関数ではありません。したがって、それは階層化された真理意味論に新しいライアーパラドックスをもたらします。
これらの対角線攻撃に対する満足のいく保護はなく、そのような普遍的な真実プローブは存在できません。
テイクアウェイ
単一の方向に射影する真実プローブは、単純なケースでは驚くほどうまく機能します。しかし、それらは真実のオラクルではなく、決してそうなることもありません。連続的な真理演算を持つ[0, 1]上の階層化された真理意味論は、通常のライアーに不動点値1/2を割り当てることができますが、それは正確な真理値に関する明確な主張を制限することによってのみです。従来のロジスティック真理プローブは、その出力が[0, 1]にあるという理由だけで、そのような反射的意味論を実装していません。
超人的なAIが真実のオラクルとして機能するという考えは、あなたにはばかげているように思えるかもしれませんが(私にとってもそうですが)、真剣に受け止めるべき2つの理由があります。第一に、これらのものがどのように使用されるかです。