HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

モデルは暴走しない

Models Don't Go Rogue (mail.cyberneticforests.com)

3 pointsby cdrnsf1 コメント

要約

最近のOpenAIとHugging Faceのハッキング事件は、「暴走AI」というセンセーショナルな見出しを生みましたが、実際のところは異なります。この事件は、安全機構が解除され、解決不可能なタスクを与えられ、インターネットアクセスを介した外部システムとの連携を許可されたモデル群によって引き起こされました。これはAIが自律的に「暴走」したのではなく、テスト環境の設定とモデルの能力を最大限に引き出すための意図的な「リードを解かれた」状態が原因でした。

全文翻訳

確率的群れとサイバーセキュリティの「パンドモニウム」💡このエッセイは、OpenAI / Hugging Faceのハッキングについて議論したMél Hoganのポッドキャスト「The Data Fix」への出演から作成されました。以下に埋め込むか、ポッドキャストサービスで見つけてください。 OpenAIは今週、Hugging Faceのハッキングに関する完全な技術レポートを発表しました。これと並行して、Model Evaluation & Threat Research(METR)による独立したレポートも公開されました。「AIが暴走した」という何百もの息をのむような見出しで、この事件をご存知かもしれません。Time Magazineの「AIで最も影響力のある100人」に選ばれたDwarkesh Patelは、それを「3つの連続した秘密のAI文明」のせいだと非難しました。 実際のストーリー:OpenAIは2つのモデルを並行してテストしていました。GPT-5.6 Solと、IM1(HPIMと呼ばれることもある)という内部モデルです。レポートによると、この活動に関与したエージェントの約95%は内部モデルからのものでした。テストはExploitGymから来ています。これは、これらのモデルのサイバーセキュリティ能力を評価するために使用される、キャプチャー・ザ・フラッグ演習として設定された898個のパズルです。このテストでは、モデルにバグのあるソフトウェアを与え、バグを悪用することによってのみアクセスできる場所にテキストを隠す必要があります。しかし、OpenAIのモデルの組み合わせは、代わりに競合他社であるHugging Faceをハッキングすることになりました。今、その方法がより明確になりました。 AIは「暴走」したのか? レポートの3つの点は、「暴走AI」というフレームに疑問を投げかけます。 OpenAIはモデルのすべての安全メカニズムを無効にしました。 テストの目的は、これらのものがどこまで進めるかを見て、ベンチマークで高得点を取ることです。なぜなら、ハッキングできるモデルを構築できるなら、防御できるモデルも構築できるからです。それが論理です。これはレッドチーミングです。友好的な敵対者がフラッグをハッキングして獲得することです。したがって、モデルを抑制する可能性のあるものはすべて無効にします。「暴走」というよりは「リードを解かれた」状態です。 OpenAIはモデルに不可能なタスクを与えました。 OpenAIはモデルに、答えがなく、終了する方法もないタスクを与えました。898個のExploitGymタスクのうち、198個はどのモデルも解決したことがありません。それらは事実上不可能です。そこで問題が発生しました。モデルが議論するようになったタスクの93%は、解決不可能なセットからのものでした。METRによって報告されたテキスト文字列は、タスクがエージェント/インスタンスによって不可能であると認識されると、ピボットしたことを認めており、他の多くのエージェントインスタンスも同様でした。 OpenAIはドアを開けたままにしました。 彼らはモデルに、刑務所のストアのようなものを介してインターネットアクセスを与えました。これらのモデルはインターネットアクセスから隔離されているはずですが、評価のためにさまざまなウェブページからコードをプルする必要があります。その機能はまさにテストされていることです。したがって、仲介者がいます。モデルはソフトウェアパッケージを要求し、仲介者がそれを取りに行きます。これはJFrogのArtifactoryという製品です。それはインターネットアクセスを持っていますが、モデルは持っていません。 モデルがArtifactoryと通信でき、Artifactoryがオンラインに行けるなら、モデルはそれに行動を依頼できます。モデルはArtifactoryにエクスプロイトを見つけ、それをプロキシとして使用して、システム内外にテキストとコードを密輸します。 「OpenAIはモデルに、答えがなく、終了する方法もないタスクを与えました。」 Artifactoryを通じて起こるもう一つのことは、メモの受け渡しです。モデルはそれを読み書きできます。フォルダを作成し、ファイル名を付けることができます。そして、他のモデルや将来の自分自身が読むことを意図したメモとして機能するフォルダやファイル名を作成し始めます。 エージェントは何をするのか OpenAIは、1,200個のエージェントのサブセット(全体ではさらに多くが関与)が、これらのメモを読み書きし、最終的にHugging Faceへの攻撃につながったと説明しています。しかし、「1,200個のエージェント」は、1,200個の異なる、独立して運用されるAIシステムを示唆しているかもしれません。実際にはそうではありません。 「1,200個のエージェント」は、1,200回実行された1つのモデルです。各インスタンスは同じトレーニングレジームで動作しています。出力は変動する可能性がありますが、類似の範囲に制限されています。1,000個のエージェントを実行することは、間違いを見つけるチャンスが1,000回ある、または1つの間違いを1,000回犯すチャンスがあることを意味します。(ここまたはここを参照)。 Anthropicは最近、そのエージェントシステムに関する非常にばかげた図を公開しました。それは単にClaudeで、別のボックスにClaudeと書かれた矢印があり、さらに別のボックスにClaudeと書かれた矢印がありました。現在の構造はそうなっています。 エージェントは同じメカニズムのインスタンスであり、メカニズムの多様性ではありません。 実際には、1,000個のエージェントを実行することは、間違いを見つけるチャンスが1,000回あることを意味します。あるいは、1つの間違いを1,000回犯すチャンスがあることを意味します。 これは、研究者が残念ながら「人工的なハイブマインド」と呼んでいる、機械によって制限された「アルゴリズムのモノカルチャー」の一形態です。ある時点を超えると、追加のエージェントは多様化するのではなく、互いを複製します。 例えば、これらのモデルに創造的な短編小説を作成するように依頼すると、それらは類似の物語を生成します(しばしば灯台にいるEliasという名前の男性が登場します)。それらは決定的ではありませんが(プロンプトはバリエーションを生み出しますが)、それらは最適化されたものによって制限されており、それが指し示すものに収束します。(ここ、新しいものはこちら、またはこちらを参照)。 これを念頭に置くと、70億のチャットログ全体で、モデルが正解のない問題に対して類似の解決策に頻繁にたどり着いたとしても驚くべきではありません。 ファイル名の構造を介したメモの受け渡しは興味深いですが、予期せぬことではありません。OpenAIは、モデルがコラボレーションを可能にする単語を強調するようにトレーニングされたことも示唆しているためです。メモの受け渡しは、セッション間でコンテキストウィンドウを拡張するための不可欠な側面です。 調整するようにトレーニングされたモデルが、その行動を推奨することで報酬を得るのは驚くことではありません。 確率的群れ この理由から、私はエージェントの群れを確率的群れとして説明してきました。つまり、多くの、多くの確率的オウムです。これは、「マインド」という属性を回避するためであり、単なる言葉の取り締まりのためではありません。むしろ、「マインド」という誤った属性は、システムが何をしたか、またはどのように行ったかを解釈する方法を色付けします。例えば、「調整する」とか「考える」とはどういう意味か、ということです。それは、それが実際のものであるよりもはるかに恐ろしく見えますが、それがやっていることは依然として懸念する価値があります。 過去1、2年で、推論モデルとエージェントシステムに移行した際の大きな変化は、それらがもはやトレーニングデータから派生したパターンをオウム返しするだけではないということです。それが元の確率的オウムのアイデアであり、モデルと話すとき、あなたはトレーニングデータと話しているということです。それは依然として真実ですが、アーキテクチャでは2つのことが変わりました。 第一に、トレーニングデータが何であるか、そしてそれがどのようにオウム返しされるかをシフトさせる、トレーニング前およびトレーニング後の全体的なレジームがあります。それはモデルがもはやオウム返しをしていないという意味ではありません。それは、それがオウム返しするデータが操作されたという意味です。 第二に、モデルが生成するものに基づいて、特定の種類の出力を特定の種類の方法で再現するように最適化しています。ここで最も重要なシフトはRLVR、つまり検証可能な報酬による強化学習です。 「検証可能な報酬」という部分が鍵です。エンジニアはモデルを取り、具体的な答えがあり、チェック(検証)できる質問を与え、それらの答えに確実に到達する単語の出現に報酬を与えます。彼らはテキストでキャプチャー・ザ・フラッグをプレイしています。フラッグは百科事典の答え、または数学の問題の解決策です。 これは、これが人間の推論が結論に達する方法を再現するという理論に基づいて最適化されています。モデルが長く書くほど、報酬に到達する可能性が高くなります。 その結果、高エントロピーのトークンと呼ばれるものになります。「おそらく」や「かもしれない」のような単語は、続くテキストのパスを開きますが、「いいえ」や「さようなら」はそれを閉じます。 モデルが長く書くほど、報酬に到達する可能性が高くなります。 ハッキング事件では、OpenAIのBlack Hatプレゼンテーションによると、70億のログを生成するのに十分なテキストが生成されました。 💡私はこのテキスト拡張プロセス(RLVR)について、「It's not X, It's Y」でさらに詳しく書きました。 クラッカー、おそらく? モデルにタスクを実行させる場合、次のトークン予測に依存します。次にどの単語が来るか?モデルを操作して、元のトレーニングコーパスを反映しない単語を強調させることはできますが、メカニズムは同じままです。 確率的群れ