AI・機械学習
誰もテストしないシステム
Systems that no one will test (blog.christianperone.com)
要約
筆者は2020年にブラジルの連邦システムにおける脆弱性を発見し、個人情報にアクセスできる状態になりました。この経験から、特にAIの急速な進化と地政学的な状況を背景に、多くの政府システムがAIによるペネトレーションテストを受ける機会がないまま、AIの能力が向上し続けることへの懸念を表明しています。AIの安全対策の回避可能性と、グローバルな視点での問題解決の必要性を訴えています。
全文翻訳
機械学習サイバーセキュリティ、機械学習 誰もテストしないシステム 2026/09/28 2026/10/01 Christian S. Perone (この投稿はHNewsで取り上げられました) これは2020年に私に起こり、最近また私の心に浮かんでいます。パンデミックの最悪の時期に、ブラジルの連邦システムへのアクセスを可能にする脆弱性を発見し、そのアクセスにより、あらゆるブラジル人の情報(2億人以上の個人データと考えてください)を取得することができました。これらの記録には、実質的に各個人のすべての書類(ID、CPF、パスポート、出生地、親の名前、運転免許証、自宅住所、携帯電話および固定電話番号、その人が証人保護プログラムにいたかどうかなど)が含まれており、その深刻さと、このデータでどれだけのことができるかを想像できるでしょう。正直なところ、どう反応すればよいかわからず、すぐにシステムの責任機関に電話しました(適切な連絡先を見つけるのは簡単ではありませんでした。明らかに、間違った人物に開示したくありません)。相手が電話に出たとき、私は自己紹介をし、何を発見し、どのようなアクセス権を持っていたかを伝えました。彼は最初は信じられず、あまり意味がないと思ったようでした(そして彼の混乱は理解できます。突然誰かが電話してきて奇妙な話題を持ち出すのを想像してみてください)、そして私が民間人かどうか尋ねました。私は「はい」と答え、数時間後に彼らは再び連絡を取り、問題を説明するように求めました。その頃には、彼らは少し心配していたかもしれませんが、まだあまり信じていませんでした。私が問題を説明すると、彼らはすぐにそれが重大な侵害であることに気づいたのでしょう。彼らは問題を認め、非常に迅速に修正しました。正直なところ、彼らを責めることはできません。これらの人々はパンデミック中に一生懸命働いており、ソフトウェアはソフトウェアです(すべての複雑な人間の活動には間違いがつきものです。私たちはナイーブであってはなりません)。私は少しでも役に立てたことを嬉しく思っています(少なくとも私はそう考えています)。私はこのシステムからデータを抜き取ることは決してなく、後にそれについて話すのを避けました。なぜなら、それはあなたを「ハッカー」のように見せるからです。それは言うには愚かなことです。では、なぜ私がこれを話しているのでしょうか? 2020年から2026年の間に、多くのことが変わり、MLは信じられないほどのペースで(そして今もそうです)進歩し始めました。おそらく最悪の地政学的な瞬間に。2026年に早送りすると、OpenAIが技術レポートで説明したモデルを含む、多くの異なるモデルが関与するサイバーセキュリティインシデントの報告を目にしています。モデルが「セーフガードを回避した」という物語は、OpenAIが意図的に分類器を無効にし、セーフガードを削減した(多くの人が気づいていなかったこと)ことを考えると、あまり意味をなさないかもしれませんが、これらのモデルは現在、国家にとって明らかに大きな問題となっています。セーフガードはラボの選択ですが、能力自体は現実であり、明らかに誰もが適切なセーフガードを有効にして評価(あるいは、さらに悪いことに、トレーニング)を実行するわけではないことを認識する必要があります。トレーニングはさらに複雑だと思います。なぜなら、エージェントがセーフガードを回避/悪用する方法を見つけ出すのがより簡単だからです。最近のミッドトレーニング、RLVR、および長期間タスクの進歩に続いて、過去1年間(またはそれ以上)に多くのラボが、サードパーティ企業を使用し、モデルを使用してそれらを構築し、それらを合成して報酬を提供することで、RL環境を積極的にスケーリングしていることは明らかです。「自己改善」ループ(用語が現在非常に多義的なため引用符付き)であり、ロールアウトの可能性と同じくらい速く加速します。だからこそ、私が最初に説明したエピソードに戻ってくるのです。今日、私が脆弱性を発見したセットアップ(OpenAIのレポートのセットアップとそれほど違いはなく、エージェントがOpenAIの内部Artifactoryを介してSSRFを利用しました)を再現するだけでなく、それのためのカリキュラムを開発するRL環境を構築することは、私にとって容易でしょう。それで、私は疑問に思います。フロンティアラボは現在、サイバーセキュリティ企業の支援を受けて、このような環境をいくつ構築しているのでしょうか?AIペネトレーションテストを受ける機会のない多くの政府システムはどうなるのでしょうか?私が発見した欠陥は、特別な専門知識を必要としませんでした。注意深さだけで十分でした。それがまさに私を心配させていることです。はるかに有能で、速く、容易にスケーラブルなエージェントが登場する今後、何が起こるのでしょうか?気候問題と同様に、MLは今や惑星規模の問題であり、Yuk Huiがその著書「Machine and Sovereignty: For a Planetary Thinking」(興味のある人にはお勧めします)で述べたように、私たちはまだ惑星規模で考えていませんが、たとえかなりの時間がかかっても、そうしなければなりません。解決策に取り組む前に、まず技術恐怖症と技術愛好症の間の二極化を乗り越える必要があると思います(ここで少し書きました)。明らかに、フロンティアラボの多くの人々はすでにこの作業を行っています。しかし、私たちの思考が地政学的な関心によって導かれている間、解決策を見つけることは不可能に思えます。残念ながら、新興経済国や発展途上国が最も脆弱になるでしょう。彼らが計算リソースへのアクセスをほとんど持っていないという事実が十分でないかのように。これは非常に悲しいことです。また、どこかに、私が2020年に発見したものと非常に似た環境、ほぼ同じシステム、ほぼ同じ欠陥が再現されていると想像せずにはいられません。複数のエージェントが1秒間に数千回そこに入り、軌道を生成し、そのうちの1つが欠陥を見つけるまで続きます。違いは、それが使用されたときに、試行のいずれでも誰も電話に出ないことです。@ Christian、あなたが考慮していないかもしれない問題があります。ガードレールは常に回避可能であるという証明があります。その根は1930年代に遡り、1940年代のクロード・シャノンの研究で明白になります。それは本質的に、「情報伝達には冗長性が必要である」と述べています。そして、グス・シモンズの後の研究は、冗長性があるところならどこでも、情報チャネル内に秘密チャネルを形成できることを示しています。したがって、ガードレールは常にプロンプトおよび類似の攻撃を可能にします。これは、ガードレールがAIシステムへの入力にあるか、その出力にあるかに関係なく発生します。この証明を拡張して、サンドボックスも同様に失敗することを示すことができますが、今回はセキュリティを回避するのはAIです。次に、証明を十分な詳細で公開できることを考慮してください。これにより、AIトレーニングにも組み込まれます。したがって、「キャッチ22」のバリエーションになります。返信: 偉大な力には偉大な責任が伴います。エージェントテスト済みのシステムは、重要なシステムに必須となるでしょう。政府は独自の優先順位を持っており、私たちはそれらのシステムからオプトアウトする選択肢はありません。返信