セキュリティ
ポスト・ミトス時代のサイバーセキュリティ:落ち着いて、いつも通りに
Post-Mythos Cybersecurity: Keep calm and carry on (cephalosec.com)
要約
AnthropicのClaude Mythos Preview発表後、サイバーセキュリティ業界では大きな動揺が広がりました。Mythosは、ゼロデイ脆弱性の自動ハンティングと悪用を可能にする画期的な技術として喧伝されましたが、すぐに提供が中止されました。この記事では、Mythosが業界に与える影響を冷静に評価し、既存のセキュリティ対策の重要性を再認識しています。高額なコストや米国政府による利用制限など、Mythosの現実的な側面が明らかにされ、AIによる脆弱性発見が既存のサイバーセキュリティ戦略を根本的に変えるものではないと結論付けています。
全文翻訳
Claude Mythos Previewの発表以来、サイバーセキュリティ分野では多くの動揺した議論を目にしてきました。これは、同分野におけるゲームチェンジャーであり、そのリーグをはるかに凌駕し、ゼロデイの完全自動ハンティングと悪用のパンドラの箱を開けるものとして発表されました。その後、Mythosとそのセーフガード重視の同等品であるFable 5がリリースされましたが、すぐに提供中止となりました。この機会に、このモデルが何をもたらし、業界にどれほどの影響を与えるかを考察してみましょう。
落ち着いて
不安、不確実性、そして疑念がサイバーセキュリティ業界を煽る
Anthropicは、広報において常にドラマチックな表現を好んできました。主要なモデルがリリースされるたびに、その安全性に関する懸念が伴い、手遅れになる前に規制や研究の一時停止が求められます。Mythosもこの傾向の例外ではなく、4月に発表されましたが、一般公開はされませんでした。その代わりに、プロジェクトGlasswingが発表され、モデルへのアクセスが50の組織に制限され、後に150の組織に拡大されました。これらの幸運な少数の組織の一部は、Anthropicの警告的な声明を裏付けました。彼らはMythosのおかげで数百の脆弱性が検出されたと発表しました。このトピックに関する最も影響力のある記事の1つは、英国政府のAIセキュリティ研究所による評価でした。Mythosは、「エキスパートレベルのタスク」で成功した最初のモデルでした。また、偵察から完全なネットワーク乗っ取りまでの攻撃チェーン全体をテストするサイバーレンジ「The Last One」を達成した初のモデルでもありました。
この記事を詳しく読むと、それほどドラマチックではない状況が描かれています。以前のモデルからの進歩はあるものの、この分野の進歩は非常に漸進的でした。GPT-5.4やOpus 4.6が、Advanced CTF Challengeでそれほど遅れていないことがわかります。Opusのサイバーレンジについても同様です。これらのベンチマークは、少なくとも成熟したサイバーセキュリティプログラムと専用のSOCを持つ企業にとっては、現実的な企業環境とはかなりかけ離れている可能性もあります。記事が強調するように、「それらは、アクティブな防御者や防御ツールなど、しばしば存在するセキュリティ機能を欠いています。また、モデルがセキュリティアラートをトリガーするような行動をとってもペナルティはありません。」このようなモデルが、偵察タスクやターゲットの情報システムへのピボットを試みる際に、非常にノイズが多く、不器用であることは間違いありません。
「確かに、しかし、モデルがオフラインで見つけられるすべての重大な脆弱性についてはどうですか?それらは、強力なゼロデイとして攻撃者によって悪用される可能性がありますよね?」と尋ねるかもしれません。この側面は、Project Glasswingの主なマーケティング論点であり、「OpenBSDの27年前の脆弱性」や「FFmpegの16年前の脆弱性」といった例が挙げられました。セキュリティ専門家は、このような声明を読むと苦笑するでしょう。脆弱性が運転できるほど古いと強調するのは、CVE発表における非常に一般的なクリックベイトのトリックであり、古典的な「CISAが連邦政府にXをパッチするよう命令」に次ぐものです。何十年も前の脆弱性が、何十万行ものコードを持つオープンソース製品に存在することは珍しくありません。ほとんどの場合、それは単に、それを発見するのに十分なスキルを持つ人がこれまでその領域を調べていなかっただけを意味します。古いバグは、サポートソフトウェアのより多くのバージョンに影響を与えるため、より価値がありますが、それは最初に見つけるのがどれほど難しかったかとは関係ありません。ただし、AI支援による発見がそれらの蔓延を増加させることは事実です。
Mythos、古いモデルの単なる漸進的な改善か?
Mythosの最大の変化は、このような網羅的な検索を行うための潤沢な資金を持つ組織のスケーラビリティの可能性です。Anthropicのレッドチームのブログ記事は、彼らがどのようにしてそのような結果を達成するかのより詳細な洞察を提供しており、それは間違いなく費用がかかるでしょう。モデルは、ほとんどのソースコードファイルに対して個別に複数回実行されました。BSDバグを発見するために、彼らの足場を千回実行し、約20,000ドルの費用がかかりました。Glassingプロジェクト全体には、1億ドル相当のトークン予算が割り当てられています。これは新しいリスクをもたらすのでしょうか?はい、しかし、おそらく最初から高度なサイバーセキュリティリソースを持っていたアクターにとってであり、平均的なスクリプトキディではありません。
もし同じ徹底的な実験の恩恵を受けていれば、以前のモデルでもこれらの脆弱性の一部を発見できたかもしれません。AnthropicがMythosをどのように実行したか(または各発見に対して何回実行したか)に関する詳細が乏しいため、公平な比較を行うのは困難です。しかし、公平かつ費用対効果の高い代替手段でこのコンセプトを再現しようと試み、いくつかの有望な結果を得た人もいます。要するに、MythosやOpusモデルがない場合でも、DeepSeekはクラウドホスティングの世界でまともであり、Gemma 4とQwen 3.6はセルフホスト可能なカテゴリでその能力をはるかに上回り、Mythosがベンチマークで発見した脆弱性の約半分を発見しています。
しかし、私は、秘密はモデルではなくハーネスにあると主張したAisleと同じくらい深くは踏み込みません。彼らも、はるかに小さいLLMを使用してMythosが最初に発見した多くの脆弱性を「検出」することに成功しましたが、これらのモデルのどれも有効なエクスプロイトを作成することはできませんでした。警告を発するだけでなく、実際に悪用可能性を証明する能力は、Mythosクラスのモデルのみが共有する明確な利点です。これは、以前のAI主導のバグハンティングの最大の欠点の1つであった誤検知も解決するようです。これは、Project Glasswingの最初の更新で指摘されており、Mozillaは271件の発見において非常に低い誤検知率を主張しました。同様に、Cloudflareは誤検知率を「人間のテスターよりも優れている」と評価しました。これらの主張が検証されるかどうかは、時間(とより広範なアクセス)だけが教えてくれるでしょう。そうでなければ、平均的な組織は、このツールを使用する際に、サイバーセキュリティノイズの海に inevitableに溺れるでしょう。
米国政府がAnthropicの進行を阻止する一方で、OpenAIが追いつく
この混乱の最中、私たちは米国政府からの予期せぬ「中断」を受けました。彼らは、米国内にいる非米国市民を含むすべての非米国市民に対し、Fable/Mythosをブロックすることを決定したのです。これはAnthropicに提供を完全に停止させるという不可能なタスクでした。これがいつまで続くかは誰にもわかりません。余談ですが、Anthropicが長年蒔いてきたものを収穫するのを見るのは、ある種の皮肉です。つまり、利用を管理し、AI競争を遅らせるための政府の関与を強めることです。これは可能な限り鈍重な方法で実行されました。
一方、OpenAIはこの分野でGPT5.5-CyberとCodex Securityプラグインで進歩を続けています。彼らもGlasswingに相当するプロジェクト「Daybreak」と「Patch the Planet」を持っていますが、煽り立てる側面を抑え、防御側に焦点を当てています。これも制御されたリリースであり、米国の規制当局を刺激しないようにしているのでしょう。Anthropicの状況が落ち着くか、非米国の競合他社が先にギャップを埋めるまでは、これらの製品をすべての顧客ベースに解き放たないと考えるのが妥当です。私はこのアプローチに不満を感じずにはいられません。一般企業は5.5-Cyberにアクセスできませんが、大手サイバーセキュリティ企業はアクセスし、それをプレミアム価格で自社の顧客に販売しているのです。言い換えれば、責任ある展開という名目で偽装された人工的な希少性です。
この減速を利用して、嵐が再び来たときに砦を守るために何ができるか、再編成して焦点を当てましょう。
更新(2026-06-27):状況は急速に変化しています。OpenAIは、Sol、Terra、Lunaという新しいモデルファミリーをリリースしており、サイバーセキュリティの能力に重点を置いたPRを行い、Mythosと比較しています。5.5-Cyberと同様に、このモデルはエクスプロイトを構築するのではなく、防御に偏るように作られています。これらのセーフガードは、新しいモデルにアクセスできる機関を審査したい米国政府には十分ではないようです。これはAnthropicにも適用され、Mythosはまず100の米国機関に開放されます。
続ける
これらの恐れ、不確実性、そして疑念の一部が現実味を帯びてくる中で、私たちはどうすればいいのでしょうか?逆説的に、私は長年やってきたことをほとんど変える必要はないと考えています。
「AIはすでに家にある」
私たち凡人はMythoにアクセスできないかもしれませんが、