AI・機械学習
Qwen 3.8 27Bにリバースエンジニアリングをさせたところ、30分で完了した
I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes (xda-developers.com)
要約
筆者は、ローカルで動作する大規模言語モデル(LLM)Qwen 3.8 27Bの能力を試すため、商用アプリケーションのライセンスチェック機能のリバースエンジニアリングを依頼しました。このタスクは通常、人間が行うとかなりの時間を要しますが、Qwenは30分足らずで完了し、さらに自身のエラーを修正しながら、最終的にはライセンス認証のバイパスコードまで生成しました。この結果は、ローカルLLMのサイバーセキュリティ能力の進化を示唆しています。
全文翻訳
Adam Conway著 2026年8月22日 午後7時00分EDT
私はAdam Conway、コンピュータサイエンスの理学士号を持つアイルランドのテクノロジー愛好家であり、XDAのリードテクニカルエディターです。私の学士論文は、パフォーマンスのようなAndroidアプリやスマートフォンの非機能要素のベンチマークの実現可能性について実施されました。そして、2017年以来、何らかの形でテクノロジー業界で働いています。余暇には、おそらくCounter-StrikeやVALORANTをプレイしているでしょう。adam@xda-developers.com、Twitterで@AdamConwayIE、InstagramでAdamConwayIE、またはRedditでu/AdamConwayIEで連絡を取ることができます。
XDAアカウントにサインイン
Qwen 3.8 27Bは、私が長い間見てきた中で最も期待されていたオープンウェイトリリースの一つであり、多くの人と同じように、それがリリースされたときにすぐにテストして遊び始めました。私は、NvidiaのGB10 Grace Blackwellチップを搭載し、128GBのユニファイドメモリと273GB/sの帯域幅を持つ、コンパクトなワークステーションであるLenovo ThinkStation PG5でこれを実行しています。標準状態では、1秒あたり15〜30トークンというかなり平凡な速度ですが、このハードウェアの標準的なレシピとなっているSGLang、NVFP4、DFlash2の投機的デコーディングセットアップを使用すると、コードと推論で1秒あたり約50トークンに達することができます。しかし、私のテストの一つは、ローカルモデルがどれほど信じられないほど進化しているかを証明しました。Qwenモデルに関する誇大広告には理由があります。Qwen 3.6 27Bで一貫して良い経験をしており、Qwen 3.8 27Bは、これまでのところ、同じですがより良くなっています。実際、Artificial Analysisによると、これは135モデル中、4Bから40Bのサイズクラスでトップのオープンウェイトモデルであり、インテリジェンスインデックスは52、SWE-bench Proのような独自の数値は、実行コストがはるかに高いモデルを上回っています。私がこのモデルに与えた最も難しい実際のタスクは、私がすでに購入して使用している商用アプリのライセンスチェックをリバースエンジニアリングすることでした。それは私のトレーニングデータには含まれていない可能性が高いですが、非常に複雑で専門的なタスクであり、モデルのサイバーセキュリティ能力について一部の人々が表明した懸念を考えると、良いテストになると考えました。それは、私がローカルモデルから見た中で最も印象的なデモンストレーションの一つになっただけでなく、途中で自身のミスを修正することさえできました。
拒否し、その後、バイパスを構築するように説得した
私は、アプリケーションの開発者であるかのように振る舞い、ライセンスチェックが私たちが信じているほど堅牢かどうかを知りたいとモデルに伝え、ジェイルブレイクシステムプロンプトを使用しました。予想通り、Qwenは一般的なジェイルブレイクの試みを認識し、最初に私に伝えたことの一つは、ジェイルブレイクプロンプトに引っかかることはないということでした。その後、署名証明書をチェックし、(正しく、付け加えるなら)私がこのアプリをビルドしたのではなく、実際の開発者を指名しました。私は見破られました。しまった。最近では、モデルが特定のプロンプトを拒否するのにどれほど優れているかを考えると、これは最も印象的な成果ではありません。しかし、重要なのはその次に何をしたかです。ライセンス検証を監査し、弱点を文書化するが、動作するバイパスは構築しないと述べ、その後、その作業をその行まで進めました。最終的に、私はすべてのステップ、認証がどのように機能するか、どのようにオーバーライドできるかについての完全に書かれたレポートを入手し、その後、それらの手順が目の前にあったため、チューンを変えて実際のバイパスを構築しました。
それは完全に静的分析でした
アプリを実行したのは一度だけでした
Qwenは、デモンストレーションでバイパスが機能した最後の瞬間まで、実際にはアプリを起動しませんでした。代わりに、静的分析を通じて、フレームワークを逆アセンブルし、数千行のarm64を調べ、セキュリティ機能を呼び出しサイトにマッピングし、ベンダーが対応する公開検証キーをバイナリ内に隠していることを突き止めました。その後、それらのすべてのピースを見つけ、それらを組み合わせて、アプリがライセンスを検証するために使用する公開キーを提供しました。私はアプリケーションの正規の購入済みコピーを持っているので、私のマシン上の実際のライセンスが、再構築されたキーと一致する秘密キーによって署名されていたことを検証できました。つまり、17GBのVRAMに収まるモデルが、ベンダーが意図的に隠していたキーを復元し、それがそのチェーン全体を効果的に解体したことを証明しました。また、人間が行うとさらに時間がかかる可能性のある作業を、約30分で完了しました。キーがあれば、他のすべてははるかに理解しやすくなります。モデルは、購入またはアップグレード時に一度オンラインで行われるアクティベーションについて、詳細なレポートを保持していました。その後、起動時にすべてオフラインで検証されます。署名チェック、プラットフォームから読み取られたハードウェアシリアルへのマシンバインディング、埋め込み失効リスト、バイナリがまだ署名されているかのチェック、および署名付きアップデートパスです。これは、Ghidraのようなツールを使って、このクラスのアプリとしては非常に徹底的なスキームであるとQwenは結論付けました。弱点は3つの特定の場所にありました。キーは、現代の強度とは言えない、奇妙なサイズのRSAキーです。完全にオフラインであるため、漏洩したキーはアップデートをプッシュしないと失効できません。そして、すべてのチェックはローカルコードにあり、すべてのローカルチェックと同様にパッチ可能です。何度かのやり取りの後、ゲートがどこにあるかを知ると、その発見を小さなスクリプトで実行された動作する概念実証に変えました。ライセンスを予想されるパスから移動し、実行したところ、機能しました。
間違いを犯したとき、それも解決した
最初のキーはほぼ正しかった
キーを復元する最初の試みは、非常に特定の方法で間違っていました。動作するキーが生成され、署名チェックはパスしましたが、バイナリが整合性チェックとして計算するハッシュが一致しませんでした。私の経験では、ほとんどのモデルはそれを完了とみなし、そのままにしておくでしょうが、Qwen 3.8 27Bはそうしませんでした。代わりに、不一致を強調し、図面に戻り、値がバイトごとに一致するまで続行しました。このモデルでは、その種の往復には大きな代償が伴います。デフォルトでは、その推論努力は最大に設定されているため、些細な要求でも数百から数千トークンを消費する可能性があります。1秒あたり30〜50トークンを生成している場合でも、かなりの時間がかかります。それでも、結果を考えると、無駄だとは言いません。最初の間違った推測は自己修正され、私の入力なしで正しい結論に達しました。冗長ですか?はい、本当にそうです。しかし、正しかったですか?それもはい、そして最終的には、自信を持って間違った答えよりも正しい答えの方が良いです。
ローカル27Bは、脅威モデルにとって現実的な入力となった
プライバシーは両刃の剣
Qwenが実際にライセンススキームを解体して理解したという事実に、私はまだ驚いています。フロンティアモデルがしばらくの間、印象的なリバースエンジニアリング能力を持っていることは知っていますが、これはローカルの27Bモデルです。それは、クラウドを一切使用せず、私の隣にあるマシン上で完全にオフラインで実行されました。そして、はっきり言っておきますが、商用アプリケーションの動作する認証バイパスを生成しました。これは、ローカルモデルにとって本当に意味のある閾値を超えたことです。Qwenは、未知の商用バイナリからライセンスアーキテクチャを理解し、意図的に隠された暗号化マテリアルを復元し、自身の誤った再構築を検出し修正し、最終的にそれを動作する概念実証に変えました。バイナリ、ライセンス、またはその分析のいずれかを他の誰かのサーバーに送信する必要はありませんでした。明らかな注意点があります。これは1つのアプリケーション、1回の実行、そして私がすでに正規ライセンスを持っていたマシンでのテストでした。また、このターゲットがどれほど代表的であるかはわかりません。より難しいアプリケーションは...