HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Pangram 3.3.2の内部表現を探る

Exploring the internal representations of Pangram 3.3.2 (pangram.com)

8 pointsby krackers1 コメント

要約

PangramはAI検出モデルを開発する企業で、本記事ではそのフラッグシップモデルPangram 3.3.2の内部表現の解釈性に関する初期の取り組みを紹介しています。線形プローブや次元削減手法を用いて、AI生成テキストの検出メカニズムや、LLMがどのモデルによって生成されたかを内部的に区別する能力について分析しています。この研究は、モデルの動作を深く理解し、予期せぬ挙動を修正することを目的としています。

全文翻訳

01 はじめに ChatGPTが2022年に登場して以来、AIアシストライティングは驚くべきペースで拡大してきました。AI生成テキストが私たちが読むものの非常に多くを占めるようになったため、一部の文章形式は機械によって生成されると価値を失うことが明らかになりました。学術界では、エッセイは学生の推論能力を育成することを目的としています。市場では、製品レビューは他の人々の経験を反映しているため価値があります。 Pangramはこの問題に対する最先端のAI検出モデルを構築する研究企業です。私たちの主力製品は、業界をリードする低い誤検出率、多言語機能、AI生成とAIアシストの区別を特徴とするAIテキスト検出モデルです。 2024年に最初のホワイトペーパーを発表して以来、私たちはAIの進歩の波を次々と見るユニークな立場にありました。私たちの研究者は、厳しすぎるコンテンツフィルターと格闘し、モード崩壊11(私たちの研究者は、特に言語モデルにおけるモード崩壊に関するGwernによるこの記事を推奨しています。)を経験し、emダッシュと「delve(深く掘り下げる)」という言葉の波をかわしてきました。 私たちの主力モデルは、このシーケンス分類タスクにファインチューニングされたLLMです。私たちはパープレキシティやバーストネスのようなカスタムメトリクスを使用しません。手動での特徴抽出も行いません。私たちは「AIフレーズ」という顧客向け製品を持っており、AIテキストでより頻繁に現れるフレーズに関する情報をユーザーに提供しています。しかし、これらはモデルの特徴量として直接使用されるわけではありません。しばらくすると、人は好奇心を抱きます。モデルは何を見ているのだろうか? 私たち研究者にとって、この問いは重要です。私たちはショートカットを防ぎ、意図しないモデルの動作を修正し、この問題を深く理解することに強く動機付けられています。この投稿では、文書レベル分析を用いた初期の解釈性への取り組みについて概説します。 02 データ 私たちは、本番トレーニングセットからドメイン内の保持サンプルを使用して解釈性データセットを構築しました。このページのインタラクティブなエクスプローラーは、人間とAIで均等に分割された5,000文書のバランスの取れたサブセットを、20の偶数層にわたって使用しています。AIサンプルは、分類器プローブに使用される以下の6つのモデルファミリーにわたるモデルバリアントを網羅しています。 モデル Claude 3.7 Sonnet Claude Sonnet 4 Claude Sonnet 4.5 Claude Opus 4 Claude Opus 4.1 Claude Opus 4.5 GPT-3.5 Turbo (23年11月) GPT-3.5 Turbo (24年1月) GPT-4 (23年3月) GPT-4 (23年6月) GPT-4o GPT-5 GPT-5.1 GPT-5.2o1 Gemini 2.0 Flash Gemini 2.5 Flash Gemini 2.5 Pro Gemini 3 Pro DeepSeek R1 DeepSeek V3 Qwen 2.5 7B Qwen 2.5 72B Qwen 3 235B Llama 3.1 8B Llama 3.1 70B ソースドメイン ニュース 科学抄録 製品レビュー ビジネスレビュー Redditクリエイティブライティング Reddit ELI5 書籍(自費出版) 書籍(プロジェクト・グーテンベルク) Wikipedia(英語) Wikipedia(多言語) Lang-8(ESL) 03 Pangram 3.3.2の概要 Pangram 3.3.2は、Pangram Labsが2026年にリリースしたAI検出モデルです。Pangram 3.3と同じ基盤モデルを使用しており、パフォーマンスを向上させるバグ修正が後から適用されています。Pangram 3.3はPangram 3.2の後継で、新しいLLM出力、人間化されたテキスト、長文のAI生成コンテンツに対するリコールを改善し、非ネイティブ英語の文章における誤検出を削減しました。 モデルカード Pangram 3.3モデルカードを読む Pangram 3.3.2のリリース詳細を見る 記事を読む 解釈性の研究は進行中です。この記事では、私たちの手法をPangram 3.2およびPangram 3.1にも遡って適用します。 04 手法 アクティベーション EditLensアーキテクチャは、単一のai_assistance_scoreに集約されるバケットベースの分類システムです。このプロジェクトでは、モデルの最終的な読み出しを破棄し、代わりにモデルが学習する内部表現に焦点を当てます。これらを調査するために、与えられた入力ドキュメントでモデルのフォワードパスを完了し、複数の内部レイヤーでモデルの隠れ表現を保存することでアクティベーションを収集します。このプロジェクトでは、ネットワーク全体を通じて、すべてのドキュメントのすべての偶数レイヤーについてアクティベーションを抽出しました。 次元削減 抽出された各アクティベーションベクトルは5,120次元でした。表現をよりよく理解するために、いくつかの次元削減手法を採用しています。 PCA 主成分分析(PCA)は最も単純な線形射影であり、アクティベーション空間における最大分散の方向を見つけます。このプロジェクトでは、ネットワークの終わりに向かって、ほとんどの分散が主成分1と2に含まれていることがわかり、それらを互いにプロットしました。 UMAP UMAPは近傍構造を保持するように設計された非線形ビューを提供します。モデルの内部空間で2つのドキュメントが近い場合、UMAPはそれらを2D空間で近くに保とうとします。ただし、クラスター間の正確な軸や距離を過度に解釈すべきではありません。 t-SNE t-SNEは、ローカルクラスターを明らかにするのに優れた別の非線形射影法です。このプロジェクトの目的では、t-SNEを使用して、モデルファミリーや人間/AIラベルなど、意味的に重要なグループがネットワークが深くなるにつれて目に見えてクラスター化するかどうかを問いかけます。 線形プローブ 私たちは次元削減手法から観察される定性的な結果を定量化するために線形プローブを使用します。各レイヤーについて、単純な分類器がそのレイヤーのアクティベーションベクトルからターゲットラベルを回復できるかどうかを問いかけます。高いプローブ精度は、関連する区別が表現空間の線形的にアクセス可能な方向にすでにエンコードされていることを意味します。 05 AI検出タスク 二値分類精度 ネットワークの過程で最終的なクラス分離がどのように達成されるかを理解するために、各レイヤーで線形プローブをトレーニングします。人間とAIで均等に分割された500サンプルを、80:20のトレーニング/テスト分割でトレーニングします。ネットワークの初期段階であっても、パフォーマンスはすでに強力であることがわかります。レイヤー2の直後に0.83の精度を達成します。これは、「bag-of-words」モデルがAI検出タスクの有用なベースラインとなることが多いという私たちの直感と一致します。ネットワーク全体を通じて、精度はレイヤー24で1.0に達するまで強化されます。 図2. 保持データにおける人間/AI線形プローブのレイヤーごとの精度。 埋め込みを読み込み中… 図3 この分離は、3つの次元削減手法すべてで明確に視覚化されます。 06 LLM分類 t-SNEおよびUMAPプロットで、ドキュメントがそれらを生成したモデルによってクラスター化されているように見えることに気づきました。これは私たちにとって驚きでした。Pangramの古いイテレーションには別のLLM分類器ヘッドがありましたが、その特定のタスクは長い間廃止されていました。Pangram 3.3.2のトレーニングプロセスでは、AIドキュメントの発信元モデルに対応するラベルは与えられていません。 それでも、発信元モデルファミリーの周りにクラスターが形成されました。さらに興味深いことに、クラスターはネットワークのレイヤー全体に出現するように見えます。 モデルクラスターの出現 同じ埋め込みをモデルファミリーで色付けして、プロバイダーレベルのジオメトリがレイヤー全体に現れるのを確認します。 埋め込みを読み込み中… 図4 レイヤー2-40の埋め込みをモデルファミリーで色付け。プロバイダーレベルのクラスターは、後のレイヤーでより明確になります。 プローブ この現象を定量化するために、6つのモデルファミリー(Anthropic、OpenAI、Google、Qwen、Llama、DeepSeek)にわたって、各モデルファミリーあたり500サンプル、全体で3,000サンプルを、80:20のトレーニング/テスト分割で分類器をトレーニングします。Pangramアクティベーションのみを使用して、特定のドキュメントの発信元モデルファミリーを分類できるプローブを実際にトレーニングできることがわかり、最大トップ1精度は91%でした。 図5. モデルファミリー線形プローブのレイヤーごとの精度。発信元モデルファミリーは、Pangramアクティベーションからますます回復可能になります。 出現は保証されない 私たちの初期の解釈性実験には、いくつかのモデルでのテストが含まれていました。驚いたことに、「LLM分類」能力の出現は、このプロジェクトで実質的にモデル間で異なった唯一の発見の1つでした。 下の図は、Pangram 3.1、3.2、および3.3.2のクラスター化挙動を比較しています。内部のサインオフ評価でバイナリ人間-AIタスクで3.1よりもモデルのパフォーマンスが優れているにもかかわらず、Pangram 3.2のモデルクラスターは、Pangram 3.1または3.3.2よりも一般的に定義が曖昧です。 図6. Pangram 3.1、3.2、および3.3.2のレイヤー40におけるt-SNE。ジオメトリ