AI・機械学習
構造のみでAI生成ウェブコンテンツを識別するモデルのトレーニング
Training a model to identify AI-generated web content from structure alone (arxiv.org)
要約
Sitefireの研究者たちは、AI生成コンテンツと人間が作成したコンテンツを、単にその構造のみに基づいて98%の精度で識別できるモデルを開発しました。このモデルは、AI生成コンテンツがしばしば情報を繰り返すなど、人間が書くものとは異なる構造的特徴を持つことを利用しています。この技術は、AI生成コンテンツの「スロップ」を特定し、より質の高いコンテンツ作成を支援するためにSitefireのサービスに組み込まれる予定です。
全文翻訳
皆さん、こんにちは!私たちはSitefireのVincentとJochenです(https://sitefire.ai)。私たちは長年一緒に仕事をしており、スタンフォード大学でのRL/最適化のバックグラウンドと、ミュンヘン工科大学(TUM)でのソフトウェアエンジニアリングの経験を持っています。
Sitefire(YC W26)では、マーケティングチームがAI検索(ChatGPT、Google AI Overviews、AI Mode、Claudeなど)で推奨されるのを支援しています。当社のソフトウェアはプロンプトを監視し、どのウェブページが引用されているかを確認し、これらの洞察を利用してマーケティングチームがYouTube動画を作成したり、適切なブログ記事を書いたりするのを支援します。
これは、私たちがAI生成ウェブコンテンツに商業的な利害を持っていることを意味します。そして今のところ、高情報量のAI生成コンテンツは、AI検索で引用され推奨されるために非常に効果的です。
しかし、何百ものマーケティングチームと話した結果、誰もがAI生成コンテンツ(「AIスロップ」)を軽蔑していることが明らかになりました。それにもかかわらず、誰もがコンテンツ作成にAIを活用したいと考えています。そこで私たちは自問しました:AIスロップの特徴は何でしょうか?人間が作成したウェブページからそれを識別するモデルをトレーニングできるでしょうか?
メリーランド大学とGoogle DeepMindの研究者は、すでにフィクションについてこの問いを立てています。彼らの論文StoryScope(Russell et al., 2026)は、単語を見なくても、構造のみでAIが書いた物語と人間が書いた物語を区別できることを示しました。
私たちはそのパイプラインを商用ウェブページに移植しました。Wayback Machineを使用して、ChatGPTが存在する前に書かれた268のB2B企業ウェブサイトから2,250のブログ記事を収集しました。各ブログ記事について、5つのAIモデル(GPT-5.4、Claude Sonnet 4.6、Gemini 3 Flash、DeepSeek V3.2、Kimi K2.5)が独自のバージョンを作成しました。
単語を見る代わりに、各投稿がどのように構築されているかを見ました。AIモデルに、投稿ごとに214の質問をさせました。例えば、その投稿が自社製品をどれだけ強く推奨しているか、主張を情報源で裏付けているか、あるいは名前のある専門家を引用しているかなどです。その後、これらの回答に基づいて分類器をトレーニングしました。
これまで見たことのないブログ記事に対して、私たちの分類器は98%の精度でAI生成記事と人間が作成した記事を区別し、1,740件中わずか19件しか間違えませんでした。
なぜこれほどうまくいくのでしょうか?すべての5つのAIモデルは、似たような形状で記述しているからです。これらの特徴に対する各AIモデルの値のマッピングを見ると、それらがクラスター化しているのに対し、人間の値は離れており、はるかに広範囲に散らばっています。データセット中のユニークなブログ記事の上位1%のうち、149件が人間によるもので、AIによるものはわずか4件でした。
では、AIスロップの特徴は何でしょうか?それは同じことを3回伝えます。タイトルはすでに何が得られるかを約束しており(「オンボーディング時間を半分にする方法」)、導入部は何が来るかを概説し、結びで再びすべてを繰り返します。AI投稿の77%が、人間による投稿の12%と比較して、主要なポイントを繰り返して終わります。私たちはこれを「整然とした、自己紹介的なブログ投稿」と呼んでいます。
それでも、各AIモデルには独自の「アクセント」があります。私たちは、5つのAIモデルのうちどれが投稿を書いたのか、あるいは人間が書いたのかを識別するために、2番目の分類器をトレーニングしました。ランダムな推測(6分の1)が17%になるのに対し、これは79%の時間で正しい作成者を選びます。その間違いのほとんどはAIモデル間の混同であり、人間とAIの間ではありません。
構造的特徴のクールな点は、単に言葉を言い換えるだけでは回避できないことです。各AIモデルに、平均73%の元の13単語シーケンスが失われるまで、独自の投稿を書き直させましたが、AIスロップ分類器は依然として同じようにうまく機能しました。
私たちはこれをSitefireに組み込んでいます。私たちのエージェントはテキストの構造的な理解を得るので、彼らが書く投稿はより深く、人間が書くような多様性を持つようになります。
人間化ツール、人間の書き直し、投稿の再構成、あるいはこれらの習慣を意図的に避けるようにAIモデルに指示するなど、まだテストしていないことはたくさんあります。また、私たちの人間による投稿は主に2020年から2022年のものであり、AIによる投稿は2026年8月に生成されたものです。構造は投稿がいつ書かれたかを実際には伝えることはできませんが、それでも同じ年での比較ではありません。
すべての図を含む研究をarXivに公開しました:https://arxiv.org/abs/2609.15369
コードはGitHubにあります:https://github.com/pulse-energy-eu/slopshape
あなたのブログはAIスロップではないと確信していますか?私たちは、あなたの投稿の1つを論文の10の特徴を通して実行するチェッカーを作成しましたので、ご自身で確認できます(完全なレポートには仕事用のメールアドレスが必要です):https://sitefire.ai/slop-checker
AIスロップと人間による執筆を区別できると思いますか?モデルについていけるかどうかの小さなゲームも作成しました。モデルは5ラウンドすべてを正しくクリアします:https://sitefire.ai/spot-the-slop