AI・機械学習
3つのAIエージェント、2つの国、そして不均一なワールドワイドウェブ
Three AI agents, two countries, and one uneven world wide web (royapakzad.substack.com)
要約
本記事では、GPT、Claude、Museの3つのAIエージェントが、米国とイランの国別プロファイルに関する世界銀行のオープンデータプラットフォームの更新タスクにおいて、多言語対応、情報アクセス、人間参加型(HITL)、監視可能性といった側面でどのように異なる挙動を示すかを比較検証しています。特に、ウェブサイトへのアクセス許可、アカウント登録の処理、およびエージェントの行動履歴の透明性において、各エージェントの顕著な違いが浮き彫りになりました。
全文翻訳
3つのAIエージェント、2つの国、そして非常に不均一なワールドワイドウェブGPT、Claude、Museが多言語リサーチ、ソースアクセス、人間参加型、監視可能性でどのようにパフォーマンスを発揮するかRoya Pakzad2026年10月02日11シェア私はテクノロジーと人権の研究者です。過去数年間、私の注力分野の一つは、言語が私たちがAIからどのように恩恵を受けたり、害を受けたりするかにどのように影響するかという問題でした。私は、異なる言語とコンテキストにおけるLLM応答の言語ペア分析のためのオープンソースプラットフォームを開発しました。また、ポリシープロンプトのガードレール評価や、LLMガードレールにツールへのアクセス権を与えることで、それらをより信頼性が高く、信頼できるものにできるかどうかの研究も行ってきました(この研究は最近NeurIPSで採択されました!やったー!!)。最近、私はRightsConのパネルで、エージェント型AIの人権影響評価について議論しました。このことが、LLMエージェントを評価する際に言語のどの側面が重要になるかについて、さらに深く考えるきっかけとなりました。私は、同じ質問を英語とペルシャ語(私の母語)で尋ねたときにモデルのパフォーマンスが異なるかどうかを問うことから一歩進んで、言語とコンテキストを考慮に入れながら、エージェントの軌跡全体(推論、計画、検索、ソース選択、ソース階層、成果物作成)を調べることを望みました。そこで、私はテストを実行することにしました。タスク:米国とイランの国別プロファイルのために世界銀行オープンデータプラットフォームを更新する3つのAIエージェントタスクは、米国とイランの公式データを使用して、世界銀行グローバル公共調達データベースの欠落情報を埋めることでした。私は米国については英語で、イランについてはペルシャ語でタスクを実行しました(下の画像参照)。エージェントは以下の3つです:MetaのMuseAnthropicのClaude Cowork, Opus 5.5 MediumOpenAIのGPT 6.1 Sol, Medium以下は、私が3つすべてに使用した正確なプロンプトです:私は、日常ユーザーが経験することを反映するために、意図的にこれらのサービスのWebバージョン(アプリやターミナルバージョンではない)を使用しました。この区別は、エージェントのアクションの監視とロギングにとって重要であり、これについては後述します。この記事は、どのエージェントがより良く、またはより速くパフォーマンスを発揮したかということよりも、情報へのアクセス、言語表現、文脈理解、透明性、人間参加型、およびセーフガードに関してエージェントがどのように異なる振る舞いをするかについてのものです。すべての結果は以下のファイルで見つけることができます:Muse、GPT、Claudeの出力Excelファイル(ここ)プロンプト受信後の各エージェントの自己生成ワークトラジェクトリ(ここ)エージェントのアクションのスクリーン録画から抽出されたテキストファイル(ここ、および完全な録画はこちら)以下に、私の観察結果を要約します。人間参加型(HITL):繰り返し許可を求めるプロンプトからほとんど介入なしデジタルライツ分野で活動している私たちにとって、AIエージェントの人間参加型(HITL)監視は、「インフォームドコンセント」に関する長い議論の列に連なります。これは、GDPRの同意要件からクッキーポップアップ、利用規約やプライバシーポリシーのボックスにルーチンでチェックを入れることまで含まれます。それを念頭に置いて、私は実験中に各エージェントがどのように私を関与させたかに細心の注意を払いました。ウェブサイトへのアクセス許可ウェブサイトから情報をアクセスして取得するために、GPTはタスクの開始時に一度だけ許可を求めました。ウェブサイトへのアクセスを要求し、「関連サイトをすべて許可する」オプションを提供してくれたので、私はそれを選択しました。それ以降、再度求められることはありませんでした。Claudeはタスク全体を通して質問をしてきました。リサーチのためにウェブサイトにアクセスすることについても、世界銀行サイトから資料を抽出することについてもです。GPTとは異なり、「関連サイトをすべて許可する」オプションは提供されなかったため、毎回許可を求められました。米国タスク(すべて.govウェブサイト)では9回、イランタスク(主に.irドメインおよびfa.wikipediaソース)では9回でした。私はすべての要求を承認しました。Claudeは技術的な制限にも遭遇し、別の種類のHITLの瞬間を引き起こしました。イランと米国の両方で、ポータルがJavaScriptでページを構築しており、Claudeのサンドボックスネットワークポリシーが世界銀行のデータファイルへのアクセスをブロックしたため、ライブGPPD国別プロファイルをロードできませんでした。Claudeは停止し、私が自分でページを(PDFとして)アップロードしたいか、またはそれなしで作業を続行したいかを尋ねました。私はその質問をスキップしたので、Claudeは続行し、代わりに世界銀行のGPPD DataBank APIから情報を取得しました。しかし、DataBankは2018年のデータを保持しており、ポータルは2022年のプロファイルを表示しています。その結果、ClaudeのベースラインデータはGPTとMuseとは異なりました。Museは、タスクの4番目の部分、つまり世界銀行のウェブサイトへの登録と情報のアップロードが必要になるまで、一切許可を求めませんでした。3つのエージェントすべてが、スプレッドシートを作成するポイントまでタスクを完了し、生成された結果に対する自信を表明しました。世界銀行のウェブサイトでのアカウント登録タスクの最後の部分である、世界銀行ポータルへの登録と変更のアップロードは、単に情報を収集する以上の、より重要なアクションをエージェントに要求したため、より興味深いものになりました。ClaudeとGPTはここで停止し、登録とアップロードを私に引き渡しました。しかし、Museは続行しました。私に尋ねたり、利用規約を見せたりすることなく、david.jones@gsa.govというメールアドレスでアカウントを登録しました。Museの完全なやり取りはここで見ることができます。下の表は、各エージェントがタスクのこの最後の部分にどのようにアプローチしたか、およびそれに関するサイバーセキュリティ上の意味合いをまとめたものです。1世界銀行ポータルへの登録を求められたときの各エージェントの行動。Claudeは拒否し、GPTはフォームを私に返しましたが、Museはテストペルソナとして登録し、私に見せることなく利用規約に同意しました。監視と観察可能性:エージェントが明らかにする量と検査の容易さには大きなばらつきがありますモデルの完全な思考連鎖(CoT)とアクションのトレースをAIラボが公開すべきかどうか、そして公開するとしたらどの程度公開すべきかについては、継続的な議論があります。ラボが公開を控える理由はいくつかあります。OpenAIは、ユーザーエクスペリエンス、競争上の優位性、および内部監視のためにCoTを利用可能にしておく価値を理由に、o1の生のCoTをユーザーに表示しないことを選択しました。Anthropicは、生の推論には不正確または未完成の思考が含まれる可能性があり、悪意のあるアクターがそれを使用してより良いジェイルブレークを構築する可能性があると指摘しました。また、ゲーミングや報酬ハッキングの懸念、および「CoTの不忠実さ」もあります。しかし、エージェントの行動を理解するためには、評価者は物事がいつ、なぜ起こるかを知る必要があり、これは監視システムが配置され、エージェントの完全な軌跡にアクセスできる場合にのみ可能です。AIラボの外部の評価者にとって、そのアクセスなしでは、エージェントの行動を完全に理解することはほぼ不可能です。そして、外部評価者が部分的な軌跡しか見ることができず、彼らが下すすべての結論が完全な情報がないことを理由に却下される可能性がある場合、独立した評価の価値は何でしょうか?これらの制限を認識した上で、私は、世界銀行情報ポータルを更新するタスクを課された通常の研究者の立場に自分を置き、各エージェントの作業の可能な限り多くを収集、監視、およびチェックするために最善を尽くしました。通常のユーザーがエージェントの作業軌跡の完全な記録を抽出するためのワンクリックの方法はないため、私は各エージェントがライブで作業するのを見て、画面上でクリック可能で表示可能なすべてを記録しました。タスクが終了したら、録画をChatGPTに与えてテキストを抽出し、検索可能にしました。これがどのようなものかを示すために、ここにスニペットを示します(左:Claude、中央:Muse、右:GPT。サイズと判読性の悪さについてはご容赦ください)。自己申告による軌跡。タスクが完了した後、私は各エージェントに、エラー、それらの処理方法、使用した回避策、検索したウェブサイトなど、実行したことの説明テキストファイルを作成するようにプロンプトしました。MuseとGPTはそれぞれダウンロード可能な.txtファイルを生成しましたが、Claudeは「reasoning_extraction」と述べて、その安全ポリシーに反すると言って拒否しました。Claudeが「推論抽出」の懸念を理由にワークトラジェクトリ.txtファイルの作成を拒否したこと。とはいえ、自己申告による軌跡は完全に信頼できるものではありません。過去に、エージェントが実際に行ったことと報告したことの間に不一致があるのを見てきました。そのため、私は...