AI・機械学習
AIスーパーフォーキャスターが登場
The AI Superforecasters Are Here (astralcodexten.com)
要約
AIが予測市場や株式市場で驚異的な利益を上げ、人間のトップ予測者を凌駕し始めている。AIスーパーフォーキャスターは、高度なモデルに予測プロセスを支援する「スキャフォールド」と呼ばれるプログラムを組み合わせたもので、人間のような調査プロセスを経て、精度の高い予測を提供する。現在、AIと人間のトップ予測者の間には統計的なデッドヒートが見られ、今後数ヶ月で人間とAIの予測能力が同等になると予想されている。
全文翻訳
AIスーパーフォーキャスターが登場
AIスーパーフォーキャスターが登場...スコット・アレクサンダー 2026年7月2日 45529259共有年次の予測市場カンファレンスが今月初めに行われた。今年は予測市場が、ニッチな趣味から数十億ドル規模の産業へと、半ば違法なものから大統領の息子をアドバイザーに迎えるものへと変貌した年だった。そのどれについても誰かが話したかどうかは覚えていない。それは全く認識されなかった。すべての目はAIスーパーフォーキャスターに注がれていた。
私はAIスーパーフォーキャスターのスタートアップ創業者に会った。彼は、自分のAIが7ヶ月でKalshiで35ドルを200万ドルに変えたと語った。別の人物は、市場中立ポートフォリオで株式市場を25%上回っていると言った。もちろんこれは運の可能性もあるが、彼は同様の差でKalshiとPolymarketを上回っていた。実際、私はこれらの人々のすべてを信じている。グラフの線を伸ばすコミュニティは、AIが2026年から2027年の間に最高の人間予測者を打ち負かすと長い間予測してきた。 botsが未来を予測することにおいてついに人間を打ち負かした瞬間は、どのようなものになると予想していたか?雰囲気?論文?エッセイ?振り返ってみれば、確かに:AIが予測市場でクレイジーな利益を上げ、かなりの差で株式市場を上回るという形になるだろう。しかし、次に何が起こるのか?
AIスーパーフォーキャスターの使用
詳細に入る前に、具体的に何について話しているのか?AIスーパーフォーキャスターとは、通常ChatGPTやClaudeのようなフロンティアモデルであるAIであり、予測に長けるように変更されたものである。これは通常、「スキャフォールド」を意味する。これは、さまざまなプロンプト、ツール、サブエージェントを作成するタイミングに関するアドバイスなどを通じて、長い調査プロセスをAIに手取り足取り導くプログラムである。全体的な経験は、他のAIを使用するのと似ているが、より多くの作業を行っているため、遅く、より高価である。
これは例で理解するとより分かりやすいかもしれない。株式市場を上回っていると主張する企業、FutureSearchは、私が彼らのAIスーパーフォーキャスターを試してここに書くことを許可してくれる親切さを示してくれた。テスト問題として、シリコンバレーの慈善家たちが最近、一般的な風邪のような呼吸器感染症を根絶するためのプロジェクトを開始した。私は彼らの成功の可能性について尋ねることにした。予測者は非常に正確な質問を必要とするため、私は2040年までに風邪の発生率が半分になる可能性はどれくらいか尋ねた。
2分以内に、AIは3つのサブエージェントを展開し、16のウェブサイトを読み込み、(私がこのスクリーンショットを撮ったまさにその瞬間に)「2040年までに広く住宅で普及するためのASHRAE Standard 241空気清浄技術の拡張性について調査中」だった。5分後、それは回答を得ていた。2040年までに米国の呼吸器感染症が半減する可能性は7%だった。
それは説明した。
エージェントの推論は、すべてが同時に成功しなければならない、困難な接続連鎖の要件を中心に展開している。
1: 生物は過酷である。200以上の風邪の原因となるウイルス、だけでも150以上のライノウイルス血清型—50年間のワクチン開発の努力は失敗しており、専門家は2025年後半でさえ5年以内の風邪ワクチンを期待していなかった。前例のない行動変容を伴うCOVIDロックダウン中、ライノウイルスの発生率はわずかにしか低下せず、すぐにリバウンドした。
2: Intercept自身のタイムラインはタイトである。彼らのロードマップは商業化を5〜7年以上先に見積もっており、フェーズ3試験、FDA承認、および2040年までの大量展開をすべて5億ドル未満(その範囲ではおそらく少なすぎる)でクリアするための余地はほとんどない。
3: 採用は不確定要素である。軽度の病気の場合、定期的な鼻スプレーや予防薬の遵守率は低いと予想される。空気清浄インフラは、急峻な改修コストと混合された証拠ベース(2025年の殺菌UVのRCTでは感染の有意な減少は見られなかった)に直面している。
4: 測定は不可能かもしれない。米国には、人口全体を対象とした定期的な風邪サーベイランスが欠如しており、2020年から2026年のベースラインはパンデミック時代の行動によって歪められている—実際の進展があったとしても、確認された50%以上の減少を示すのは難しい。
この取り組みは本当に斬新で信頼できるが、変革的なAIの加速なしに14年で風邪の頻度を半分にすることは、途方もなく高いハードルである。あなたは、より緩やかな閾値(例:2035年までに25%削減)を予測することによって、またはInterceptの特定の技術的アプローチ(鼻スプレー対ワクチン対空気清浄)を、意味のある影響を与える可能性によってランク付けすることによって、フォローアップできる。
...そして、もし私がもっと学びたいと思った場合に備えて、212の出典を引用していた。予測は5分かかり、クレジット8ドルを要した。しかし、それは本当か?理想的には2040年まで待って確認するだろう。今のところ、私はそれを別のスーパーフォーキャスターAIと比較することから始めた。PreseenはKalshiでシード資金を10万倍にしたと主張する企業である。彼らの回答は次のとおりだ。
FutureSearchの7%と比較して8.8%、悪くない!これらのどちらかが本当だろうか?私は人間のスーパーフォーキャスターにこの質問を予測するように頼み、彼女がAIと同じ回答を得たかどうかを確認した。彼女は、言葉の曖昧さによって、5〜10%になると述べた。これも悪くない!
人間対機械
もちろん、これを大規模に実験して、AIが人間と比較してどうなのかを一度決着させるのがさらに良いだろう。しかし、予測能力を測定するのは難しい。それは質問の難易度に完全に依存するため、「質問の85%に正しく答える」のようなことは言えない。もし質問が「太陽は明日の朝昇るか」のようなものであれば、100%の正答率でさえ印象的ではない。代わりに、私たちは異なる予測者を互いにマッチさせ、誰がより良いか悪いかを判断することしかできない。絶対的な空間へのいかなるアンカリングも、私たちの予測能力を直感的に理解しているグループ(例えば、一般の人々の平均メンバー、CIAアナリストなど)を含めることによって行われる。
予測ウェブサイトMetaculusは、AIと人間、そしてAI同士を共通の指標でマッチさせている。以下は、時間の経過に伴う彼らの結果である。
Metaculusコミュニティ予測は、Metaculus上のすべての予測者の「集合知」スタイルの集計である。Metaculusプロ予測者は、トップのプロフェッショナルスーパーフォーキャスターである。このグラフは、Gemini 3.1が最先端だった2026年5月現在、AIがコミュニティ予測に近づいているように見える。これは偉業ではないが、プロフェッショナルスーパーフォーキャスターレベルからはまだ遠い。
しかし、最近のブログ投稿で、Metaculusは文脈を追加している。上記のグラフは、GPTやClaudeのような市販のブランド名AIのみを測定している。FutureSearchのような予測に特化したスキャフォールドは含まれていない。Metaculusによる別の調査では、これらの取り組みは「ベースモデルの進歩の9ヶ月に相当する」ことがわかっている。つまり、今日の優れたスキャフォールド付きAIは、9ヶ月後のベースモデルと同じくらい予測に長けている。
グラフの緑色の破線を2026年7月まで延長し、追加のスキャフォールディングのために9ヶ月を加えると、最高のAIは31程度になるはずであり、トッププロ予測者の36と比較される。したがって、理論上は、世界で最も優れた予測者が依然としてトップAIを上回っているが、勝利の差はグラフが示唆するよりも小さく、約6ヶ月で人間とAIの同等性を期待すべきである。
しかし、スキャフォールド付きAIがベースモデルより9ヶ月進んでいるという主張自体が、約9ヶ月前のものだ。この分野の数人が、これは真の進歩を過小評価していると考えていると私に語った。AIスタートアップ自身の主張は懐疑的に扱われるかもしれないが、数人のトップ人間のスーパーフォーキャスターさえも、もはや自分がボットに勝てると確信できないと言っていた。
直接対決の時期が来たようだ。Metaculus Cup—予測のワールドカップ!—がその役割を担っている。シーズンごとに、トップの人間とAIが「ネパール総選挙の勝者は誰か?」や「米国はイランを攻撃するか?」のような約50の質問で競い合う。最近のトーナメントの勝者は次のとおりだ。
人間が上位2位を占めたが、PreseenのAIは3位に入った。すべての予測コンペティションにはかなりの運が伴うため、現実的にこの時点で人間とAIは統計的にデッドヒート状態にある。進行中の夏のMetaculus Cupの中間結果を見ることで確認できる。
春にトップ10に入った人間の中で、2人(benshindelとMarcosO)が夏にもそのパフォーマンスを繰り返した。トップ10のAIも2つ(manticAIとLaertes)がそうだった(Preseen-Chestnutは厳しい夏を過ごしている。