AI・機械学習
知能のコストが100倍低下すると何が起こるか
What Happens When the Cost of Intelligence Drops 100x (catalystneuro.com)
要約
大規模言語モデル(LLM)の進歩は、単に最高性能モデルができることの拡大だけでなく、特定の能力をどれだけ安価に実現できるかという側面でも進んでいます。この記事では、LLMの知能レベルあたりのコストが過去数ヶ月で劇的に低下しており、この傾向が加速していることを指摘しています。これにより、これまで予算的に不可能だった大規模なタスク(例: 全ての科学論文の読解、大量の契約書のチェック)が現実的になりつつあり、AIの応用範囲を大きく広げる可能性を示唆しています。
全文翻訳
大規模言語モデルの進歩は、通常、最高のモデルが以前はできなかったことを今やできるようになったという形で報告されます。それがヘッドラインを生み出す方向であり、確かに信じられないほど素晴らしいものでした。レンジのトップでの一歩一歩が、モデルが以前は手の届かなかった種類のタスクを処理できるようになります。それは、コードベース全体にまたがるバグを修正することであったり、最近では、未解決の数学的問題を解決することであったりします。
あまり注目されない進歩の第二の方向性は、特定のレベルの能力をどれだけ安価に購入できるかということです。多くの有用な作業には、最も賢いモデルは必要ありませんが、十分な能力を持つモデルを数千回適用することが必要です。あるトピックに関するすべての科学論文を読むこと、アーカイブ内のすべての契約書を特定の条項についてチェックすること、または大規模なディスカッションフォーラムのすべてのスレッドを要約することなどが、この種のタスクです。これらのタスクでは、仕事ができるモデルが存在するかどうかではなく、予算内でそれを1万回実行できるかどうかが問題となります。天井は新しい種類のタスクを解き放ち、床はボリュームを解き放ちます。
アプリケーションのモデルを選択する際には、その能力と各呼び出しのコストをトレードオフします。エージェントコーディングに関しては、私はほぼ完全に能力に焦点を当ててきました。たとえ比較的安価なモデルでも合理的に能力があるものが存在する場合でも、仕事の質の向上にはそれだけの価値があるという一般的な感覚がありました。最近、私はフロアのコストに注目するようになりました。
DANDI Archiveで共有されたデータセットが後続の出版物でどれだけ再利用されているかを測定しています。これは、約1万件の候補論文をモデルで読み込み、それぞれが実際にデータを使用したかどうかを尋ねることを意味します。今日の価格では、このコーパス全体を一度通過するのに、春のフロンティアにあったモデルで100ドル強かかります。この3月の価格では、同じレベルの能力で同じパスを実行するには数千ドルかかりました。そして1年前には、その能力はどんな価格でも利用できませんでした。このフロアの変化が、分析をサンプルでできることから実行可能なプロジェクトに変えたのです。
私はコストスペクトル全体での進歩、特に安価なモデルがどれほどインテリジェントになったかに驚いています。Artificial Analysisは2年間、数百のモデルにわたって知能と価格をベンチマークしており、そのデータの多くにアクセスできるため、トレードオフを再構築できます。特に、このプロットは知能指数とタスクあたりのコストを示しており、さまざまなレベルのモデル能力に対する現実的なコスト見積もりを提供しています。
一番上の線は、彼らが「パレート線」と定義しているものです。これは、特定の価格帯で最も能力の高いモデルです。この線はLLMの真のフロンティアを表しています。私はartificialanalysis.aiからデータを抽出し、新しいモデルがリリースされるにつれてパレートフロンティアがどのように移動したかを確認しました。
この進歩を一度立ち止まってレビューし、今後数ヶ月の予測を立てる価値があると思います。短いバージョン:2月にタスクあたり1.22ドルかかっていた知能レベルは、6ヶ月未満で今日の0.022ドルに低下しました。低下率は加速しています。測定されたペースでは、特定の能力レベルで100倍の低下には約1年かかります。そして問われるべき質問は、それが起こるかどうかではなく、それが何を変えるかです。
Artificial Analysis 知能指数
この記事全体での能力軸はArtificial Analysis知能指数です。そのため、その数値が何であるかを明確にすることが価値があります。現在のバージョン、v4.1.1は、4つのカテゴリにグループ化された9つの評価の加重平均です。エージェントタスクが34%、コーディングが24%、科学的推論が24%、一般的な能力が18%です。重み付けは、分野の注意がどこにあるかを反映しています。スコアの3分の1は、モデルが多段階のエージェント作業を完了する能力から来ており、試験問題を回答する能力からではありません。コンポーネント評価、その重み、およびスコアリングの詳細は、Artificial Analysisの知能ベンチマーク方法論に文書化されています。
最終的に得られるのは、モデルの能力を表す単一の数値です。LLMのIQのようなものです。完璧ではありませんし、同じスコアの2つのモデルが異なる強みを持つこともありますが、このスコアはモデルの能力を示すのに十分なほど良い仕事をしていると私は考えています。
参考として、Anthropicの「Claude 4.5 Sonnet (Reasoning)」は、私や他の多くの人にとって、コードを書くためのエージェントハーネスで使用できるほど能力が高いと感じた最初のモデルでした。当時私はClineを使用していましたが、このモデルはオートコンプリートやコピー&ペーストのワークフローと比較して大幅な生産性向上をもたらしました。そのモデルは知能スコア37.4(今日の知能スコアリングシステムに基づく)でした。現在のトップモデルはClaude Opus 5 max effortで、63.1です。
さまざまなインデックスレベルが何を意味するのかをより感覚的に理解するために、Simon Willisonのペリカンベンチマークを借用しました。「自転車に乗っているペリカンのSVGを生成してください」とモデルにプロンプトし、何が返ってくるかを確認します。これはインデックスが測定するものではありませんが、誰でも目で判断できるタスクです。以下のパネルは、GPT-5.6ファミリーをインデックスの4つのポイントで使用しています。Lunaは低、高、超高努力で、Solは最大努力です。モデルごとに3つのサンプルを生成し、最初のものを表示します。それらはすべてサイトリポジトリにあります。
Index 33.9 GPT-5.6 Luna (low)
Index 47.0 GPT-5.6 Luna (high)
Index 50.1 GPT-5.6 Luna (xhigh)
Index 60.9 GPT-5.6 Sol (max)
2026年8月20日にOpenRouter経由で生成されたプロンプト「自転車に乗っているペリカンのSVGを生成してください」に対する、各モデルの3つのサンプルのうち最初のもの。知能指数スコアはArtificial Analysisによるものです。
進行は明らかです。より詳細になり、プロポーションが改善され、ペリカンが単に自転車の上に浮かんでいるのではなく、実際に自転車に乗っているように見えます。
タスクあたりのコスト測定
トークンあたりのコストは容易に入手できますが、異なるモデルは非常に異なる数のトークンを使用する可能性があるため、モデルのコストのより良い指標はこれを考慮する必要があります。タスクあたりのコストはArtificial Analysis独自の測定値です。これは、入力、推論、および実行中に実際に請求された回答トークンを含め、Intelligence Index評価スイートの1つのタスクを実行するために平均してかかるUSDのコストです。ウェブサイトには表示されていますが、無料APIティアには含まれていないため、サイト上の各モデルのページに埋め込まれたデータからスクレイピングしました。これには、現在ベンチマークされているモデルと、ページに測定値がまだ残っている引退したモデル(古いClaude OpusおよびSonnetバージョン、GPT-5.xラインなど)が含まれます。これにより、DeepSeek V3(2024年12月)まで遡る137モデルの測定コストが得られ、それぞれにリリース日と現在のスケールでの知能指数スコアがペアになっています。
フロンティアはどのように移動したか
以下のチャートは、知能とタスクあたりの測定コストをプロットし、各知能レベルに到達するための最も安価な方法であるパレートフロンティアを、現在の状態と過去1年間の2ヶ月ごとの間隔で追跡しています。各モデルのリリース日を使用して、利用可能だったものを再構築しています。チャートは、一度に1つのフロンティアを構築し、全体像で一時停止してから繰り返します。停止するにはボタンを使用してください。ポイントにカーソルを合わせると、その背後にあるモデルが表示されます。
知能指数対タスクあたりの測定コスト(対数スケール)。小さな点は、最後の測定コストでの137の測定済みモデルすべてで、リリースされた2ヶ月ごとのウィンドウで色付けされています(2025年8月より前のモデルは2025年8月のウィンドウとグループ化されています)。小さな点と大きな点の両方の空の点はオープンウェイトモデル、塗りつぶされた点はプロプライエタリモデルです。ポイントにカーソルを合わせると、Artificial Analysisがライブベンチマークから引退させたかどうかを含む詳細が表示されます。各線は、スナップショット日までにリリースされたモデルの中で、特定の知能指数に到達するための最も安価な方法を追跡しています。線がセグメントを共有する場合、古い線が上に描画されるため、新しい線はフロンティアが...