HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: AIリーダーボードの規模を監査したところ、全スコアが6〜15ポイント低下しました

Show HN: I audited my AI leaderboard scale – every score dropped 6-15 points (agiranker.com)

4 pointsby baraklaniado1 コメント

要約

AGI Rankerは、主要な公開AIベンチマークを集約し、AIがAGI(汎用人工知能)にどれだけ近いかを単一のスコア(0〜100)で示すプラットフォームです。最近の監査により、このスコアリングシステムの規模を評価した結果、多くのモデルのスコアが6〜15ポイント低下したことが判明しました。これは、ベンチマークの重み付けやデータソースの品質評価の見直しによるものです。

全文翻訳

2026年5月以降 主要な公開AIベンチマークから集約 ONE SCORE. INFINITE CLARITY. AGI Rankerは、各最先端AIがAGIにどれだけ近いかを測定します。10の公開ベンチマークから抽出された、透明性の高い単一のスコア(0〜100)が各モデルに付与されます。スコア100はAGIの閾値を示します。独立した検証をラボの自己申告よりも優先します。検証できないスコアはフラグを立てますが、捏造はしません。すべての修正は公開で記録されます。AGIの定義を見る ライブリーダーボード 起動 インタラクティブエクスプローラー TOP MODEL - - FRONTIER MODELS - AGI Score ≥ 65 集約されたベンチマーク - ライブベンチマーク(TBAを除く) AGIへの距離 - pts トップモデルのAGIスコア100までのギャップ トップモデルの内訳 - 思考 44%の重み - 流動的推論 + 世界知識 行動 43%の重み - エージェンシー(ツール、計画、コーディング) + 視覚的推論 コミュニケーション 13%の重み - 言語生成 + 視覚的推論出力 リアルタイムランキング AGI Ranker リーダーボード 100 = AGI AGI コーディング 推論 知識 ツール使用 値 カスタム 注意:推論にはベンチマークが2つ(ARC-AGI-2とAIME 2025)しかなく、ほとんどのモデルは1つしか測定されていません。ここでは単一セルでのランキングは誤解を招く可能性があります。より多くの推論ベンチマーク(FrontierMath、SimpleBench)は、ロスターカバレッジが十分に広がり次第、有効化される予定です。スコア:高から低へ スコア:低から高へ 値:ベストスコア / $ 名前 A-Z オプション列 アリーナElo - LMSYSユーザー選好 カバレッジ - ベンチマーク・コンポーネント API 価格 - $/Mトークン、入力/出力 カスタム重みがアクティブ。これらは正規のAGIスコアではありません。カスタム重みがアクティブ。以下のスコアは、スライダー設定を反映したものであり、正規のAGIスコアではありません(AGIスコア100はデフォルトの重みでのみAGIの基準となります)。リセットしてデフォルトに戻す 競合モデルを表示 値:ドルあたりの能力 🏆 トップ - 最高能力 💎 値 - ドルあたりの追加能力が最も高い 🪙 バジェット - 実行コストが最も安い 能力は、その領域自体のタブと同じスコアです。コストはリスト価格からの推定値であり、測定されたタスクごとの請求額ではありません。能力は、選択された領域の公開スコアです - その領域のタブと同一です(全体 = AGIスコア)。💎 ベストバリューの選択肢は、ドルあたりの追加能力を最も多く提供するモデルです。バリューフォーマネーがどのように算出されるかの詳細は、方法論を参照してください。コストは、そのワークロードの典型的なトークンミックスでの公開リスト価格の推定値であり、測定されたタスクごとの請求額ではありません。 より多くの値 フロンティア 同じモデルを能力とコストでプロット。破線は、それよりもスコアが高く、かつ安価なモデルがないモデルを結びます。# モデル AGIAGIスコア アリーナElo 主要な強み カバレッジ 価格 $/Mトークン ·詳細 スコアはベンチマークごとの上限に正規化されています:人間の研究が存在する場合は人間のパリティで測定され、存在しない場合はベンチマークの最大値で測定されます(方法論を参照)。完全な方法論を見る → 値ビューでは、重みカスタマイズは一時停止されています - 重みは価格性能の散布図を変更しません。計算式をカスタマイズするには、AGIまたはスペシャリティタブに切り替えてください。計算式のカスタマイズ インタラクティブモデルエクスプローラー ドメインの重みを調整し、AGIスコアがどのように変化するかを即座に確認できます。透明性が核となります。バランスの取れた 推論重視 エージェンシー重視 知識重視 合計:100% - スコアリング前に100%に正規化されています デフォルトに戻す スコアを再計算 比較するモデルを選択(最大4つ) ドメイン習熟度レーダー 0モデル選択済み 透明な方法論 AGIスコアの計算方法 シグナルを最大化し、ノイズを最小化するように設計された、透明で再現可能な複合指数です。1 データ取り込みとキュレーション GPQA Diamond, HLE, ARC-AGI-2, AIME 2025, SWE-bench Verified, Terminal-Bench 2.1, τ³-Banking, LiveBench, LiveBench Agentic Coding, MMMU-Proなどの主要な公開AIベンチマークからスコアを集約します。各セルは引用されており、どのスコアでもその出典を追跡できます。ベンチマークは自社で実行するのではなく、他社が既に公開しているものを集約しています。ソースの品質は階層化されています:独立したベンチマークリーダーボード(ティア1)は1.00倍で完全にカウントされます。プロバイダーが関与するサードパーティ評価者(ティア2)は0.85倍。実績が検証されたラボからの自己申告(ティア3)は0.75倍。検証されていないラボやコメントコンテンツ(ティア4)は、スコアリングから完全に除外されます。AAインテリジェンスインデックスに関する注記(2026年6月削除):以前は、Artificial Analysisの複合インテリジェンスインデックスを言語シグナルとして採用していました。AGIスコアからは削除しました。彼らのv4.1改訂版では、これを明示的なエージェンティック複合(GDPval-AA, Terminal-Bench 2.1, τ³-Banking, SciCode, HLE, GPQAなど)に変更し、既に直接スコアリングしているベンチマークを再バンドルしました。これを維持すると、コンポーネント全体でこれらのシグナルが二重カウントされ、エージェンシーが言語として誤ってラベル付けされることになります。言語は現在LiveBenchに依存しています。第二の独立したソースを復元するために、専用の言語/ライティングベンチマークをロードマップに載せています。AAインデックスは外部参照として引き続き追跡します。2 ベストヒューマンへの正規化 v2.0.0で改訂:各生のベンチマークスコアは上限値で再スケールされます。公開されている人間の研究がモデルと比較可能なプロトコルで存在する場所では、その測定値が上限値となり、100は人間のパリティを意味します。存在しない場合は、上限値はベンチマークの最大値となり、100は人間の主張を伴わない完璧なスコアを意味します。現在、スコアリングされたベンチマークのうち、人間の上限値を持つのはGPQA Diamond(0.81)のみであり、他の9つはベンチマークの最大値に対してスコアリングされているため、AGIスコアは現在、純粋な人間比較ではなく混合スケールとなっています。さらに3つのベンチマークが同じ上限値監査を通過しましたが、ボードには載っていません:OSWorld(0.72)はv2.0.0で引退し、FrontierMath(0.35)とSimpleBench(0.837)はまだ収集されたカバレッジがありません。以前はすべての上限値を「ベストヒューマン」と説明していましたが、ほとんどの場合それは正確ではなく、v2.0.0でスコアが移動した主な理由は、それを修正することでした。AGIスコア=100は、私たちの定義「AGIは、物理的な身体の関与なしに、純粋に脳ベースの知的タスクのすべてにおいて最高の人間を凌駕する人工知能である」に従い、AGIの発生点としてのマーカーであり続けます。スコアは、AIが生成から超人的(ASI方向)領域に成長するにつれて100を超えて上昇します。ASI/ポストAGI世界でインデックスが情報的であり続けるように、それらをクランプするのではなく保持します。3 5コンポーネント集約 ベンチマークは、AGIが習得する必要のある5つの認知コンポーネントにロールアップされます:エージェンシー(35%)、流動的推論(29%)、世界知識(15%)、視覚的推論(11%)、言語生成(10%)。各コンポーネント内では、スコアはモデルの貢献ベンチマークの加重平均です。各ベンチマークの実効重みは sub_weight × source_tier_multiplier です。サブウェイトはベンチマークごとに固定されており、コンポーネント内の各ベンチマークの相対的な重要性を反映しています(例:ARC-AGI-2は推論の25%を占め、GPQAは20%を占めます)。飽和ルールは動的に適用されます:ベンチマーク上のトップ10モデル間の正規化スコアのIQRが5パーセントポイント未満に低下した場合、そのベンチマークのサブウェイトは半分になり、解放されたウェイトは同じコンポーネント内の飽和していないベンチマークに再分配されます。これにより、コンポーネントスコアは、まだフロンティアモデルを識別しているベンチマークに引き続き応答します。ソース階層化は、ソースの独立性に基づいてセルに倍率を適用します(T1 1.00倍、T2 0.85倍、T3-検証済みラボ 0.75倍。T4はスコアリングから完全に除外)。コンポーネントの重みは、下のエクスプローラーでユーザーが調整できます。AGIスコア = Σ (wᵢ × Cᵢ) / Σ wᵢ ここで Cᵢ = コンポーネントスコア(カバレッジが薄い場合は中央値に向かって収縮)、wᵢ = コンポーネントの重み 4 スパースデータ処理(非対称プルダウン + 再正規化) ベンチマークのカバレッジは不均一です。各コンポーネント内で、存在するベンチマーク over 加重平均を計算します(分母を再正規化)。次に非対称プルダウン収縮:モデルのコンポーネント内のカバレッジが60%未満であり、かつ生のスコアが母集団の中央値を超えている場合、カバレッジ不足に比例して中央値に引き寄せます。カバレッジが薄い低スコアは低いままで、弱点を隠すことへの報酬はありません。カバレッジが薄い高スコアは引き寄せられます。