HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

フロンティアモデルカード30件を調査:各ラボが報告したベンチマーク一覧

I checked 30 frontier model cards. Here are the benchmarks labs report (koutian.is-a.dev)

7 pointsby ktwu017 コメント

要約

この記事は、AIモデルのベンチマーク報告を追跡・可視化するダッシュボードの機能について解説しています。モデルカードごとのベンチマーク採用状況、組織ごとの報告頻度、スコアの推移などをグラフやタイムラインで表示し、データの透明性と検証可能性を高めることを目的としています。

全文翻訳

今日のデイリーブリーフィング 今日の質問 検索 スキャン日 種類 カテゴリ ソース 組織 イベント フィルターをクリア 一致する観測結果 さらに表示 2つのレイヤーが示すもの 明記された発見事項 報告の推移 ベンチマークの採用 フロンティア 追跡されたすべてのベンチマーク 1つの時間軸上の3つの測定値。 各オレンジ色のひし形は、そのベンチマークの最初の報告を行った組織を示しており、累積数を増加させる唯一のイベントです。その下のラグは、日付の付いたモデルカードごとに1つの目盛りを示しており、すでにカウントされている組織からの後続のカードは灰色の目盛りとして表示され、階段状のグラフは平坦になります。 公開日がないカードはタイムライン上に配置できず、両方の帯に含まれませんが、上記の合計にはカウントされます。 長い平坦な期間は、このキュレーションされたレジストリ内で観測された報告の飽和状態を示しており、ベンチマークスコアの飽和状態についての主張ではありません。 その下のスコアトラックは別の測定値です。引用された文書からそのまま読み取れるすべての値であり、機器とプロトコルが同一である場合にのみ接続されています。 平坦なスコアのテールは、通常、新しい数値を読み取れなかったことを意味するため、ギャップは描画せずにマークされています。 フロンティアのマイルストーン モデルカードの採用によるベンチマーク 検索 ドメイン 組織 ベンチマークリリース フィルターをクリア 各モデルカードはベンチマークごとに1回カウントされます。 AIMEを4つの構成で報告するカードは、1回報告するカードと同じようにカウントされるため、長い付録は異なるベンダーを上回ることはできません。 組織がタイを破ります。6つのベンダーからの同じカウントは共有標準であり、1つのベンダーからのカウントはハウススタイルです。 カウントを監査する レジストリ内のモデルカード このランキングが計算されるキュレーションされたソースリスト。 任意のカードを展開すると、ソースドキュメントがグループ化している方法でグループ化された、報告されているすべてのベンチマークが表示されるため、データを元のドキュメントと行ごとに照合できます。 ドメイン別の新規 毎日の証拠と注目度 カテゴリタグは重複します。各バーは独立したカウントであり、積み上げ合計の一部ではありません。 リリースのみ すでに公開されたものの更新として再発表されたレコードは除外します。 毎日の台帳 ソースミックスは、スコアリング後のランク付けされた証拠をカウントします。 フェッチヘルスは、スコアリング前の生レコードをカウントするため、ソースは正常でも空の場合があります。 日付 カバレッジ (UTC) 証拠 ソースミックス カテゴリ イベント 注目度 フェッチヘルス ダッシュボードが利用できません 検証済みのデータファイルをロードできませんでした。 更新を試すか、最新のデイリーを検査してください。 ダッシュボードの再構築中に問題が発生しました。 毎日の問題を開く ↗