AI・機械学習
Minecraftの再現はベンチマークではない
Recreating Minecraft Is Not a Benchmark (kuber.studio)
要約
この記事では、AIモデルの能力を評価するために使用される「デモベンチマーク」の有効性に疑問を呈しています。Minecraftの再現やペリカンが自転車に乗るような、視覚的で分かりやすいデモは、モデルの進歩をマーケティングするには効果的ですが、固定されたテストケースは容易に最適化されてしまうため、モデルの真の能力を測る指標としては不十分であると論じています。真のベンチマークは、常に進化し、予測不可能であるべきだと主張しています。
全文翻訳
GPT Astraが数日前にリリースされ、必然的に私のフィード全体が同じ5つのこと、つまり1つのプロンプトでMinecraftを再現すること、MSペイントで自分自身を描くこと、SVGで自転車に乗るペリカン、信じられる重力を持つ回転する箱の中で跳ねるボール、そしてSVGゲームコントローラーで埋め尽くされました。
紙の上では、これらはモデルにとってより難しく、より視覚的な問題のように見えます。それらがこれほど大きい理由があります。
私はそれらをデモベンチマークと呼び始めています。誰にでも理解できるほど視覚的で分かりやすいですが、次のモデルがそれに「完璧」になるのに十分な有限性があります。
問題は、これらのテストではモデルの良さをもう測れないということです。なぜなら、ラボが次のリリースでこれらのテストに正確に最適化するのは容易だからです。
正直に言って、彼らがそうしないのは彼らのせいではありません。打ち上げをペリカンや3Dゲームコントローラーほど引用できないタイムラインほど売れるものはありません。
View Tweet
固定された有名なターゲットと8週間のランウェイは、解決されたペリカンです。これらのテストは決して変わらず、決して変わらないものは過学習される可能性があります。
スケジュールで完璧にできるテストは、準備を測定するのであって、能力を測定するのではありません。私にとって、それはベンチマークの定義そのものに反しています。それは難しいテストであるべきです。完璧にするのが非常に難しいものです。
同じダイナミクスがオープン評価にも見られます。実際にはより賢く感じる小さなモデルが、Artificial Analysisのようなサイトではより優れたモデルを上回っています。
これは仮説ではありません。Thinking MachinesのInkling Smallは、パラメータの3分の1未満で、Artificial Analysis Intelligence Indexでフラッグシップモデルと1ポイント差であり、Humanity’s Last Exam、GPQA Diamond、SciCodeではそれを上回りました。
公開された、静的な、有名なテストセットは、トレーニングデータやファインチューニングの選択肢に漏れ込みます。
ローンチは第一印象であり、第一印象はマーケティングです。だからこそ、あなたは常に驚くことになるでしょう。その驚きはスケジュールされていたのです。
では、代替案は何でしょうか?
正直に言って、私は確信がありません。なぜなら、考えてみると、明白な解決策はすでに存在しているからです。
LiveBenchは質問をローテーションし、ARC-AGIはプライベートセットを保持し、Humanity’s Last Examは一部を保持しています。
テストされる側が何をテストされているかを知らないテスト:まだ書かれていないテストに教えることはできません。
しかし、ホールドアウト評価が答えであるなら、なぜペリカンはまだ勝つのですか?
答えは、ソーシャルメディアのほとんどが研究論文を理解する必要がないことです。自転車にペダルが付いたか、アニメーション化されたことに気づく必要はありません。
デモベンチマークは、それが数秒でより良い能力である理由を明白にします。
だから、いいえ、良いデモの代替案はありません。
しかし、モデルが実際にどれほど良いかを見るための、デモベンチマークよりも優れた代替案はあります。
そして、モデルがうまくスコアを付けたのに、あなたの仕事で失敗し続けるなら、それは調査に値するギャップです。
デモベンチマークは素晴らしいコンテンツになります。
ただ、それらで採点するのをやめてほしいだけです。