HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

最先端モデルは物理学においてどの程度優れているのか?

How good are frontier models at physics? (arxiv.org)

24 pointsby qt314159265 コメント

要約

最先端の言語モデルは物理学のベンチマークで低いスコアを示すとされていましたが、専門家による詳細な監査の結果、多くの「間違い」はモデルの誤りではなく、評価手法や参照解答の不備に起因することが明らかになりました。これらの問題点を修正したところ、モデルの物理問題解決能力は大幅に向上し、現在のベンチマークがモデルの真の能力を過小評価している可能性が示唆されました。今後は、より高度で専門家が検証した評価手法が必要とされています。

全文翻訳

人工知能指数(2026年)でも取り上げられている主要な物理学ベンチマークにおける低い報告スコアは、最先端の言語モデルが依然として高度な物理学に苦戦していることを示唆しており、これは科学的推論と定量的問題解決能力に対する厳しいテストです。しかし、この印象はドメイン専門家が自身の業務でこれらのモデルを使用する経験と必ずしも一致しません。 私たちは、6つの広く使用されている物理学ベンチマークで最先端モデルを評価し、専門家による監査を行うことで、これらの報告された発見を再検討します。特に、検証可能な最終的な答えを持つテキストのみの問題に焦点を当てます。 物理学の各サブフィールドにおいて、関連する専門知識を持つ教員や大学院生が、問題文、参照解答、およびモデルの応答を注意深くレビューし、モデルの真のエラーと、グレーダーのエラー、不正確な参照解答、曖昧または不十分な質問を区別します。 監査されたケースのほとんどは、当初誤りと評価されたものでしたが、モデルの物理学推論におけるエラーではなく、これらのベンチマークの問題を反映していました。 次に、専門家にこれらのベンチマークの問題に対処してもらい、誤った参照解答を修正したり、欠陥のある質問を修正または除外したりします。 GPT-5.6-Solの測定されたmean@4は、HLE-Physicsで47.3%から78.7%に、CMT-Benchmarkで61.0%から87.2%に上昇し、その修正されたpass@4は、保持された54のCritPtチャレンジで94.4%に達することがわかりました。修正されたスコアは、専門家レビューに続く保持された評価サブセットで計算されます。 UGPhysics、PRISM-Physics、およびPHYBenchの監査されたサブセットのスコアも、修正後に大幅に上昇します。 これらの発見は、現在のベンチマークが、適切に定式化された物理学の問題を解決する最先端モデルの能力を大幅に過小評価していることを示唆しています。これらの閉鎖的なタスクにおける飽和状態は、より要求が高く、専門家によって検証された評価の必要性を浮き彫りにしています。