HN 日本語サマリー

← 一覧へ戻る
科学・技術

私のフットボール予測モデルはブックメーカーの0.198に対し0.203を記録するも、負ける

My football predictor scores 0.203 vs. the bookies' 0.198 – and loses (kickoffreport.com)

3 pointsby cmanoliu2 コメント

要約

Kickoff Reportは、独自のフットボール予測モデルを開発し、その仕組みとパフォーマンスを詳細に説明しています。モデルはEloレーティングと最近のフォームを基に、各チームのゴール期待値を算出し、それをポアソン分布とDixon-Coles補正を用いてスコアライン確率に変換します。テストの結果、モデルはブックメーカーのオッズに迫る精度を示しましたが、僅かに及びませんでした。

全文翻訳

キックオフレポートのすべての試合プレビューには予測が含まれています。各サイドの勝利確率、期待ゴール数、最も可能性の高いスコアライン、そして最も可能性の高い3つの正確なスコアです。これらの数字は推測ではなく、ブックメーカーからスクレイピングされたものでもありません。それらは私たちが構築し、テストしたモデルから来ています。このページでは、そのモデルがどのように機能するか、何が入力され、それらの入力で何が行われ、そして実際の成績と比較してどの程度うまく機能するかを、平易な言葉で正確に説明します。 短いバージョン 各チームがどれだけゴールを挙げる可能性が高いかを推定し、その2つの数字をあらゆる可能なスコアラインの確率に変換します。ホームチームが勝利するスコアラインを合計するとホーム勝利確率が得られます。同様に引き分けとアウェイ勝利についても行います。 期待ゴール数推定は、各チームの強さを示す単一の数値であるEloレーティングを基準とし、最近のフォームで洗練されています。スコアライン確率は、Dixon-Colesと呼ばれるよく知られた低スコア補正を持つポアソンモデルから来ています。それが全体のエンジンです。残りは詳細です。 ステップ1 — 各チームの強さは? (Eloレーティング) 出発点は、各サイドのEloレーティングです。Eloはチェスのランキングと同じ考え方です。各チームには数値があり、2つのチームの数値の差が、一方のチームがもう一方よりどれだけ強いかを示します。100ポイントの差は、トップクラブ対中位クラブでも、ワールドカップの優勝候補対アウトサイダーでも、同じ意味を持ちます。 国内クラブについては、公開されているクラブEloレーティングを使用します。国際チームについては、ナショナルチームEloを使用します。レーティングは結果が入るにつれて更新され、古くなったレーティング(1ヶ月以上更新がない)は信頼されるのではなく、欠落として扱われます。 ステップ2 — レーティング差を期待ゴールに変換 Eloは誰が強いかを示しますが、予測にはゴールが必要です。レーティング差をゴール優位性、つまり強い方のチームがどれだけ多くのゴールを挙げる可能性があるかに変換します。これは単純で調整された関係に基づいています:優位性 = K × (レーティング差) ここでKは過去のデータから適合させた係数です(詳細は後述)。平均的な試合の総ゴール数を仮定し、その合計を優位性を使って中立点周りで分割します。優位な方のシェアは増え、劣勢な方のシェアは減ります。結果として得られる2つの数値、ホームサイドとアウェイサイドの期待ゴール数(統計学者はこれをラムダと呼びます)が予測の心臓部です。 ホームアドバンテージもここで追加されます。ホームサイドのレーティングに固定ボーナスとして追加されます。これは、実際のホーム観客と慣れ親しんだピッチが提供する優位性に相当します。中立会場の試合、例えばワールドカップ決勝では、そのボーナスはゼロに設定されます。開催国のチームが自国で開催されるトーナメントでプレーする場合は、維持されます。 ステップ3 — 最近のフォーム、慎重に使用 レーティングは長期的な強さを捉えますが、ここ数週間の状態は捉えません。そのため、最近の結果がある場合は、フォームに基づいた推定値をブレンドします。これは、チーム自身の得点率を、相手の守備の堅さで調整したものです。最近の試合は古い試合よりも重要視されます。最も最近の5試合は、古いものから新しいものへと重み付けされており、先週末は1ヶ月前よりも重要です。 2つの正直な注意点。第一に、フォームは補助的なものであり、同等のパートナーではありません。両チームが信頼できるEloレーティングを持っている場合、テストではフォームを混ぜるよりも優れた予測を生成したため、Eloベースの推定値に完全に依存します。フォームは、レーティングが欠落している場合に真の働きをします。シーズンの早い段階や、現在のレーティングがないチームの場合です。第二に、リーグ平均ゴール率を推定するのに十分なシーズンが経過している場合にのみ、リーグ平均ゴール率を信頼します。数回のワールドカップグループゲームでは少なすぎるため、妥当なデフォルト値にフォールバックします。 ステップ4 — 直接対決、穏やかな調整のみ 2チームが最近少なくとも3回対戦している場合、その履歴を推定値の調整に利用します。ただし、その調整は10パーセントに限定され、ホーム側だったかに関わらず、各過去の試合のゴールを正しいチームに帰属させることを確認した後のみ行います。直接対決は弱く、ゆっくりと変化するシグナルであり、私たちはそれをそのように扱います。それは決してレーティングを上書きせず、わずかに傾けるだけです。 ステップ5 — 期待ゴールから完全な確率セットへ これで2つの期待ゴール数値が得られました。確率を得るために、各チームのゴールはポアソン分布に従うと仮定します。これは、試合中のゴールのような独立したイベントを数えるための標準的な統計モデルです。これにより、0-0、1-0、2-1など、各サイド最大10ゴールまでのグリッド全体で、あらゆる正確なスコアラインの確率が得られます。 実際のサッカーには、純粋なポアソンモデルが見落とす、よく文書化された1つの癖があります。それは、チームがスコアに応じてプレーを調整するため、低スコアの結果(0-0、1-0、1-1)が純粋な独立性によって予測されるよりもわずかに多く発生することです。私たちは、これらの特定の低スコアラインを観測された頻度に引き上げるために、Dixon-Coles補正(Mark DixonとStuart Colesによる1997年の論文から)を適用します。これは、ごまかしの要素ではなく、小さく原理に基づいた調整です。 グリッドを合計すると、ウィジェットが表示するすべてが得られます:勝利/引き分け/敗北確率 — ホーム勝利スコアライン、引き分けスコアライン、アウェイ勝利スコアラインをすべて合計します。最も可能性の高いスコアライン — 単一の最も可能性の高い正確なスコア。(最も可能性の高いスコアが引き分けでも、一方のサイドが全体的に明らかに有利である場合、通常のチップスターの慣習に従い、そのサイドの最も可能性の高い勝利スコアを表示します。ただし、真のコインフリップは引き分けを維持します。)上位3つのスコアライン — パーセンテージ付きの、最も可能性の高い3つの正確なスコア。両チーム得点および2.5ゴール以上/以下は、同じグリッドから直接読み取れます。 ノックアウト:誰が勝ち進むか 主要トーナメントのシングルレッグノックアウトタイでは、90分後の引き分けは終了しません。延長戦とPK戦になります。これらの試合では、通常の時間での勝利だけでなく、各サイドが進出する確率も示します。これは、チームのレギュラータイム勝利確率に引き分け確率の半分を加えたもので、延長戦とPK戦の抽選を50/50として扱います。一方のサイドが明確な有利(少なくとも五分五分のレギュラータイム勝利)である場合、ヘッドラインはそのサイドの最も可能性の高い勝利スコアを示します。タイが真の接戦の場合、ヘッドラインは最も可能性の高い90分間のスコアと、どちらが進出する可能性が高いかを示します。 実際にはどの程度機能するか? これはほとんどの予測サイトがスキップする部分です。私たちは、予測者が行うべき方法でモデルをテストします。つまり、フィッティング中に一度も見たことのない何千もの過去の試合を再再生し、実際の出来事と比較して予測を採点します。 私たちは、ヨーロッパのトップ5リーグの5シーズン分の結果でモデルの係数を適合させ、その後、トレーニングに使用されなかった完全に別のシーズン(1,751試合)で検証しました。 主な測定基準は、3方向のフットボール予測の標準的な指標であるRanked Probability Score (RPS)です。低いほど良いです。完璧な予測は0を記録します。そのホールドアウトシーズンでは: モデル RPS(低いほど良い) キャリブレーション 単純な「リーグ平均」ベースライン 0.229 — 私たちのモデル 0.203 0.97 Bet365のオッズ(ブックメーカーのベンチマーク) 0.198 — ここで重要なことが2つあります。第一に、私たちのモデルは単純なベースラインを明らかに上回っています。それは実際のモデルであり、飾り立てられた平均ではありません。第二に、そして同様に重要なことですが、それはブックメーカーを上回っておらず、そのように装うつもりもありません。Bet365のインプライドオッズは、同じ試合で私たちの0.203に対して0.198を記録しました。ブックメーカーはより多くのデータとリソースを持っており、そのオッズを打ち負かすのは非常に困難です。私たちのモデルはそれに近づいており、これは個人で構築したシステムとしては本当に良い結果ですが、「ブックメーカーよりも鋭い」ではなく、「ブックメーカーに近い」というのが正直な主張です。 キャリブレーション数は、私たちがそれを信頼するもう1つの理由です。キャリブレーションされたモデルとは、60%と言う場合、その事象が約60%の時間発生するモデルのことです。これを、予測値と実際値の頻度をプロットした線で測定します。完全にキャリブレーションされたモデルは傾きが1.0になります。私たちのモデルは0.97となり、非常に正直に近い値でした。 モデルを出荷する前に、以下のルールを設けています。それは、以前のモデルの精度を上回り、キャリブレーションの傾きが0.8から1.2の間であること。もし