Odds
xGを使ってサッカーの試合結果を予想できるのか?
本記事では、「期待ゴール(xG)」とは何かを理解し、xGを使ってサッカーの試合を予測する方法を探り、最後に、イングランド北西部にあるランカスター大学の研究者、マーク・ディクソンとスチュアート・コールズが開発したモデルについて分析していきます。
スポーツベッティング、とりわけ単なる娯楽以上のものとして取り組もうとする人々にとって、「期待値(Expected Value)」という概念は長年なじみ深いものです。
ベットには勝ちも負けもありますが、その結果の大部分は、実際には運によって左右されます。
しかし長期的には、期待値を理解することで、より大きなサンプル数のベットにおいて、どれほどの利益が期待できるかを推定することが可能になります。「期待(Expectation)」という言葉は、単純に言えば「算術平均」または「平均値」を意味します。
近年、この「期待」という概念は、サッカー界にも「期待ゴール(Expected Goals, xG)」という形で浸透してきました。xGは、チームや選手のパフォーマンスを評価する指標として使われており、得点機会に対して「ゴールになる確率」を割り当てることで分析を行います。
この確率は、過去の類似したシュート機会や得点率の履歴データをもとに計算されます。そのため、1つの決定機に対するxG値は0から1の間になります。
さらに、試合中の複数の得点機会におけるxGを合計すると、その試合全体のxG、より一般的には各チームのxGが算出されます。
理論上、xGは実際の得点数よりも、試合内容やチーム間の実力差をより忠実に反映する指標とされています。
得点にはある程度の運(統計学でいう「ノイズ」)が含まれており、実際のスコアだけを使って次の試合を予測することは、xGを利用する場合よりも信頼性が低い可能性があります。
ある意味では、得点はベッティングにおける勝敗に似ており、xGは期待値(EV)のようなものです。だとすれば、実際の得点の代わりにxGを使って試合結果を予測し、利益を上げることは可能なのでしょうか?

ゴール数とxGの比較
数学者であり、『Soccermatics: Mathematical Adventures in the Beautiful Game』の著者でもあるデイヴィッド・サンプターは、将来の試合予測において、得点数とxGのどちらが有用かについて興味深い見解を示しています。彼は、ゴールデータから予測シグナルを見つけ出す難しさを簡潔に説明しています。
「統計学的観点から見ると、サッカーの試合結果は、シグナルというよりノイズに近い。これはポアソン分布から数学的に説明できる。サッカーの得点はポアソン分布に従い、チームは平均約1.4ゴールを記録する。ポアソン分布では平均と分散が等しいため、標準偏差は√1.4、すなわち1.18となる。つまりノイズ(1.18)は、シグナル(1.4)よりわずかに小さい程度に過ぎない。」
一方でxGは、得点機会の質を測る指標であり、単なる得点数よりもチームのパフォーマンスをより正確に評価できます。
一般的にxGにはノイズが少なく、シグナルが多く含まれています。得点データとxGデータの双方において、分析対象の試合数が増えるほどノイズは減少しますが、その減少率は当初、xGの方が大きくなります。
サンプターはこの情報をもとに、今後の試合を予測する際に注目すべきデータの種類を提案しています。
1〜2試合程度であれば、試合そのものの内容(マッチレポート)が最も有益な情報を提供します。
一方で、15試合以上、あるいは半シーズンに相当するサンプルでは、ゴールデータもxGと同程度に信頼できる可能性があります。
ノイズは依然として若干大きいものの、その差は非常に小さくなります。また、ゴールは「実際に起きた現実」であるのに対し、xGは得点可能性を推定する確率モデルです。もしモデル自体が不正確であれば、実際のゴールデータより信頼性が低くなる可能性もあります。
その中間領域こそ、xGを予測ツールとして使う際に最も興味深い部分です。
サンプターによれば、xG比率(xG ratio)は3〜6試合のサンプルで最も有効であり、7〜15試合ではゴール数とxGを比較しながら使う方が望ましいとされています。
本記事では、私はチームの直近6試合を利用したxG予測モデルを構築し、それがベッティング市場で利益を生み出せるかを検証しました。
ディクソン=コールズ(Dixon-Coles)モデル
サッカー試合予測において最も文献化されたアプローチの一つは、1997年にランカスター大学のマーク・ディクソンとスチュアート・コールズが『Journal of Applied Statistics』に発表したものです。
「ディクソン=コールズモデル」として知られるこの手法は、各チームの得点数と失点数をリーグ平均と比較し、「攻撃力」と「守備力」を数試合分のデータから算出するという考え方に基づいています。
これらのデータをもとに、各チームが次の試合で記録すると予想される得点数を推定します。
ディクソン=コールズ(Dixon-Coles)モデル(続き)
最後に、各チームの予想得点数を平均値として、ポアソン分布を利用し、個別の得点確率を計算します。なお、Pinnacle はこの手法について詳しく説明した記事も公開しています。
ここでは私は、従来の「ゴール数」の代わりにxGを使用するようモデルを改良し、直近6試合のホームまたはアウェー成績をもとに攻撃力と守備力を算出しました。
データセットには、2015/16シーズンから2019/20シーズンまでのイングランド、フランス、ドイツ、イタリア、スペインの1部リーグの試合を含めています。
ホーム勝利、引き分け、アウェー勝利の予測確率は、それぞれ公平オッズ(フェアオッズ)へ換算され、その後、Pinnacleのクローズ価格と比較されました。
モデルが算出したフェアオッズよりもPinnacleのオッズが高い場合、それは理論上の「バリュー(期待値)」が存在することを意味します。その後、価値があると判断されたベットを実際の結果と比較しました。
以下のグラフは、モデルによって特定された7,795件のバリューベット(総対象18,006件中)における利益推移の時系列を示しています。
フラットベット(一定額賭け)によるROIは**-5.0%**でした。
比較対象として、18,006件すべての結果に対して無差別に1ユニットずつ賭けた場合の損失率は**-4.3%**でした。
さらに、このサンプルにおける平均期待値(EV)が**38.9%**だったことを踏まえると、この結果を単なる「期待外れ」と表現するのは極めて控えめな言い方でしょう。

モデルの潜在的な欠陥
このモデルが失敗した最初の兆候は、おそらく平均期待値(EV)の数字そのものにあります。
平均オッズが4.69であるにもかかわらず、全体の3分の1以上の試合で平均期待値が40%近く存在するという事実は、モデルが算出したフェアオッズと、Pinnacleの実際のオッズとの間に極めて大きな乖離が存在していたことを強く示唆しています。
実際、モデルによる予測xGと試合で実際に記録されたxGの相関グラフを見れば、その問題が明確になります。

ノイズが非常に多く、モデル化されたxGは実際の試合でのチームxGを精度高く予測できていません。
この失敗の原因を特定するのは簡単ではなく、少なくとも4つの潜在的問題が考えられます。
第一に、ディクソン=コールズモデル自体をサッカーのスコア予測に使用することが、本質的に誤っている可能性があります。
このモデルの中核であるポアソン分布は、「ゴール同士は独立している」という前提に立っています。つまり、あるゴールが別のゴールの原因にならないという仮定です。
しかし実際には、この前提は選手やチームの心理的影響を十分に考慮していません。
ビハインドを負ったチームは、同点に追いつくため以前より高いモチベーションを持つかもしれませんし、同点のチームは勝ち越しを狙ってさらに攻勢を強める可能性もあります。
スポーツベッティングにおける優れたROIとは?
もしそうであれば、「ゴールはランダムに発生する」という考え方そのものが見直されるべきかもしれません。
ディクソンとコールズ自身も、オリジナルの予測モデルが低スコア試合(0-0、1-0、0-1、1-1)を過小評価していることを認めています。
この点を検証するため、私は予測xGデータと実際のxGデータを、それぞれ低い順から高い順に並べ替え、人工的な相関グラフとして比較しました(実線)。
結果を見ると、低xG試合はモデル予測ほど存在せず、一方で高xG試合は予測以上に発生していることが明らかになりました(点線)。
ディクソン=コールズが得点データに関して指摘した問題は、xGにも当てはまるようです。
これは、大規模サンプルでは実際の得点数とxGが高く相関していることを考えれば、決して驚くべきことではありません。

第二の誤差要因として考えられるのは、xGモデル自体です。
私のデータサンプルでは、実際に記録された総得点数は、モデルが予測したゴール数の**97.8%**に相当しました。
一見すると非常に優れた精度に見えますが、このわずかな差異がサッカー予測モデル全体の有効性にどれほど影響するかは判断が難しいところです。
プレシーズンマッチからベッターは何を学べるのか?
第三の誤差要因として、攻撃力・守備力を計算する際に採用した「直近試合数」の設定が挙げられます。
本記事前半で述べた理由から、私は6試合を採用しました。
しかし、より少ない試合数、あるいはより多い試合数を使用していた場合、結果が改善されていた可能性はあります。
こうした変更は比較的簡単に実装できますが、モデル全体の再構築が必要になるため、ここでは行いませんでした。
さらに、6試合すべてに同じ重み付けを適用しました。
しかしディクソンとコールズは、より最近の試合に高い重みを与えるべき可能性を認識しており、後年のモデルではこの考え方を組み込んでいます。
これも私自身でモデリング可能でしたが、作業量の多さを理由に採用しませんでした。
続き(「最後の問題、存在論的な課題」〜結論)を翻訳します。
2024年2月24日土曜日
同じカテゴリ内
Odds
FIFA Club World Cup 2025: Opta’s Predictions
2025年6月13日金曜日
As the FIFA Club World Cup 2025 approaches, set to take place in the United States, the football world is closely watching this newly expanded 32-team tournament. Opta has released its data-driven predictions as of June 9, 2025, estimating each club’s cha...
記事を見るOdds
スポーツベッティングにおける「本当の実力」をどう測定するのか?
2025年3月15日土曜日
スポーツベッティングで「勝っている=実力がある」とは限らないスポーツベッティングでは、短期間で利益を出している人を見て「この人は本当に上手い」と判断してしまいがちです。しかし現実には、数週間や数か月の結果だけでは、実力と運を区別することは非常に困難です。偶然の連勝は存在します。 逆に、優秀なベッターでも長期間のマイナス収支に苦しむことがあります。だからこそ、本当に重要なのは「どれだけ勝ったか」ではなく、👉 その利益が再現可能なスキルによるものなのか?を測定することです。プロフェッショナルなベッティングの...
記事を見るOdds
分散の真実 ― スポーツベッティングにおける最大の誤解
2025年3月8日土曜日
📉 分散とは何か?スポーツベッティングにおいて、「分散(Variance)」は避けて通れない概念です。多くのベッターは、数回負けただけで「戦略が間違っている」と考えます。しかし実際には、短期的な結果は実力ではなく“確率の揺らぎ”によって大きく左右されます。分散とは簡単に言えば:期待される結果と、実際の結果との差を意味します。たとえプラス期待値(+EV)の戦略を使っていても、短期では損失が続くことがあります。逆に、長期的には負ける戦略でも、一時的に大勝ちすることもあります。つまり、短期間の結果だけでは「実...
記事を見るBet2Investはブックメーカーではなく、スポーツベッティングのサービスも提供していません。ただし、当サイトのコンテンツはスポーツベッティング活動に関連しています。
未成年者の賭博は固く禁じられています。責任あるプレイを — 過度な賭博は、金銭的損失、借金、依存につながる可能性があります。