Odds
xG를 활용해 축구 경기 결과를 예측할 수 있을까?
이 글에서는 기대 득점(Expected Goals, xG)이 무엇인지 이해하고, xG를 활용해 축구 경기를 예측하는 방법을 살펴본 뒤, 마지막으로 영국 북서부에 위치한 랭커스터 대학교의 연구자 마크 딕슨(Mark Dixon)과 스튜어트 콜스(Stuart Coles)가 개발한 모델을 분석해 보겠습니다.
스포츠 베팅, 특히 단순한 취미 이상의 수준으로 접근하고자 하는 사람들에게는 오래전부터 “기대값(Expected Value, EV)”이라는 개념이 익숙합니다.
베팅에는 승리와 패배가 존재하지만, 실제 결과의 상당 부분은 운에 의해 좌우됩니다.
그러나 장기적으로 보면 기대값에 대한 이해는 더 큰 표본에서 얼마나 수익을 기대할 수 있는지를 추정하는 데 도움을 줍니다. “기대(Expectation)”라는 용어는 사실상 “산술 평균” 또는 “평균값”을 의미합니다.
최근에는 이러한 기대 개념이 축구에도 적용되기 시작했으며, 그것이 바로 기대 득점(Expected Goals, xG)입니다.
xG는 팀과 선수의 경기력을 평가하기 위해 사용되는 성과 지표로, 특정 득점 기회가 실제 골로 이어질 확률을 수치화합니다.
이 확률은 유사한 슈팅 상황과 과거 골 전환율 데이터를 기반으로 계산됩니다. 따라서 한 번의 득점 기회에 대한 xG 값은 0에서 1 사이가 됩니다.
또한 경기 중 여러 득점 기회의 xG를 합산하면 해당 경기 전체의 xG가 계산되며, 일반적으로 팀별 xG 수치로 표현됩니다.
이론적으로 xG는 실제 득점 수보다 팀 경기력과 팀 간 우위를 더 정확하게 반영하는 지표입니다.
득점에는 일정 수준의 운(통계학자들이 말하는 “노이즈”)이 포함되기 때문에, 실제 스코어만으로 다음 경기를 예측하는 것은 xG를 사용하는 것보다 신뢰성이 낮을 가능성이 있습니다.
어떤 의미에서는 실제 득점은 베팅에서의 승패와 비슷하고, xG는 기대값(EV)과 유사합니다. 그렇다면 실제 득점 대신 xG를 사용해 축구 경기 결과를 예측하고 수익을 낼 수 있을까요?

골 수와 xG 비교
수학자이자 《Soccermatics: Mathematical Adventures in the Beautiful Game》의 저자인 데이비드 섬프터(David Sumpter)는 향후 경기 결과 예측에서 실제 득점과 xG 중 무엇이 더 유용한지에 대해 흥미로운 통찰을 제시했습니다.
그는 골 데이터를 이용해 예측 신호(signal)를 찾는 것이 얼마나 어려운지를 간결하게 설명합니다.
“통계학적 관점에서 축구 경기 결과는 신호라기보다 거의 노이즈에 가깝다. 이는 포아송 분포(Poisson distribution)를 통해 설명할 수 있다. 축구 득점은 포아송 분포를 따르며 팀은 평균 약 1.4골을 기록한다. 포아송 분포에서는 평균과 분산이 같기 때문에 표준편차는 √1.4, 즉 1.18이 된다. 따라서 노이즈(1.18)는 신호(1.4)보다 겨우 약간 낮은 수준이다.”
반면 xG는 득점 기회의 질을 측정하는 지표이므로 실제 골 수보다 경기력 평가에 더 적합합니다.
일반적으로 xG는 노이즈가 적고 시그널(signal)이 더 많습니다.
골 데이터와 xG 데이터 모두 경기 수가 많아질수록 노이즈는 감소하지만, 초기에는 xG의 감소 속도가 더 빠릅니다.
섬프터는 이러한 점을 바탕으로 향후 경기 예측 시 어떤 데이터를 중점적으로 봐야 하는지 제안합니다.
1~2경기 정도라면 경기 자체의 내용(매치 리포트)이 가장 유용한 정보를 제공합니다.
반면 15경기 이상, 혹은 반 시즌 수준의 표본에서는 실제 골 데이터도 xG만큼 신뢰할 수 있습니다.
노이즈는 여전히 약간 더 크지만 차이는 매우 작습니다. 또한 실제 득점은 “현실에서 일어난 결과”인 반면, xG는 득점 확률을 기반으로 한 모델입니다. 만약 모델 자체가 부정확하다면 실제 골 데이터보다 신뢰성이 떨어질 수도 있습니다.
그 중간 영역이 바로 xG를 예측 도구로 사용할 때 가장 흥미로운 구간입니다.
섬프터에 따르면 xG 비율(xG ratio)은 3~6경기에서 가장 유용하며, 7~15경기 구간에서는 실제 득점과 xG를 함께 비교하는 것이 더 현명할 수 있습니다.
이 글에서 저는 팀의 최근 6경기를 활용한 xG 예측 모델을 구축해, 스포츠 베팅 시장에서 수익을 창출할 수 있는지를 테스트했습니다.
딕슨-콜스(Dixon-Coles) 모델
축구 경기 예측 분야에서 가장 잘 문서화된 접근법 중 하나는 1997년 랭커스터 대학교의 마크 딕슨과 스튜어트 콜스가 『Journal of Applied Statistics』에 발표한 연구입니다.
“딕슨-콜스 모델(Dixon-Coles Model)”로 알려진 이 접근법은, 각 팀의 득점과 실점을 리그 평균과 비교하여 공격력과 수비력을 계산하는 개념을 기반으로 합니다.
이는 일정 기간 동안의 경기 데이터를 바탕으로 산출됩니다.
이러한 데이터를 통해 각 팀이 다음 경기에서 기록할 것으로 예상되는 득점 수를 추정합니다.
딕슨-콜스(Dixon-Coles) 모델 (계속)
마지막으로, 예상 득점 수를 평균값으로 사용하는 포아송 분포(Poisson distribution)를 통해 각 득점 확률을 계산합니다. Pinnacle 또한 이 방법론을 설명하는 기사를 공개한 바 있습니다.
여기서 저는 기존의 실제 득점 대신 xG(기대 득점) 를 사용하도록 모델을 수정했습니다. 그리고 최근 홈 또는 원정 6경기를 기준으로 공격력과 수비력을 계산했습니다.
데이터셋에는 2015/16 시즌부터 2019/20 시즌까지 잉글랜드, 프랑스, 독일, 이탈리아, 스페인 1부 리그 경기들이 포함되었습니다.
홈 승리, 무승부, 원정 승리의 예측 확률은 공정 배당률(fair odds)로 변환되었으며, 이후 Pinnacle의 마감 배당률(closing odds)과 비교되었습니다.
모델이 계산한 공정 배당률보다 Pinnacle의 배당률이 더 높을 경우, 이는 이론적인 가치(value)가 존재한다는 의미였습니다. 이후 가치 베팅(value bets)의 실제 결과를 분석했습니다.
아래 그래프는 모델이 식별한 7,795개의 가치 베팅 기회(전체 18,006개 중)에 대한 수익 시계열을 보여줍니다.
고정 금액 베팅(flat staking) 기준 수익률은 **-5.0%**였습니다.
비교를 위해, 18,006개의 모든 결과에 무작위로 동일 금액을 베팅했을 경우 손실률은 **-4.3%**였습니다.
특히 이 샘플에서 평균 기대값(EV)이 **38.9%**였다는 점을 고려하면, 이를 단순히 “부진한 성과”라고 표현하는 것은 매우 절제된 표현일 것입니다.

모델의 잠재적 한계
이 모델 실패의 첫 번째 신호는 아마도 평균 기대값(EV) 자체에 있을 수 있습니다.
평균 배당률이 4.69임에도 불구하고, 전체 베팅 기회의 3분의 1 이상에서 평균 기대값이 약 **40%**에 달했다는 사실은, 모델이 계산한 공정 배당률과 Pinnacle 실제 배당률 사이에 매우 큰 괴리가 존재했음을 강하게 시사합니다.
실제로 모델이 예측한 xG 값과 실제 경기에서 기록된 xG 값을 비교한 상관 그래프는 이를 잘 보여줍니다.

노이즈가 상당히 많으며, 모델링된 xG는 실제 경기에서 팀이 기록한 xG를 정확하게 예측하지 못합니다.
이 모델 실패의 원인을 특정하기는 쉽지 않으며, 최소 네 가지 문제 가능성이 존재합니다.
첫 번째는 딕슨-콜스 모델 자체가 축구 점수 예측에 본질적으로 부적절할 가능성입니다.
이 모델의 핵심인 포아송 분포는 득점들이 서로 독립적이라는 가정을 전제로 합니다. 즉, 하나의 골이 또 다른 골의 원인이 되지 않는다는 것입니다.
하지만 현실에서는 이러한 가정이 선수와 팀의 심리적 요소를 충분히 반영하지 못합니다.
예를 들어, 뒤지고 있는 팀은 동점을 만들기 위해 더 강한 동기부여를 받을 수 있으며, 무승부 상황의 팀 역시 승리를 위해 더 적극적으로 공격할 가능성이 있습니다.
스포츠 베팅에서 좋은 ROI란 무엇인가?
만약 그렇다면, 득점이 무작위적으로 발생한다는 개념 자체를 재검토해야 할 수도 있습니다.
딕슨과 콜스는 원래 모델이 저득점 경기(0-0, 1-0, 0-1, 1-1) 를 과소평가한다는 사실을 스스로 인정했습니다.
이를 검증하기 위해 저는 모델이 예측한 xG 데이터와 실제 경기 xG 데이터를 각각 낮은 값부터 높은 값 순으로 재정렬한 뒤, 인위적인 상관 그래프로 시각화했습니다(실선).
그 결과, 모델이 예측한 것보다 낮은 xG 경기 수는 더 적고, 반대로 높은 xG 경기 수는 더 많다는 점이 명확하게 드러났습니다(점선).
딕슨-콜스가 실제 골 데이터에서 발견한 문제는 xG에서도 동일하게 나타나는 것으로 보입니다.
대규모 데이터 샘플에서 실제 득점과 xG가 높은 상관관계를 보인다는 점을 고려하면, 이는 놀라운 결과는 아닙니다.

두 번째 잠재적 오류 원인은 xG 모델 자체입니다.
제 데이터 샘플에서 실제 총 득점은 모델이 예측한 골 수의 **97.8%**와 일치했습니다.
표면적으로는 상당히 좋은 결과처럼 보이지만, 이러한 작은 차이가 전체 예측 모델의 유효성에 얼마나 영향을 미치는지는 판단하기 어렵습니다.
프리시즌 경기에서 베터가 배울 수 있는 것은 무엇인가?
세 번째 오류 원인은 공격력과 수비력을 계산할 때 사용한 최근 경기 수 선택일 수 있습니다.
앞서 설명한 이유로 저는 최근 6경기를 선택했습니다.
그러나 더 적거나 더 많은 경기 수를 사용했다면 결과가 개선되었을 가능성도 있습니다.
이 변경은 비교적 쉽게 구현할 수 있지만, 모델 전체를 재구성해야 하기 때문에 여기서는 진행하지 않았습니다.
또한 6경기에 동일한 가중치를 부여했습니다.
하지만 딕슨과 콜스는 더 최근 경기에 더 높은 가중치를 부여해야 할 가능성을 인정했고, 이후 모델 버전에서는 이러한 가중치를 도입했습니다.
이 역시 제가 직접 모델링할 수 있었지만, 작업의 복잡성과 시간 소모 때문에 구현하지 않았습니다.
다음 파트에서 결론 (“존재론적 문제”, Pinnacle 모델과의 비교, xG로 수익을 낼 수 있는가?) 를 이어서 번역하겠습니다.
2024년 2월 24일 토요일
같은 카테고리에서
Odds
FIFA Club World Cup 2025: Opta’s Predictions
2025년 6월 13일 금요일
As the FIFA Club World Cup 2025 approaches, set to take place in the United States, the football world is closely watching this newly expanded 32-team tournament. Opta has released its data-driven predictions as of June 9, 2025, estimating each club’s cha...
기사 보기Odds
스포츠 베팅에서 진짜 실력을 어떻게 측정할 수 있을까?
2025년 3월 15일 토요일
스포츠 베팅에서 수익이 난다고 해서 반드시 실력이 있다는 뜻은 아니다스포츠 베팅에서는 단기간에 큰 수익을 올리는 사람을 보면 쉽게 “이 사람은 정말 잘한다”고 생각하게 됩니다.하지만 현실은 훨씬 더 복잡합니다.실력이 부족한 베터도 운 좋게 몇 달 동안 큰 수익을 낼 수 있고,반대로 매우 뛰어난 베터도 긴 손실 구간을 겪을 수 있습니다.그래서 중요한 질문은 단순히:👉 “얼마를 벌었는가?”가 아니라,👉 “그 결과가 반복 가능한 실력에서 나온 것인가, 아...
기사 보기Odds
스포츠 베팅에서의 분산(Variance)의 진실
2025년 3월 8일 토요일
📉 분산(Variance)이란 무엇인가?스포츠 베팅에서 분산은 절대 피할 수 없는 개념입니다.많은 베터들은 몇 번 연속으로 패배하면 자신의 전략이 잘못되었다고 생각합니다. 하지만 실제로 단기 결과는 실력보다 확률적 변동성에 더 크게 영향을 받는 경우가 많습니다.분산이란 간단히 말하면:기대했던 결과와 실제 결과 사이의 차이를 의미합니다.플러스 기대값(+EV)을 가진 전략을 사용하더라도, 단기적으로는 큰 손실이 발생할 수 있습니다.반대로 장기적으로는 손해...
기사 보기Bet2Invest는 북메이커가 아니며 스포츠 베팅 서비스를 제공하지 않습니다. 다만, 콘텐츠는 스포츠 베팅 활동과 관련되어 있습니다.
미성년자의 도박은 엄격히 금지됩니다. 책임감 있게 플레이하세요 — 과도한 도박은 금전적 손실, 부채 또는 중독으로 이어질 수 있습니다.