体育中运气的作用-我们能测量它吗-
体育中运气的作用:我们能测量它吗?
原文:
towardsdatascience.com/the-role-of-luck-in-sports-can-we-measure-it/
引言 :当技能不足时
你看着你的球队控制着控球权,射门数翻倍……却还是输了。这只是运气不好吗?
球迷责怪裁判。球员责怪“状态不佳”。教练提到“势头”。但如果我们告诉你,随机性——而不是天赋或战术——可能是体育结果中的一个主要隐藏变量呢?
这篇文章深入探讨了运气如何影响体育,我们如何尝试使用数据量化随机性,以及数据科学如何帮助我们区分技能和运气。
所以,像往常一样,以下是我们今天要快速总结的内容:
-
在体育中定义运气
-
测量运气
-
回归残差
-
蒙特卡洛方法
-
贝叶斯推理
-
-
案例研究
-
著名的随机事件
-
如果我们能消除运气会怎样?
-
最后的想法
在体育中定义运气
这可能是有争议的,因为不同的人可能会有不同的定义,所有解释都同样可以接受。我的定义是:体育中的运气是关于方差和不确定性。
换句话说,我们可以说运气是所有未被技能解释的结果方差。
现在,对于数据科学家来说,另一种说法:运气是我们模型无法解释或适当预测的残差噪声(例如,模型可以是足球比赛)。以下是一些例子:
-
一脚空门打在门柱上而不是进球。
-
一记网球网前球改变了球的方向。
-
一个有争议的 VAR 决定。
-
板球或美式足球中的一次抛硬币获胜。
运气无处不在,我并没有发现什么新东西。但我们能测量它吗?
测量运气
我们可以用许多方式来测量运气,但我们将从基本到高级参观三种方法。
回归残差
我们通常专注于建模事件的预期结果:一个球队将进多少球,两个 NBA 球队之间的得分差将是多少……
没有完美的模型存在,我们所有人都知道,追求 100%准确率的模型是不现实的。但正是这种差异,将我们的模型与完美模型区分开来,我们可以将其定义为回归残差。
让我们看看一个非常简单的例子:我们想要预测一场足球(足球)比赛的最终得分。我们使用像 xG、控球率、主场优势、球员指标等指标……我们的模型预测主队将进 3.1 球,客队的得分板将显示 1.2(显然,我们得将它们四舍五入,因为实际比赛中进球是整数)。
然而,最终结果是 1-0(而不是 3.1-1.2 或四舍五入的 3-1)。这种噪声,即结果与预测之间的差异,就是我们所说的运气成分。
目标始终是让我们的模型减少这种运气成分(误差),但我们也可以用它来根据超常表现与预期表现来排名球队,从而看到哪些球队更容易受到运气(基于我们的模型)的影响。
蒙特卡洛方法
当然,蒙特卡洛方法必须出现在这篇文章中。我已经有一篇深入探讨它的文章(更具体地说,是关于马尔可夫链蒙特卡洛),但无论如何,我还是会介绍它。
蒙特卡洛方法或模拟包括反复使用抽样数字来获得一系列结果发生的似然性数值结果。
基本上,它被用来估计或近似不确定事件的可能结果或分布。
继续用我们的体育例子来说,假设一个篮球运动员从罚球线投篮的准确率为 75%。用这个百分比,我们可以模拟 10,000 个赛季,假设每个球员保持相同的技能水平,并随机生成比赛结果。
通过这些结果,我们可以比较基于技能预测的结果与模拟分布。如果我们看到球队的实际情况 FT%记录超出了模拟范围的 95%,那么这很可能是运气(是好是坏取决于极端情况)。
贝叶斯推理
这是我最喜欢的衡量运气的方法,因为贝叶斯模型能够将潜在技能与噪声性能区分开来。
假设你是一名足球选材团队的一员,正在检查来自当地挪威联赛最佳球队的年轻前锋。你特别关注他的进球转化率,因为那正是你球队所需要的,而你看到他在过去 10 场比赛中进了 9 球。他是精英球员吗?还是只是运气好?
使用贝叶斯先验(例如,平均转化率=15%),我们在每场比赛后更新我们的信念,最终得到一个后验分布,显示他的表现是否是持续高于平均水平的,或者只是一次偶然。
如果你想要深入了解贝叶斯推理的话题,我写了一篇尝试使用这些方法预测上季冠军联赛的文章:towardsdatascience.com/using-bayesian-modeling-to-predict-the-champions-league-8ebb069006ba/
案例研究
让我们动手实践一下。
情景是这样的:我们有 6 支球队的循环赛,每支球队都相互对战两次(主场和客场),每场比赛都为两支球队生成预期进球(xG),实际进球是从围绕 xG 的泊松分布中抽取的:
| 主场 | 客场 | 主场 xG | 客场 xG | 主场进球 | 客场进球 |
|---|---|---|---|---|---|
| 球队 A | 球队 B | 1.65 | 1.36 | 2 | 0 |
| 球队 B | 球队 A | 1.87 | 1.73 | 0 | 2 |
| 球队 A | 球队 C | 1.36 | 1.16 | 1 | 1 |
| 球队 C | 球队 A | 1.00 | 1.59 | 0 | 1 |
| 球队 A | 球队 D | 1.31 | 1.38 | 2 | 1 |
继续上一节留下的内容,让我们估计每个球队的真实进球能力,并看看他们的实际表现与它的偏离程度——我们将将其解释为运气或方差。
我们将使用贝叶斯泊松模型:
-
让λₜ代表每个球队的潜在进球率。
-
然后,我们的先验是λₜ ∼ Gamma(α,β)
-
我们假设进球数服从泊松分布(λₜ),并使用跨比赛的实际进球数来更新对λₜ的信念。
-
后验值,然后是:
λₜ | data ∼ Gamma(α+total goals, β+total matches)
对,现在我们需要决定α和β的值:
-
我的初始信念(没有查看任何数据)是,大多数球队每场比赛大约进 2 个球。我还知道,在伽马分布中,均值是使用α/β来计算的。
-
但我对它并不非常自信,所以我想标准差相对较高,至少要超过 1 个目标。再次强调,在伽马分布中,标准差是从√α/β计算得出的。
从这些推理中出现的简单方程中求解,我们发现α=2和β=1可能是好的先验假设。
这样,如果我们运行我们的模型,我们会得到以下结果:
| 球队 | 比赛场次 | 总进球数 | 后验均值(λ) | 后验标准差 | 观测均值 | 幸运(观测 - 后验) |
|---|---|---|---|---|---|---|
| 球队 A | 10 | 14 | 1.45 | 0.36 | 1.40 | −0.05 |
| 球队 D | 10 | 13 | 1.36 | 0.35 | 1.30 | −0.06 |
| 球队 E | 10 | 12 | 1.27 | 0.34 | 1.20 | −0.07 |
| 球队 F | 10 | 10 | 1.09 | 0.31 | 1.00 | −0.09 |
| 球队 B | 10 | 9 | 1.00 | 0.30 | 0.90 | −0.10 |
| 球队 C | 10 | 9 | 1.00 | 0.30 | 0.90 | −0.10 |
我们如何解释它们?
-
所有球队的表现都略低于他们的后验预期——在短暂的赛季中这是常见的,因为方差。
-
球队 B和球队 C的“幸运”差距最大:他们的实际得分比贝叶斯估计低每场比赛 0.10 个球。
-
球队 A最接近其预测的强度——最“中性”的幸运球队。
这是一个使用假数据编造的例子,但我敢打赌你已经开始感受到它的力量。
现在我们来检查一些体育世界中的历史随机时刻。
著名的随机性时刻
任何 NBA 球迷都会记得2016 年总决赛。那是第 7 场比赛,克利夫兰在勇士的主场进行比赛,他们在比赛还剩下不到一分钟时以 89 平。凯里·欧文面对斯蒂芬·库里,投进了一个令人难忘的、关键的 3 分球。然后,骑士赢得了总决赛。
这是技巧还是运气?凯里是一位顶级球员,也许也是一个很好的射手。但面对对手,时间和比分板上的压力……我们根本无法知道哪一个是它。
现在转向足球,我们专注于2019 年欧洲冠军联赛半决赛,利物浦对阵巴塞罗那。这场比赛对我个人来说很痛苦。巴塞罗那在首回合主场以 3-0 获胜,但在次回合在利物浦以 0-4 输球,给了红军晋级决赛的机会。
利物浦的超常表现?还是统计异常?
最后的一个例子:NFL 硬币投掷加时赛胜利。整个季后赛的结果都是由一个 50/50 的简单场景决定的,硬币(运气)拥有全部的决定权。
如果我们能消除运气怎么办?
我们能消除运气吗?答案是明确的:不能。
然而,为什么我们中的这么多人还在尝试呢?对于专业人士来说,这是显而易见的:这种不确定性会影响表现。我们能够控制的越多,我们就能越优化我们的方法和策略。
更多的确定性(更少的运气)意味着更多的钱。
我们这样做是合理的:运气是无法消除的,但我们可以减少它。这就是为什么我们构建复杂的 xG 模型,或者构建带有概率推理的投注模型。
但体育应该是不确定的。这就是为什么它们对观众来说是如此激动人心的。如果我们已经知道了结果,大多数人不会看比赛。
最后的想法
今天我们有幸讨论了运气在体育中的作用,这是非常重要的。理解这一点可以帮助球迷避免过度反应。但它也可能帮助球探和球队管理,或者为更明智的投注或幻想联赛决策提供信息。
总的来说,我们必须知道,最好的球队并不总是获胜,但数据可以告诉我们它们应该有多大的胜率。

浙公网安备 33010602011771号