比赛预测模型在学术与商业上都被广泛研究,但它的实际能力被公众严重高估。乐鱼体育沿着足球的低分特征、可用数据、模型结构与评估方法四个环节,把预测模型的真实边界拆开。

1、模型在什么情况下会明显失效
有几类比赛是所有模型的共同难点。第一类是赛季初,因为球队阵容变化大,历史数据失去参考价值。第二类是换帅之后的前几场,新战术的影响无法量化。第三类是关键保级战与决赛,心理因素权重上升,而这些因素没有数据可采集。第四类是天气或场地出现异常的比赛。因此一个诚实的模型会给出置信度,在这些场景下主动降低置信度,而不是给出一个看起来很确定的概率。
2、预测模型的真正用途不是猜结果
俱乐部使用预测模型的方式与公众想象的不同。他们不用模型预测单场比赛的胜负,而是用它评估战术调整的效果,比如改变防线高度后失球概率会怎么变化;或者用它做赛季规划,估算不同引援方案对最终排名的影响。这类用途关注的是概率分布的变化,而不是某一次的预测结果。这才是预测模型在职业足球里的真实位置,也是它最有价值的地方。

3、预期进球模型是怎么建出来的:从坐标到概率
预期进球模型的输入是每一次射门的若干特征,最基础的是射门点到球门的距离与角度,这两项决定了理论上的可射门面积。在此之上会加入射门方式,头球、脚内侧推射、正脚背抽射与凌空抽射的转化率差别很大;加入身体状态,静止射门、跑动中射门与失衡状态下的射门分别建模;加入防守压力,最近防守者的距离与门将是否已经封堵近角;加入比赛情境,包括比分状态与比赛时间,因为落后时的射门往往更仓促。模型的输出是这一次射门的进球概率,通常用逻辑回归或梯度提升树拟合,训练样本是历史上几十万次射门的结果。模型质量的评估用对数损失而不是准确率,因为预测的是概率而不是结果。不同供应商的模型差异主要来自特征集合与样本范围,有的只用基础特征,有的加入追踪数据计算门将的实际站位,后者的精度明显更高但只覆盖有追踪系统的联赛。使用预期进球时最重要的一条是:它是长期指标,单场比赛的预期进球差几乎没有解释力,必须累积十场以上才能看出稳定的能力差异。
4、低分项目让随机性占主导
足球一场比赛的平均进球数不到三个,这个特征决定了随机因素的影响力远大于其他运动。在高分项目里,实力差距会在大量得分机会里被平均掉,因此强队胜率更高;在足球里,一次误判、一次门柱、一次个人失误就能改变结果。统计上这表现为爆冷频率高,实力明显占优的一方胜率往往只有五到六成。任何模型都无法消除这层随机性,它只能在这层随机性之上做出概率估计。
5、可用数据的历史长度限制了模型
高质量的追踪数据只有近十年左右的历史,更早的比赛只有基础统计。这意味着模型可用的训练样本很有限,尤其是淘汰赛与关键场次的样本更少。同时足球的战术演变很快,十年前的数据对今天的预测价值有限,因此模型必须对近期数据赋予更高权重,这进一步减少了有效样本量。样本不足是足球预测模型最根本的约束,比算法选择的影响大得多。
6、特征选择比算法更重要
常用的特征包括近期表现、主客场差异、休息天数、伤停名单、历史交锋、进球与失球的预期值差、以及联赛排名。研究发现最有预测力的特征往往不是最直观的那些:预期进球差比实际进球差更稳定,休息天数比排名更重要,主客场差异在某些联赛里几乎消失。算法方面,简单的回归模型与复杂的机器学习模型差距不大,这再次说明瓶颈在数据而不在方法。
7、评估方法决定了结论的可信度
评价一个预测模型不能只看它猜对了多少场,因为随机猜测也能达到三成左右,而总是猜主队胜就能达到四成多。正确的评估指标是与这些基准比较的提升幅度,以及概率校准程度,也就是模型预测六成胜率的比赛里,实际是否真的有六成赢了。很多公开宣称准确率高的模型,用的是错误的基准或者只在特定时段测试,这类结论不可信。
六成的准确率已经是这个项目的上限
足球的低分特征与随机性决定了预测能力的天花板,任何声称能稳定超过七成的模型都值得怀疑。乐鱼体育认为接受这个上限,是理解足球数据的第一步。