同样叫作传球成功率的数字,在两个联赛、两个位置与两种战术里含义完全不同,爱游戏官方想用四类偏差帮你建立一套提问清单,读图时先问再信。

1、比赛状态偏差
领先与落后会系统性改变传球次数、进攻区域与冒险动作。一支经常领先的球队看起来传球成功率高、压迫数据好,其实一部分是比分带来的。处理办法是只比较同等局面下的回合,或者把数据按领先平局落后分层统计。
2、任务不同
教练给每名球员的任务不一样。一名边后卫被要求固定保护,另一名被要求套边传中,两人的传中次数自然相差很大,却不能说明谁更好。因此比较必须在同角色内进行,同时要写清楚角色定义,否则数字会惩罚执行力强的人。
3、对手与赛程
面对高压球队与面对摆大巴球队,同一名中场的数据会有巨大差别。赛程里客场比例、连续作战密度也会污染指标。做时间序列分析时应当把对手强度与主客作为一个显式变量,而不是默认它们平均掉了。
4、环境因素
高海拔、湿度、草皮类型与季节都会改变比赛节奏与球的物理行为。高原球门的远射表现与海平面场地不可直接比较,湿滑草皮上的触球失误也更常见。跨环境比较必须至少观察多个主场的平均,而不是拿单场极端值。

5、样本大小的欺骗
小样本里比率型指标波动极大,一场比赛七次对抗的胜负会给出百分之八十六或十四这样夸张的数字。正确做法是同时报告绝对次数,并用滚动窗口看趋势。任何只给百分比不给基数的图,都要打上问号。
6、跨级别不可比
低级别的数据往往在更松的防守强度下产生,同样的传球成功率在高级别里意味着完全不同的能力。评估跨级转会时更可靠的是相对位置:他在原环境里是否处于同位置前列、以及他的强项是否正好对应新体系的需求。只看数字会系统性高估。
7、一套可以直接用的提问清单
读任何统计时依次问五个问题:这个数字怎么定义、局面分布如何、球员任务是什么、对手与场地环境有什么差别、样本有多大。五个问题问完,多数夸张的结论会自动缩水,而真正有价值的差异会被留下来,这就是数据素养的核心。
8、给自己建立一份基线
横向比较之前先做纵向:把同一名球员在同一环境下的多个场次平均,作为他的基线,再看偏离。这样能自动过滤掉大部分由任务与对手带来的噪声,也避免了用别人家的数字来要求自己的球员。基线不需要复杂模型,一张表加六场样本就够用,它最大的好处是把争论从"谁更强"变成"他比上周的自己更好还是更差"。
9、给结论加一个适用范围
任何跨队比较都应该注明样本条件:同联赛、同位置角色、局面相近与样本量足够。这四条写在结论旁边,读者才能判断它是否适用于自己的场景。缺少适用范围的数字很容易被断章引用,最终变成一次错误决策的依据,而注明它只需要多写一行字,这一行字往往比结论本身更重要。
10、口径不同
不同数据商对触球、对抗、传中、拦截的定义都不一样。有的把解围算进拦截,有的把折射后的触球另作记录;有的按秒采样位置,有的按事件采样。同一支球队在两个平台上会出现明显不同的数字。因此在任何比较前,第一件事是确认来源与定义。
可比性是一种纪律
愿意主动检查可比性的读者与从业者,会少犯绝大多数错误。爱游戏官方建议把这五个问题贴在分析文档的开头,让每一个结论都必须回应。