"评论数乘以30"的经验法则随处可见,所以我想知道它实际偏差有多大。我建立了一个测试集:这些游戏曾公开披露过销量数据,且评论数和好评率以披露日期的数据为准。目前收集了62款游戏——其中21款附带了来源链接和原始数据的引用语句,其余则源自Gamalytic在发布其准确度基准时提供的样本,因此数据可比性得到了保证。

结果发现,这个经验法则在中位数上几乎完全准确,但对任何单个游戏而言基本无用。整个测试集中每篇评论对应的真实销量:

  • 第10百分位:11.5倍
  • 中位数:31.1倍
  • 第90百分位:70.6倍
  • 完整范围:3.1倍至160.4倍

因此,固定倍数大致无偏,但本质上仍等同于抛硬币——只是多了些步骤。

将调整后的估算值与这些披露数据对比——调整因素包括:发行年份、评论数区间、游戏是否深度打折:

  • 误差在10%以内:17.7%
  • 误差在30%以内:45.2%
  • 误差在50%以内:61.3%
  • 误差在70%以内:72.6%

作为参考,已发布基准显示:固定倍数在30%误差内的比例为42.7%,调整后倍数约为50.4%,同时在线玩家/游戏时长法为64.4%,而完整集成模型为76.9%。因此45.2%大致对应调整后倍数的应有表现。集成模型的上限需要客户端工具不具备的基础设施:持续采样数百万Steam用户资料、多年的每日畅销榜快照。

单个数藏匿的三个真相如下:

调整机制恰恰在最需要帮助的地方失效了。 测试集中最严重的错误是《盖瑞模组》,高估206%:66.5万条评论,估算销量6120万,实际销量2000万——这是Facepunch工作室在2021年9月公布的数据,且明确为Steam销量(因为该游戏从未在其他平台销售)。实际每篇评论对应30.1倍。而估算器应用了92倍,因为调整链读取到"2006年发行"和"深度打折",将两者叠加到了基础倍数上。《英灵神殿》每篇评论对应29.8倍,被应用了约30倍,误差在1%以内。相同的倍数,截然不同的结果——正是调整因素造成了破坏。

很多披露数据并非Steam销量。 《乌鸦之境》宣布销量5万份,但开发者还给出了平台细分——Steam占64%——因此实际目标应为3.2万份。对比3.2万份,估算的8.94万份高估了179%;若对比标题的5万份,则显示高估79%。如果不对全平台汇总数据进行修正,就会美化所有已发布的倍数——这正是我最终逐一核查数据来源而非盲目信任数字的原因。

在独立游戏领域,这个方法的误差最大。 《V-Hunter Puzzler Dx》售出46份,数据直接来自开发者事后总结中的Steamworks页面。而估算器显示为430份。当销量低于约一千份时,特定买家群体的评论习惯就会主导信号,而这没有对应的系数。

我还尝试用置信等级预测准确度,但失败了。在该测试集中,不同等级虽呈现正确趋势但差异不显著——"良好"与"低"等级在30%误差内的差距为13个百分点,排列检验p=0.68。因此该工具只输出表格,而非声称等级具有实际意义。

所有内容均可复现:62个测试用例及评估工具均位于此仓库中,运行npm run calibrate即可精确打印上述表格。

在此向本版请求两件事:

  1. 如果贵工作室曾公布过销量数据,或愿意透露自家游戏的评论-销量倍数,我会将其加入测试集并更新表格。当前测试集在千份销量以下和2020年之前的数据较为薄弱,而这恰恰是误差最大的区间。
  2. 您实际用这些估算数据做什么?我猜想大多数真实用途是竞争规模评估——三倍误差范围完全够用,而对精确数字的需求多半是虚幻的。