如何处理TMDB 10000电影数据集中budget、revenue高占比零值问题
TMDB数据集预算/收入零值清洗方案
针对你提到的零值占比高、全量统计值有偏差、不能直接删除的问题,可按以下步骤分层处理:
- 第一步:先做零值标记,不要直接修改原始字段
新增两个标记字段区分零值类型,方便后续分析时灵活筛选:# 标记预算为零的记录 df['is_budget_zero'] = df['budget'] == 0 # 标记收入为零的记录 df['is_revenue_zero'] = df['revenue'] == 0 - 第二步:根据分析目标选择处理方式
- 如果你的分析目标是预算收入相关性、投资回报率、票房预测模型:优先保留
is_budget_zero=False且is_revenue_zero=False的样本做核心分析,剩余零值样本可以单独作为「财务数据未公开」分组做描述性统计,不要混入核心计算避免偏差。 - 如果你的分析需要用到全量样本(比如全年代电影收入分布统计):采用分层分组填充方案,不要用全量统计值:
- 优先用「上映年份+电影类型+制片地区」三个维度组合分组,取每个组内非零值的中位数做填充,同维度下的电影财务水平可比性更强,中位数也能避免极值干扰。
- 如果分组后部分组内没有非零值,可以扩大分组维度(比如去掉制片地区,只按年份+类型分组)再做填充。
- 若上述方式仍无法覆盖,可采用多重插补法,调用对应数据分析库的迭代插补工具,用电影时长、评分、演职人员热度、发行公司等其他特征作为变量拟合预测值,最大程度保留数据分布特征。
- 如果你的分析目标是预算收入相关性、投资回报率、票房预测模型:优先保留
- 第三步:做一致性校验
无论采用哪种填充方式,都需要对比填充后的财务数据分布和原始非零样本的分布差异,如果核心统计指标(中位数、四分位距)偏差超过15%,需要调整填充逻辑。同时所有用到填充值的分析结论,都需要用原始非零样本做敏感性验证,确保结论不会因为填充逻辑出现本质偏差。
注意事项
如果需要计算投入产出比(ROI)这类比值指标,建议仅用原始非零样本计算,填充值会导致比值误差过大,不具备参考意义。
内容的提问来源于stack exchange,提问作者hasu33
相关产品推荐
相关产品推荐

