You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何处理TMDB 10000电影数据集中budget、revenue高占比零值问题

TMDB数据集预算/收入零值清洗方案

针对你提到的零值占比高、全量统计值有偏差、不能直接删除的问题,可按以下步骤分层处理:

  • 第一步:先做零值标记,不要直接修改原始字段
    新增两个标记字段区分零值类型,方便后续分析时灵活筛选:
    # 标记预算为零的记录
    df['is_budget_zero'] = df['budget'] == 0
    # 标记收入为零的记录
    df['is_revenue_zero'] = df['revenue'] == 0
    
  • 第二步:根据分析目标选择处理方式
    • 如果你的分析目标是预算收入相关性、投资回报率、票房预测模型:优先保留is_budget_zero=False且is_revenue_zero=False的样本做核心分析,剩余零值样本可以单独作为「财务数据未公开」分组做描述性统计,不要混入核心计算避免偏差。
    • 如果你的分析需要用到全量样本(比如全年代电影收入分布统计):采用分层分组填充方案,不要用全量统计值:
      1. 优先用「上映年份+电影类型+制片地区」三个维度组合分组,取每个组内非零值的中位数做填充,同维度下的电影财务水平可比性更强,中位数也能避免极值干扰。
      2. 如果分组后部分组内没有非零值,可以扩大分组维度(比如去掉制片地区,只按年份+类型分组)再做填充。
      3. 若上述方式仍无法覆盖,可采用多重插补法,调用对应数据分析库的迭代插补工具,用电影时长、评分、演职人员热度、发行公司等其他特征作为变量拟合预测值,最大程度保留数据分布特征。
  • 第三步:做一致性校验
    无论采用哪种填充方式,都需要对比填充后的财务数据分布和原始非零样本的分布差异,如果核心统计指标(中位数、四分位距)偏差超过15%,需要调整填充逻辑。同时所有用到填充值的分析结论,都需要用原始非零样本做敏感性验证,确保结论不会因为填充逻辑出现本质偏差。

注意事项

如果需要计算投入产出比(ROI)这类比值指标,建议仅用原始非零样本计算,填充值会导致比值误差过大,不具备参考意义。


内容的提问来源于stack exchange,提问作者hasu33

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 16:18:03