如何利用R targets高效更新超大规模数据集?
如何用R targets设置文件追踪,高效处理超大规模数据集的增量更新?
场景示例
构建存储家庭成员出行城市信息的tibble对象city_log,需将其转换为以人员为维度的信息,最终生成两个目标:
traveler_log_full:全量人员出行明细traveler_log:带统计指标的人员出行汇总
核心挑战
当前数据集规模:770万条城市出行记录、2万名出行人员,且数据集会频繁更新。希望避免每次更新都全量重新计算traveler_log_full。
已有尝试与明确需求
- 已通读
targets及targetopia全部官方文档 - 拒绝使用动态分支:分支变化时会触发所有中间目标重新生成,不符合效率要求
- 排除
tar_map()静态分支:找不到合适的迭代维度 - 理想方案:将大文件拆分为小文件,更新时仅处理新增的城市出行记录
- 额外痛点:更新后的数据集仍命名为
city_log,会触发下游所有中间对象全量重生成
现咨询如何基于R targets实现上述增量更新需求?
内容的提问来源于stack exchange,提问作者Hirschey
相关产品推荐
相关产品推荐

