You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何利用R targets高效更新超大规模数据集?

如何用R targets设置文件追踪,高效处理超大规模数据集的增量更新?

场景示例

构建存储家庭成员出行城市信息的tibble对象city_log,需将其转换为以人员为维度的信息,最终生成两个目标:

  • traveler_log_full:全量人员出行明细
  • traveler_log:带统计指标的人员出行汇总

核心挑战

当前数据集规模:770万条城市出行记录、2万名出行人员,且数据集会频繁更新。希望避免每次更新都全量重新计算traveler_log_full。

已有尝试与明确需求

  1. 已通读targets及targetopia全部官方文档
  2. 拒绝使用动态分支:分支变化时会触发所有中间目标重新生成,不符合效率要求
  3. 排除tar_map()静态分支:找不到合适的迭代维度
  4. 理想方案:将大文件拆分为小文件,更新时仅处理新增的城市出行记录
  5. 额外痛点:更新后的数据集仍命名为city_log,会触发下游所有中间对象全量重生成

现咨询如何基于R targets实现上述增量更新需求?


内容的提问来源于stack exchange,提问作者Hirschey

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 00:01:02