如何在Palantir Foundry中合并多份原始松散文件数据集及连接?
Foundry合并多份无Schema原始数据集并保留历史的解决方案
直接合并现有原始数据集(最简方案)
- 新建一个无Schema的Raw Dataset,格式匹配原数据集
- 进入新数据集的「Files」页面,点击右上角「Add files」→「From datasets」
- 选中所有需要合并的原始数据集,将它们的全部文件导入新数据集,完整保留历史数据
- 为新数据集创建Data Connection并配置调度,替代原来的N个连接和任务
用Pipeline Builder批量迁移+配置新Ingestion
- 新建Pipeline,添加「Dataset Input」节点导入所有待合并的原始数据集
- 加入「Copy Files」节点,将所有输入文件直接复制到目标新Raw Dataset
- 运行Pipeline完成历史数据迁移
- 给新数据集配置Data Connection和调度,负责后续增量数据拉取
注意事项
- 确保所有原数据集文件格式一致,若有差异,先在Pipeline中用「Format Conversion」节点统一格式
- 新Raw Dataset保持无Schema状态,避免自动推断Schema干扰后续Ingestion
- 合并完成后,停用原数据集的Data Connection和调度,防止重复拉取
内容的提问来源于stack exchange,提问作者user5233494
相关产品推荐
相关产品推荐

