在Foundry Pipeline Builder新建流水线中生成虚拟测试数据的步骤咨询
在Foundry Pipeline Builder中生成虚拟测试数据的具体步骤
方法一:通过Transform节点编写代码生成
- 打开新建的流水线,进入Pipeline Builder画布界面
- 从左侧面板拖拽Transform节点到画布中
- 双击Transform节点,选择Python或Scala作为代码语言
- 编写虚拟数据生成代码,以下是Python示例(Foundry环境默认预装
faker库):from transforms.api import transform_df, Output from faker import Faker import pandas as pd fake = Faker() @transform_df( Output("/your/project/path/output/virtual_test_data"), ) def compute(ctx): # 生成100条虚拟用户数据,可按需调整字段和数据量 data = [] for _ in range(100): data.append({ "user_id": fake.uuid4(), "full_name": fake.name(), "email": fake.email(), "signup_date": fake.date_between(start_date="-365d", end_date="today") }) return pd.DataFrame(data) - 保存代码后返回画布,点击节点右上角的运行按钮,完成后即可得到生成的虚拟数据集
方法二:使用内置Data Generator工具(需环境支持)
- 若你的Foundry环境启用了Data Generator工具,从左侧面板拖拽该节点到画布
- 双击节点进入配置界面:
- 自定义字段名称、数据类型(如字符串、日期、数字等)
- 设置每条字段的取值规则(比如姓名用随机人名、日期范围、数字区间)
- 指定生成的数据行数
- 配置完成后,设置输出数据集的存储路径,运行节点即可生成虚拟数据
验证结果
- 运行完成后,点击输出数据集的预览图标,检查生成的虚拟数据是否符合预期
- 若需调整,返回对应节点修改代码或配置,重新运行即可
内容的提问来源于stack exchange,提问作者user99463
相关产品推荐
相关产品推荐

